Old guide · Sprint 1
기존 학습방식용 라벨링 가이드
이 문서는 Sprint 1의 classification 중심 운영 기준을 보존한 old guide다. 현재 기준은 Data and Text Labeling Guide를 따른다.
왜 old 문서로 분리했는가
Sprint 1에서는 새 데이터셋을 빠르게 학습하고 데모앱을 안정화해야 했기 때문에,
이미지가 어떤 landmark_id인지 확인하는 image-label classification 기준이 가장 중요했다.
그래서 confirmed/uncertain/rejected, 주 피사체와 배경 landmark 분리, OOS/저품질 분리가 중심이었다.
Sprint 2에서는 MobileCLIP2-S4의 image encoder와 text encoder를 함께 활용하는 multi-task fine-tuning을 검토하기 때문에, image-label만으로는 부족하다. 이미지별 한/영 caption, contrast caption, hard negative pair, text catalog coverage가 학습 신호로 들어가야 한다.
이전 기준의 핵심
| 기준 | 이전 방식에서의 역할 | 현재 방식에서의 상태 |
|---|---|---|
label_status |
confirmed만 supervised 학습에 사용했다. | 계속 필수다. 다만 caption 품질과 pair 품질도 함께 본다. |
landmark_visibility |
배경에 작게 보이는 landmark를 positive로 섞지 않기 위한 필드였다. | 계속 필수다. contrastive 학습에서는 잘못된 positive pair 방지에 더 중요하다. |
confusing_with |
실패 분석과 hard case 기록에 사용했다. | hard negative pair와 contrast caption 생성 기준으로 승격된다. |
| 랜드마크 텍스트 카탈로그 | 앱 자연어 검색과 keyword bonus를 보강했다. | caption 생성 기준, text index, 검색 회귀 테스트의 공통 vocabulary가 된다. |
| 이미지 캡션/시각 노트 | 주로 사람이 검수하기 위한 보조 설명이었다. | 학습 가능한 image-text pair의 직접 supervision으로 바뀐다. |
이전 방식이 합리적이었던 이유
- 월요일 시연 전까지 모델을 서버에서 바로 재학습하고 데모앱에 탑재해야 했다.
- 이미지 인식이 Sprint 1의 핵심 기능이었고, 자연어 검색은 text index와 keyword 보정으로 우선 구현 가능했다.
- 13개 class의 closed-set recognition을 빠르게 안정화하는 데는 classification 중심 학습이 가장 단순했다.
- 데이터셋 품질 문제가 아직 많았기 때문에 caption 학습보다 confirmed positive 정리가 먼저였다.
현재 문서로 넘긴 결정
아래 항목은 old guide의 정신을 유지하되, 현재 가이드에서 더 강하게 다룬다.
- 이미지 positive 여부만 보지 않고, 해당 이미지와 맞는 caption인지 확인한다.
- 한국어와 영어 caption을 함께 둔다.
- 광화문/근정문 같은 혼동쌍을
confusing_with에 기록하고 contrast caption으로 만든다. - 텍스트 카탈로그를 앱 검색용 사전이 아니라 학습 기준 vocabulary로도 본다.
- OOS, screenshot, blur, noise는 classification 평가뿐 아니라 confidence policy 회귀 테스트에 둔다.