Old guide · Sprint 1

기존 학습방식용 라벨링 가이드

이 문서는 Sprint 1의 classification 중심 운영 기준을 보존한 old guide다. 현재 기준은 Data and Text Labeling Guide를 따른다.

왜 old 문서로 분리했는가

Sprint 1에서는 새 데이터셋을 빠르게 학습하고 데모앱을 안정화해야 했기 때문에, 이미지가 어떤 landmark_id인지 확인하는 image-label classification 기준이 가장 중요했다. 그래서 confirmed/uncertain/rejected, 주 피사체와 배경 landmark 분리, OOS/저품질 분리가 중심이었다.

Sprint 2에서는 MobileCLIP2-S4의 image encoder와 text encoder를 함께 활용하는 multi-task fine-tuning을 검토하기 때문에, image-label만으로는 부족하다. 이미지별 한/영 caption, contrast caption, hard negative pair, text catalog coverage가 학습 신호로 들어가야 한다.

이전 기준의 핵심

기준 이전 방식에서의 역할 현재 방식에서의 상태
label_status confirmed만 supervised 학습에 사용했다. 계속 필수다. 다만 caption 품질과 pair 품질도 함께 본다.
landmark_visibility 배경에 작게 보이는 landmark를 positive로 섞지 않기 위한 필드였다. 계속 필수다. contrastive 학습에서는 잘못된 positive pair 방지에 더 중요하다.
confusing_with 실패 분석과 hard case 기록에 사용했다. hard negative pair와 contrast caption 생성 기준으로 승격된다.
랜드마크 텍스트 카탈로그 앱 자연어 검색과 keyword bonus를 보강했다. caption 생성 기준, text index, 검색 회귀 테스트의 공통 vocabulary가 된다.
이미지 캡션/시각 노트 주로 사람이 검수하기 위한 보조 설명이었다. 학습 가능한 image-text pair의 직접 supervision으로 바뀐다.

이전 방식이 합리적이었던 이유

현재 문서로 넘긴 결정

아래 항목은 old guide의 정신을 유지하되, 현재 가이드에서 더 강하게 다룬다.

  1. 이미지 positive 여부만 보지 않고, 해당 이미지와 맞는 caption인지 확인한다.
  2. 한국어와 영어 caption을 함께 둔다.
  3. 광화문/근정문 같은 혼동쌍을 confusing_with에 기록하고 contrast caption으로 만든다.
  4. 텍스트 카탈로그를 앱 검색용 사전이 아니라 학습 기준 vocabulary로도 본다.
  5. OOS, screenshot, blur, noise는 classification 평가뿐 아니라 confidence policy 회귀 테스트에 둔다.