Experiment result · 2026-06-12

Sprint 2 MobileCLIP 5-fold 결과 기록

MobileCLIP2-S3 server partial run과 MobileCLIP2-S4 ArcFace partial unfreeze를 같은 데이터 snapshot, 같은 split 정책, 같은 metric으로 비교한 screening 결과 기록이다. config 점검 결과 기존 S3 run은 이름과 달리 true full unfreeze가 아니므로, 이 문서는 최종 backbone 결론이 아니라 후보 탐색 근거로 보존한다.

Abstract-style Summary

23-class Landmark Assistant recognition task에서 기존 S3 server partial run은 S4 ArcFace partial unfreeze보다 5-fold 평균 test Top-1, Top-3, macro-F1, hard-case Top-1 모두 높았다. 특히 test macro-F1은 S3 pilot이 0.9770 ± 0.0066, S4 ArcFace partial이 0.9678 ± 0.0073으로 S3 pilot이 약 +0.0092 높았다.

다만 이 비교는 학습 방식이 완전히 통제된 factorial comparison이 아니다. 따라서 자연어 검색 지표뿐 아니라 backbone/학습방식 최종 판단도 paper-grade experiment matrix 완료 후 다시 결정한다.

Decision

  • 이 결과는 후보 탐색(screening) 결과로 보존한다.
  • 최종 결론은 S3/S4 × full/partial/ArcFace/LoRA matrix 완료 후 작성한다.
  • text retrieval은 이번 결과에서 검증하지 않은 항목으로 분리한다.
  • 반복 약점 class는 데이터/라벨/혼동쌍 분석으로 후속 처리한다.

Experimental Setup

Dataset root /workspace/landmark-assis/Dataset
Dataset fingerprint ec2ad988299869f98622e52f5ebcebb35f56553c
Dataset size total 6469, confirmed 6423, trainval 5462, test 961, holdout_non_confirmed 46
Class count 23
Split policy splits/kfold_seed20260513.json, seed 20260513, 5 folds, test ratio 0.15
Compute Server etri-gpu, Tesla P100 16GB, 4-process DDP on CUDA_VISIBLE_DEVICES=2,3,4,5
Metric source C:\Users\hi\Downloads\종설_작업중\wandb_exports W&B scalar CSV export

Primary Result

아래 표는 fold0-4 전체 평균과 표준편차다. 값은 W&B CSV에서 metric column을 직접 읽어 계산했다. CSV의 _timestamp column은 metric이 아니므로 집계에서 제외했다.

Model Val Top-1 Val Macro-F1 Test Top-1 Test Top-3 Test Macro-F1 Hard-case Top-1 Low-margin
S3 server partial pilot 0.9855 ± 0.0046 0.9661 ± 0.0163 0.9875 ± 0.0018 0.9960 ± 0.0017 0.9770 ± 0.0066 0.9883 ± 0.0013 1.2 ± 0.8
S4 ArcFace partial 0.9843 ± 0.0021 0.9648 ± 0.0100 0.9846 ± 0.0017 0.9938 ± 0.0022 0.9678 ± 0.0073 0.9853 ± 0.0017 1.8 ± 1.3
5-fold mean comparison higher is better except low-margin
S3 pilot Test Top-1
0.9875
S4 ArcFace Test Top-1
0.9846
S3 pilot Macro-F1
0.9770
S4 ArcFace Macro-F1
0.9678
S3 pilot Hard-case
0.9883
S4 ArcFace Hard-case
0.9853

막대는 0-1 score를 0-100% 폭으로 표시한다. 차이가 작아 보이지만, 같은 test set과 같은 split 정책에서 반복된 평균 차이다.

Fold-level Results

fold별 결과를 보존하는 이유는 단일 fold의 우연한 유리함을 피하기 위해서다. S3 pilot은 fold1에서 가장 높았지만, 이 문서의 결론은 fold1 하나가 아니라 fold0-4 평균으로 판단한다. 단, 이 평균도 paper-grade final conclusion이 아니라 screening evidence다.

Fold-wise Test Macro-F1 0.990 0.975 0.960 0.940 fold0fold1fold2fold3fold4
S3 pilot test macro-F1 S4 ArcFace partial test macro-F1
Model Fold Best Epoch Val Top-1 Test Top-1 Test Top-3 Test Macro-F1 Hard-case Top-1 Low-margin
S3 pilot0180.98460.98650.99480.98050.98722
S3 pilot1220.99000.99060.99580.98670.99040
S3 pilot2280.97810.98650.99580.97050.98721
S3 pilot3140.98710.98750.99480.97280.98832
S3 pilot4280.98800.98650.99900.97440.98831
S4 ArcFace partial0180.98550.98340.99380.97470.98401
S4 ArcFace partial1180.98090.98340.99170.96170.98403
S4 ArcFace partial2220.98350.98440.99480.96060.98512
S4 ArcFace partial3250.98620.98440.99170.96580.98513
S4 ArcFace partial4250.98520.98750.99690.97620.98830

Error Pattern

모델 선택에는 전체 평균을 사용했지만, 다음 데이터 개선 방향은 lower F1 class에서 잡는다. 아래 class들은 fold별 최저 F1 목록에 반복적으로 등장했다.

Class S3 pilot 평균 F1 S4 ArcFace partial 평균 F1 해석
deoksugung_daehanmun 0.871 0.732 두 모델 모두 반복 약점이다. 데이터 수, 시점 다양성, 내부 구조물과의 혼동을 우선 점검한다.
cheonggyecheon 0.931 0.890 야간/도심 산책로/물길 구성이 다양해 scene group과 caption template 재점검이 필요하다.
gyeongbokgung_geunjeongjeon 0.949 0.944 궁궐 계열 구조물 간 혼동 후보로 유지한다. 근정문/광화문과의 관계를 별도 분석한다.
gwanghwamun 0.958 0.967 S4 ArcFace가 평균 F1에서는 약간 높다. 다만 전체 모델 선택을 뒤집을 수준은 아니다.

Limitations

Next Steps

  1. paper-grade experiment matrix를 완료한다.
  2. 새 matrix 결과로 final config를 결정한다.
  3. final retrain, ONNX parity, demo regression은 final config 확정 후 진행한다.

Related Documents