Abstract-style Summary
23-class Landmark Assistant recognition task에서 기존 S3 server partial run은 S4 ArcFace partial unfreeze보다 5-fold 평균 test Top-1, Top-3, macro-F1, hard-case Top-1 모두 높았다. 특히 test macro-F1은 S3 pilot이 0.9770 ± 0.0066, S4 ArcFace partial이 0.9678 ± 0.0073으로 S3 pilot이 약 +0.0092 높았다.
다만 이 비교는 학습 방식이 완전히 통제된 factorial comparison이 아니다. 따라서 자연어 검색 지표뿐 아니라 backbone/학습방식 최종 판단도 paper-grade experiment matrix 완료 후 다시 결정한다.