Lightweight Model Reference Audit

작성일: 2026-05-13 · 기준: 2026.05 현재 공개된 공식/1차 출처 · 주제: MobileNetV4, MobileCLIP2 추가 검토

결론

기존 후보였던 EfficientNet/MobileNetV3/ConvNeXt만으로는 2026.05 기준 최신 경량 후보 탐색이 부족하다. MobileNetV4는 image-only student 후보로 추가하고, MobileCLIP2는 image-text retrieval reference, deployable embedding 후보, 그리고 accuracy-first fine-tuning 후보로 추가한다. license를 제외하면 MobileCLIP2-S4/S3/B가 실제 정확도 1순위 후보일 수 있으므로 MobileNetV4 Large와 직접 비교한다.

Reference Summary

후보 근거 우리 설계 반영
MobileNetV4 timm/Hugging Face model card 기준 pretrained MobileNetV4 weight가 제공된다. 해당 card는 MobileNetV4 conv large가 ImageNet-1k 모델이며 feature backbone/embedding 용도도 문서화한다. model card의 비교표 기준 상위 MobileNetV4 Conv-AA/Hybrid Large 계열은 ImageNet top-1 83~85%대다. mobilenetv4_conv_medium, mobilenetv4_hybrid_medium, mobilenetv4_conv_large, mobilenetv4_hybrid_large, mobilenetv4_conv_aa_large_in12k를 search space에 추가한다. accuracy-first 비교에서는 Large 계열을 MobileCLIP2와 직접 비교한다.
MobileCLIP2 Apple 공식 페이지와 GitHub repo가 MobileCLIP2를 TMLR 2025 Featured work로 소개한다. Hugging Face model card 기준 MobileCLIP2-S0/S2/B/S3/S4 체크포인트가 있으며, IN-1k zero-shot top-1은 S2 77.2%, B 79.4%, S3 80.7%, S4 81.9%로 공개되어 있다. MobileCLIP2-S2/B/S3/S4를 frozen retrieval, linear probe, partial fine-tune 후보로 둔다. MobileCLIP2-S4는 teacher/reference도 겸한다.

Risk Notes

Sources