Lightweight Model Reference Audit
작성일: 2026-05-13 · 기준: 2026.05 현재 공개된 공식/1차 출처 · 주제: MobileNetV4, MobileCLIP2 추가 검토
결론
기존 후보였던 EfficientNet/MobileNetV3/ConvNeXt만으로는 2026.05 기준 최신 경량 후보 탐색이 부족하다. MobileNetV4는 image-only student 후보로 추가하고, MobileCLIP2는 image-text retrieval reference, deployable embedding 후보, 그리고 accuracy-first fine-tuning 후보로 추가한다. license를 제외하면 MobileCLIP2-S4/S3/B가 실제 정확도 1순위 후보일 수 있으므로 MobileNetV4 Large와 직접 비교한다.
Reference Summary
| 후보 | 근거 | 우리 설계 반영 |
|---|---|---|
| MobileNetV4 | timm/Hugging Face model card 기준 pretrained MobileNetV4 weight가 제공된다. 해당 card는 MobileNetV4 conv large가 ImageNet-1k 모델이며 feature backbone/embedding 용도도 문서화한다. model card의 비교표 기준 상위 MobileNetV4 Conv-AA/Hybrid Large 계열은 ImageNet top-1 83~85%대다. |
mobilenetv4_conv_medium, mobilenetv4_hybrid_medium,
mobilenetv4_conv_large, mobilenetv4_hybrid_large,
mobilenetv4_conv_aa_large_in12k를 search space에 추가한다.
accuracy-first 비교에서는 Large 계열을 MobileCLIP2와 직접 비교한다.
|
| MobileCLIP2 | Apple 공식 페이지와 GitHub repo가 MobileCLIP2를 TMLR 2025 Featured work로 소개한다. Hugging Face model card 기준 MobileCLIP2-S0/S2/B/S3/S4 체크포인트가 있으며, IN-1k zero-shot top-1은 S2 77.2%, B 79.4%, S3 80.7%, S4 81.9%로 공개되어 있다. |
MobileCLIP2-S2/B/S3/S4를 frozen retrieval, linear probe,
partial fine-tune 후보로 둔다. MobileCLIP2-S4는 teacher/reference도 겸한다.
|
Risk Notes
- MobileNetV4 timm weights는 실용적으로 좋지만, TensorFlow official weights와는 별개다.
- MobileCLIP2와 MobileNetV4의 공개 수치는 zero-shot과 supervised ImageNet top-1이 섞여 있으므로, 공개 수치만으로 최종 우열을 확정하지 않는다.
- MobileCLIP2 model card는 export 전 reparameterization을 안내한다. ONNX export smoke가 반드시 필요하다.
- MobileCLIP2는 text encoder를 앱에 싣지 않고, offline text/prototype index를 생성한 뒤 image encoder만 쓰는 방향이 현실적이다.