Paper writing guide · 2026-05-21

모델 개발 과정 논문 작성 가이드

이 문서는 Landmark Assistant에서 모델 개발을 단독으로 진행한 과정을 논문처럼 정리하기 위한 작성 기준이다. 앱 개발은 팀원이 담당했고, 이 문서는 모델 선택, 데이터셋 설계, 학습, 변환, 검증, 실패 분석, Sprint 2 multi-task 전환까지의 모델 개발 흐름을 중심으로 쓴다.

먼저 방향 정리

이 논문은 “새로운 세계 최고 모델을 제안했다”가 아니라, 제한된 랜드마크 도메인에서 온디바이스 인식/검색이 가능한 모델 개발 과정을 체계적으로 설계하고 검증했다는 형태가 자연스럽다.

따라서 중심 서사는 모델 개발자의 의사결정 과정이다. 왜 MobileCLIP2-S4를 선택했는지, 왜 단순 classification만으로는 부족했는지, 왜 INT8/NPU 실험을 분리해서 해석했는지, 왜 Sprint 2에서 multi-task 학습으로 바꾸는지가 논문의 핵심이다.

논문에서 주장할 수 있는 것

구분 쓸 수 있는 주장 필요한 근거
문제 정의 관광객이 촬영한 랜드마크 이미지를 온디바이스 환경에서 인식하고, 자연어 검색까지 확장하는 문제를 다룬다. 프로젝트 요구사항, Sprint Goal, demo app 기능.
모델 선택 MobileCLIP2-S4는 이미지 인식과 텍스트 검색 확장성을 동시에 고려한 균형점이다. ADR-0004, 후보 모델 비교, MobileCLIP2 text encoder 활용 가능성.
데이터 설계 랜드마크별 이미지 라벨뿐 아니라 caption, hard negative, OOS/저품질 정책이 필요하다. Data and Text Labeling Guide, dataset fingerprint, split manifest.
배포 가능성 PyTorch checkpoint만으로는 팀원 실행/앱 탑재에 부담이 있어 ONNX/INT8 artifact를 분리 검증했다. ONNX/INT8 benchmark, paging file 이슈, artifact contract.
실패 분석 NPU latency가 좋아도 PTQ로 embedding이 붕괴하면 배포 모델로 사용할 수 없다. AI Hub w8a16, FP32 AI Hub 동치성, INT8 mode collapse 기록.
Sprint 2 전환 특정 랜드마크 분류와 자연어 검색을 함께 개선하려면 multi-task fine-tuning이 필요하다. multi-task 구현 문서, CE/contrastive/hard-negative loss 구성.

논문 제목 후보

권장 논문 구조

  1. Abstract

    문제, 방법, 핵심 실험, 결과, 한계를 150~250단어 수준으로 요약한다. 아직 최종 실험 수치가 없으면 숫자를 비워두고, “모델 개발 및 검증 프로세스” 중심으로 쓴다.

  2. Introduction

    사용자가 랜드마크 사진을 찍었을 때, 앱이 오프라인에서도 어떤 장소인지 알려주는 문제를 소개한다. 기존 범용 VLM보다 작은 온디바이스 모델이 필요한 이유를 쓴다.

  3. Project Scope and Role

    모델 개발은 단독으로 진행했고, 앱 개발은 팀원이 담당했음을 명확히 쓴다. 이 논문은 앱 전체가 아니라 모델 개발, artifact, serving contract, 실험 검증을 다룬다.

  4. Dataset Construction

    13개 랜드마크, 폴더 구조, labels.json, confirmed/holdout, caption_set, confusing_with, train/validation/test split, fingerprint를 설명한다.

  5. Model Selection

    MobileNetV4, MobileCLIP2-B/S3/S4 등 후보를 어떤 기준으로 봤는지 쓰고, 정확도와 자연어 검색 확장성을 고려해 MobileCLIP2-S4로 고정한 이유를 설명한다.

  6. Sprint 1 Model Development

    classification 중심 학습, W&B 추적, fold 평가, demo app 탑재, ONNX/INT8 변환, artifact contract를 시간순으로 쓴다.

  7. Deployment and Quantization Experiments

    FP32 ONNX, dynamic INT8, AI Hub w8a16 NPU 실험을 분리한다. latency와 정확도 동치성을 따로 검증했다는 점이 중요하다.

  8. Error Analysis

    광화문/근정문/청와대 배경, 40%대 유사도, OOS 이미지, low-quality 이미지, 자연어 검색 실패 같은 실제 문제를 원인별로 정리한다.

  9. Sprint 2 Multi-task Redesign

    classification-only에서 multi-task로 넘어간 이유를 설명한다. CE/CosFace/ArcFace, image-text contrastive, hard-negative margin loss를 서술한다.

  10. Discussion and Limitations

    데이터 수량, class 불균형, 유사 궁궐 구조, 모바일 메모리, INT8/NPU accuracy 문제, OOS 거절의 한계를 솔직하게 쓴다.

  11. Conclusion

    Sprint 1에서 모델/데모/배포 artifact의 토대를 마련했고, Sprint 2에서 multi-task 학습과 Flutter 온디바이스 앱으로 확장한다는 결론을 쓴다.

모델 개발 과정 타임라인

단계 한 일 결정 또는 결과 논문에서 쓰는 방식
문제 정의 종로구 10~15개 랜드마크를 온디바이스로 인식하는 목표 설정. Top-3 후보, 상세정보, OOS/저신뢰 대응이 필요함. Introduction / System Goal
데이터셋 구성 랜드마크별 폴더, images, labels.json, confirmed/holdout 분리. 13-class dataset과 k-fold split 구성. Dataset Construction
모델 후보 탐색 MobileNetV4, MobileCLIP2 계열 후보 비교. MobileCLIP2-S4를 정확도와 자연어 확장성 기준으로 선택. Model Selection
학습 구현 서버 P100 환경, W&B, split, tmux 실행, checkpoint 저장. Sprint 1 image recognizer 경로 구축. Training Procedure
데모 앱 연동 Streamlit demo app에서 이미지/자연어 검색, Top-3, 상세보기 검증. 기술 시연 가능한 수준의 demo 확보. Application Validation
배포 artifact 검증 PyTorch, FP32 ONNX, dynamic INT8, AI Hub NPU 경로 비교. dynamic INT8은 실행 경로로 유지, AI Hub w8a16은 latency evidence로만 사용. Deployment Experiments
오류 분석 광화문/근정문 혼동, 낮은 margin, OOS/저품질 문제 분석. classification-only 한계와 confidence policy 필요 확인. Error Analysis
Sprint 2 재설계 caption_set, confusing_with, multi-task loss 설계. MobileCLIP2-S4 multi-task 학습 경로 구현. Method Redesign

처음 논문을 쓸 때 지켜야 할 것

초록 초안

본 연구는 제한된 지역 랜드마크 인식 시나리오에서 온디바이스 실행을 목표로 하는 Landmark Assistant 모델 개발 과정을 정리한다. 대상 도메인은 종로구 주요 랜드마크 13개로 제한하고, 사용자가 촬영한 이미지 또는 자연어 질의로 관련 랜드마크를 찾는 것을 목표로 하였다. 모델 개발 과정에서는 MobileNetV4 및 MobileCLIP2 계열 후보를 비교한 뒤, 이미지 인식과 자연어 검색 확장성을 함께 고려하여 MobileCLIP2-S4를 기본 모델로 선정하였다. 이후 데이터셋 split, W&B 기반 실험 추적, ONNX 및 INT8 artifact 변환, demo app regression을 통해 모델의 정확도와 배포 가능성을 분리 검증하였다. 또한 NPU latency 측정과 PTQ 실패 사례를 통해 실행 속도와 embedding 동치성은 별도로 검증되어야 함을 확인하였다. Sprint 2에서는 classification-only 학습의 한계를 보완하기 위해 한/영 caption, hard negative, image-text contrastive loss를 포함한 multi-task fine-tuning 구조로 확장하였다.

관련 문서