Paper-grade experiment system · updated 2026-06-15

논문화 실험 기록 허브

Landmark Assistant 모델 개발 실험을 논문 작성 가능한 수준으로 남기기 위한 상위 허브다. 이곳은 논문 본문이 아니라, 논문 본문을 쓰기 위한 실험실 노트, 재현성 자료, 결과 대시보드, 실패 기록, 최종 모델 선택 근거를 관리하는 공간이다.

이 허브의 목적

모델 실험은 결과 수치만 남기면 나중에 다시 설명할 수 없다. 이 허브는 왜 실험했는지, 무엇을 고정했는지, 어떤 결과를 신뢰할 수 있는지, 다른 사람이 재현할 수 있는지를 한 곳에서 확인하도록 만든다.

기존 Sprint 2 5-fold 결과는 screening evidence로 보존한다. 최신 main evidence는 S3/S4와 full/partial/ArcFace/LoRA 조건을 공정하게 맞춘 40-run matrix 결과로 관리한다. 결과 문서는 표 + 핵심 그래프 2~3개를 함께 사용해, 발표용 해석과 논문식 검산을 동시에 지원한다.

읽는 순서

1. 연구 설계

문제, 연구 질문, 가설, 변수 통제, 모델 선택 기준을 먼저 확인한다.

2. 재현성

dataset, split, commit, config, seed, artifact, 환경 정보를 기록한다.

3. Run Registry

각 run의 목적, 상태, 결과 파일, 제외 사유를 표준 형식으로 남긴다.

4. 결과 해석

평균/표준편차, error analysis, deployment 평가를 보고 최종 후보를 정한다.

결과 문서 UX 원칙

1. 먼저 그래프 validation mean, low-margin risk, accuracy-risk 관계를 작은 그래프 2~3개로 먼저 본다.
2. 다음 요약 카드 best config, best fold, 평균/표준편차, pending QA를 카드로 빠르게 확인한다.
3. 마지막 raw table 논문 표와 재현성 검산을 위해 fold-level 값을 끝까지 보존한다.

논문화 실험 문서

새로운 결과를 받을 때는 아래 문서 순서로 갱신한다.

Design

Research Design

연구 질문, 가설, fair comparison 조건, Dataset Card, model selection rule, threats to validity.

연구 설계 열기
Reproduce

Reproducibility and Artifacts

동일 실험을 다시 돌리기 위해 필요한 파일, 명령어, 환경, checksum, checkpoint 추적 기준.

재현성 문서 열기
Registry

Run Registry and Result Template

main, screening, failed/excluded run을 같은 형식으로 기록하는 표준 템플릿.

실행 기록 열기
Matrix

Sprint 2 Paper Matrix

S3/S4 backbone과 full/partial/ArcFace/LoRA 조건의 공정 비교 matrix.

실험 매트릭스 열기
Screening

Sprint 2 5-fold Screening

기존 S3 pilot과 S4 ArcFace partial 결과. 최종 결론이 아니라 후보 탐색 기록이다.

screening 결과 열기
Results

Sprint 2 Main Matrix Results

8개 config x 5 folds, 총 40개 main run의 평균/표준편차, fold별 raw table, screening 분리 기록.

main 결과 열기
Text Retrieval

Semantic Text Search Evaluation

MobileCLIP2-S3 text encoder 기반 자연어 검색의 tokenizer parity, text index, query regression, OOS 보정 결과.

텍스트 검색 평가 열기
Protocol

Legacy Protocol Page

기존 실험 프로토콜과 누적 결과. 새 허브에서는 하위 상세 기록으로 참조한다.

기존 프로토콜 열기

작업 프롬프트

새로운 결과 파일을 받았거나 실험 문서를 갱신할 때는 아래 프롬프트를 기준으로 작업한다. 핵심은 추측하지 않고, 결과와 해석을 분리하며, 재현 가능성 증거가 없는 항목은 pending으로 남기는 것이다.

너는 Landmark Assistant의 모델 실험 기록 담당자다.

목표:
MobileCLIP2 기반 랜드마크 인식 실험을 논문 작성 가능한 수준으로 기록한다.

작업 순서:
1. 현재 docs/experiments/paper 구조를 확인한다.
2. 새 결과가 main, screening, failed/excluded 중 어느 범주인지 분류한다.
3. dataset fingerprint, split manifest, config, seed, commit, W&B run id, checkpoint, metric export가 있는지 확인한다.
4. 누락된 값은 추측하지 않고 "missing" 또는 "pending"으로 표시한다.
5. 같은 조건 비교인지 먼저 검증한다. backbone, train method, loss, epoch, split, metric이 다르면 결론을 보류한다.
6. 결과는 fold별 값, mean, std, best/worst fold, hard-case, low-margin, error taxonomy로 정리한다.
7. PyTorch 성능과 ONNX/INT8/mobile runtime 성능은 분리해서 기록한다.
8. 실패 실험과 제외 사유를 삭제하지 않고 Run Registry에 남긴다.
9. 최종 모델 선택은 validation 기준으로 먼저 판단하고, locked test는 최종 보고용으로만 사용한다.
10. 문서 수정 후 HTML 파싱, 내부 링크, 오래된 로컬 GPU 기준 표현 잔존 여부를 검증한다.

완료 조건:
- Research Design, Reproducibility, Run Registry 중 관련 문서가 갱신되어 있다.
- 새 결과가 어떤 실험 범주인지 명시되어 있다.
- 재현에 필요한 최소 자료가 기록되어 있다.
- 비교 불가능한 결과를 최종 결론처럼 쓰지 않는다.
- 검증 명령과 결과가 마지막에 남아 있다.

현재 완료 체크

항목 상태 근거 / 다음 작업
논문화 실험 문서 허브 작성 현재 페이지와 하위 문서가 source of truth 역할을 한다.
연구 질문과 가설 작성 Research Design에서 관리한다.
재현성 체크리스트 작성 Reproducibility and Artifacts에서 관리한다.
main matrix 결과 작성 Sprint 2 Main Matrix Results에서 40-run 결과를 관리한다.
최종 모델 선택 보류 공정 비교 수치는 정리되었지만, deployment/runtime parity가 끝나기 전에는 앱 최종 모델로 단정하지 않는다.