How to work with experiment results · 2026-05-21
실험 결과 전달과 문서 반영 가이드
모델 실험 결과가 나왔을 때 무엇을 모아야 하고, 그 결과를 어떻게 분석·문서화·논문화할지 정리한 운영 문서다. 이 문서를 기준으로 결과 파일을 전달하면, 이후 분석과 문서 반영을 일관된 방식으로 진행한다.
핵심 흐름
논문 작성과 실험 결과 반영은 연결되어 있지만 같은 작업은 아니다. 평소에는 실험 결과를 먼저 수집하고, 분석 문서에 반영한다. 여러 실험이 쌓이면 그 기록을 바탕으로 논문 본문을 작성한다.
실험 실행
→ 결과 파일 전달
→ 결과 검증
→ 해석 작성
→ docs 반영
→ 누적 결과를 논문 구조에 편입
내가 준비해야 하는 것
모든 항목을 항상 줄 필요는 없다. 하지만 아래 항목이 많을수록 분석 품질이 올라간다.
| 자료 | 예시 | 왜 필요한가 |
|---|---|---|
| 실험 이름 | mobileclip2_s4_partial_unfreeze_ce_hardneg_fold0 |
문서와 W&B, run folder를 연결하기 위해 필요하다. |
| config | configs/experiments/mobileclip2_s4_partial_unfreeze_ce_hardneg.yaml |
무엇을 바꾼 실험인지 확인한다. |
| dataset fingerprint | 9f1c5b9... |
다른 데이터셋으로 나온 결과를 같은 조건처럼 비교하지 않기 위해 필요하다. |
| metrics.json | runs/.../metrics.json |
Top-1, Top-3, macro F1, hard-case, text retrieval 등 정량 결과의 핵심이다. |
| prediction 로그 | predictions_test.jsonl, predictions_text_queries.jsonl |
어떤 이미지나 query에서 틀렸는지 분석한다. |
| low-margin 파일 | low_margin_test.csv |
정답은 맞았지만 애매한 케이스를 찾아낸다. |
| W&B 링크 또는 export | run URL, CSV export | 학습 곡선, overfitting, loss 안정성을 확인한다. |
| 실패 이미지/스크린샷 | 광화문인데 근정문/청와대가 함께 보이는 이미지 | 숫자로만 안 보이는 실제 오류 원인을 분석한다. |
| 내 관찰 메모 | “광화문 야간 이미지는 점수가 낮음” | 정량 로그와 사람이 본 문제를 연결한다. |
가장 간단한 전달 형식
바쁠 때는 아래 형식으로만 보내도 된다.
실험 이름:
사용 config:
dataset fingerprint:
run 폴더:
W&B 링크:
첨부 파일:
- metrics.json
- predictions_test.jsonl
- low_margin_test.csv
특이한 점:
궁금한 점:
결과를 받으면 내가 하는 일
-
파일 존재와 구조 확인
필수 파일이 있는지, JSON/CSV가 열리는지, class 수와 dataset fingerprint가 맞는지 확인한다.
-
정량 결과 요약
Top-1, Top-3, macro F1, hard-case accuracy, low-margin count, text retrieval 결과를 표로 정리한다.
-
비교 해석
baseline보다 무엇이 좋아졌고 나빠졌는지, 비교 조건이 공정한지 확인한다.
-
오류 분석
confusion pair, low-margin case, OOS/저품질 실패, 자연어 검색 실패를 원인별로 묶는다.
-
문서 반영
결과 표, 실험 해석, 실패 케이스, 다음 실험 계획을 관련 HTML 문서에 반영한다.
-
논문 재료로 정리
실험이 충분히 쌓이면 모델 개발 과정 논문 문서의 Method, Results, Discussion에 편입한다.
논문 작성과의 관계
논문 작성은 실험 결과를 받을 때마다 바로 완성되는 작업이 아니다. 먼저 실험별 기록을 쌓고, 그중 신뢰할 수 있는 결과를 골라 논문 본문으로 옮긴다.
| 작업 | 목적 | 문서 위치 |
|---|---|---|
| 실험 결과 반영 | 새 run의 결과와 해석을 누적한다. | Model Experiment Protocol |
| 모델 개발 서사 정리 | 왜 이런 결정과 실험을 했는지 논문 흐름으로 정리한다. | Model Development Paper Guide |
| 최종 논문 초안 | Abstract, Introduction, Method, Results, Discussion 형태로 작성한다. | 추후 별도 문서 생성 |
분석할 때 지키는 원칙
- 결과 파일에 없는 값은 추측해서 채우지 않는다.
- 명령이 성공했다는 것과 모델이 좋아졌다는 것을 구분한다.
- dataset fingerprint가 다르면 “동일 조건 비교”라고 쓰지 않는다.
- validation 결과는 모델 선택에 쓰고, test 결과는 최종 보고용으로 둔다.
- 좋아진 점과 나빠진 점을 같이 쓴다.
- 실패 케이스는 삭제하지 않고 다음 실험 근거로 남긴다.
- 앱 UI 성과와 모델 성과를 섞어 쓰지 않는다.
- 논문 표현에서는 검증된 사실, 해석, 추측을 분리한다.
결과를 주기 전 체크리스트
- 이 실험이 어떤 질문에 답하려는지 알고 있는가?
- config 파일명을 알고 있는가?
- dataset fingerprint를 확인했는가?
- metrics.json을 확보했는가?
- 틀린 케이스 또는 애매한 케이스 파일을 확보했는가?
- W&B run URL 또는 export를 확보했는가?
- 내가 봤을 때 이상한 점을 한두 문장으로 적었는가?