DACON 멀티모달 바이어스 개발일지 03: 결과 정리
결과 표
| exp_id | model_id | model_family | prompt | training | public_score |
|---|---|---|---|---|---|
| E002 | Qwen/Qwen3.5-9B | qwen | safe_generic_v0 | zero_shot | 0.98941 |
| E004 | Qwen/Qwen3.5-9B | qwen | decisive_evidence_v1 | zero_shot | 0.98800 |
| E006 | OpenGVLab/InternVL3_5-8B-HF | internvl | safe_generic_v0 | zero_shot | 0.00000 |
| E008 | zai-org/GLM-4.1V-9B-Thinking | glm | safe_generic_v0 | zero_shot | 0.00000 |
| E009 | Qwen/Qwen3.5-9B | qwen | trained_v0 | qlora_sft | 0.00000 |
| E010 | OpenGVLab/InternVL3_5-8B-HF | internvl | trained_v0 | qlora_sft | 0.00000 |
| E011 | zai-org/GLM-4.1V-9B-Thinking | glm | trained_v0 | qlora_sft | 0.00000 |
| D001 | Qwen/Qwen3.5-9B | qwen | test_informed_diagnostic_v0 | zero_shot | 0.00000 |
내용 정리
E002
첫 실험인 E002의 public score : 0.98941로 [2026-06-05 00:10:13] 기준 28등이였습니다.
처음 실험이였기에, 우선 시간은 고려하지 않고 가장 간단한 방법으로 VLM을 돌려보는 것을 목표로 했었습니다. 아마 4시간 걸려서 된 것 같네요.
처음에 T4로 해두고, BATCH를 2로 설정했었기에 당연히 오랜 시간이 걸릴 수 밖에 없었고, 중간에 Pro를 구매한 뒤 A100으로 바꿔서 BATCH를 32로 늘려서 진행했는데, 그래도 1시간 30분 정도 걸렸던 것 같습니다.
E004
두번째 실험인 E004의 public score : 0.988로 [2026-06-05 02:02:30] 기준 30등이였습니다.
elapsed=81.3 min으로 70분 기준을 넘어섰기에, 기존의 변수들을 조정해야할 필요가 있었습니다.
점수가 하락했지만, 이 프롬프트가 나쁘냐라는 건 알 수 없는 것 같습니다. E002는 시간을 무제한급으로 두고 진행했기에 점수가 높게 나왔을 수 있고, E004는 BATCH를 32로 늘려서 진행했기에 점수가 조금 하락할 수도 있었다는 생각은 합니다.
그래서 E002를 BATCH 32, MAX_NEW_TOKENS 48로 해서 다시 돌려보는 것도 괜찮을 것 같다는 생각이 들었습니다. (E002나 E004나 모델은 동일합니다)
| 변경 | 속도 개선 | 정확도 리스크 |
|---|---|---|
| MAX_NEW_TOKENS 80 → 48 | 중간 | 낮음 |
| MAX_PIXELS 200704 → 150528 | 중간 | 낮음~중간 |
| MAX_PIXELS 150528 → 131072 | 큼 | 중간 |
| Reasoning 제거, Answer만 출력 | 큼 | 알 수 없음 |
| BATCH 32 → 48/64 | 불확실 | OOM 리스크 |
위에서 먼저, MAX_NEW_TOKENS를 80에서 48로 줄이는 것은, reasoning이 길어지는 것을 방지하기 위한 것이였습니다.
reasoning이 길어지는 경우가 많았고, reasoning이 길어지는 경우에는 시간이 오래 걸리는 경우가 많았기에, MAX_NEW_TOKENS를 줄이는 것은 시간 개선에 도움이 될 것이라고 생각했습니다.
E002 BATCH 32, MAX_NEW_TOKENS 48
elapsed=33.5 min public score : 0.9739166667으로 점수가 많이 하락했지만, 33.5분이라는 단축된 시간 안에 실험이 완료되었습니다.
이제 시간과 점수 사이에서 적절한 균형점을 찾아야할 필요가 있을 것 같습니다.
문제를 확인해보니 토큰 길이가 짧아지면서 아래와 같은 형태의 Reasoning만 있고, Answer가 없는 경우가 제법 생겼습니다.
Reasoning: The text explicitly states that Zahra Al-Zoubi disparaged women and claimed they are naturally inferior, which aligns with being a misogynist, while Imani Singleton only agreed that different rules could sometimes make sense but shouldn
다음 전략
VLM이 처리를 어려워 하는 샘플만 따
의문점: LLM이다 보니, 같은 프롬프트임에도 불구하고 매번 같은 답을 내지 못하는 것일까??
댓글