Hun-Bot

DACON 멀티모달 바이어스 개발일지 03: 결과 정리

DACON multimodal VLM Colab Qwen experiment-harness MLOps devlog

결과 표

exp_idmodel_idmodel_familyprompttrainingpublic_score
E002Qwen/Qwen3.5-9Bqwensafe_generic_v0zero_shot0.98941
E004Qwen/Qwen3.5-9Bqwendecisive_evidence_v1zero_shot0.98800
E006OpenGVLab/InternVL3_5-8B-HFinternvlsafe_generic_v0zero_shot0.00000
E008zai-org/GLM-4.1V-9B-Thinkingglmsafe_generic_v0zero_shot0.00000
E009Qwen/Qwen3.5-9Bqwentrained_v0qlora_sft0.00000
E010OpenGVLab/InternVL3_5-8B-HFinternvltrained_v0qlora_sft0.00000
E011zai-org/GLM-4.1V-9B-Thinkingglmtrained_v0qlora_sft0.00000
D001Qwen/Qwen3.5-9Bqwentest_informed_diagnostic_v0zero_shot0.00000

내용 정리

E002

첫 실험인 E002의 public score : 0.98941[2026-06-05 00:10:13] 기준 28등이였습니다.

처음 실험이였기에, 우선 시간은 고려하지 않고 가장 간단한 방법으로 VLM을 돌려보는 것을 목표로 했었습니다. 아마 4시간 걸려서 된 것 같네요.

처음에 T4로 해두고, BATCH를 2로 설정했었기에 당연히 오랜 시간이 걸릴 수 밖에 없었고, 중간에 Pro를 구매한 뒤 A100으로 바꿔서 BATCH를 32로 늘려서 진행했는데, 그래도 1시간 30분 정도 걸렸던 것 같습니다.


E004

두번째 실험인 E004의 public score : 0.988[2026-06-05 02:02:30] 기준 30등이였습니다.

elapsed=81.3 min으로 70분 기준을 넘어섰기에, 기존의 변수들을 조정해야할 필요가 있었습니다.

점수가 하락했지만, 이 프롬프트가 나쁘냐라는 건 알 수 없는 것 같습니다. E002는 시간을 무제한급으로 두고 진행했기에 점수가 높게 나왔을 수 있고, E004는 BATCH를 32로 늘려서 진행했기에 점수가 조금 하락할 수도 있었다는 생각은 합니다.

그래서 E002를 BATCH 32, MAX_NEW_TOKENS 48로 해서 다시 돌려보는 것도 괜찮을 것 같다는 생각이 들었습니다. (E002나 E004나 모델은 동일합니다)

변경속도 개선정확도 리스크
MAX_NEW_TOKENS 80 → 48중간낮음
MAX_PIXELS 200704 → 150528중간낮음~중간
MAX_PIXELS 150528 → 131072중간
Reasoning 제거, Answer만 출력알 수 없음
BATCH 32 → 48/64불확실OOM 리스크

위에서 먼저, MAX_NEW_TOKENS를 80에서 48로 줄이는 것은, reasoning이 길어지는 것을 방지하기 위한 것이였습니다.

reasoning이 길어지는 경우가 많았고, reasoning이 길어지는 경우에는 시간이 오래 걸리는 경우가 많았기에, MAX_NEW_TOKENS를 줄이는 것은 시간 개선에 도움이 될 것이라고 생각했습니다.

E002 BATCH 32, MAX_NEW_TOKENS 48

elapsed=33.5 min public score : 0.9739166667으로 점수가 많이 하락했지만, 33.5분이라는 단축된 시간 안에 실험이 완료되었습니다.

이제 시간과 점수 사이에서 적절한 균형점을 찾아야할 필요가 있을 것 같습니다.

문제를 확인해보니 토큰 길이가 짧아지면서 아래와 같은 형태의 Reasoning만 있고, Answer가 없는 경우가 제법 생겼습니다.

Reasoning: The text explicitly states that Zahra Al-Zoubi disparaged women and claimed they are naturally inferior, which aligns with being a misogynist, while Imani Singleton only agreed that different rules could sometimes make sense but shouldn

다음 전략

VLM이 처리를 어려워 하는 샘플만 따

의문점: LLM이다 보니, 같은 프롬프트임에도 불구하고 매번 같은 답을 내지 못하는 것일까??

data_automation_multimodal_bias 3 / 3

목차

댓글