728x90
- 리플레이: https://hehee9.github.io/maze-bench/public/index.html
- 리더보드: https://hehee9.github.io/maze-bench/public/leaderboard.html
- Hugging Face Space: https://huggingface.co/spaces/Hehee-dev/maze-bench
- GitHub: https://github.com/hehee9/maze-bench (제작: hehee9, Apache 2.0)
Maze Bench Replay — Compare Model Maze-Solving Paths
Replay and compare how LLMs navigate visual mazes, including optimal paths, movement logs, and outcomes.
hehee9.github.io
한 줄 소개
Maze Bench는 AI 모델에게 미로 이미지를 보여주고 탈출 경로를 만들게 한 뒤, 그 풀이를 한 수씩 재생(replay) 하며 점수화·비교하는 독립 오픈소스 벤치마크입니다. 핵심 목적은 "연속적인 시각·공간 추론(continuous visual and spatial reasoning)" 능력 측정.
⚠️ 흔한 오해 정정: 좌표·벽 정보를 텍스트로 주는 게 아니라 미로를 이미지로 줍니다. 그래서 이건 순수 논리 퍼즐이 아니라 "그림을 보고(vision) + 길을 계획하는(reasoning)" 멀티모달 과제입니다. 텍스트만 잘하는 모델은 여기서 고전합니다.
- 1. 과제 방식 — 모델은 무엇을 하나이동 명령 (4방향, 상대 방향)
명령의미이 "상대 방향"이 난이도를 확 올립니다. "오른쪽으로 가"가 절대 동쪽이 아니라 지금 향한 쪽 기준의 오른쪽이라, 모델이 매 스텝 자기 방향(heading) 상태를 머릿속에서 갱신해야 합니다. 방향을 놓치면 그 뒤 경로가 통째로 어긋납니다.한 줄 문자열로 반환. (코드블록으로 감싸는 것도 허용) 이 문자열을 채점기가 그대로 실행해 점수를 냅니다.
S 앞으로 (forward) B 뒤로 (backward) R 오른쪽 (right) L 왼쪽 (left)
2. 미로 구성 — 난이도와 경로 유형난이도크기경로 유형 (출발-도착 변의 관계)Easy 4x4, 6x6 Medium 9x9, 12x12 Hard 15x15, 18x18 유형의미adjacent 출발·도착이 인접한 변 opposite 반대편 변 (보통 가장 긴 경로) same 같은 변
3. 점수 계산 — 왜 "성공/실패"만 보지 않나- P (진행도, Progress) = m / (m + r)
- E (효율성, Efficiency) = D / (m + r)
- D = 출발→목표 최소 이동 수 (정답 경로 길이)
- m = 벽에 안 부딪히고 성공한 이동 수
- r = 멈춘 최종 위치에서 목표까지 남은 최소 이동 수
4. 결과 — 현재 리더보드에서 드러난 것종합 상위: Claude Fable 5 → Kimi K3 → GPT-5.6 Sol → Gemini 3.5 Flash핵심 발견- 가장 잘하는 Claude Fable 5조차 종합 40% 미만. → 현행 최상위 모델에게도 시각·공간 추론은 여전히 어려운 영역이라는 뜻. (미로는 사람에겐 쉽지만 LLM에겐 아직 난제)
- 모델별 강점이 갈림:
- Claude 계열: 작은 미로에 강하고 비용 효율 좋음.
- GPT / Kimi: 큰 미로에서 상대적으로 우수하지만 비용 효율은 낮음.
- 난이도가 Easy→Hard로 가면 점수가 급락(90%대 → 10%대). 격자가 커질수록 방향·경로를 끝까지 유지하기가 급격히 어려워짐.
5. 리플레이 뷰어 (님이 준 링크가 이것)- 미로 시각화: 벽·출발·도착·모델이 지나간 경로.
- 단계별 재생: 이전 / 다음 / 재생, 속도 0.5×~4×.
- 최단 경로 오버레이: 정답 경로와 겹쳐 보며 어디서 돌아갔는지 확인.
- 이동 로그(MOVEMENT LOG): 각 스텝의 명령 표시.
- URL 상태 공유: ?size=4x4&maze=maze_04x04_adjacent_01&model=MiniMax+M3+(thinking) — 특정 모델의 특정 미로 풀이 장면을 링크로 공유.
요약- 정체: LLM이 미로 이미지를 보고 탈출 경로를 짜는 능력을 측정하는 시각·공간 추론 벤치마크.
- 입력/출력: 미로 이미지 → S/B/R/L(상대 방향) 한 줄 명령.
- 채점: 100 × 진행도(P) × 효율(E) — 성공/실패가 아닌 연속 점수.
- 난이도: Easy(4
6) / Medium(912) / Hard(15~18), 경로유형 adjacent·opposite·same. - 핵심 결론: 최상위 모델도 종합 40% 미만 → 아직 미해결 난제. 작은 미로는 Claude, 큰 미로는 GPT/Kimi.
- 차별점: 결과를 replay로 시각화해 "어떻게 풀었는지"를 드러냄
-
S R L S R R L L ...
728x90
'기타 > 관심(●'◡'●)' 카테고리의 다른 글
| [복붙]claude buddy (0) | 2026.04.28 |
|---|---|
| [퍼옴]Web기반 무료 3D 인테리어 프로그램 3종 사용기 (0) | 2025.12.19 |
| 챗GPT 아틀라스(ChatGPT Atlas) (0) | 2025.10.22 |
| n8n에서 GitLab Personal Access Token 생성 (0) | 2025.09.17 |
| 한국어 특화 임베딩 모델(snunlp/KR-SBERT-V40K-klueNLI-augSTS) (0) | 2025.09.11 |