리포트

LLM 현황 2026: 포디움 리포트

2026년 8월 기준 모델 지형 스냅샷으로, 전부 저희 랭킹 뒤의 데이터에서 가져왔습니다 — 추적 모델 58개, 벤치마크 25개, 출처 리더보드 5개.

포디움 정상

Claude Mythos Preview97.4로 #1을 지키고, 이어 Claude Fable 5(93.4), 그리고 포디움의 유일한 비-Anthropic 모델인 Kimi K3(83.3)가 있습니다. K3는 추적 중인 최고 오픈 웨이트 모델이기도 합니다. Anthropic이 상위 5개 중 4개를 차지합니다.

오픈 웨이트 격차: 14점, 그리고 줄어드는 중

Kimi K3의 83.3은 독점 프런티어보다 약 14 Podium 포인트 아래입니다. LiveCodeBench에서는 10배 비싼 여러 폐쇄 모델을 이깁니다. 다만 오픈 상위 3개 이후 점수는 50 아래로 떨어집니다 — 오픈 진영은 현재 프런티어에서 한 랩의 깊이뿐입니다.

가격: 178배의 격차

출력 가격은 $0.28/M(DeepSeek V4 Flash)부터 $50/M(Claude Fable 5)까지. 시장은 세 단계로 나뉘었습니다: 유틸리티(<$1/M), 워크호스($1–10/M), 프런티어($25–50/M). 가치 랭킹은 달러당 지능의 스위트스팟이 워크호스 대에 있음을 보여줍니다.

속도: 플래시 전쟁

Google의 Flash 계열이 속도 포디움을 독차지했습니다 — Gemini 3.5 Flash-Lite가 초당 389 토큰 — 한편 Meta의 Muse Spark 1.1(208 t/s, $4.25/M)은 올해 최고의 속도 대비 달러 스토리입니다.

2026년을 결정한 것

에이전틱 벤치마크가 채팅 선호를 밀어내고 전장이 되었습니다: SWE-Bench Verified(Fable 5가 95%)와 Terminal-Bench가 선두를 갈랐고, Humanity's Last Exam은 여전히 프런티어의 천장 — 누구도 여유롭게 넘지 못합니다. 새로운 맞대결 페이지에서 어떤 매치업이든 탐색하세요.

← 전체 아티클