속도는 사용자가 매일 체감하는 벤치마크이며, 2026년의 폭은 엄청납니다: 정상 초당 389 토큰부터 대형 추론 모델의 한 자릿수까지. 속도 랭킹 기준 현황입니다.
지금 가장 빠른 모델
- Gemini 3.5 Flash-Lite — 389 t/s
- Gemini 3.5 Flash — 267 t/s
- Gemini 3.6 Flash — 233 t/s
- Muse Spark 1.1 (Meta) — 208 t/s
- Qwen3.7 Max — 203 t/s
Google의 Flash 계열이 포디움 전체를 차지했습니다. Meta의 Muse Spark 1.1도 주목할 만합니다: 208 t/s에 출력 $4.25/M로, 추적 중인 모델 중 속도 대비 달러 최고 옵션 중 하나입니다.
속도 vs 지능 트레이드오프
가장 빠른 모델이 가장 똑똑하지는 않습니다: Flash-Lite는 원시 능력을 처리량으로 바꿉니다. 2026년의 실용 패턴은 라우팅 — 초안과 도구 호출은 빠른 모델로, 어려운 5%는 Claude Mythos Preview 같은 프런티어 모델로. 비교 도구는 속도와 Podium Score를 나란히 보여줍니다.
채팅에는 지연 시간(TTFT)이 중요
체감 반응성은 첫 토큰까지의 시간이 지배합니다. 채팅 제품에서는 200 t/s에 TTFT 150ms 모델이 389 t/s에 콜드 스타트 2초 모델보다 더 빠르게 느껴집니다 — 항상 두 수치를 함께 보세요. 각 모델 프로필에 표시됩니다(예: Claude Fable 5: 71 t/s, TTFT 141ms).
결론
순수 처리량이면 Gemini Flash-Lite, 속도+품질 균형이면 Muse Spark 1.1이나 Qwen3.7 Max를. 실시간 수치는 속도 랭킹에서.