报告

2026年LLM现状:领奖台报告

截至2026年8月的模型格局快照,全部取自我们排行榜背后的数据——58个追踪模型、25项基准测试、五个来源排行榜。

领奖台顶端

Claude Mythos Preview97.4 稳居第1,其后是 Claude Fable 5(93.4)以及——领奖台上唯一的非Anthropic模型——Kimi K3(83.3),它也是我们追踪的最佳开放权重模型。Anthropic 占据前五中的四席。

开放权重差距:14分,且在收窄

Kimi K3 的 83.3 落后专有前沿约14个 Podium 分。在 LiveCodeBench 上它击败了几款价格贵十倍的闭源模型。不过开放模型前三名之后,分数跌破50——开放阵营目前在前沿只有一家的深度。

定价:178倍的价差

输出定价从 $0.28/M(DeepSeek V4 Flash)到 $50/M(Claude Fable 5)。市场已分成三层:实用级(<$1/M)、主力级($1–10/M)与前沿级($25–50/M)。价值排行榜显示每美元智能的甜区在主力级。

速度:Flash之战

Google 的 Flash 家族占据整个速度领奖台——Gemini 3.5 Flash-Lite 达 389 token/秒——而 Meta 的 Muse Spark 1.1(208 t/s,$4.25/M)是今年速度性价比的最佳故事。

什么决定了2026

代理类基准测试取代聊天偏好成为主战场:SWE-Bench Verified(Fable 5 达95%)与 Terminal-Bench 拉开了领先者,而 Humanity's Last Exam 仍是前沿的天花板——没有人能从容通过。欢迎在新的对战页面探索任意组合。

← 返回所有文章