截至2026年8月的模型格局快照,全部取自我们排行榜背后的数据——58个追踪模型、25项基准测试、五个来源排行榜。
领奖台顶端
Claude Mythos Preview 以 97.4 稳居第1,其后是 Claude Fable 5(93.4)以及——领奖台上唯一的非Anthropic模型——Kimi K3(83.3),它也是我们追踪的最佳开放权重模型。Anthropic 占据前五中的四席。
开放权重差距:14分,且在收窄
Kimi K3 的 83.3 落后专有前沿约14个 Podium 分。在 LiveCodeBench 上它击败了几款价格贵十倍的闭源模型。不过开放模型前三名之后,分数跌破50——开放阵营目前在前沿只有一家的深度。
定价:178倍的价差
输出定价从 $0.28/M(DeepSeek V4 Flash)到 $50/M(Claude Fable 5)。市场已分成三层:实用级(<$1/M)、主力级($1–10/M)与前沿级($25–50/M)。价值排行榜显示每美元智能的甜区在主力级。
速度:Flash之战
Google 的 Flash 家族占据整个速度领奖台——Gemini 3.5 Flash-Lite 达 389 token/秒——而 Meta 的 Muse Spark 1.1(208 t/s,$4.25/M)是今年速度性价比的最佳故事。
什么决定了2026
代理类基准测试取代聊天偏好成为主战场:SWE-Bench Verified(Fable 5 达95%)与 Terminal-Bench 拉开了领先者,而 Humanity's Last Exam 仍是前沿的天花板——没有人能从容通过。欢迎在新的对战页面探索任意组合。