每年"开放模型落后两年"的说法都会被重新检验,而每年差距都在缩小。2026年8月,我们追踪的最佳开放权重模型——Moonshot AI 的 Kimi K3——Podium Score 为 83.3,而最佳专有模型 Claude Mythos Preview 为 97.4。
一个数字看懂差距
在归一化的 0–100 刻度上,开放权重前沿落后专有前沿约 14 分。这大约是专有模型第1名与第8名之间的距离——显著,但已不再是另一个量级。在 LiveCodeBench 上,Kimi K3(74.7%)击败了数款每 token 价格高10倍的闭源模型。
当前最佳开放权重模型
- Kimi K3(Moonshot AI)— 83.3
- GLM-5.2(Z.ai)— 59.1
- MiMo V2.5 Pro(Xiaomi)— 50.3
- DeepSeek V4 Pro — 44.8
- Kimi K2.6 — 44.3
长尾下滑很快:前三名之后,分数跌破50。诚实的解读是:目前只有一家开放实验室在前沿竞争,其余聚集在下一梯队。
开放权重何时仍然获胜
自托管、数据隐私、微调与每 token 经济性。DeepSeek V4 Flash 输出价格 $0.28/M,让高吞吐负载在专有模型 $25–50/M 定价无法支撑的场景下变得可行。对受监管行业而言,能在本地运行权重往往比几分基准测试更有价值。