当前最强大的 AI 大模型(截至 2026-09-09)
结论:没有唯一答案,闭源头部是 OpenAI GPT-6 Astra 与 Anthropic Claude Fable 5.1 双雄。 两者一周内前后脚发布(Fable 5.1 于 09-01,Astra 于 09-03),基础定价同为 $10/$50 每百万 token。分歧点很清晰:
- Astra 赢在编程/终端类基准(自带 Codex 脚手架)
- Fable 5.1 赢在独立综合智能体 Elo,而且赢得相当彻底
最关键的一个数据点(由完整性批判补出,草稿原本漏了):在 GDPval-AA v2 这个目前最有分量的独立智能体 Elo 榜上,GPT-6 Astra (max) = 1580,总排名第 21,落后于 Fable 5.1 Max (1764)、Opus 5 Max (1735)、Opus 5 Xhigh (1708)、Muse Spark 1.3 (1703)、GLM-5.3 (1676)、Qwen3.8 Max (1630)、GPT-5.6 Sol (1624)、Kimi K3 (1584)。如果只能选一个"最强",按独立第三方综合口径应该是 Claude Fable 5.1。
分维度冠军
| 维度 | 冠军 | 依据 |
|---|---|---|
| 综合(独立 Elo) | Claude Fable 5.1 | GDPval-AA 实时 1764 第 1;arena.ai Agent 榜 14.51% 第 1;BenchAlign 84.36 第 1 |
| 终端/编程 | GPT-6 Astra | tbench.ai Terminal-Bench 4.0 58.2%±2.8 第 1(Fable 5.1 紧随 57.9%±3.8);WebDev Arena 1796 + Code Arena 双第 1 |
| 长时程自主 | 争议 | Vending-Bench 2:Astra $15,514.70 第 1(挤掉 Opus 5 的 $11,181.87);但 METR 时间跨度榜最高 17.41h 属 Claude Mythos Preview (early),数据截止 2026-05-08,未测 Astra/Fable 5.1 |
| 数学/科学 | ⚠️ 无独立数据 | 仅厂商自报:Astra FrontierMath T4 98%、ARC-AGI-3 99.9%;Gemini 3.1 Pro GPQA Diamond 94.3%、ARC-AGI-2 77.1%;微软 MAI-Thinking-1 AIME 2026 94.5% |
| 人类偏好 | 按域分裂 | Fable 5.1 拿 Agent + BenchAlign;Astra 拿 WebDev + Code |
| 长上下文 | Astra / Kimi K3 | 窗口最大:Astra 1,050,000、Kimi K3 1,048,576;有质量验证的是 Gemini 3.1 Pro(MRCR v2 84.9@128K / 26.3@1M)。Fable 5.1 与 Opus 5 的 1M 已由官方平台文档独立确认 |
| 开源权重 | GLM-5.3(Z.ai) | AA 智能指数 45 = 开源第 1(753B,自定义许可);后接 Kimi K3 (44)、Qwen3.8-2.4T-A95B、GLM-5.3-Flash (42, MIT) |
| 性价比 | Claude Opus 5 | $5/$25,GDPval-AA 1735 总第 3;Grok 4.6 更便宜 $2/$6 |
| GUI 电脑操作 | Fable 5[1m] | OSWorld-Verified 86.0%——是 Fable 5,不是 5.1(常见张冠李戴) |
Top 模型对比
| 模型 | 厂商 | 发布 | 已验证代表成绩 |
|---|---|---|---|
| Claude Fable 5.1 | Anthropic | 09-01 | $10/$50,缓存读 $0.25/M(砍 75%);GDPval-AA 1764 第 1、arena Agent 14.51% 第 1、BenchAlign 84.36 第 1、TB4 57.9% 第 2;1M 上下文(官方文档确认) |
| GPT-6 Astra | OpenAI | 09-03 | $10/$50(另有 $20/$75 高等级、flex $2/$25);TB4 58.2% 第 1、WebDev/Code Arena 第 1、Vending-Bench 2 第 1;1.05M 上下文;但 GDPval-AA 仅 1580 第 21 |
| Claude Opus 5 | Anthropic | 07-24 | $5/$25;GDPval-AA 1735 总第 3(Xhigh 档 1708 第 4);ALE 55.5% |
| Meta Muse Spark 1.3 | Meta | 09-02 | GDPval-AA 1703 第 5,1M 上下文(1.1 版在 Scale SWE-bench Pro 公开榜第 1,61.5%±3.1) |
| GLM-5.3 | Z.ai | 08-14(权重 08-28) | 开源第 1,AA 指数 45;GDPval-AA 1676 第 6;TB4 41.8%(非 OpenAI/Anthropic 系最高) |
| Qwen3.8 Max | 阿里 | 09-02 | GDPval-AA 1630,高于 Astra;2.4T/1M;开源版 SWE-bench Pro 67.7 |
| Grok 4.6 | xAI | 08-12 | $2/$6 最便宜;AA 指数 61(xAI 官网口径,跨快照有争议)。Grok 4.7 预计 ~09-12 发布,xAI 声称将全面超越 |
| Gemini 3.1 Pro | 02-19 | GPQA 94.3、SWE-Bench Verified 80.6、1M + MRCR 验证;短板:Pro 线自 2 月停更,只有 Flash 在迭代(3.8 Flash 在 TB4 仅第 10,19.1%) |
被推翻 / 存疑的流行说法
- ❌ "OpenAI 全面领先" — 独立榜按域分裂,Astra 在综合 Elo 上甚至排第 21
- ❌ GLM-5.3 "GDPval 1769 打败所有闭源" — 8 月过期快照,Elo 已重锚定,实时 1676 第 6
- ❌ OSWorld 86.0% 属 Fable 5.1 — 实为 Fable 5
- ❌ METR 17.41h 属 Mythos 5.1 — 实为 Mythos Preview (early),数据比 5.1 发布早四个月
- ❌ DeepSeek V4 早期世系日期(base 2/17、Pro 6/22)— 官方 changelog 无记录,判定为编造;真实旗舰是 V4-Pro-0813(1.7T,GA 08-13)
- ⚠️ AA 式智能指数跨快照互相矛盾(一说 Fable 最高、一说 Astra 59.1 vs 52.0、xAI 又标 Grok 61)——不同快照排名不可混用
- ⚠️ tau2-bench "Qwen3.5 87.9% 开源第一" — 无法验证,第三方榜显示 GLM-5.2 以 99.1% 领先
如何选
- 终端/工程编程:GPT-6 Astra
- 通用智能体、长时程自主:Claude Fable 5.1(重度缓存场景成本优势最大,$0.25/M)
- 性价比生产:Claude Opus 5($5/$25)或 Grok 4.6($2/$6)
- 网安/生科受限领域:Claude Mythos 5.1(仅限美国组织,需通过验证计划)
- 1M 长文档:闭源 Astra 或 Gemini 3.1 Pro;开源自部署 Kimi K3
- 自托管:GLM-5.3(最强)/ GLM-5.3-Flash(MIT 低成本多模态)/ DeepSeek-V4-Pro-0813
- 数学科学:Astra 或 Gemini 3.1 Pro,但必须自己复测——这块没有独立数据
- 别急着定:Grok 4.7 约 09-12 发布