当前最强大的 AI 大模型(截至 2026-09-09)

结论:没有唯一答案,闭源头部是 OpenAI GPT-6 Astra 与 Anthropic Claude Fable 5.1 双雄。 两者一周内前后脚发布(Fable 5.1 于 09-01,Astra 于 09-03),基础定价同为 $10/$50 每百万 token。分歧点很清晰:

  • Astra 赢在编程/终端类基准(自带 Codex 脚手架)
  • Fable 5.1 赢在独立综合智能体 Elo,而且赢得相当彻底

最关键的一个数据点(由完整性批判补出,草稿原本漏了):在 GDPval-AA v2 这个目前最有分量的独立智能体 Elo 榜上,GPT-6 Astra (max) = 1580,总排名第 21,落后于 Fable 5.1 Max (1764)、Opus 5 Max (1735)、Opus 5 Xhigh (1708)、Muse Spark 1.3 (1703)、GLM-5.3 (1676)、Qwen3.8 Max (1630)、GPT-5.6 Sol (1624)、Kimi K3 (1584)。如果只能选一个"最强",按独立第三方综合口径应该是 Claude Fable 5.1。

分维度冠军

维度冠军依据
综合(独立 Elo)Claude Fable 5.1GDPval-AA 实时 1764 第 1;arena.ai Agent 榜 14.51% 第 1;BenchAlign 84.36 第 1
终端/编程GPT-6 Astratbench.ai Terminal-Bench 4.0 58.2%±2.8 第 1(Fable 5.1 紧随 57.9%±3.8);WebDev Arena 1796 + Code Arena 双第 1
长时程自主争议Vending-Bench 2:Astra $15,514.70 第 1(挤掉 Opus 5 的 $11,181.87);但 METR 时间跨度榜最高 17.41h 属 Claude Mythos Preview (early),数据截止 2026-05-08,未测 Astra/Fable 5.1
数学/科学⚠️ 无独立数据仅厂商自报:Astra FrontierMath T4 98%、ARC-AGI-3 99.9%;Gemini 3.1 Pro GPQA Diamond 94.3%、ARC-AGI-2 77.1%;微软 MAI-Thinking-1 AIME 2026 94.5%
人类偏好按域分裂Fable 5.1 拿 Agent + BenchAlign;Astra 拿 WebDev + Code
长上下文Astra / Kimi K3窗口最大:Astra 1,050,000、Kimi K3 1,048,576;有质量验证的是 Gemini 3.1 Pro(MRCR v2 84.9@128K / 26.3@1M)。Fable 5.1 与 Opus 5 的 1M 已由官方平台文档独立确认
开源权重GLM-5.3(Z.ai)AA 智能指数 45 = 开源第 1(753B,自定义许可);后接 Kimi K3 (44)、Qwen3.8-2.4T-A95B、GLM-5.3-Flash (42, MIT)
性价比Claude Opus 5$5/$25,GDPval-AA 1735 总第 3;Grok 4.6 更便宜 $2/$6
GUI 电脑操作Fable 5[1m]OSWorld-Verified 86.0%——是 Fable 5,不是 5.1(常见张冠李戴)

Top 模型对比

模型厂商发布已验证代表成绩
Claude Fable 5.1Anthropic09-01$10/$50,缓存读 $0.25/M(砍 75%);GDPval-AA 1764 第 1、arena Agent 14.51% 第 1、BenchAlign 84.36 第 1、TB4 57.9% 第 2;1M 上下文(官方文档确认)
GPT-6 AstraOpenAI09-03$10/$50(另有 $20/$75 高等级、flex $2/$25);TB4 58.2% 第 1、WebDev/Code Arena 第 1、Vending-Bench 2 第 1;1.05M 上下文;但 GDPval-AA 仅 1580 第 21
Claude Opus 5Anthropic07-24$5/$25;GDPval-AA 1735 总第 3(Xhigh 档 1708 第 4);ALE 55.5%
Meta Muse Spark 1.3Meta09-02GDPval-AA 1703 第 5,1M 上下文(1.1 版在 Scale SWE-bench Pro 公开榜第 1,61.5%±3.1)
GLM-5.3Z.ai08-14(权重 08-28)开源第 1,AA 指数 45;GDPval-AA 1676 第 6;TB4 41.8%(非 OpenAI/Anthropic 系最高)
Qwen3.8 Max阿里09-02GDPval-AA 1630,高于 Astra;2.4T/1M;开源版 SWE-bench Pro 67.7
Grok 4.6xAI08-12$2/$6 最便宜;AA 指数 61(xAI 官网口径,跨快照有争议)。Grok 4.7 预计 ~09-12 发布,xAI 声称将全面超越
Gemini 3.1 ProGoogle02-19GPQA 94.3、SWE-Bench Verified 80.6、1M + MRCR 验证;短板:Pro 线自 2 月停更,只有 Flash 在迭代(3.8 Flash 在 TB4 仅第 10,19.1%)

被推翻 / 存疑的流行说法

  • ❌ "OpenAI 全面领先" — 独立榜按域分裂,Astra 在综合 Elo 上甚至排第 21
  • ❌ GLM-5.3 "GDPval 1769 打败所有闭源" — 8 月过期快照,Elo 已重锚定,实时 1676 第 6
  • ❌ OSWorld 86.0% 属 Fable 5.1 — 实为 Fable 5
  • ❌ METR 17.41h 属 Mythos 5.1 — 实为 Mythos Preview (early),数据比 5.1 发布早四个月
  • ❌ DeepSeek V4 早期世系日期(base 2/17、Pro 6/22)— 官方 changelog 无记录,判定为编造;真实旗舰是 V4-Pro-0813(1.7T,GA 08-13)
  • ⚠️ AA 式智能指数跨快照互相矛盾(一说 Fable 最高、一说 Astra 59.1 vs 52.0、xAI 又标 Grok 61)——不同快照排名不可混用
  • ⚠️ tau2-bench "Qwen3.5 87.9% 开源第一" — 无法验证,第三方榜显示 GLM-5.2 以 99.1% 领先

如何选

  • 终端/工程编程:GPT-6 Astra
  • 通用智能体、长时程自主:Claude Fable 5.1(重度缓存场景成本优势最大,$0.25/M)
  • 性价比生产:Claude Opus 5($5/$25)或 Grok 4.6($2/$6)
  • 网安/生科受限领域:Claude Mythos 5.1(仅限美国组织,需通过验证计划)
  • 1M 长文档:闭源 Astra 或 Gemini 3.1 Pro;开源自部署 Kimi K3
  • 自托管:GLM-5.3(最强)/ GLM-5.3-Flash(MIT 低成本多模态)/ DeepSeek-V4-Pro-0813
  • 数学科学:Astra 或 Gemini 3.1 Pro,但必须自己复测——这块没有独立数据
  • 别急着定:Grok 4.7 约 09-12 发布