← 返回博客

从 GOAT 到拉完了:2026 年 7 月主流大模型排位

从 GOAT 到拉完了:2026 年 7 月主流大模型排位

7 月 9 日一天之内:OpenAI 发布 GPT-5.6 全家族,Grok 4.5 向公众开放,Meta 交出史上第一个收费模型 Muse Spark 1.1。一星期后,Kimi K3 开源登场,数小时内冲上前端榜第一。再过四日,也就是今日,Claude Fable 5 的订阅新政正式生效。

同一个月,Google 的 Gemini 3.5 Pro 第三次错过自己定下的发布日。

一个月,塞进了一年的戏。于是一个老问题又被问了一万次:现在到底该用哪个模型?

这篇文章给出一份有立场的答案:2026 年 7 月 20 日这一天,主流大模型从 GOAT 排到拉完了,每一级都附理由与缺点。先讲清楚尺是怎样量的,再逐级点评,最后拆四个读榜单最常中的陷阱。

排位之前:三把尺

挑模型跟挑补习老师是同一回事。公开考试成绩当然要看,但没有家长只看成绩——还要看收费是否合理,以及老师到底教不教你住的那一区。

所以本排位用三把尺,缺一不可:

  1. 综合能力:以 Artificial Analysis Intelligence Index(v4.1,汇总 GDPval、Terminal-Bench、GPQA Diamond 等 9 项评测)为主要基准,辅以单项榜单。

  2. 价格:同样的工作,付出的成本差多少。7 月正值价格战,这把尺的变动比上把更大。

  3. 可用性:今天就用得到,还是仍在「即将推出」。对香港与中国用户,这把尺还包括「官方到底做不做你的生意」。

一个必须先讲的事实:目前综合榜前十名的分差只有 8.5 分。换言之,山顶上非常拥挤,排位是一张快照,不是判词。

排位正文

GOAT:Claude Fable 5

Anthropic 6 月 9 日发布、7 月 1 日全球开放的 Mythos-class 旗舰,目前以 59.9 分坐在 Artificial Analysis 综合榜第一位。长文推理、agentic 任务、代码工程全面在线,是「不想妥协时的预设答案」。

缺点同样清楚:它属最贵的一档,而且订阅权限一个月内几经变动——7 月 20 日起纳入 Max 与 Team Premium,但只按标准额度的 50% 提供。另一句诚实话:第二名只落后一分。GOAT 是事实,但不是断层。

顶级:GPT-5.6 Sol・Kimi K3

GPT-5.6 Sol(OpenAI,7 月 9 日发布):综合榜 58.9 分,与第一名几乎贴身。它的叙事不是「最聪明」,而是「更少 token、更低成本做到同级结果」,配合 Cerebras 推理最高每秒 750 tokens,是效率与速度的旗舰。GPT-5.6 起,OpenAI 改用 Sol/Terra/Luna 三档命名,日后各档按自己节奏升级。

Kimi K3(Moonshot AI,7 月 16 日发布):本月最大变数。约 2.8 万亿参数 MoE、1M token context 的开源路线模型,综合榜 57.1 分排第三;发布数小时内在 Frontend Code Arena 由第 18 位跳上第 1,七个分项拿下六个。价格约为闭源旗舰的三分之一,kimi.com 另设免费档。

各自的缺点:Sol 的深度绑定在 OpenAI 生态,迁移成本不低;K3 综合分仍落后两分余——单项登顶是真的,全面超越是标题党。

能用:每日主力层

这一级的共通点:不是榜首,但价格与稳定度令它们成为多数人的日常主力。

模型

一句定位

一句缺点

Claude Opus 4.8

久经考验的工作马,生态与工具链最成熟

综合分已被 K3 贴近,光环让给了 Fable 5

Claude Sonnet 5

6 月底上市,贴近 Opus 4.8 表现的性价比新主力

上市未满一个月,优惠定价属限时

GPT-5.6 Terra

日常工作的性价比正解,旗舰八成功力

难的任务仍要升级 Sol

Grok 4.5

7 月 8 日上线的 coding/agentic 特化,定价比同级低约六成

综合智能约 54 分,非全能选手

DeepSeek V4

开源阵营的价格屠夫,大规模调用成本最低

风头被 K3 抢去,生态走弱

GLM-5.2

Z.ai 的 744B MoE,开源 agentic coding 榜首

知名度在中国以外仍有限

顺带一提 Qwen3.6:授权最自由、单卡可跑,本地部署场景的首选,只是定位已偏离「主流对话旗舰」的赛道。

鸡肋:食之无味,弃之可惜

Muse Spark 1.1(Meta,7 月 9 日发布):Meta 首个收费模型,1M context,主打 agentic 任务,定价低至旗舰的十分之一级。问题出在 Meta 自己的对标名单——GPT-5.5、Opus 4.8、Gemini 3.1 Pro,全是上一代旗舰。用上一代的尺量自己,成绩再好看也要打折读。便宜是真便宜,能否经受时间考验,8 月再看。

Gemini 3.5 Flash(Google):模型本身不差,而且对香港用户有一重特殊意义——Gemini 是少数官方直接服务香港的顶级模型渠道,这是「弃之可惜」的一半。「食之无味」的另一半:旗舰缺席,一个中量级独力撑场,拿 Flash 对打别家的 Sol 与 Fable,是不对等竞赛。

拉完了:Gemini 3.5 Pro

本排位唯一因为「不存在」而垫底的模型。

原定 6 月发布,至今三度跳票;多方报道指原版本因 coding 与 recursive tool-calling 的结构性问题推倒重练;公开 API 至今没有 gemini-3.5-pro 的踪影。Google 成为唯一一家没有 2026 年旗舰在产的大厂。

必须补一句公道话:它一旦正式发布,很可能直接跳回顶级——「拉完了」评的是 2026 年 7 月 20 日的存在状态,不是 Google 的技术上限。这正是下一节第三个陷阱的引子。

读榜单的四个陷阱

一・把单项榜读成综合榜。「K3 压过 Fable 5」的正确读法是「在前端单项压过」,综合仍差两分余。单项榜选工具,综合榜选预设——两张榜答两条不同的问题。

二・用价钱猜实力。7 月是价格战月:Sol 定价低于上一代旗舰,能力反而更强;Grok 4.5 便宜六成,不代表缩水六成。价格反映的是竞争策略,不是能力刻度。

三・等一个完美模型。等 Gemini 3.5 Pro 的人已经等了三次。手上的工作不会等人:用今天最好的组合完成今天的事,新王登基之日再换不迟——反正没有迁移成本的用法(见陷阱四)才是正确用法。

四・把排位当圣旨。包括这一份。最可靠的测试永远是:拿你自己的真实任务——一份要改的合同、一段要调试的 code、一份要摘要的会议纪要——同一条指令喂两三个模型,并排比较输出。十五分钟的实测,胜过十篇排位文,包括本篇。

收尾:这份排位的有效期是一个月

7 月的教训恰恰是:不要跟任何一个模型结婚。一天三发、开源逆袭、旗舰跳票,全部发生在三十日之内。把不同科目交给不同的老师,每月重看一次成绩表,是 2026 年用 AI 的基本姿势。

8 月版排位会在下月同期更新:届时 K3 与 Muse Spark 都交出了首月实战成绩单,而 Gemini 3.5 Pro——看看它还在不在这一级。你的 GOAT 是谁?留言告诉我,8 月版会纳入读者投票。


*本文资料截至发稿日(2026 年 7 月 20 日),仅供一般参考,不构成任何建议;第三方产品之功能、价格与政策,以其官方最新公布为准;Essevin 服务详情以官网与 console 实际显示为准。