← 返回 Blog

從 GOAT 到拉完了:2026 年 7 月主流大模型排位

從 GOAT 到拉完了:2026 年 7 月主流大模型排位

7 月 9 日一天之內:OpenAI 發布 GPT-5.6 全家族,Grok 4.5 向公眾開放,Meta 交出史上第一個收費模型 Muse Spark 1.1。一星期後,Kimi K3 開源登場,數小時內衝上前端榜第一。再過四日,也就是今日,Claude Fable 5 的訂閱新政正式生效。

同一個月,Google 的 Gemini 3.5 Pro 第三次錯過自己定下的發布日。

一個月,塞進了一年的戲。於是一個老問題又被問了一萬次:現在到底該用哪個模型?

這篇文章給出一份有立場的答案:2026 年 7 月 20 日這一天,主流大模型從 GOAT 排到拉完了,每一級都附理由與缺點。先講清楚尺是怎樣量的,再逐級點評,最後拆四個讀榜單最常中的陷阱。

排位之前:三把尺

揀模型跟揀補習老師是同一回事。公開試成績當然要看,但沒有家長只看成績——還要看收費是否合理,以及老師到底教不教你住的那一區。

所以本排位用三把尺,缺一不可:

  1. 綜合能力:以 Artificial Analysis Intelligence Index(v4.1,彙整 GDPval、Terminal-Bench、GPQA Diamond 等 9 項評測)為主要基準,輔以單項榜單。

  2. 價格:同樣的工作,付出的成本差多少。7 月正值價格戰,這把尺的變動比上把更大。

  3. 可用性:今天就用得到,還是仍在「即將推出」。對香港與中國用戶,這把尺還包括「官方到底做不做你的生意」。

一個必須先講的事實:目前綜合榜前十名的分差只有 8.5 分。換言之,山頂上非常擠迫,排位是一張快照,不是判詞。

排位正文

GOAT:Claude Fable 5

Anthropic 6 月 9 日發布、7 月 1 日全球開放的 Mythos-class 旗艦,目前以 59.9 分坐在 Artificial Analysis 綜合榜第一位。長文推理、agentic 任務、程式工程全面在線,是「不想妥協時的預設答案」。

缺點同樣清楚:它屬最貴的一檔,而且訂閱權限一個月內幾經變動——7 月 20 日起納入 Max 與 Team Premium,但只按標準額度的 50% 提供。另一句誠實話:第二名只落後一分。GOAT 是事實,但不是斷層。

頂級:GPT-5.6 Sol・Kimi K3

GPT-5.6 Sol(OpenAI,7 月 9 日發布):綜合榜 58.9 分,與第一名幾乎貼身。它的敘事不是「最聰明」,而是「更少 token、更低成本做到同級結果」,配合 Cerebras 推理最高每秒 750 tokens,是效率與速度的旗艦。GPT-5.6 起,OpenAI 改用 Sol/Terra/Luna 三檔命名,日後各檔按自己節奏升級。

Kimi K3(Moonshot AI,7 月 16 日發布):本月最大變數。約 2.8 萬億參數 MoE、1M token context 的開源路線模型,綜合榜 57.1 分排第三;發布數小時內在 Frontend Code Arena 由第 18 位跳上第 1,七個分項拿下六個。價格約為閉源旗艦的三分之一,kimi.com 另設免費檔。

各自的缺點:Sol 的深度綁定在 OpenAI 生態,遷移成本不低;K3 綜合分仍落後兩分餘——單項登頂是真的,全面超越是標題黨。

能用:每日主力層

這一級的共通點:不是榜首,但價格與穩定度令它們成為多數人的日常主力。

模型

一句定位

一句缺點

Claude Opus 4.8

久經考驗的工作馬,生態與工具鏈最成熟

綜合分已被 K3 貼近,光環讓給了 Fable 5

Claude Sonnet 5

6 月底上市,貼近 Opus 4.8 表現的性價比新主力

上市未滿一個月,優惠定價屬限時

GPT-5.6 Terra

日常工作的性價比正解,旗艦八成功力

難的任務仍要升級 Sol

Grok 4.5

7 月 8 日上線的 coding/agentic 特化,定價比同級低約六成

綜合智能約 54 分,非全能選手

DeepSeek V4

開源陣營的價格屠夫,大規模調用成本最低

風頭被 K3 搶去,生態走弱

GLM-5.2

Z.ai 的 744B MoE,開源 agentic coding 榜首

知名度在中國以外仍有限

順帶一提 Qwen3.6:授權最自由、單卡可跑,本地部署場景的首選,只是定位已偏離「主流對話旗艦」的賽道。

雞肋:食之無味,棄之可惜

Muse Spark 1.1(Meta,7 月 9 日發布):Meta 首個收費模型,1M context,主打 agentic 任務,定價低至旗艦的十分之一級。問題出在 Meta 自己的對標名單——GPT-5.5、Opus 4.8、Gemini 3.1 Pro,全是上一代旗艦。用上一代的尺量自己,成績再好看也要打折讀。便宜是真便宜,能否經受時間考驗,8 月再看。

Gemini 3.5 Flash(Google):模型本身不差,而且對香港用戶有一重特殊意義——Gemini 是少數官方直接服務香港的頂級模型渠道,這是「棄之可惜」的一半。「食之無味」的另一半:旗艦缺席,一個中量級獨力撐場,拿 Flash 對打別家的 Sol 與 Fable,是不對等競賽。

拉完了:Gemini 3.5 Pro

本排位唯一因為「不存在」而墊底的模型。

原定 6 月發布,至今三度跳票;多方報導指原版本因 coding 與 recursive tool-calling 的結構性問題推倒重練;公開 API 至今沒有 gemini-3.5-pro 的蹤影。Google 成為唯一一家沒有 2026 年旗艦在產的大廠。

必須補一句公道話:它一旦正式發布,很可能直接跳回頂級——「拉完了」評的是 2026 年 7 月 20 日的存在狀態,不是 Google 的技術上限。這正是下一節第三個陷阱的引子。

讀榜單的四個陷阱

一・把單項榜讀成綜合榜。「K3 壓過 Fable 5」的正確讀法是「在前端單項壓過」,綜合仍差兩分餘。單項榜選工具,綜合榜選預設——兩張榜答兩條不同的問題。

二・用價錢猜實力。7 月是價格戰月:Sol 定價低於上一代旗艦,能力反而更強;Grok 4.5 便宜六成,不代表縮水六成。價格反映的是競爭策略,不是能力刻度。

三・等一個完美模型。等 Gemini 3.5 Pro 的人已經等了三次。手上的工作不會等人:用今天最好的組合完成今天的事,新王登基之日再換不遲——反正沒有遷移成本的用法(見陷阱四)才是正確用法。

四・把排位當聖旨。包括這一份。最可靠的測試永遠是:拿你自己的真實任務——一份要改的合約、一段要除錯的 code、一份要摘要的會議紀錄——同一條指令餵兩三個模型,並排比較輸出。十五分鐘的實測,勝過十篇排位文,包括本篇。

收尾:這份排位的有效期是一個月

7 月的教訓恰恰是:不要跟任何一個模型結婚。一天三發、開源逆襲、旗艦跳票,全部發生在三十日之內。把不同科目交給不同的老師,每月重看一次成績表,是 2026 年用 AI 的基本姿勢。

8 月版排位會在下月同期更新:屆時 K3 與 Muse Spark 都交出了首月實戰成績單,而 Gemini 3.5 Pro——看看它還在不在這一級。你的 GOAT 是誰?留言告訴我,8 月版會納入讀者投票。


*本文資料截至發稿日(2026 年 7 月 20 日),僅供一般參考,不構成任何建議;第三方產品之功能、價格與政策,以其官方最新公布為準;Essevin 服務詳情以官網與 console 實際顯示為準。