Artificial Analysis Intelligence Index 66 分。Opus 5 是 63,GPT-5.6 Sol 是 61,Grok 4.6 是 61。

截至 2026 年 9 月 1 日,Fable 5.1 是這個排行榜上的第一名,而且領先第二名 3 分。


Intelligence Index 排行:四個維度都在前面

Artificial Analysis Intelligence Index 是目前追蹤範圍最廣的 AI 模型綜合排行,由四個維度各佔 25% 加權組成:agent、coding、通用能力、科學推理。底層包含 9 個 benchmark(GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity’s Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR),所有評測由 Artificial Analysis 獨立執行。

9 月 1 日的排行,把同一模型不同 effort level 的重複去掉,按模型家族看差距:

排名 模型 分數 與 Fable 5.1 差距
1 Claude Fable 5.1 (Anthropic) 66
2 Claude Opus 5 (Anthropic) 63 -3
3 Claude Fable 5 (Anthropic) 62 -4
4 GPT-5.6 Sol (OpenAI) 61 -5
4 Grok 4.6 (xAI) 61 -5
6 Kimi K3 (Moonshot) 60 -6
6 GLM-5.3 (智譜) 60 -6
8 Qwen3.8 (阿里) 58 -8
8 Qwen3.8 2.4T A95B (開放權重) 58 -8
10 MiniMax Spark 1.2 57 -9

幾個數字值得停下來看。

vs OpenAI:差 5 分。 GPT-5.6 Sol 排第 4(61 分),在 Fable 5.1 發布前已經落後 Opus 5 和 Fable 5。這不是 1 分的誤差範圍,是明確的世代差。

vs 開源/開放權重:差 6-8 分。 開放權重最強的是 Kimi K3 和 GLM-5.3(都是 60 分),比 Fable 5.1 低 6 分。Qwen3.8 的 2.4T 開源版是 58 分,差 8 分。DeepSeek V4 不在 top 20 裡。

Anthropic 的壟斷程度。 如果不去重,top 20 裡有 10 個位置是 Anthropic 的模型(同一模型不同 effort level 各占一位)。去重後,前三名仍然全是 Anthropic。

AA-Omniscience 準確率 67.2%,Fable 5 是 65.4%。


Benchmark 拆開看:哪裡強、強多少

Benchmark Fable 5 Fable 5.1 變化
Terminal-Bench Science 0.1 24.7% 52.6% +113%
Terminal-Bench 4.0 42.0% 55.8% +33%
AutomationBench 17.1% 31.4% +84%
OSWorld 2.0 36.1% 41.7% +16%
CursorBench 3.2.0 70.5% 73.4% +4%
Humanity’s Last Exam 63.8% 65.0% +2%

Terminal-Bench Science 0.1 上,Fable 5.1 拿到 52.6%,Fable 5 是 24.7%——翻了一倍多。這個 benchmark 涵蓋 70 個科學工作流(生命、物理、地球、數學、工程科學),agent 在封閉終端環境裡自主操作,產出物由隱藏測試評分。Opus 5 在同一個 benchmark 上是 29.0%,GPT-5.6 Sol 是 22.4%。

Terminal-Bench 4.0(agentic coding)從 42.0% 到 55.8%。AutomationBench(商業自動化流程)從 17.1% 到 31.4%——接近翻倍。

Anthropic 自己的說法:Fable 5.1 特別針對「長時間複雜任務」強化。Threads 上的 aiposthub 串文講得更白:

以後叫 Claude 跑那種幾十分鐘、甚至更久的 coding / Agent 任務,穩定度跟能力可能又往前跳了一大截。

這和 benchmark 數字的方向一致——漲幅最大的都在需要自主操作、多步驟、長時間的任務上(Terminal-Bench Science +113%、AutomationBench +84%),而偏短任務的 benchmark(CursorBench +4%、Humanity’s Last Exam +2%)提升有限。

X 上 JAZII 的三日風向整理講得精準:「beast at coding and agentic work / consume usage way faster / thinks 2–5x longer」。JUMPERZ 實測:比 Opus 5 聰明、規劃強、不會盲目同意,但不適合當日常模型。


AI 科研能力大躍進:不只是 benchmark,是實際產出

科研能力的跳躍幅度可能比 coding 更有長期意義。Terminal-Bench Science 翻倍不是唯一訊號——Anthropic 同時展示了三個實際科研產出。

金星地形圖。 Fable 5.1 / Mythos 5.1 用 NASA 麥哲倫任務 30 多年前拍攝的雷達圖像,訓練神經網絡,為金星三分之一的表面生成高分辨率地形圖。精度從 10-20 公里提升到 2-3 公里,高度精度提高最多 25%。Anthropic 以 Creative Commons 協議公開發布,希望對 NASA 即將執行的 VERITAS 任務和 ESA 的 EnVision 任務有用。

蛋白質設計。 Mythos 5.1 配上開源的蛋白質設計和折疊工具後,設計出的高親和力結合物在三個靶點上的結合親和力比 Adaptyv Bio 蛋白質設計競賽的最佳提交高出 10 倍,成功率接近 50%,行業一般水平是 10-15%。

GPU kernel 優化。 Mythos 5.1 自己寫 GPU kernel 和快取中間結果,把七個開源深度學習模型的推理速度提升 1.4-2.5 倍。全基因組分析的 GPU 成本因此降低 30-60%。Anthropic 說這類優化通常需要性能工程團隊花幾週,學術實驗室根本做不起,Mythos 5.1 用公開源代碼幾天搞定。

這些不是 benchmark 分數,是模型開始在前沿科學領域做出實際產出。幾個月後回頭看,科研能力的大幅跳躍可能比 coding 更有長期意義——半年後人類科學可能因此加速。


成本帳:cache 降 75%,對 agent 是真的便宜

項目 Fable 5 Fable 5.1
Input $10/M token $10/M token
Output $50/M token $50/M token
Cache read $1/M token $0.25/M token

input 和 output 單價沒動。cache read 從 $1 降到 $0.25 per million token,降了 75%。

為什麼這很重要?因為 Agent 真正燒錢的地方,就是不停讀 context、跑工具、回頭確認、繼續執行——每一個 loop 都在做 cache read。aiposthub 的觀察:「現在連讓 Agent 長時間工作的成本也開始被壓下來了。」

數字對得上。我 8 月拆自己帳單的時候,17.2 億 token 裡 95.6% 是 cache read,cache read 佔帳單的 53-56%。帳單裡最大的一塊,被砍了 75%。

Anthropic 自己的估算:典型工作流省約 25%,重度 agent 工作流省到 45%。

有用戶用同一組遊戲 prompt 測:Fable 5.1 是 $7.08,Fable 5 是 $7.65,便宜了 7%,同時品質更好。他的結論:Fable 5 很快沒有理由再用了。


但 per-task cost 貴了 20%——這筆帳怎麼看

Artificial Analysis 的測試結果

“Claude Fable 5.1 tops the Artificial Analysis Intelligence Index but costs 20% more per task than Fable 5 despite a 75% cache read price cut”

per-task cost $3.69,比 Fable 5 貴約 20%。原因:Fable 5.1 平均輸出 1.7 倍的 token。

Anthropic 說省 25%,Artificial Analysis 說貴 20%。兩個都對,因為量的東西不同。

Anthropic 量的是 per-token cost——同一個 cache read token 便宜了 75%。Artificial Analysis 量的是 per-task cost——完成同一個 benchmark 任務的總 API 花費。Fable 5.1 更聰明但更話多,它用 1.7 倍的 output token 完成任務,output 單價 $50/M 是 cache read 新價 $0.25/M 的 200 倍——cache 省下來的錢被 output 多吐的 token 吃回去了。

差別在 cache 佔比。Artificial Analysis 的 Intelligence Index benchmark 不是長對話的 agentic loop——它是一組獨立問題,每個問題的 context 不大,cache 佔比遠低於真實 coding agent 的 95.6%。cache 佔比低,降幅省不了多少;output 暴增的代價就蓋過去了。

用我的帳單結構粗算:cache read 佔 55% 降 75%(省 41.25%)、output 佔 20% 漲 1.7 倍(多 14%)、淨效果省約 27%——和 Anthropic 的「省 25%」方向一致。

結論:如果你跑 agent 長對話(cache 佔比高),Fable 5.1 又強又便宜。如果你跑短任務多輪獨立呼叫(cache 佔比低),可能反而貴。 但即使貴了 20%,你買到的是 Intelligence Index 第一名的能力。


訂閱用戶:配額會更快用完

API 用戶看帳單,訂閱用戶看配額。1.7 倍的 output token 在訂閱制下不是多付錢——是更快撞牆。

有用戶一次小調查就燒掉 5 小時限額的 13%、週限額的 3%,這是在 $100/月的 Max 訂閱上。另一位用戶試著部署 Vercel,整個 5 小時限額直接燒完

這和同日的 20x 爭議接在一起看:用戶才剛發現 20x 只掛在 5 小時窗口上、週限額只多約 1.7 倍,現在模型本身又變得更話多——同樣的配額,能做的事變少了。

API 用戶得到更強的模型和更便宜的 cache,訂閱用戶得到更強的模型和更快的撞牆。同一個模型更新,兩群人的感受完全不同。


Fable 最大的問題「護欄」有改善嗎?

說到 Fable 5,大家最討厭就是那個切到 Opus 的自動安全護欄。Anthropic 說 5.1 有改善:

  • cyber safeguard 介入減少 60%
  • 生物類良性請求的誤判減少 85%

官方數字聽起來進步很大,但社群體感不太一樣。JAZII:「safeguards still kinda same」。JUMPERZ:護欄仍兇。QC:比 Fable 5 更煩。

官方量的是「誤觸率降了多少」,用戶感受的是「我被擋的時候有沒有變少」——兩件事不完全一樣。誤判減 85% 代表以前 100 次誤殺現在只剩 15 次,但如果你剛好撞到那 15 次,體感就是「沒變」。

護欄這題大概要等更多人跑過日常工作流才有定論。發布第一天的抱怨和官方 benchmark 都不是終局數字。


企業最討厭的問題:數據留存 30 天

Fable 模型強制數據保留 30 天。原本享受零數據留存(ZDR)的企業客戶,一夜之間隱私保障降了一級。金融、醫療、政府——數據合規要求最嚴的行業,推理過程留在 Anthropic 伺服器 30 天,客戶怎麼可能接受?

OpenAI 兩週前剛拿這個點發起攻勢,宣布 Private Safety Processing:最強模型也能零留存。

Anthropic 的回應是 Enterprise Frontier Safeguards(EFS)。核心思路:數據存在客戶自己控制的雲基礎設施,不進 Anthropic 系統;人工審核也由客戶自己完成。Anthropic 說跟 100 多家客戶合作開發,涵蓋金融、醫療、製造、法律。EFS 預計秋天分階段上線,過渡期 ZDR 客戶可照常使用 Fable 5.1。


防蒸餾:thinking block 開始上鎖

Fable 5.1 帶了一個跟成本無關但跟生態有關的 breaking change。

新帳號(2026 年 8 月 31 日之後建立)使用 Fable 5.1 時,thinking block 生成後不能再修改 system prompt、tools 或對話歷史——Anthropic 說這是防止蒸餾。API 會驗證 thinking block 是在原始的 system prompt 和 tools 環境下產生的,不匹配就報錯。

三個 breaking change:forced tool use 會報錯、thinking block 不能跨模型讀、改對話歷史會讓 thinking block 失效。

對一般用戶影響不大。對自建 agent harness 的開發者影響大——如果你的 harness 會在對話中途注入 system reminder、壓縮歷史、或切換 fallback 模型,Fable 5.1 的 thinking block 會直接失效。日本開發者 @connect24h 的評論直接說「模型防衛開始改變 agent 設計」。

現有帳號暫時不受影響,但 Anthropic 明確說未來的模型版本會擴大適用。


IPO 預演與開源防線

這次發布,是 Anthropic 衝 IPO 前秀出的最強成績單。Intelligence Index 66 分登頂,投資人看的就是這個。

其他廠商呢?OpenAI 拼性價比——GPT-5.6 Sol 61 分但便宜很多。開源陣營 Qwen3.8 / GLM-5.3 差 6-8 分,但免費。除了爭奪最強,其他人都在拼 cost per intelligence。

防蒸餾機制在這個脈絡下就看得懂了:thinking block 鎖住不讓改,不只是技術規格,是防止開源透過蒸餾搬走閉源的推理能力。蒸餾是開源追上閉源最快的捷徑,Anthropic 把這條路堵了。30 天數據留存也是同一邏輯——Anthropic 需要偵測誰在大規模蒸餾。

天花板的護城河不能被蒸餾填平,但護城河的代價是用戶的數據也被圍在牆內。EFS 是 Anthropic 試著在兩邊取平衡的解法。


坦白說

Intelligence Index 排行和 benchmark 分數來自第三方獨立評測,可信度高。但 benchmark 不等於你的實際工作流——Terminal-Bench Science 的 52.6% 代表模型在標準化科學任務上的能力,不代表它在你的 codebase 上的表現。

科研展示(金星地形圖、蛋白質設計、GPU kernel)帶有 Anthropic 的敘事目的,但蛋白質設計的結果經過了外部實驗驗證,金星地圖也以 Creative Commons 公開可下載,不是空口說說。不過這些是精心挑選的 demo,不代表所有科研場景都能複製同等成果。

Artificial Analysis 的 per-task cost $3.69 和「貴 20%」是跑 Intelligence Index benchmark 的成本,不是真實 agent 工作流的成本。我用的「cache 佔 55% → 省 27%」粗算基於我自己的帳單結構,不同人的工作流差異很大。1.7 倍 output 是 benchmark 數字,真實 coding 場景的 output 增量可能不同。

護欄改善的官方數字和社群體感有落差,兩邊的量測方式不同,都不算錯。EFS 秋天才上線,30 天留存在過渡期仍然是事實。IPO 格局是我的推演,不是 Anthropic 自己說的。

社群反應是發布後 24 小時的快照。配額問題的回報來自個別用戶,不是系統性測量。

但綜合所有第三方數字,Fable 5.1 確實是截至 9 月 1 日、公開 benchmark 上最強的模型。如果你做的事需要長時間自主推理——coding agent、科學研究、商業流程自動化——它不只是最強的選擇,在 cache 佔比高的工作流裡還是更便宜的選擇。


關鍵洞察

一、Fable 5.1 是目前最強的公開模型。 Intelligence Index 66 分登頂,Terminal-Bench Science 翻倍,四個維度(agent、coding、通用能力、科學推理)都在頂端。領先幅度不是 1 分的誤差——和 Opus 5 差 3 分,和 GPT-5.6 Sol 差 5 分。如果你的工作依賴模型推理的天花板,Fable 5.1 是目前的天花板。

二、成本看 cache 佔比,不看標題數字。 Anthropic 說省 25%,Artificial Analysis 說貴 20%——兩邊都對,差別在工作流的 cache 佔比。跑 agent 長對話 loop 的人(cache 佔帳單 50% 以上):省。跑短任務獨立呼叫的人(cache 佔比低):可能貴。衡量 agent 成本用 per-task,不要用 per-token。

三、訂閱用戶要重新估配額。 Fable 5.1 的 1.7 倍 output 會讓你的有效配額再縮一截。日常工作考慮用 Opus 5(Intelligence Index 63,per-task cost $2.34),把 Fable 5.1 留給真正需要天花板能力的任務。

四、科研能力可能是最有長期意義的升級。 金星地形圖、蛋白質設計 50% 成功率、自寫 GPU kernel——這些不是 benchmark,是實際科研產出。做自動科研的公司會是 Fable 5.1 / Mythos 5.1 最大受益者,半年後人類科學可能因此加速。

五、日常工作不一定需要 Fable 5.1。 一般任務,普通模型早就 KO。天花板任務再上就好。模型愈來愈強,但不是每個人都需要天花板——知道什麼時候該上、什麼時候不用,這才是真正的能力。

六、自建 harness 的開發者注意防蒸餾機制。 動態修改 system prompt、壓縮歷史、切換 fallback 模型的設計,在 Fable 5.1 上會讓 thinking block 失效。這不是 bug,是有意設計——現在只限新帳號,但未來會擴大。


常見問題 Q&A

Q: Fable 5.1 到底是不是目前最強的 AI 模型?

截至 2026 年 9 月 1 日,在 Artificial Analysis Intelligence Index(綜合排行,涵蓋 agent、coding、通用能力、科學推理四個維度)上,Fable 5.1 以 66 分排名第一,領先 Claude Opus 5 的 63 分、GPT-5.6 Sol 的 61 分、Grok 4.6 的 61 分。在 Terminal-Bench Science 0.1(科學研究自主操作)上拿到 52.6%,是第二名 Opus 5 的 29.0% 的近兩倍。需要注意這是公開 benchmark 的結果,不等於在所有特定領域都最強——但從綜合排行來看,它是目前測得到的天花板。

Q: Fable 5.1 的 cache read 降價 75% 對實際帳單影響多大?

取決於你的工作流。在 agentic coding loop(Agent 編程迴圈)裡,同一段對話歷史每次 API 呼叫都重送,cache read 佔整體 token 量的絕大多數(實測約 95.6%),也佔帳單的 53-56%。Cache read 從 $1 降到 $0.25 per million token,帳單的最大一塊被砍了 75%。Anthropic 估計典型工作流省約 25%,重度 agent 工作流(Agent Workflow)省到 45%。但如果你的工作流是短問答、獨立任務,cache 佔比低,降價的效果也小。

Q: 為什麼 Artificial Analysis 說 Fable 5.1 per-task cost 貴了 20%?

因為 Fable 5.1 平均輸出 1.7 倍的 token——模型更聰明但也更話多。Output 單價 $50/M 是 cache read 新價 $0.25/M 的 200 倍,所以 output 多吃的錢把 cache 省下的吃回去了。Artificial Analysis 的 per-task cost(每任務成本)$3.69 是跑 Intelligence Index benchmark 的結果,這類 benchmark 是一組獨立問題,cache 佔比遠低於真實 agent 長對話。在 cache 佔比高的真實 agent 工作流裡,整體成本方向是省的。

Q: 訂閱用戶(Claude Pro / Max)用 Fable 5.1 有什麼要注意的?

1.7 倍的 output token 在訂閱制下不會多收錢,但會更快消耗你的配額上限——5 小時窗口限額和週限額都會更快用完。有用戶反映一次小調查就燒掉 5 小時限額的 13%。建議把 Fable 5.1 留給高價值的長時間 coding / agent 任務,日常工作用 Opus 5(Intelligence Index 63 分,per-task cost $2.34),在能力和配額之間找平衡。

Q: Fable 5.1 的安全護欄(Guardrails)有改善嗎?

Anthropic 官方說 cyber safeguard 介入減少 60%,生物類良性請求誤判減少 85%。但發布第一天的社群體感不太一樣——多位用戶回報護欄仍然很兇,甚至比 Fable 5 更煩。官方量的是「誤觸率降了多少」,用戶感受的是「我被擋的時候有沒有變少」,兩件事不完全一樣。這題要等更多人跑過日常工作流才有定論。

Q: Fable 模型的 30 天數據留存(Data Retention)是什麼問題?

Anthropic 強制所有 Fable / Mythos 級模型的使用數據保留 30 天,原本享受零數據留存(Zero Data Retention, ZDR)的企業客戶一夜之間隱私保障降了一級。Anthropic 的回應是 Enterprise Frontier Safeguards(EFS):數據存在客戶自己控制的雲基礎設施,人工審核也由客戶自己完成,預計 2026 年秋天分階段上線。過渡期間,符合條件的 ZDR 客戶可照常使用 Fable 5.1。


來源