那條線讓社群炸了

Artificial Analysis 的 Intelligence Index v4.1.1 圖表,Y 軸是智力分數,X 軸是每 task 美元成本,137 個模型攤在上面。

Qwen3.8-27B 自架在 RTX 5090 上,10% 利用率,成本落在 $0.0143/task。Intelligence Index 52 分,跟 GPT-5.6 Luna 同級。Apache 2.0 零授權費。

從這個點往右畫一條水平線——所有比它貴、智力又不比它高的模型,全部被一刀斬掉。我稱它為斬殺線。

Artificial Analysis Intelligence Index v4.1.1 vs Cost per Task

社群很多朋友看到這張圖直接轉發——「這不就是把大半 API 模型一刀斬掉嗎?」興奮是正常的。圖上大半的雲端模型確實掉進死區:比它貴,又比它笨或同級。

但冷靜一步想:成本哪有那麼容易算?


雲端的錢不是只有 token

那個 $0.0143 是「硬體攤提 + 電費」。

雲端模型的 $0.3-$3/task 裡包了什麼?服務可用性。7x24 運維。硬體壞了無縫輪換。自動擴容。API 版本管理。安全合規。SLA 保證。客服支援。

你比的不是同一個東西。一個是原料成本,一個是成品售價。拿生豆價格跟星巴克比,然後宣布咖啡店要倒閉——這個邏輯有問題。

雲端 API 的定價確實包含了巨大的利潤空間,這是事實。但把所有差價都歸因於「暴利」,忽略了運營成本的真實存在,也是一種誤導。


地端也沒有那麼簡單

另一邊更讓我不舒服的是:有人看到這條線就喊「奇點已到,無腦買機器」。

這種人比賣雲端 API 的更壞。

一張 RTX 5090,8 月初台灣大概 17 萬。買回來之後呢?散熱規劃、驅動相容性、推理引擎選型、量化格式選擇、VRAM 管理、長時間滿載穩定性——每一項都是實打實的工程問題。575W 滿載功耗,你家電路夠不夠?跑到一半 kernel panic,你查不查得出來?GPU 壞了,保固流程你跑過沒有?

上週我整理了 300+ 條社群實測貼文,裡面多少人踩坑才跑起來的?量化選錯格式品質暴跌、KV cache 設定不對 OOM、MTP 要特定版本 llama.cpp 才支援。

賣 API 的至少把這些坑替你踩過了。叫人無腦買機器的連坑在哪都不告訴你。


真正該看的是趨勢

斬殺線本身是一個 snapshot。2026-08-18 抓取的一個數字。

真正值得注意的不是那條線現在在哪裡,是它背後有多少結構性力量在同一個方向推。

開源正在全面起來,而且速度比所有人預期的快。

模型迭代:四個月一代

Qwen 3.6 到 3.8,四個多月。Intelligence Index 從大約 38 跳到 52,一代之間 +14 分。27B dense 模型第一次站到 frontier 門口。

這個迭代速度不是偶然。阿里的開源策略是系統性的——每一代都是 Apache 2.0,每一代都讓社群去壓測、去量化、去發現問題,然後吃回來做下一代的訓練數據。社群不只是用戶,是免費的 QA 團隊。

產業推力全部同方向

Jensen 在華府遊說開放 AI 政策——GPU 銷量依賴開源生態繁榮。Meta 重新全力下場推 open source,Llama 系列持續迭代。中國幾個主要 lab 全開 Apache 2.0。

閉源和開源不是互斥的。但產業最大的幾股力量——晶片商、平台商、模型 lab——現在全部有動機推動開源。這不是理想主義,是利益結構。

Serving framework 雨後春筍

llama.cpp 的 MTP 支援讓 RTX 4090 從 45 飆到 97 tok/s。SGLang 在 5090 上跑出四人併發每人 106 tok/s。vLLM、Ollama、LM Studio 各有主場,持續優化。AtomicChat 的 AD 量化在相同檔案大小下全面壓過通用量化,24GB VRAM 用 AD-Q5_K 跑到 97.3% Top-1 準確率。

每一個推理引擎的優化,都讓同一張卡跑得更快,或者讓更便宜的卡跑得動。

Harness 層開源爆發

模型是嘴,harness 是手。光有嘴說話沒用,要有手去讀檔案、改程式碼、呼叫工具、管理工作流。

過去這雙手只能借——Cloud Code、Codex、Cline,你用的是別人寫的 harness,改不了、帶不走。這個月 DeepSeek 把 DSH 完整開源了。OpenClaw、Hermes、Pi、Maka——harness 層的選擇正在爆發。

嘴跟手第一次都可以是你自己的。這才是結構性的轉變。

社群已經形成飛輪

Qwen3.8-27B 釋出不到一週,光 X 上就有 300+ 條實測貼文。RTX 3090 到 DGX Spark 六種硬體平台都有人跑過。那篇社群實測整理的結論只有一句話:太可怕的社群力量了。

而且這才第一週。回顧每個熱門開源模型的歷史,社群優化在前三個月最密集。飛輪才剛開始轉。


單位智力密度正在飆升

這些力量匯在一起,產生的效果不是「進步一點」——是每 B 參數能買到的智力在結構性暴漲。

用一個指標來看:分/B——Intelligence Index 分數除以模型總參數量(十億)。數字越高,每一 B 參數能買到的智力越多。

Model 總參數 每 token 激活 Index 分/總 B 分/激活 B
Qwen3.8-27B 27B dense 27B 52 1.93 1.93
DeepSeek V4 Flash 0731 284B MoE 13B 50 0.18 3.85
GLM 5.3 743B MoE 40B 60 0.08 1.50
Kimi K3 2,800B MoE 104B 60 0.02 0.58

分/總 B 決定你需要多少 VRAM——也就是你需要花多少錢在硬體上。Qwen3.8-27B 是 1.93,Kimi K3 是 0.02。差 90 倍。

上一代 Qwen3.6-27B 大概 38 分,分/總 B 約 1.41。一代之間密度提升了 37%。如果這個速度持續,兩三代之後同樣的 27B 參數量能做到什麼水準?

而且小模型追大模型有一個結構性的經濟優勢:test-time compute。

Artificial Analysis 的評測紀錄顯示,Qwen3.8-27B 在評測中總共生成了 1.6 億 tokens,所有受測模型的中位數只有 4300 萬。它用將近 4 倍的推理量——更長的思維鏈、更多的搜索和驗證——來彌補參數量的不足。

在雲端,想得更用力 = 生成更多 token = 帳單更高。長思維鏈是成本放大器。

在本地,想得更用力 = 多花一點電和時間。Token 成本接近零。長思維鏈是免費的智力放大器。

同一個機制,在兩種成本結構下產生完全相反的經濟效應。開源本地模型天生就適合靠推理時間換品質。


杰文斯悖論:智力便宜之後會怎樣

1866 年,英國經濟學家杰文斯翻帳本發現一件所有人都猜反的事:蒸汽機越來越省煤,英國的煤消耗不是下降——是翻著倍往上漲。

道理不複雜。煤貴的時候,只有最賺錢的礦主用得起蒸汽機。煤一便宜,紡織廠用得起了,鐵路用得起了,輪船用得起了,最後連家裡燒熱水都用得起了。每一分省下來的成本都被新冒出來的用途吃回去——還不夠吃。

智力正在走同一條路。

今天頂級 AI 智力是奢侈品。Frontier 級的雲端模型動輒 $0.3-$3/task,所以只有最高價值的任務才配用:寫程式、做研報、跑量化交易策略。一間十人新創每月光 API 帳單就可能燒掉一個工程師的薪水。絕大多數日常任務請不起頂級模型幫忙。

地端模型當然做不到 Sota——上一篇拆過,知識類和推理天花板類還是輸。27B 的知識密度終究比不上幾百 B 的大模型,事實性要求高的場景還是需要大模型或 RAG 輔助。

但重點是:大量日常任務根本不需要 Sota。它們需要的是「夠好的智力、夠低的成本、跑得夠多次」。$0.014/task 的 52 分模型,對這一整層任務來說綽綽有餘。你那份 200 頁的政府採購規格書要有人逐條比對、公司裡那套跑了十五年沒人敢重構的 legacy 系統要有人讀懂、客服團隊每天回覆的那三百封信要有人分類分派——這些事從來不缺方案,缺的是「值得為它花那個腦子」的經濟條件。

當單位智力的成本持續崩盤,這一整層「過去不值得用 AI」的任務會被解鎖。杰文斯悖論告訴我們:省下來的不會被存起來,會被新冒出來的用途全部吃掉。


結論:中小企業的 AI 部署門檻,被一次性拆掉了

Qwen3.8-27B 不會明天統治世界。52 分不是 Sota,Opus 5 還在 63 分的位置。知識類問題還是差一截,容易幻覺,長 CoT 有延遲代價。

但它做了一件過去沒有任何單一模型做到的事:把中小企業部署 AI 的五道門檻一次性解決。

資安。 Apache 2.0,模型跑在自己的機器上,資料不出公司。對受監管行業(醫療、金融、法律、政府標案)來說,這一條就足以從「不能用 AI」變成「可以用 AI」。

性價比。 $0.014/task,52 分。大量日常任務不需要 Sota——逐條比對規格書、分類客服信件、讀懂 legacy 系統——需要的是「夠好的智力、夠低的成本、跑得夠多次」。

智力水準。 Intelligence Index 52,跟 GPT-5.6 Luna 同級。不是玩具等級,是真的能做事的等級。上一篇拆過,agentic 任務贏 Opus。

硬體價格門檻。 一張 5090,17 萬。不便宜,但一間十人公司付得起。不需要機房,不需要跟雲端廠商簽年約。

硬體部署門檻。 這可能是最被低估的一點。27B dense 模型,單卡就裝得下。不用跨卡、不用 NVLink、不用處理 tensor parallelism。一張卡插上去,跑。跟過去動輒十幾張卡拼起來才能跑的 MoE 大模型比,部署複雜度差了一個量級。

五道門檻同時倒,這才是那條斬殺線真正的意義。不是「便宜」兩個字能概括的。


現在缺的是什麼?Killer AI app。

模型有了、成本降了、部署簡化了、harness 開源了——基礎設施已經就位。但中小企業不會因為「AI 便宜了」就自動導入。他們需要看到一個具體的應用場景,解決一個真實的業務痛點,產生可量化的回報。

一旦那個 killer app 出現——不管是智能客服、自動化報告、合規審查、還是我們今天還沒想到的東西——中小企業會大量開花。因為門檻已經不在了。過去擋在他們面前的不是需求不夠,是成本太高、部署太難、資安過不了關。

現在這些理由一個一個失效了。

Cline 官方的原話:「我們完全沒預料到本地模型進步會這麼快。」

改變不會在一瞬間發生。但當基礎設施到位而門檻消失的時候,爆發通常比所有人預期的更快。