"地端AI 系列總覽:從一張消費級顯卡到企業級地端 AI"
2026 年,「用地端」第一次不是退而求其次。Qwen3.8-27B 在 SWE-bench Pro 拿下 61.7,超過 Opus 4.6 Max——一張消費級顯卡就跑得動的模型,第一次在能力上不輸雲端。
這個系列記錄了我從「買一張 5090 試試看」到「企業級地端部署」的完整路徑。每篇都是實測數據,不是理論推導。
目錄
Qwen3.8-27B 實戰
Qwen3.8-27B 是這波 local-first 的觸發點。SWE-bench Pro 61.7 超越 Opus 4.6 Max,27B 大小在 RTX 5090 上跑出 100+ tok/s——這不是「堪用」,是「好用」。
| 文章 | 重點 |
|---|---|
| Qwen3.8-27B 開源:「那就用地端」第一次不是妥協 | SWE-bench Pro 61.7、RTX 5090 實測、為什麼這次不一樣 |
| Qwen3.8-27B 斬殺線:別只看 $0.01 | 成本結構拆解、frontier 模型的真正威脅 |
| Qwen3.8-27B 多平台實測 tok/s 整理 | RTX 3090/4090/5090/PRO 6000/DGX Spark/Mac 全平台數據 |
| DFlash 2 讓 Qwen3.8-27B 快兩倍 | 同模型、同卡,純靠更聰明的推理快兩倍 |
| YouTube 逐字稿:Qwen3.8-27B RTX5090 SGLang/vLLM/MTP 實測 | 影片版完整實測紀錄 |
| Qwen 3.7 vs Qwopus3.6-27B-v2 | 版本演進、社群改版比較 |
| Qwen 3.5 / 9B 小模型架構 | 越級打怪的神級小模型 |
硬體與推論加速
選硬體決定了你的 token 天花板。選引擎決定了同一張卡能榨出多少速度。這兩件事要一起看。
| 文章 | 重點 |
|---|---|
| RTX 5090 + Qwen3.6-27B 七種推論引擎實測 | SGLang/vLLM/llama.cpp/Ollama/LM Studio 完整 benchmark |
| Inference Engine 選型指南 (2026) | 先選硬體策略,引擎自然會浮現 |
| llama.cpp 合併 MTP:本地推論提速 30-60% | Multi-Token Prediction 落地實測 |
| Gemma 4 加速 3x:Google 把 drafter 整套開源 | Speculative Decoding + Apache 2.0 drafter |
| Mac 用戶的企業級推理加速 | Apple Silicon 上的 MTP 加速 |
| MoE Offload 完全拆解 | 671B 模型只吃 17GB VRAM 還能跑的原理 |
| RTX Pro 6000 一週實驗 Day 1-2 | GLM 5.2 拿 98 分、DeepSeek V4 Flash 58 tok/s |
| RTX Pro 6000 一週實驗完賽 | Offload 天花板 10 tok/s、Qwen VL 工程圖 96% |
| 把 LLM 燒進晶片:Taalas ASIC | 推理成本的終局猜想 |
KV Cache 經濟學
Token 不是免費的。KV Cache 是推論成本的隱藏殺手,搞懂它等於搞懂你的 OPEX 結構。
| 文章 | 重點 |
|---|---|
| Pi 99.93% Cache Hit:10 億 token 只花 $2.65 | Agent 選型要多盯一個數字 |
| 搞懂快取機制:從 Gemma4 到 Claude Code 省 80% Token | 快取機制全景拆解 |
| 切模型不用重算 KV Cache:NVIDIA 的線性映射 | Cross-model cache transfer 技術 |
| DeepSeek V4 Flash 為何那麼強:兩年以上的架構革命 | Disk KV Cache + 50x 經濟效益 |
Harness 與 Agent 架構
模型再強,沒有 harness 就是裸奔。Harness 是讓 AI 能寫 code 但不能自己上 production 的那層控制面。
| 文章 | 重點 |
|---|---|
| Harness Engineering 架構全景 | 完整架構圖、四層防護 |
| Local-first 模型需要 local-first harness | Kimi K3 用第三方 harness 贏原廠 10 個百分點 |
| On-Prem 小模型爆發時代 | 為什麼我這週訂了 RTX 5090 桌機 |
Sovereign AI 與開源主權
模型主權不是口號。當你的 weights 在別人的伺服器上,你的產品就在別人手裡。
| 文章 | 重點 |
|---|---|
| Sovereign AI 不是口號:Sequoia 的四級路徑 | 開源 60 vs 封閉 62 的算術、你該停在第幾級 |
| 老黃買 Hugging Face 在幹嘛? | 預判主權 AI,鎖死分銷管道 |
| 開源模型是 AI 新時代的偉大航道 | 老黃的 X 貼文、梁文鋒 42 頁逐字稿 |
| YouTube 逐字稿:地端模型到底對我有何用途? | 機敏場景、無護欄場景、OPEX 變 CAPEX |
安全與紅軍
地端模型的另一面:無護欄版本讓紅軍測試變得前所未有地容易——也讓攻擊者的門檻降到了前所未有地低。
| 文章 | 重點 |
|---|---|
| 用無護欄 AI 做黑箱紅軍的兩小時實錄 | 只給 URL,2 小時 10 個 finding、2 個 PoC |
| Qwen3.8-27B 開源三天,五個無護欄模型就在你的筆電上 | Abliteration 技術拆解、842 道有害 prompt 拒答率歸零 |
企業地端部署
從一張卡到一個機房,架構決策完全不同。這裡是給認真考慮 on-prem 的人。
| 文章 | 重點 |
|---|---|
| On-Premise Enterprise LLM 架構完整藍圖 | 企業級地端 LLM 部署全景 |
| Fable 5 企業天花板:intelligence-per-dollar | 企業採用的真正瓶頸 |
這個系列持續更新。每篇新的實測、選型比較、架構拆解都會加進來。
如果你正在評估 local-first 路線,建議的閱讀順序:
- 先看 Qwen3.8-27B 開源 理解為什麼現在不一樣
- 再看 Inference Engine 選型指南 選你的硬體和引擎
- 然後看 KV Cache 省 80% Token 搞懂成本結構
- 最後看 Sovereign AI 四級路徑 決定你要走多深
常見問題 Q&A
Q: 地端推論(Local Inference)現在真的能跟雲端模型比了嗎?
對,2026 年是第一次地端模型在能力上不輸雲端。Qwen3.8-27B 在 SWE-bench Pro 拿下 61.7 分,超過 Opus 4.6 Max,然後它只有 27B 參數,一張消費級 RTX 5090 就能跑出 100+ tok/s。這不是「勉強堪用」的等級,是真的好用。關鍵轉折就是模型能力追上來了,地端部署第一次變成策略選擇而不是退而求其次。
Q: 推論引擎(Inference Engine)怎麼選?SGLang、vLLM、llama.cpp 差在哪?
先決定硬體策略,引擎自然會浮現。系列裡有一篇專門做了七種推論引擎的完整 benchmark——SGLang、vLLM、llama.cpp、Ollama、LM Studio 都測過。然後像 MTP(Multi-Token Prediction,多 token 預測)這類加速技術落地之後,llama.cpp 合併 MTP 就能提速 30-60%。不同場景適合不同引擎,不是一個答案走天下,建議從「Inference Engine 選型指南」那篇開始看。
Q: KV Cache 經濟學(KV Cache Economics)是什麼?跟我的成本有什麼關係?
KV Cache 就是推論過程中模型暫存先前 token 注意力計算結果的那塊記憶體,它是推論成本的隱藏殺手。搞懂 KV Cache 等於搞懂你的 OPEX(營運支出)結構。系列裡有實測數據:Pi 做到 99.93% Cache Hit Rate,10 億個 token 只花 $2.65;Gemma4 到 Claude Code 的快取機制拆解則展示了怎麼省 80% token。做 Agent 選型的時候要多盯這個數字,不然帳單會嚇到你。
Q: Sovereign AI(主權 AI)跟我有什麼關係?什麼時候該考慮自己跑模型?
當你的 weights(模型權重)在別人的伺服器上,你的產品就在別人手裡——API 斷供、價格調整、政策變更都不是你能控制的。系列裡引用 Sequoia 的四級路徑來分析:開源模型 60 分 vs 封閉模型 62 分,差距已經很小了。重點是評估你該停在第幾級,不是每個人都需要走到最底層自己訓練。機敏場景(Sensitive Scenario)、無護欄場景(Guardrail-free Scenario)、想把 OPEX 變 CAPEX 的企業,這三類最該認真考慮地端部署。
Q: 這個系列這麼多篇,建議怎麼讀?
按這個順序走最有效率:第一步看 Qwen3.8-27B 開源那篇,理解為什麼 2026 年地端推論不一樣了;第二步看 Inference Engine 選型指南,決定你的硬體和引擎組合;第三步看 KV Cache 省 80% Token 那篇,搞懂成本結構;最後看 Sovereign AI 四級路徑,決定你要走多深。這四篇讀完就有完整的判斷框架,之後再根據需要挑細節篇看。