"YouTube 逐字稿:地端模型到底對我有何用途?機敏場景 Coding、無護欄模型場景、OPEX 變 CAPEX"
作者: Wisely Chen 日期: 2026 年 8 月 系列: AI Coding 實戰觀察 — YouTube 逐字稿 關鍵字: Qwen3.8-27B, Opus 4.6, 地端模型, 機敏場景, 無護欄模型, abliteration, 紅隊測試, OPEX, CAPEX, 雲地混合, DeepSeek V4, GLM 5.2
這集在講什麼
Qwen3.8-27B 開源之後,抖音「Token就是詞元」做了一集祖傳代碼 Bug 挑戰賽,拿 27B 地端模型對上 Opus 4.6——青銅、白銀、黃金三級都是三題解兩題,打平。這是該系列唯一一次地端小模型上場,也是唯一一次跟 Tier 1 雲端模型打成平手。
一個 75 到 80 分的地端模型,對企業到底有什麼用?這集整理三個以前做不到、現在開始成立的需求:機敏場景 Coding(不用先去機敏化再丟雲端)、無護欄模型場景(資安紅軍藍軍攻防測試)、OPEX 變 CAPEX(把不穩定的雲端定價換成可預測的硬體投資)。
長度: 約 10 分鐘
時間戳
- 0:00 Qwen3.8-27B 真的如傳聞一樣會 coding 嗎
- 0:58 祖傳代碼 Bug 挑戰賽:27B 地端模型對上 Opus 4.6,三級打平
- 2:34 代價:黃金級思考 45 到 50 分鐘,Opus 4.6 只要 4 到 5 分鐘
- 3:13 量變造成質變:75 到 80 分的地端模型能解鎖什麼
- 3:19 需求一:機敏場景 Coding,不用先去機敏化再丟雲端
- 4:50 需求二:無護欄模型場景,資安紅軍藍軍攻防測試
- 5:46 案例:7 月 Hugging Face 被入侵,Claude、OpenAI 都不肯 trace log,最後靠 GLM 5.2
- 6:43 需求三:DeepSeek V4 漲價 2 到 3 倍之後,把不穩定的 OPEX 變成可預測的 CAPEX
- 8:00 地端模型一路走來:從限縮場景到 daily agentic task 再到 AI coding
- 10:04 結論:未來半年一定是雲地混合,差別只是 3:7 還是 7:3
完整逐字稿
開場:Qwen3.8-27B 真的比較會 coding 嗎
大家好,我們來看一下 Qwen3.8-27B 是不是真的如同大家講的就是一樣好。
首先我們從 coding 這邊來看。我們覺得之前就是 Qwen3.6-27B,其實已經聰明到可以支援大部分像是 OpenClaw 這種比較 agentic 的 task。不過 3.8-27B 對於大家最大的感覺、感受就是它好像真的比較會 coding,而且 coding 其實成功率是蠻高的。
我覺得一開始的時候我們就從一些它的 benchmark 就看到,它至少在 benchmark 這邊看到是跟大家所熟知的 Opus 4.6 是蠻接近的。那我們自己下去嘗試,包括我自己也下去嘗試,但是我也覺得說使用起來的手感沒有差到太多,就是還蠻順暢的,跟現在的 Tier 1 的 model 差距不大。
祖傳代碼 Bug 挑戰賽:27B 對上 Opus 4.6
然後我昨天在看那個我其實一直蠻喜歡的一個抖音的一個小節目,叫做「祖傳代碼 Bug 挑戰賽」。它其實是將就是很多的 Tier 1 的 model,然後它再準備一些它之前工作的時候的一些比較困難的 bug,然後把它分成青銅級、白銀級然後黃金級,然後來進行一個挑戰。
其實這個挑戰賽其實還蠻難的,而且有很多就是很強的模型,其實在裡面很容易就是失守。那昨天終於迎來我最想看到的一集,就是 Opus 4.6 對到那個 Qwen3.8-27B。
老實說這是這個挑戰賽裡面,唯一一次地端的小模型,27B 的模型來進行挑戰的。那我那時候就覺得 Qwen 27B 應該表現得不錯,只是沒想到它到最後居然就是跟 Opus 4.6 一樣——在青銅級的那個三題解兩題,白銀三題解兩題,那黃金三題、黃金解兩題。所以到最後是跟 Opus 4.6 打平,就連主持人都非常驚訝,其實我也蠻驚訝的。
那所以雖然說它不是一個證據,但是它其實跟我的體感差不多,然後也跟 benchmark 提供的體感也差不多。就是它其實真的還蠻能用,真的蠻能打的。
代價:慢 10 倍
那唯一在那個就是節目裡面,它所明確提到的就是 3.8-27B 要花很多時間來去思考。像它最難的黃金級,它甚至花了大概 45 分鐘到 50 分鐘來思考。那所以這可能是它的問題,然後相對起來 Opus 4.6,它只花了大概 4 到 5 分鐘來做思考。這個可能是算力,也可能是它的設計的部分。不過到最後出來的成果是有目共睹的不錯,那不要說它很好,但是可以說不錯。
量變造成質變:三個新需求
所以我們可以看到 Qwen3.8-27B,基本上它在 AI coding 是夠用的。那在這情況下,其實就變成了一個量變造成質變,我們可以拿來做幾件事情。
需求一:機敏場景 Coding
第一件事情是除了我們平常就知道的一些 daily 的 agentic 的 task 以外,它能夠解鎖 AI coding 這塊,尤其是一些比較機敏場景的 AI coding。
主要原因是這樣子,我們在做 coding 的時候,雖然我們大部分的工作是可以切到一個雲端的模型來進行 coding,但是裡面總是有很多機敏的場景的一些 data,或者是一些就是比較關鍵的一些演算法,然後或者關鍵的文件,在企業這邊其實它是不允許其實用雲端模型來做的。
所以要用 AI 來做 coding 的話,必須要經過一個資安 review 過,去經過一個就是去機敏化的工作,把那些 data 以及把那些文件把它去機敏化之後,才能夠到雲端的模型這邊來做 coding 開發。
但現在有一個這種等級,我們不能說它是 100 分,但是可以說它是一個 75 分到 80 分的地端的模型的話,那它基本上就可以完全解鎖像這樣子的場景。那可以直接碰到它裡面的 data,跟一些演算法來做相關的 coding。
所以第一個就是說,它那個就在地端的 coding,從以前不太可能,或是只能夠修修小 bug,變成說它其實能夠拿來幹就是幹一些事情,這個其實是蠻重要的。
需求二:無護欄模型場景——資安紅軍藍軍攻防
那第二個是我這幾天在玩的,就是把一些模型的護欄拆掉的這些,就是無護欄的模型。那在之前的話,這種模型是拿來做一些特殊的 task,像是做一些版權移除的,當然也有些人做情色的。但其實我們之前用這個模型最重要的功用是來做資安裡面的紅軍的測試。
原因是因為有大量的平常的一些場景在資安檢測的場景下,需要模型能夠做紅軍的測試,就是模擬的進攻,跟另外一邊能夠做那個模擬的防守。那在這種任務下,其實最近的雲端模型的審核越來越嚴格,就很容易一不小心它就認為說你是在做一個資安的攻擊,就直接不做了。
那這個其實最有名的一個場景就是,在 7 月的時候 Hugging Face 它被入侵了,然後它想要去 trace 裡面的 log,找 Claude、找 OpenAI,但是都直接被認為說就算是連 trace 的 log,它都認為這是一個模擬的進攻,所以它都不願意做。到最後他們真的沒辦法了,他們只能找 GLM 5.2 來幫忙做這件事情。
所以這個其實也體現到就是現在的雲端模型它的審核越來越多,其實在做一些理論上應該是正常而且合法合規的 task 當中,其實都還是有一些限制。可是自從有了像 Qwen 這種等級的地端模型,再把它的護欄拆掉的話,其實我們是真的可以拿來做很多平常沒辦法做、必須還是要人來做的 task,所以就會讓它的可利用性越來越高。
需求三:OPEX 變 CAPEX
那第三個當然能夠解鎖的場景,其實就是跟錢有關。我們到現在隨著整個就是 AI coding 的成本越來越高,而且越來越不穩定,就是雲的廠商不斷的在調整價格,不斷在就是調整它的方案定價,甚至提出更多的規則。
像是原本 DeepSeek V4,原本人家說是一個接近免費的方式來打市場,可突然之間就變成原本的兩倍到三倍,所以就導致大家就突然之間又不能夠又要重新找一個新的 solution。
所以在這情況下,有一個可以用的就是地端模型,然後那就是完全不需要去思考它的 token 在那邊怎麼樣使用,你唯一要思考的是你要怎麼去建置你這個 server 的部分。所以這樣子有點讓原本的相關成本,從 OPEX 那邊考量,而且是一個不穩定的 OPEX 考量,變成是一個穩定而且是一個可預測的 CAPEX 考量。這個其實也是對企業這邊是一個蠻重要的一個議題,那它能夠增加很多的相關的穩定性。
地端模型演進:從限縮到解鎖
所以到最後我們發現到的是,隨著 Qwen3.8-27B 出了,它能夠解鎖像機敏場景的 AI coding,然後一些無護欄的一些相關的行為,像一些資安紅軍藍軍這邊的攻防,然後第三個我們又有了一些能夠在規劃 token 的時候更多的選項。
所以總體上來說,地端的模型一路走過來,除了從原本的就是一個只能夠做一些最重要最機敏的一些相關的任務,然後是一個限縮的場景。那一直到了就是今年年初的 Qwen3.6-27B 出了,因為它增加了它的相關的智力,所以就變得說我們已經可以來做一些 daily operation 的 agentic task,然後再搭配上像 OpenClaw、Hermes 這樣子的 agent,它其實能夠做的事情越來越多了。
那到了現在 3.8-27B 出來之後,除了這幾個場景下,又解鎖了在機敏的場景下面的一些 AI coding,然後還有一些就是無護欄然後就是 agentic 的 AI coding task,像是紅軍藍軍的攻防測試。當然還有就是隨著我們現在對算力的需求越來越多,然後整個成本越來越高,如何去精算、如何去限制整個企業裡面怎麼叫做 AI coding,就變得越來越難。
但是有了就是一個地端的一個相關 solution 的話,我們可以把一定比例的人或一定比例的一些 usage 就直接到地端這邊,然後讓原本的花費從不穩定的 OPEX 變成穩定的 CAPEX。那這些其實都對企業來說是很重要的部分。
結論:雲地混合,3:7 還是 7:3
我覺得到未來就是至少在這段時間,這半年左右,絕對不會是一個雲端獨大,也絕對不會是一個地端吃掉全部,一定是一個雲地混合的情況。只是隨著不同的企業,它對機敏程度的要求,它是一個 3 比 7,還是一個 7 比 3,或是中間一個 5 比 5,那這個就是要仰賴各位就是好好去思考,怎麼去規劃你的這些 AI 的用法。
那就是我今天要講的東西,謝謝大家。
延伸閱讀
- Qwen3.8-27B 開源三天,五個 Opus 級無護欄模型就在你的筆電上跑了
- Qwen3.8-27B 開源:SWE-bench Pro 61.7 贏過 Opus 4.6 Max
- Qwen3.8-27B 實測:RTX 3090/4090/5090/PRO 6000/DGX Spark/Mac tok/s 整理
- Qwen3.8-27B 斬殺線:別只看那 $0.01,真正該看的是背後的趨勢
- GLM-5.2 出了,好評如潮:開源這次真的贏了
- Qwen 3.6-27B 本地部署:DGX Spark / Mac mini 跑出 Sonnet 4.6 等級 AI Agent
- YouTube 逐字稿:千問3.8-27B 用了兩天說說感覺——RTX 5090 SGLang/vLLM/llama.cpp 實測
常見問題 Q&A
Q: Qwen3.8-27B 跟 Opus 4.6 的 coding 能力到底差多少?
抖音「Token就是詞元」的祖傳代碼 Bug 挑戰賽(Legacy Code Bug Challenge)裡,Qwen3.8-27B 跟 Opus 4.6 在青銅、白銀、黃金三個難度各三題,結果都是解兩題,打平。這是該系列唯一一次地端小模型上場,也是唯一一次跟 Tier 1 雲端模型打成平手。不過代價是速度:黃金級最難的題目,27B 花了 45 到 50 分鐘思考,Opus 4.6 只要 4 到 5 分鐘,差了大概 10 倍。對,就是結果一樣好,但要等很久。
Q: 地端模型(On-Premise Model)能解鎖哪些以前做不到的企業需求?
主要三個。第一是機敏場景 Coding(Sensitive-Context Coding):企業裡有些資料、演算法、文件不允許丟到雲端,以前要先做去機敏化才能用 AI,現在有 75 到 80 分的地端模型就可以直接在本地碰這些資料做開發。第二是無護欄模型場景(Uncensored Model Use Cases):資安紅軍藍軍(Red Team / Blue Team)的攻防測試需要模型不拒答,雲端模型審核越來越嚴格,連 trace log 都會被當成模擬進攻而拒絕。第三是 OPEX 變 CAPEX:把不穩定的雲端按量計費(OPEX,Operating Expenditure)換成可預測的硬體投資(CAPEX,Capital Expenditure)。
Q: 為什麼說雲端模型做資安紅隊測試(Red Team Testing)越來越難用?
7 月 Hugging Face 被入侵的時候就是一個實例。他們想用 AI 去 trace 入侵的 log,結果找 Claude、找 OpenAI,兩家都直接判定這是模擬攻擊行為,拒絕協助。到最後沒辦法了,只能找 GLM 5.2 來做這件事。然後雲端模型的審核只會越來越嚴格,很多理論上合法合規的資安任務都會被擋住。有了地端模型再搭配護欄移除(Abliteration),這類任務就不再受限於雲端廠商的政策判斷。
Q: 未來企業的 AI 部署會是雲端還是地端為主?
一定是雲地混合(Hybrid Cloud-On-Premise),差別只在比例。至少未來半年,不會是雲端獨大,也不會是地端吃掉全部。對機敏程度要求高的企業可能是 7 比 3(地端為主),一般企業可能是 3 比 7(雲端為主),中間也可能 5 比 5。關鍵是根據自己的機敏需求、成本結構、跟資安要求來規劃比例,不是選邊站。