我整天在用 AI 寫 blog,深知去 AI 味有多重要。本站的出版閘門有一份禁字表,12 個詞,都是我讀到覺得刺眼就加進去的;寫作指引裡也有句子結構的規範。做法跟市面上大部分去 AI 味清單差不多,憑語感,看到什麼不順就禁什麼。

但我一直覺得這樣不夠。禁了 12 個詞之後,文章讀起來還是有一股說不上來的 AI 味,到底是哪裡在漏?我沒有答案,只知道靠感覺繼續加詞不是辦法。

然後就在 X 上看到這則貼文。作者 @Zhiyu333 用 629 篇文章、約 283 萬字做了一個對照實驗,把 26 項流行的 AI 味說法逐項量過,只有 11 項站得住,好幾項方向整個反過來。規則、研究報告、量測腳本全部開源在 lieflat-less-ai-tone,8 月 20 日建立,到 9 月 16 日有 942 顆星,MIT 授權。

我把它的規則轉成繁體,量了本站 2026 下半年 67 篇文章。破折號每千字 5.75,同一份研究裡人類文章是 0.80,五個模型裡最重的 DeepSeek V4-Pro 是 5.16。

我禁的 12 個詞,沒有一個在它驗證過的清單裡。真正量得出來、差距最大的那一項是標點,我從來沒查過。

30 秒定位

項目 內容
語料 629 篇文章、約 283 萬字,其中 AI 生成 300 篇、人類文章 329 篇
生成模型 Claude Opus 4.6、DeepSeek V4-Pro、Gemini 3.1 Pro、GPT 5.6 Sol、Kimi K3 各寫 60 篇,涵蓋 38 個話題
生成條件 不聯網、不給任何風格指令,只給話題
候選特徵 26 項公共討論裡常見的「AI 味」
結果 11 項通過,15 項沒有區分力或方向相反
公開內容 SKILL.md 規則、研究報告、三支 Python 量測腳本,MIT 授權
沒公開的 語料本身(版權與隱私)

去 AI 味清單的做法為什麼不夠

大部分去 AI 味清單是這樣來的:某個人讀多了 AI 文章,覺得破折號太多、「不是 A 而是 B」太多、愛設問、句長太均勻,把印象寫成條目,在社群轉久了就變成常識。作者自己講得很準:這些句式單獨看都沒問題,「但它們以特定的密度和組合方式反覆出現時,構成了一種可以被立即識別的氣息」。

用過這類清單之後碰到兩個問題。一是覆蓋不全,感覺得到的 AI 味清單裡沒寫;二是誤傷,把自己的寫作習慣也一起刪了。根源相同:條目沒被檢驗過。

所以它換了做法。拿同樣話題、同樣文體的人類文章和 AI 文章,逐項算每個句式的出現頻率,再比兩邊。判定門檻:AI 頻率是人類兩倍以上才收;0.8 到 1.25 倍算沒差;低於 0.8 代表人類用得更多。另外人類各組之間差距不能超過 5 倍,排除某個作者的個人習慣被當成人類共性。規則還必須能指到具體句子和詞,「比喻不貼切」這種要靠語意判斷的,一律不收。

工程師可以這樣理解:你懷疑某個功能讓轉換率變差,最省事的做法是看幾個使用者抱怨就下結論。正確做法是拉兩組流量,控制其他變數,看數字。去 AI 味清單過去都在做第一種,這個 repo 做的是第二種。

通過的 11 項:問題集中在段落銜接

區分力最強的一項叫「段首零回指評論」。AI 愛在新段落第一句直接下評語,像「聽起來像一條功能描述」,卻不說在評論什麼,讀者得往回翻。AI 在非首段出現的比例是 0.61%,人類 0.14%,4.4 倍。

段首銜接詞的總量,AI 14.4%、人類 15.1%,幾乎一樣。AI 並沒有少用銜接詞,差在評論句省掉了「這」。改法就是補一個字。

差距比較大的幾項列在下表。

特徵 AI vs 人類 倍數
只為了引出列表的空轉句(「主要有以下幾種場景:」) 0.29 vs 0.03 9.4
擬人化喻體(「像一位不知疲倦的助手」) 0.018 vs 0.002 7.3
段首零回指評論 0.61% vs 0.14% 4.4
提示語冒號(「核心是:」「說白了:」) 0.29 vs 0.08 3.8
對舉結構(不是 A 而是 B) 0.73 vs 0.22 3.4
破折號 2.38 vs 0.80 3.0

(除段首零回指是占非首段比例,其餘單位都是每千字。)

六項各長什麼樣,舉一句 AI 常見的寫法:

  • 空轉句冒號:「目前主要有以下幾種方案:」後面接列表。這句話本身不帶資訊,只負責把列表牽出來,刪掉不影響讀者理解。
  • 擬人化喻體:「它就像一位永不疲倦的私人教練,隨時準備為你提供指導。」人類打比方比較常用具體的人,「像一個老師傅」。
  • 段首零回指:新段落開頭直接寫「這樣的邏輯顯然更合理」,卻沒說在評論上一段的什麼,讀者得往回翻。補一個「這」或「上面這個設計」就解決。
  • 提示語冒號:「核心是:我們需要重新審視這個問題。」刪掉「核心是:」三個字,意思完全不變。
  • 對舉結構:「真正的問題不是技術不夠成熟,而是我們還沒有找到正確的應用方式。」人類偶爾用,AI 每千字 0.73 次是人類的 3.4 倍。
  • 破折號插入補充:一句話裡插一到兩組破折號做括號式的補充說明,是 Claude 和 DeepSeek 最常見的寫法。本站每千字 5.75 就是這樣來的。

比喻那條值得特別講。作者原本認定 AI 愛用比喻,實測人類用比喻是 AI 的 2.4 倍。再把比喻細分,才找到 AI 真正多出來的那一種:把工具比成一個理想化的職業人格,導師、秘書、助手。人類打比方比較常用具體的人,「像一個老師傅」。

沒通過的 15 項:好幾條方向整個反過來

設問句幾乎出現在每一份去 AI 味清單裡。

實測人類每千字 1.83 次、AI 0.10 次,人類是 AI 的 17 倍。照清單把設問刪掉,文章只會離人類更遠。

句長均勻度更戲劇化。一開始算出 51 倍,一度排在規則第一條。後來發現是切句程式把 Markdown 表格和沒有句號的長列表算成一句,修正後 0.87,兩邊沒有差別。

問句小標題也一樣。用每千字當分母算出 32 倍,但 AI 平均每篇約 10 個小標題,人類只有 1 到 2 個,量到的其實是「AI 小標題比較多」。換成占小標題總數的比例,AI 2.7%、人類最高組 3.6%,差異消失。

作者把這些整理成六次測量失誤,公開在 repo 裡。比喻那次,正則是 11 個詞的固定詞表,實際文章裡的比喻一個都沒抓到,算出 0.000。提示語冒號那次,初測 6,431 條命中裡,標題 1,266、列表 1,225、對話 207,全是規則本來就不管的東西。

六次的共同點:先看到數字,才去看命中了什麼。作者定下的規程是這一句:

改规则前先抽样看 20 条命中,再看频率。

我覺得這句話比 11 條規則都值錢。

不同模型的 AI 味差很遠

特徵(每千字) Claude DeepSeek Gemini GPT Kimi
破折號 4.25 5.16 0.51 0.11 2.32
對舉結構 0.61 0.86 0.29 1.26 0.51
提示性冒號 0.38 0.43 0.22 0.25 0.32

破折號在 DeepSeek 和 GPT 之間差了四十倍以上。GPT 幾乎不用破折號,對舉結構卻是五個裡最重的。

「AI 味」沒有單一形態。拿一個模型的毛病寫成清單,套到另一個模型身上,一半的規則在抓不存在的東西。作者提到研究初期用兩個模型、30 篇樣本時,得出「破折號是 Claude 獨有」,擴到五個模型就被推翻。

拿同一把尺量本站

repo 的腳本裡正則全是簡體字,本站是繁體,直接跑會漏抓。我把其中幾條手動轉成繁體,量 content/ 資料夾,排除英文版、LinkedIn 版、X 版和逐字稿。

期間 篇數 破折號 對舉結構 提示性冒號 段首零回指
2025 年 8 1.57 0.87 1.03 0.27%
2026 上半年 26 5.94 0.80 0.97 0.72%
2026 下半年 67 5.75 0.32 0.43 0.45%
repo 的 AI 側 300 2.38 0.73 0.29 0.61%
repo 的人類側 329 0.80 0.22 0.08 0.14%

照 repo 的規程,我先各抽 20 條命中來看。

破折號 20 條全是真的破折號,不是連字號也不是連結標題。有人會懷疑是文末「延伸閱讀」灌水,所以我再只算正文段落,把標題、表格、列表、引用和帶連結的行都拿掉,結果是 6.25,更高。逐篇看,73 篇裡有 41 篇超過 DeepSeek 的 5.16。

對舉結構 20 條全是「不是……而是」。提示性冒號比較雜,20 條裡我判斷大約 15 條符合規則定義,其餘是正常的總說分說,這一欄要打折看。

幾件事看得出來。

破折號是本站最明顯的 AI 痕跡,而閘門一次都沒查過。 我禁的 12 個詞,沒有一個在 repo 驗證過的清單裡。真正量得出來、差距最大的那一項是標點,不是詞。

對舉結構和提示性冒號在下半年降了一半以上。我沒有為這兩項特別加過規則,比較可能的原因是寫作指引裡加了「引用原話、再用一句話講重點」的寫法,句子結構跟著變。這個因果我沒辦法證明。

更尷尬的是,本站的語氣指南自己在示範提示語冒號。「白話重點」「弦外之音:」都是指南裡的好範例,用 repo 的標準看,正好是 3.8 倍那一類。

反方:破折號也許就是我的習慣

repo 自己也說,如果有描述作者風格的文件,以風格文件為準;某位作者本來就愛用破折號,就不該刪。人類側破折號組間從 0.01 到 1.29,本來就差很大。

2025 年留在這個資料夾的只有 8 篇、約 1.8 萬字,破折號 1.57,比現在低很多,方向跟「換成模型起草之後變多」一致。但 8 篇太少,而且 2025 年的文章也是 AI 協作寫的,當不了乾淨的人類對照組。

所以我把宣稱降一級。本站的破折號密度落在 repo 裡 AI 模型的區間,比它測到的所有人類組都高,而且跟本站主力寫作模型 Claude 的方向一致。至於「這就是 AI 味」,我證明不了。

這篇文章本身也用同一支腳本量過,正文一個破折號都沒用,寫起來確實要刻意繞開。

坦白說:這個研究自己也有幾個洞

作者在 README 裡把局限寫得很完整,語料不公開這點也明寫是實質缺陷。以下是我讀原始碼和表格時看到的,README 沒特別講。

人類側的來源很集中。 冒號那張表剔除一個來源後,人類側剩 189 篇,推算那一個來源就占 140 篇,剔除後表上只剩兩組。「人類各組差距不超過 5 倍」這個穩定性檢查,建立在大約三個來源上,比 329 篇這個數字聽起來薄很多。

規則的範圍比量測的範圍寬。 SKILL.md 第 1 條「翻案腔」除了「不是……而是」,還列了「你以為……其實」「說到底」「回頭才發現」,並寫明換任何字面都要改。但腳本裡量的只有「不是、並非、不在於」接「而是、而在於」。3.4 倍是窄定義量出來的,寬定義沒有數字。這正好是作者自己六次失誤的結構:規則名稱和量測範圍之間有落差。

11 項裡有條件收錄。 頓號羅列是 1.8 倍,其實沒過 2 倍門檻。數字密度是 0.35 倍,方向相反,它收的是「原文有數字時不准用概括詞蓋掉」這半條。說 11 項「通過」,嚴格過門檻的少於 11。

倍率方向沒統一。 腳本裡的倍率是人類除以 AI,文件是 AI 除以人類,SKILL.md 第 2 條還寫著 0.56。讀者自己拿腳本復算時,很容易看反。

繁體中文用戶要自己改腳本。 SKILL.md 丟給模型用沒問題,模型讀得懂繁體。但量自己的文章,正則得自己轉。

這些洞都不影響它最核心的貢獻。它把「AI 味」從一個大家各說各話的形容詞,變成一組可以復算、可以被推翻的數字,連推翻自己的過程都公開了。8 月 24 日它還在重測冒號規則,新增了空轉句那一種形態。

作者的結論,這可能要在預訓練解決

作者最後的判斷是,靠 prompt 或 skill 只能解決局部。能讓模型不用破折號,很難讓它懂一個比喻什麼時候才算貼切。寫作能力要真的往上走,得等底層能力。

這跟我之前寫 RLHF 和 RLVR 的結構性代價 是同一個方向。模型的文風是訓練目標塑造出來的,事後用規則修,修到的都是表面形態。

也跟 Astra 的 machineslop 是同一件事的兩面。那篇是模型判斷沒人會看,程式碼就不為人寫;這篇是模型寫的文字有一套可量測的慣性。兩篇都得到同一個結論,要靠量測,光憑感覺抓不到。

關鍵洞察

先量自己的語料,再決定禁什麼。 我的禁字表抓了 12 個詞,真正差距最大的是破折號。repo 的三支腳本換成自己的語料就能跑,繁體要先改正則。

按主力模型挑規則。 用 GPT 寫的人去刪破折號是白工,GPT 每千字只有 0.11;該查的是對舉結構。用 Claude 或 DeepSeek 的人,破折號是第一個要看的。

任何量測數字,先看 20 條命中。 這條不只適用於去 AI 味。閘門、lint、eval,只要是正則或規則算出來的數字,都可能在量別的東西。

不要照清單刪設問句和比喻。 這兩項人類用得比 AI 多,刪了更像 AI。


常見問題 Q&A

Q: lieflat-less-ai-tone 是什麼?

lieflat-less-ai-tone 是 GitHub 上一個開源的去 AI 味 Agent Skill(MIT 授權),規則來自一份對照實驗。作者用 629 篇文章、約 283 萬字做語料,其中 AI 生成 300 篇(Claude Opus 4.6、DeepSeek V4-Pro、Gemini 3.1 Pro、GPT 5.6 Sol、Kimi K3 各 60 篇)、人類文章 329 篇,測了 26 項常見的 AI 味說法,11 項收成規則。可以用 npx skills add larashero3-dotcom/lieflat-less-ai-tone 安裝,也可以把 SKILL.md 當 system prompt 用。

Q: 實驗裡哪個 AI 味特徵最有區分力?

以穩定性和倍數綜合看,是段首零回指評論(Zero Anaphora Comment),也就是新段落第一句直接下評語、不交代評論對象。AI 在非首段出現的比例是 0.61%,人類 0.14%,差 4.4 倍。倍數更高的有空轉句冒號 9.4 倍、擬人化喻體 7.3 倍,但絕對頻率很低。

Q: AI 寫作真的比較愛用設問句和比喻嗎?

在這份語料裡剛好相反。正文設問句人類每千字 1.83 次、AI 0.10 次,人類是 AI 的 17 倍;比喻人類用得是 AI 的 2.4 倍。AI 多出來的只有擬人化喻體,例如把工具比成「一位不知疲倦的助手」。照流行清單刪掉設問和比喻,文章會更不像人寫的。

Q: 破折號還算 AI 味嗎?GPT 不是已經不太用了?

要看模型。這份研究裡破折號每千字 DeepSeek 5.16、Claude 4.25、Kimi 2.32、Gemini 0.51、GPT 0.11,人類平均 0.80。GPT 幾乎不用,但 Claude 和 DeepSeek 仍是人類的五倍以上。我用同一套規則量本站 2026 下半年 67 篇主要由 Claude 起草的文章,破折號是 5.75。

Q: 用繁體中文寫作,可以直接用這個 skill 嗎?

SKILL.md 本身是給模型讀的規則,繁體文章直接丟進去沒問題。但 repo 附的三支量測腳本,正則全是簡體字(例如「这意味着」「说白了」),量繁體語料會漏抓。破折號、頓號這類標點規則不受影響,其他句式要先把正則轉成繁體再跑。


資料來源

  • larashero3-dotcom,lieflat-less-ai-tone:README.md、RESEARCH.md、SKILL.md、scripts/(讀取於 2026-09-16)
  • 躺在廢墟裡 Lieflat (@Zhiyu333),X 貼文,2026-09-15
  • 本站數字:以該 repo 的 compare-human-ai.py 與 check-structure.py 正則轉繁體後自測,範圍為 content/ 內中文主文章