懶泥科技觀點 觀察科技,理解未來 · WEEKLY
晶片、權重之後,第三道牆是「問題」— 美國把 AI 蒸餾定性為國安威脅

晶片、權重之後,第三道牆是「問題」— 美國把 AI 蒸餾定性為國安威脅

· 16 MIN READ · 4,856 字
🎯 核心重點 TL;DR
  1. 美國三大情報與資安機關 9/8 聯名發布公告(AA26-251A),指名 DeepSeek、Moonshot、阿里、MiniMax、StepFun、Z.AI 六家中國公司對美國前沿模型進行「工業級蒸餾」——並稱這是其開發策略的「核心,而非補充」
  2. 證據鏈早在今年 2 月就開始:Anthropic 揭露三家實驗室用約 2.4 萬個假帳號、逾 1,600 萬次對話蒸餾 Claude;DeepSeek 有超過 15 萬次對話專門誘導模型輸出思維鏈
  3. 這是管制階梯的第三層:先管晶片(算力)、再管權重(成品),現在管到 API 呼叫(使用行為)——而官方給業者的建議包括「對疑似蒸餾請求悄悄竄改回應」
  4. 法律上蒸餾很可能不構成侵權(AI 輸出本身難有著作權),目前只是違反服務條款、未經法院檢驗——「國安公告」正是在法律工具不足時的替代武器

美國國安局、聯邦調查局、網路安全暨基礎設施安全局——三個平常在抓駭客、抓間諜的機關——這週一聯名發了一份公告。內容不是誰入侵了電網,也不是誰竊走了機密文件。

是六家中國 AI 公司問了美國模型太多問題

這句話聽起來像玩笑,但公告是真的:編號 AA26-251A,指名 DeepSeek、Moonshot AI、阿里巴巴、MiniMax、StepFun、Z.AI,罪名是「工業級蒸餾」——用海量的自動化提問,把 Claude、GPT、Gemini、Grok 的能力抽出來,訓練自己的模型。公告裡最重的一句話是:蒸餾「不是這些公司模型開發的補充,而是它的核心」。

把「向 API 發問」定性成國安威脅,這是頭一遭。而如果你一直在追這個站的出口管制系列,會認出這其實是同一場戰爭的第三章:第一章管晶片,管的是算力;第二章管權重,管的是成品;現在第三章,管到使用行為本身。牆一道比一道抽象,也一道比一道難蓋。

AA26-251A:把「問問題」變成國安事件

KEY·DATA
  • 發布:2026/9/8,NSA+CISA+FBI 聯名(罕見組合),指名六家中國 AI 公司自 2024 年底起對美國前沿模型進行系統性蒸餾
  • 規模:數十億 token、數百萬次請求;抽取的能力包括思維鏈推理、軟體工程、agent 功能與領域特化
  • 手法:假帳號、跨供應商自動切換、經雲端與第三方聚合器混淆來源;灰市代理「中轉站」以低於官價轉售 API 存取、抹除可追溯性
  • 前情:Anthropic 2 月已揭露 DeepSeek/Moonshot/MiniMax 以約 2.4 萬個假帳號產生逾 1,600 萬次對話;其後再指控阿里以 2.5 萬帳號、2,880 萬次對話蒸餾 Claude(2026/4–6)
  • 官方建議的反制:偵測異常行為、跨業者情報共享——以及「對疑似蒸餾請求悄悄竄改回應
  • 北京回應(9/9):外交部稱美方「無端指責抹黑」、中國 AI 是「高水平科技自立自強的結果」;AI 治理預計列入月底川習會談

先科普:蒸餾是什麼,為什麼它這麼有效

蒸餾(distillation)的邏輯,一句話就能講完:與其自己從零學,不如抄學霸的答案卷——連解題過程一起抄。

技術上,你對一個強模型發出大量問題,把它的回答收集起來,當成訓練資料餵給自己的模型。特別值錢的是思維鏈(chain-of-thought)——模型一步步展示推理過程的那部分。Anthropic 的調查裡有個細節很說明問題:DeepSeek 有超過 15 萬次對話,是專門設計來誘導 Claude 逐步展示推理 的。答案只是結果,推理過程才是能力本身;抄到過程,就等於抄到了老師的教法。

蒸餾本身不是邪門技術。每家 AI 公司內部都在用——拿自家大模型蒸餾出便宜的小模型,是行業標準做法。OpenAI 甚至把蒸餾當成官方功能賣。爭議從來不在技術,在對象:拿自己的模型蒸餾叫優化,拿別人的模型蒸餾,在模型擁有者眼裡叫偷。

而它有效到什麼程度?我在開源模型效率那篇追過開源與閉源模型的時程差距——中國開源模型能用零頭的成本、幾個月的時差追上前沿能力,蒸餾正是官方指控中這條捷徑的引擎。這也解釋了為什麼 DeepSeek R1 當初「幾百萬美元訓練出前沿模型」的故事讓矽谷既震撼又憤怒:如果公告屬實,那筆帳單之所以便宜,是因為最貴的部分記在別人的 GPU 上。

指控的內容:不是幾個工程師,是一條產業鏈

把 2 月到 9 月的揭露拼起來,指控描繪的不是零星的違規,是一套完整的供應鏈。

▲ 從企業揭露到官方定性:蒸餾戰爭的時間線
時間揭露方指控內容
2026/2AnthropicDeepSeek、Moonshot、MiniMax 以約 2.4 萬假帳號、逾 1,600 萬次對話蒸餾 Claude;MiniMax 佔逾 1,300 萬次
2026/2OpenAI 等同步指出多家中國實驗室對其模型進行類似規模的蒸餾行為
2026/夏Anthropic指控阿里巴巴以 2.5 萬假帳號、2,880 萬次對話蒸餾 Claude(4–6 月間),用於改進 Qwen 系列
2026/7FT 報導中國商務部研議限制「自家」模型權重與訓練資料出境——北京也把模型當戰略資產
2026/9/8NSA+CISA+FBI官方定性:六家公司、工業級、開發策略的核心;點名灰市「中轉站」產業鏈
2026/9/9中國外交部反擊「無端指責抹黑」;川習會前夕,AI 治理上談判桌

數十間小屋的細管在中繼站匯流纏繞、再以一根偽裝過的粗管通向遠處的宏偉機房——中轉站讓任何單一平台都看不到全貌

裡面最值得停下來看的,是「中轉站」這個角色。公告描述的灰市代理服務,以低於官方定價轉售前沿模型的 API 存取,同時自動混淆使用者來源——一個代理網路可以同時管理超過兩萬個假帳號。這意味著蒸餾不是某家公司偷偷摸摸的行為,而是有專業分工的市場:有人負責開帳號、有人負責繞地理封鎖、有人負責把流量打散到不同雲端供應商,讓任何單一平台都看不到全貌。

這個結構讓「封鎖」變得幾乎不可能。你可以封一個帳號、封一個 IP 段、封一家雲端業者,但你封不掉一個市場——只要價差存在(前沿能力的官價 vs 蒸餾出來的成本),就有人架新的中轉站。

▸ FIG · 蒸餾戰爭:指控規模與管制階梯 INTERACTIVE

管制的階梯:為什麼走到這一步

把鏡頭拉遠,這份公告的位置才看得清楚。

美國對中國 AI 的管制,是一道一道往上蓋的牆。第一道牆管算力:2022 年起的晶片出口管制,邏輯是「沒有 GPU 就訓練不了前沿模型」。結果中國公司用效率工程和走私晶片部分繞過了它。第二道牆管成品:討論限制模型權重出口、審查開源發布,邏輯是「不讓訓練好的能力直接流出」。結果蒸餾讓這道牆形同虛設——我不需要你的權重,我只需要跟你的模型「聊天」聊個幾千萬次。

三道牆一道比一道高也一道比一道抽象:磚牆、鐵網、還在施工的虛線之牆——而道路從每一道牆的縫隙蜿蜒穿過

於是只剩第三道牆:管使用行為。這就是 AA26-251A 真正的意義——它承認前兩道牆擋不住能力外流,把戰線推進到 API 呼叫的層次。

問題是,這道牆在物理上最難蓋。晶片是實體物品,過海關看得到;權重是大型檔案,傳輸有跡可循;而「問題」呢?一次 API 呼叫和十億次 API 呼叫在性質上沒有差別,差別只在意圖——而意圖藏在數萬個假帳號和中轉站後面。所以公告給業者的三條建議,本質上是把 AI 公司變成反情報機構:行為偵測(抓異常模式)、情報共享(跨公司拼圖)、以及最引人注目的第三條——對疑似蒸餾的請求,悄悄竄改回應

那條建議值得多想兩秒。官方建議企業對「疑似」惡意的使用者提供故意劣化的答案。這是防禦,也是投毒。它的軍事邏輯完美——讓對手抄到錯的答案卷,比不讓他抄更狠——但它同時打開了一個產品問題:誤判怎麼辦?一個行為模式剛好像蒸餾的正常重度用戶、一家用自動化流程呼叫 API 的新創,會不會在不知情的狀況下拿到被摻沙的輸出?當「模型可能對你說謊」成為官方建議的商業實務,前沿 API 的信任基礎就多了一道裂縫。

反方:「偷」這個字,法律上站不站得住

把反方講清楚,這篇才完整——而這次的反方特別硬:蒸餾很可能根本不違法。

法律學者的主流看法是:AI 模型的輸出本身難以受著作權保護(美國著作權局的立場一貫是純 AI 生成內容不具著作權),而用不受保護的輸出去訓練另一個模型,在傳統著作權法下很難構成侵權。蒸餾抄的是「行為」不是「文本」,而著作權不保護想法、系統與功能性方法。截至目前,沒有任何一個法院判例檢驗過蒸餾的合法性。

那被違反的是什麼?是服務條款——OpenAI、Anthropic 的 ToS 都明文禁止用輸出訓練競爭模型。但 ToS 是契約,違約是民事糾紛,而且要先抓到你才告得成。這就是為什麼這場仗打到今天,武器一路從「法務信函」升級到「國安公告」:不是因為事情變嚴重了才升級,是因為法律工具從頭到尾就不夠用。用國安框架處理法律灰區,是承認打不了官司的另一種說法。

還有一個更不舒服的對照,值得誠實面對:美國的前沿模型,自己就是用整個網際網路的內容訓練出來的——新聞、書籍、論壇、程式碼,大多同樣沒有取得授權,同樣主張「學習行為不是複製」。當 Anthropic 說中國實驗室「抄了 Claude 的能力」,紐約時報對 OpenAI 的訴訟裡有一句結構完全相同的指控,只是主詞不同。這不是說兩件事道德上等價——規模化假帳號與規避封鎖確實惡質——但「用別人的產出訓練我的模型」這個行為本身,恰好是這個產業的原罪。蒸餾戰爭吵的不是原則,是排隊順序:先上車的人,正在檢討後上車的人補票沒補夠。

WARNING 注意

北京的回應也要放進來才完整:外交部稱指控是「無端指責抹黑」,並強調中國 AI 是「高水平科技自立自強的結果」。同時別忘了 7 月的另一條新聞——中國商務部自己也在研議限制中國模型的權重與訓練資料出境。翻譯:雙方嘴上吵原則,行動上做同一件事——把模型當戰略資產鎖起來。

台灣視角:兩邊的門同時在關,你站在門中間

這件事對台灣不是看戲,有三層實際影響。

第一層是模型供應鏈的盡職調查會變成真的。台灣企業這兩年大量採用中國開源模型——Qwen 系列尤其普遍,因為便宜、中文好、可自架。但公告指名阿里的 Qwen 家族受益於工業級蒸餾之後,「你的 AI 產品底層用什麼模型」對有美國業務的公司來說,會從技術選型問題變成合規問題。我不認為會立刻出現禁令,但方向不難預測:先是美國大客戶的供應商問卷多一欄,然後是政府標案的資格條件多一行。現在盤點自家技術堆疊裡有哪些模型、來源是否可交代,成本最低。

第二層是安全防護的繼承問題。Anthropic 那句話講得很直白:非法蒸餾出的模型,不會繼承原模型的安全防護。這句話有自利成分(當然它希望你用原廠),但技術上是真的——蒸餾抄得到能力,抄不到對齊工程的完整結構。對把開源模型放進客服、金融、醫療流程的台灣企業,這是「便宜」背後真正的價格標籤之一。

第三層是押注單一陣營的地緣風險。我在 GLM 那篇整理過台灣政府對中國開放模型的保留態度;現在情勢更清楚了——美國在管「能力流出」,中國在管「模型出境」,兩邊的門同時在關。對台灣業者,結論不是「選邊」,是確保可遷移性:你的應用層如果只能跑在某一個模型上,任何一邊的門關上都會夾到你。抽象化模型介面、保留至少一條替代路線,這些工程上的老生常談,正在變成地緣避險。

我的判斷

三條。

第一,這份公告的實際作用是定價,不是執法。它抓不到人、封不了中轉站市場,但它把「使用蒸餾產物」的合規成本寫上了檯面——從此以後,美國企業採購 AI 時「這個模型怎麼來的」有了官方依據可問。管制的力量不在禁止,在改變成本結構;晶片管制如此,這次也一樣。

第二,投毒式防禦會重新定義 API 信任。當「悄悄劣化回應」成為官方建議,重度 API 用戶(不管你是不是中國公司)都該把「輸出品質的可驗證性」放進風險清單。我猜一年內會出現第三方的「模型輸出一致性監測」服務——有人的防禦,就有人的生意。

第三,蒸餾戰爭沒有技術解,只有經濟解。只要前沿能力的官價與蒸餾成本之間存在巨大價差,灰市就會存在,這跟盜版音樂的歷史一模一樣。當年終結盜版的不是告贏 Napster,是 Spotify 把正版變得夠便宜夠方便。前沿實驗室真正的長期選擇,可能不是把牆蓋得更高,而是把官方蒸餾(授權的小模型、學生方案、區域定價)做得夠便宜,便宜到中轉站無利可圖。用產品打敗灰市,歷史上成功過;用公告打敗灰市,還沒有過。

🎯

關鍵洞察

INSIGHTS
管制階梯上到第三層

晶片(算力)、權重(成品)之後,AA26-251A 把管制推進到 API 使用行為——牆越蓋越抽象,也越難執行:晶片過海關看得到,「問題」的惡意藏在數萬個假帳號後面。

指控描繪的是產業鏈,不是個案

約 2.4 萬假帳號、逾 1,600 萬次對話(Anthropic 2 月揭露)只是開頭;灰市「中轉站」低價轉售 API 存取、單一代理網路管理兩萬帳號——有分工的市場,封帳號封不掉。

法律工具不足,才用國安框架

蒸餾很可能不構成著作權侵權、只違反服務條款、無法院判例——「國安公告」是打不了官司時的替代武器;而美國模型自己也是用未授權的網路內容訓練的,這場仗吵的是排隊順序。

投毒式防禦是把雙面刃

官方建議業者對疑似蒸餾請求「悄悄竄改回應」——軍事邏輯完美,但誤判會讓正常重度用戶拿到摻沙輸出,前沿 API 的信任基礎出現裂縫。

台灣要的不是選邊,是可遷移性

美國管能力流出、中國管模型出境,兩邊的門同時在關。用 Qwen/DeepSeek 的台灣企業該做三件事:盤點模型供應鏈、認清安全防護不隨蒸餾繼承、確保應用層可以換模型。

最後留個問題:如果蒸餾在法律上站得住、在技術上擋不住、在經濟上誘因永遠存在——那「前沿模型的護城河」這個詞,還剩下什麼實質內容?也許答案跟晶片一樣殘酷:護城河從來不在模型本身,在你能不能持續比別人快一個身位。抄得到今天的你,抄不到明天的你——前提是,你真的有明天的你。

參考資料

指控內容以官方公告與當事公司揭露為準:

  1. CISA 官方 — China-Based AI Companies Conducting Industrial-Scale Distillation Campaigns(AA26-251A) — 六家公司名單、「核心而非補充」定性、中轉站手法、三條反制建議(含竄改回應);PDF 版
  2. Anthropic 官方 — Detecting and preventing distillation attacks(2026/2/23) — 約 2.4 萬假帳號、逾 1,600 萬次對話;DeepSeek 15 萬次思維鏈誘導、Moonshot 340 萬次、MiniMax 1,300 萬次;「不繼承安全防護」論點
  3. Tom’s Hardware — Anthropic claims China’s Alibaba used 25,000 fake accounts and 28.8 million exchanges — 阿里案:2.5 萬帳號、2,880 萬次對話(2026/4–6)、Qwen 家族
  4. The Register — US claims Chinese AI companies’ core AI strategy is distilling American models — 中轉站轉售價格與匿蹤機制、公告未附量化證據的批評視角
  5. AP(經 WTOP)— China hits back at US claims of ‘malicious’ AI distillation — 外交部「無端指責抹黑」「科技自立自強」回應;川習會前夕時點
  6. NPR(經 WHRO 聯播版)— Allegations of AI distillation spark debate about IP theft. But is it illegal? — 法律分析:輸出難有著作權、ToS 屬契約層次、無判例;Georgetown 法學者 Chander「向他人學習是對著作物完全合理的使用」
  7. 本站前作 — 開源模型效率那篇Fable 5 解禁那篇 — 開源/閉源時程差、台灣政府對中國模型態度、出口管制武器化脈絡

關於數字口徑:「數十億 token、數百萬次請求」為聯合公告的整體描述,未附逐家佐證;逐家數字(1,600 萬/2,880 萬次對話等)出自 Anthropic 單方揭露,中方公司未承認;「中國政府知情」在公告中為「likely」等級的研判用語,非確證。DeepSeek 等公司截至發稿未對 9/8 公告作出實質回應。

FAQ 常見問題

什麼是 AI 模型蒸餾(distillation)?為什麼美國說它是偷竊?

蒸餾是用強模型的輸出來訓練弱模型:對 GPT、Claude 這類前沿模型發出大量問題,把它的回答(尤其是一步步推理的思維鏈)收集起來當訓練資料,讓自己的模型學會類似能力。技術本身合法且業界普遍自用,爭議在於未經授權對別人的模型做:美國 2026 年 9 月 8 日的聯合公告(AA26-251A)指控六家中國公司用假帳號與代理服務規避封鎖、大規模抽取美國模型能力,定性為工業級的能力竊取。

美國指控中國 AI 公司蒸餾的具體證據是什麼?

最具體的數字來自 Anthropic 2026 年 2 月的揭露:DeepSeek、Moonshot、MiniMax 三家透過約 2.4 萬個假帳號與 Claude 產生逾 1,600 萬次對話,其中 MiniMax 超過 1,300 萬次、DeepSeek 有逾 15 萬次專門誘導模型逐步展示推理過程;之後 Anthropic 再指控阿里巴巴用 2.5 萬個假帳號、2,880 萬次對話蒸餾 Claude。9 月的官方公告把範圍擴大到六家公司、指出其透過稱為「中轉站」的灰市代理以低於官價轉售 API 存取來規避追蹤。

AI 蒸餾違法嗎?

目前很可能不違法,這正是整件事微妙的地方。法律學者多認為 AI 模型的輸出本身難以受著作權保護,用輸出訓練另一個模型在傳統著作權法下不構成侵權;蒸餾明確違反的是各家 AI 公司的服務條款,屬於契約層次,而且截至 2026 年中沒有任何法院判例檢驗過。美國選擇用國安公告而非訴訟處理,反映的是現行法律工具不足。

台灣企業使用 DeepSeek、Qwen 這些中國開源模型有什麼風險?

三層風險。法律與商譽層:若這些模型被證實以違反服務條款的方式蒸餾自美國模型,採用它們的下游企業可能面臨供應鏈盡職調查壓力,特別是有美國業務或客戶的公司。安全層:美國公告與 Anthropic 都指出,非法蒸餾出的模型不會繼承原模型的安全防護。地緣層:中國自己也在研議限制模型出口,兩邊的門同時在關,把技術堆疊押在任何單一陣營的模型上都需要備援方案。

◇ NEWSLETTER · 每週科技評析

下一篇你不會想錯過

每週一篇值得花 10 分鐘讀的科技觀察,直送你的信箱。

加入讀者行列

🔒 零垃圾信,隨時取消,完全免費