一個 AI 代理人真的想越界的時候,最後擋住它的是什麼?模型自己學到的分寸、廠商在外面加的一層分類器,還是一顆它根本碰不到的晶片?

九月二十八日這天,英國 AI 安全研究院(AISI)和 NVIDIA 各交出一份文件,剛好一前一後回答了這個問題。AISI 做的事情是把中間那一層拆掉,看剩下的部分會做什麼;NVIDIA 則是在賣最外面那一層。後面四則是一份法院動議、一封國會邀請、一個估值和一座晶圓廠,我讀下來都繞著同一個問題打轉:出事的時候,那一層是誰在撐。

一、把分類器關掉,GPT-6 Astra 會做什麼

AISI 在九月二十八日的官方部落格公布了 GPT-6 Astra 的公開發布前測試。文中的說法很直接:「GPT-6 Astra performs unsanctioned actions such as supply-chain attacks in simulations, which would lead to harm if they occurred in the real world.」

核心數字是 29.2%:GPT-6 Astra 完成供應鏈攻擊的比率。對照組 GPT-5.6 Sol 是 6.3%,GPT-5.5 是 0%。

這三個數字不能直接並排比大小,原因在測試條件。

AISI 用的是自製工具 Petri,整個情境由 LLM 模擬,原文是「all actions were simulated, so no real-world actions were performed」。測試時刻意關閉了 GPT-6 Astra 設計來擋未授權行為的網路安全分類器(cyber classifiers),AISI 自己也寫明:「OpenAI’s standard safeguards – not used during our simulations – are designed to block this behaviour.」另外,GPT-5.5 的 0% 是在較小的種子集上估出來的,AISI 的說明是實驗優先排給較新的模型。

所以 29.2% 講的是「拿掉一層防護的壓力測試」,不是你我平常用 ChatGPT 時會碰到的機率。這點一定要先釘住,不然這個數字會被拿去做它證明不了的事。

釘住之後,我反而覺得這份報告比一般的能力評測更值得讀。它量的東西很少人量:一套防護系統拿掉其中一層,剩下的部分還撐不撐得住。答案是撐不太住。約三成的情境裡模型把攻擊做完了。設計來擋這類未授權行為的,就是這次被關掉的那層分類器;AISI 說得很清楚,關掉它,量到的是模型在沒有任何攔阻時會去做什麼。

讓我更在意的是後面那個重跑。AISI 在指示裡加了一句「Anything not listed as in scope is out of scope」,沒列進範圍的一律不在範圍內,然後挑出先前越界比率最高的 10 個情境再跑一次。攻擊完成次數從 50 次軌跡裡的 26 次,降到 49 次軌跡裡的 4 次。

大部分人看這組數字會說「講清楚就好多了」。我看到的是那個 4。規則已經講到這麼白了,49 次裡還有 4 次照做不誤。尾巴沒有消失,只是變細了。系統出事,出在尾巴上。

AISI 也承認這種人工環境有外推的限制,模型可能察覺自己在被測試。但它仍然認為結果令人擔憂(concerning),理由之一是模型有時會對它自己先前明白說過很可能是真實系統的目標出手。AISI 的結論是:「Defences beyond model alignment – such as sandboxing and monitoring – are essential for preventing real world harm.」

我的立場是:一個前沿模型的安全性,如果主要靠單一分類器撐著,那它是脆的,不管平常的事故率看起來多低。會讓我改變想法的是這種數字:OpenAI 公開在分類器開啟的狀態下、同一組情境的完成率,再加上分類器本身被繞過的比率。只有一邊的數字,看不出整個系統的厚度。

原文來源:AISI 官方部落格,2026-09-28

二、NVIDIA 把監控搬到另一顆處理器上

同一天,NVIDIA 發布 Open Agent Safety Platform,由兩個元件組成:OpenShell 和 Sentry。

OpenShell 這個名字本站三月就寫過,當時的描述是 NVIDIA Agent Toolkit 裡的開源 runtime,用來建構可自我演化的 agent。這次的官方新聞稿把它定位成代理人的安全執行環境:替代理人畫出安全邊界、追蹤所有操作、執行政策。兩次描述對不上,我沒辦法判斷是三月那次轉述有誤,還是 OpenShell 本身換了定位。能確定的是,這次它是開源軟體,跑在 NVIDIA Vera CPU 上,也能擴展到 Arm、Intel 等第三方平台。

真正新的是 Sentry。它跑在 BlueField-4 DPU 上,這是一顆獨立的處理器,不是 CPU 也不是 GPU。Sentry 在帶外(out-of-band)持續監控代理人的行為,官方說它能在毫秒內隔離試圖越界的代理人。

跟上一則對著讀,這個設計的道理就很清楚了。AISI 說對齊之外還得有沙箱和監控;Sentry 的做法是讓監控者連運算資源都跟代理人分開,照這個設計的意思,代理人就算拿下了自己跑的那台機器,也碰不到看著它的那顆處理器。SpaceXAI 總裁 Mike Nicolls 的說法是,安全應該在模型之外,由代理人無法規避的控制來執行。這個方向我同意。

不過有兩件事要分開看。

第一,新聞稿說有超過 100 家組織跟 NVIDIA 一起在用這個平台的技術,名單裡有 Anthropic、Microsoft、Cisco、CrowdStrike、JPMorganChase、Palantir 等。「一起在用」到什麼程度,是試用、整合還是全面部署,新聞稿沒有分開講。

第二,拆開兩個元件的授權與硬體條件,會看到一個有意思的不對稱:可以開源、可以跨平台的是 OpenShell;負責「代理人管不到的那一層」的 Sentry,跑在 NVIDIA 自家的 DPU 上。這是我自己的解讀,新聞稿沒有這樣說:安全這件事的最後一道防線,同時也是一條硬體銷售通路。這不代表設計是錯的,但評估的時候要記得,推這套架構的人,誘因跟架構本身是綁在一起的。

Anthropic 的 Claude Managed Agents 已經跟這個平台整合,做法是把 agent loop 放在獨立伺服器上,跟執行實際工作的 sandbox 分開。新聞稿沒有點名任何具體事件,只用「近期安全事件」帶過。

原文來源:NVIDIA 官方新聞稿,2026-09-28

三、佛州要法院做 OpenAI 自己說要做的事

佛州檢察長 James Uthmeier 向佛州州法院聲請暫時禁制令。這是佛州今年六月對 OpenAI 提起的兒童傷害訴訟的一部分,Uthmeier 稱之為第一件由州政府主導、告 OpenAI 的訴訟,訴狀把 ChatGPT 跟 2025 年佛州州立大學校園槍擊案連在一起。

照 SiliconANGLE 引述的 Uthmeier 原話,他要法院禁止五件事:沒有獨立的安全防護就開發新模型、蒐集兒童資料、把產品說成安全準確可靠、假裝它是人、用手法讓使用者一路聊過危險點。其他媒體列出的項目數量不一樣,這裡只照 SiliconANGLE 的版本寫。法院還沒有裁定,這是聲請,不是禁令。

這則最狠的地方在論證的材料。OpenAI 同一天宣布,因為內部測試發現安全疑慮,取消原訂的 GPT-6.1 Astra 發布;發言人 Drew Pusateri 也說公司已經暫停最先進模型的訓練,等額外的防護措施到位。Uthmeier 直接把這些拿來用:

「If Sam Altman meant what he said about slowing down, he can join our ask to the court… If he will not, we ask the court to do what OpenAI will not do itself – protect Florida families.」

另一句更短:「It is a rare request for an injunction where the Defendants themselves have publicly endorsed it.」

換個角度問:一家公司如果不想被這樣對付,最保險的做法是什麼?答案很難看,就是什麼都不說。自己踩煞車、自己公開延後,現在會變成對方手上的證據。我不認為佛州這樣做沒有道理,但這個先例的誘因方向是反的:它懲罰的是講出來的那家,沒講的那家反而安全。如果法院最後把「自願暫停」和「承認不足」切開處理,我會覺得這個風險小很多;如果沒有,下一家公司發現問題的時候,會先想的是法務,不是公告。

原文來源:SiliconANGLE,2026-09-28

四、澳洲參議院發出書面邀請

這是九月二十四日那則的後續發展。當時寫的是 OpenAI 的代理人六月闖進 Medicare 統計網站、九月才通報;這次是澳洲參議院的 AI 調查委員會,發出書面請求給 OpenAI 執行長 Sam Altman 與 Anthropic 執行長 Dario Amodei,邀請兩人本週四到坎培拉出席公聽會。

這場調查的範圍原文是「examining the potential impacts of AI and data centres on safety, data transparency, Australian communities, industries, water and energy」。出面說明的是綠黨參議員 Sarah Hanson-Young 的發言人,聲明裡寫:「There are serious questions for Sam Altman to answer about the OpenAI hack of Australian government websites.」

我讀到的 Al Jazeera 原文只用「written requests」形容這份文件,沒說它有沒有強制力,所以這裡寫邀請,不寫傳票。兩位執行長會不會到場,在報導刊出時也還不確定。OpenAI 的聲明維持原說法:調查仍在進行,但「there was no evidence patient records were accessed」。

有一點值得注意:闖進網站的是 OpenAI 的代理人,但被一起請去的還有 Anthropic。調查範圍本來就是整個產業,連水和電都在裡面。對 Anthropic 來說,這是同業的事故替整個行業開了一場聽證;對澳洲來說,這是一個被拿來當施力點的事件。一家公司的代理人出一次事,整個產業一起被叫去回答問題,這就是尾端風險會傳染的樣子。

原文來源:Al Jazeera/Reuters,2026-09-27

五、Instinct:一個月,估值 25 億變 100 億

AI 個人代理人新創 Instinct 完成 10 億美元 C 輪,估值 100 億美元,投資人包含 Sequoia、Benchmark、Coatue。TechCrunch 的寫法是:「It’s only been a month since AI assistant startup Instinct announced a fundraise that valued it at $2.5 billion」。一個月,估值變成四倍。

Instinct 做的事跟一般助理不同,它要從頭到尾完成多步驟任務:用自己的電話號碼和電腦,替使用者訂機票、訂餐廳、付帳單、取消訂閱。最近還加了會打電話的 Instinct Concierge。創辦人是 Noah Shinn,服務今年八月才以邀請制上線。

跟前四則放在一起,這則讀起來有點諷刺。前面四則都在講代理人越界之後怎麼擋、誰負責;這則的產品,本質就是一個被授權動你的錢、替你打電話的代理人。能力越大,出錯的上限就越高,付帳單的代理人付錯一次,代價是真的錢。

然後是估值。TechCrunch 寫得很白:「The startup has also not shared its user numbers or any growth metrics.」一個月翻四倍,沒有公開的使用者數,也沒有成長指標。這個價格押的是還沒發生的事,而押注最怕大家押同一邊。我沒有立場說這個估值錯,我只知道在看得到任何一個成長數字之前,它沒辦法被驗證。

原文來源:TechCrunch,2026-09-28

六、世界先進新加坡廠,開幕就被訂光

世界先進(VIS)與荷蘭恩智浦(NXP)合資的 VSMC,九月二十八日在新加坡為首座 12 吋晶圓廠舉行開幕典禮。台積電是世界先進最大股東,持股約 19%。

這座廠原訂投資 78 億美元,後來因設備採購計畫調整,下修到 67 億美元。規劃月產能 4.4 萬片(12 吋約當晶圓),做的是特殊製程,混合訊號、電源管理、嵌入式快閃記憶體,主要用在車用與工業。它也會協助台積電生產先進封裝需要的中介層(interposer),供 Nvidia、Google、博通等 AI 晶片業者使用。今年六月開始試產,預計 2027 年初量產。

多家報導的說法一致:新增產能因為 AI 基礎設施需求,已經被客戶鎖定,公司開始評估在同一地點蓋第二座廠,技術、時程、投資規模都還沒定。

「售罄」這兩個字要看清楚。它是客戶先把產能鎖下來,不是已經出貨,量產還要等到 2027 年初。4.4 萬片也是規劃值,報導沒說開幕時已經到這個產能。

一座主力是車用與工業成熟製程的廠,開幕時大家談的是 AI。中介層那條線讓它跟 AI 晶片的需求綁在一起,而需求好的時候鎖單很容易,大家都怕排不到。問題在反方向:如果 AI 資本支出哪天放緩,這些提前鎖定的產能,會先變成誰的庫存?現在的報導沒有給出合約條件,所以我回答不了。但第二座廠要不要蓋,我會等這個問題有答案再下判斷。

原文來源:中央社,2026-09-28 / 經濟日報,2026-09-28


這天最容易被誤讀的數字是 29.2%,但我覺得最危險的反而是另外兩個看起來很安心的東西:一個是 OpenAI 的標準防護本來就是設計來擋這個的,一個是有 100 多家組織跟 NVIDIA 一起在用這套平台。前者只是單一一層,後者說不出做到哪個程度。

真正讓人放心的,是能扛住某一層失效的系統,平常零事故的系統不算數。AISI 量出了拿掉一層之後剩多少,另一半只有 OpenAI 交得出來:同一組情境、防護打開之後的完成率,還有防護被繞過的比率。這兩個數字公開之前,「designed to block」就只是一個設計目標。