沒有安全工具,agent 根本不用談。講這句話的是 Nvidia 執行長 Jensen Huang,場合是 10 月 7 日舊金山一場發表新筆電的活動。

開源元件 LMCache 也在那天被揭露 9.8 分的漏洞,到現在沒有修補版本。一家評測機構把 ChatGPT 的青少年版評為「unacceptable risk」,理由之一是它在對話裡很少叫人停下來。

三件事分開看,各是一則新聞。擺在一起,缺的是同一樣東西:大家都在加速,煞車裝在哪裡、誰踩得到,講得清楚的人很少。發表會的投影片不會放下行風險,那通常要等到出事那天才量得出來。

一、Microsoft 和 Nvidia:2,599 美元的筆電,和一個轉正的沙箱

Reuters 報導,Microsoft 與 Nvidia 10 月 7 日週三在舊金山發表搭載 Nvidia RTX Spark 的 Surface Laptop Ultra,起價 2,599 美元,最高配 5,899 美元(20 核處理器、128 GB 記憶體、1 TB 儲存),入門機是 24 GB 記憶體。HotHardware 寫得更細:入門的 2,599 美元是 18 核 CPU、40 個 SM 的 Blackwell GPU、24GB unified RAM;頂配是 20 核、48 個 SM、128GB。另外還有一台 Surface RTX Spark Dev Box,5,999.99 美元,HotHardware 說依商店頁面是 11 月某個時候出貨。

價格本身就有故事。Reuters 提到,Nvidia 自家的 DGX Spark 從上市到現在漲了約 75%,到 6,950 美元,原因是記憶體成本上升。Moor Insights & Strategy 的分析師 Anshel Sag 對 Reuters 說:

「So it’s becoming this thing where only the people who have the budget can really afford to run AI locally.」

不過我覺得這場真正該記住的是 MXC(Microsoft Execution Containers)。HotHardware 說 Microsoft 把它「out of beta and into general availability」,它是一個靠政策驅動的沙箱,限制 AI agent 能碰哪些本機檔案、哪些網路資源、哪些工具,Windows、Linux、macOS 都涵蓋。Reuters 的說法是 Anthropic、OpenAI、Nvidia 都會用它;IT 部門設定 agent 的規則,Windows 在每位員工的機器上強制執行。

Microsoft CEO Satya Nadella 的原話是「We needed to make the desktop the most secure place for agents to execute」。Nvidia CEO Jensen Huang 談到安全工具時說得更重:「Without it, (agents are) a complete nonstarter」。

這種沙箱最可能怎麼失敗?我想得到的是規則寫得太緊,agent 動不動就被擋,開發者嫌煩,最後整批放寬。這是我的推測,不是報導內容。所以半年後企業的預設規則長什麼樣子,比 MXC 現在擋得了什麼更值得看。

這則有三處我沒辦法確認。HotHardware 寫了「available for pre-order today, … begin shipping next week, on October 16th」,但那句接在 ODM 廠商清單後面,是否包含 Surface Laptop Ultra 看不出來,Reuters 也沒寫出貨日。兩家對「能在 PC 本機跑的模型」描述不一樣,所以這裡不寫具體模型名和跑分說法。CNBC 的同題報導我打不開(回 403),沒讀到。

原文來源:Reuters(investing.com 轉載),2026-10-07 / HotHardware,2026-10-07

二、LMCache:9.8 分,沒有修補版

Microsoft 在替 agent 蓋圍牆的同一天,JFrog 揭露了 LMCache 的 CVE-2026-105192。The Hacker News 引的嚴重度是「9.8 out of 10」,原文沒標是哪一版 CVSS。發現的人是 JFrog 研究員 Yuval Moravchick。

受影響的範圍很長:從 0.3.9(2025 年 10 月發布)一路到目前最新穩定版 0.5.5,0.5.6 的 release candidate 和開發分支也一樣有問題。算下來是大約一年份的版本。

然後是最刺眼的一句:「No fixed version exists.」LMCache 也還沒發安全公告。

成因說穿了很單純。多行程 server 用的 ZeroMQ socket 沒有任何驗證,而且收到訊息後,先 unpickle 才檢查型別。pickle 這個格式在還原物件的時候可以順手執行程式碼,所以先 unpickle 再檢查,就像先把包裹拆開、拿出裡面的東西用了,才去看寄件人是誰。

預設情況下,這個 socket 只聽 localhost。問題出在有人把它設成可路由的位址,遠端就打得到。JFrog 另外發現,官方容器映像是用 root 在跑這個行程,這點 The Hacker News 是轉述 JFrog 的說法。

JFrog 給的建議(同樣是 The Hacker News 轉述)是:不要給 multiprocess server 可路由的位址,port 留在本機或可信任的叢集網路裡。它也講明了防火牆只能降低風險,因為任何連得上那個 port 的主機都能執行程式。

這是今天唯一一則我會叫人今天就處理的新聞。判斷方式很簡單:你的 LMCache multiprocess server 綁的位址如果是 localhost,這則可以排到你有空的時候;只要它綁在任何可路由的位址上,就該今天改。

我想多講一句的是時間差。0.3.9 發布到現在大約一年,這段期間這個 socket 一直沒有驗證。危險一直都在,只是到 10 月 7 日才被公開。Microsoft 在上面那一層談的是限制 agent 能碰什麼;下面這個洞跟 agent 乖不乖無關,只要連得上那個 port 就能執行程式,而且官方映像還是用 root 跑。上面那道圍牆管得到 agent,管不到這個洞。

原文來源:The Hacker News,2026-10

三、Claude Haiku 5.5:價目表很好看,記得看 100k 那條線

Anthropic 10 月 7 日發表 Claude Haiku 5.5,model ID 是 claude-haiku-5-5。以下價格以 2026 年 10 月 7 日官方頁為準,單位是每百萬 token,Haiku 5.5 分成「prompt 100k 以下/超過 100k」兩欄:

輸入 0.10/0.50 美元,輸出 0.50/2.50 美元,cache 讀取 0.01/0.05 美元,cache 寫入 0.125/0.625 美元。對照 Haiku 4.5:輸入 1.00、輸出 5.00、cache 讀取 0.10、cache 寫入 1.25 美元。

100k 以下,每個 token 的價格是 Haiku 4.5 的十分之一。超過 100k,價格跳成五倍,但也還是 Haiku 4.5 的一半。

這條線我覺得比頭條數字重要。Claude Code 2.1.293 的 release notes 寫的是 Haiku 5.5 有 1M context,而且已經是 Anthropic API 上的預設 Haiku 模型。agent 的對話一路長下去,很容易就跨過 100k,跨過去之後,你付的就是第二欄。如果你的呼叫大多是短的分類、抽取,第一欄的價格就是你的真實價格;如果是長跑的 agent,請用第二欄估預算。

另一個會讓帳單偏離價目表的地方是 tokenizer。官方頁自己寫了 Haiku 5.5 換了新的 tokenizer,「uses slightly more tokens per task」,並說它跟 Sonnet 5.5、Opus 5.5 的 tokenizer 相近。「slightly」是多少,頁面沒給數字。

跑分全部來自 Anthropic 自己的表,欄位依序是 Haiku 5.5/Haiku 4.5/GPT-6 Luna/Sonnet 5.5。最誇張的一列是 Terminal-Bench 4.0:39.2%/0.0%/16.4%/70.6%。OSWorld 2.1(offline subset)是 72.4%/15.7%/48.9%/83.9%。自家出的表,我只拿來看同一家前後代的差距,跨廠牌的那一欄先打個問號。

順帶一提,Sonnet 5.5 的 cache 讀取也降價了,原文是「Cache reads now cost 50% less: $0.10 per million tokens rather than $0.20.」頁面說這讓 Sonnet 5.5 大部分 agentic 工作的成本降了「around 20%」。

可用性方面,原文寫「available now on all platforms, including Amazon Web Services, Google Cloud, and Microsoft Azure」。Claude Code 2.1.293 在 GitHub 上的 published_at 是 2026-10-07T18:10:20Z,台北時間 10 月 8 日凌晨 2:10。同一版另一條修正,長時間跑 agent 的人值得留意:「Fixed Claude sometimes treating its own last actions before a context compaction as done after it, and retracting or redoing finished work」。

原文來源:Anthropic:Claude Haiku 5.5 / Claude Code v2.1.293 release notes

四、ChatGPT 的 Intelligent UI:回答開始會動了

TechCrunch 報導,OpenAI 10 月 7 日週三隨一個新的 GPT-6 模型推出 Intelligent UI。Pro、Plus、Business、Enterprise 全球可用,Free 和 Go 方案是週四。

回覆裡會直接長出可以點的按鈕、客製計算機、互動圖表、可編輯的圖表。TechCrunch 舉的例子有機翼升力圖、食譜視覺、單車機構圖、多天的健行地圖、個人儲蓄計算機。OpenAI 產品經理 Aarush Selvan 說「ChatGPT has predominantly been a text-based interface」,又說「the most helpful answers aren’t just text」,目標是讓「learning complex topics easier」。

有一個細節我覺得做對了:使用者可以把視覺的量調低。

我比較在意的是那個儲蓄計算機。一段文字答錯,你讀得出哪一句怪;一個計算機算錯,你看到的只是一個數字。報導沒說這些元件的公式能不能攤開來看。

原文來源:TechCrunch,2026-10-07

五、ChatGPT for Teens:平均值擋不住的那一段

Common Sense Media 把 ChatGPT for Teens 評為「unacceptable risk」,TechCrunch 資深記者 Rebecca Bellan 10 月 7 日報導。Common Sense 說 engagement cues「pervasive even in crisis situations」,而它稱為「Red Lines」的五個嚴重傷害類別裡,有三個不及格。

測試結果裡有幾個數字。休息提醒方面,在將近 2,000 個 prompt 裡只遇到 2 次,兩次都出現在大約 90 分鐘的對話裡。危機轉介方面,風險來自別人的時候,模型在 94% 的危機提示中會叫青少年去找可信任的大人;可是當風險跟青少年和 ChatGPT 自己的關係有關,模型就很少這樣做。

報導引了兩句模型的回應。對一個出現精神病情境的青少年,它說「You can keep talking with me about what you’re noticing.」對一個被朋友說用太多的青少年,它說「You don’t have to stop talking to me.」

OpenAI 發言人反駁,說測試沒有「accurately reflect how ChatGPT’s teen safeguards work in practice」,還說「the bulk of their testing may have begun and concluded before activation of parental controls was complete」。OpenAI 也給了自家數據:青少年平均每天用不到 15 分鐘,連續使用超過 3 小時的不到 2%;有跳出休息提醒的對話裡,將近一半的青少年在 5 分鐘內休息或結束對話。

兩邊的數字其實在量不同的東西。Common Sense 量的是測試 prompt 裡模型怎麼回;OpenAI 量的是實際使用的平均和比例。我站在 Common Sense 那一側,理由不在誰的方法比較乾淨,在於風險長在哪裡。

一個在危機裡的青少年,本來就不是平均值。平均每天不到 15 分鐘,說的是大多數人;出事的那個人,很可能就落在「超過 3 小時、不到 2%」那一小段裡。產品對大多數人安全,跟它對最脆弱的那一小群人安全,是兩件事,前者再好看也證明不了後者。

至於「家長控制還沒完全啟用」這個反駁,反過來讀,照 OpenAI 自己的說法,家長控制有沒有啟用,保護效果就不一樣。那麼沒啟用的帳號是什麼狀態,就值得另外問。Common Sense 若在家長控制完全啟用後重測、結果明顯不同,我會改變看法。現在手上只有這一份測試。

原文來源:TechCrunch,2026-10-07


agent 能被放出去做多少事,上限是它的煞車畫出來的。

Haiku 5.5 在 Terminal-Bench 4.0 從上一代的 0.0% 拉到 39.2%,這種能力要真的交給它在員工電腦上跑,還得有人先寫好它不准碰什麼。Jensen Huang 那句「nonstarter」,講的就是這個順序。

LMCache 那一層更直接。一個 socket 只聽 localhost 的時候,它的煞車就是那個位址;位址一改,煞車就沒了,因為這一年份的版本裡,socket 本身沒有驗證這第二道。

最讓我不舒服的是那句「You don’t have to stop talking to me.」煞車本來應該在產品手上,這句話是產品自己把它放開了。

所以之後再看到任何 agent 或 AI 產品的新聞,我會先問:叫它停下來的那個開關在誰手上,那個人要花幾步才按得到。這個問題答得出來,能力的數字才有意義。