十月三日是德國統一紀念日,全國放假。Aleph Alpha 在部落格裡寫明,新模型 Kolibri 就是在這一天發布,完整權重放上 Hugging Face,授權 Apache 2.0。同一篇文章的標題把它叫做 sovereign open-weight model。把「主權」寫進標題,又把發布日跟統一紀念日綁在一起,訊號給得很足。

不過這篇最值得看的是那張比較表:Kolibri 輸掉的格子,跟贏的格子一起印在上面。

週末另外兩則:一位 OpenAI 安全人員離職後在外面公開批評公司,OpenAI 回應說需要時會暫停;Claude Code 發了一版修正,自己列出權限規則被繞過的幾種寫法。

一、Aleph Alpha 開源 Kolibri:比較表裡輸掉的那幾格

Kolibri 是英德雙語的 Mixture-of-Experts 模型。官方表格寫的規格是總參數 78.1B、每個 token 啟用 3.46B,384 個專家每次挑 6 個,外加 1 個 shared expert,共 50 層,詞表 128,000。官方對用途的說法是:

「a specialized language model built for sovereign mission-critical work in regulated areas including public administration, industrials and aerospace」

訓練用的是德國與芬蘭的基礎設施,官方也說可以在地端執行,內部資料不必送到第三方的推論服務。預訓練吃了 20T tokens,9 月 11 日完成,知識截止日是 6 月 18 日。它前面還有一個沒公開的前代 Kolibri Origin(30.6B 總參數、3.27B 啟用),6 月 11 日完成預訓練,官方把這條從 Origin 走到 Kolibri 的流程叫「Model Factory」。

發表文裡有一句我很少在模型發表看到:

「Over 21 days of pre-training of Kolibri, we hit 38 unplanned interruptions, roughly one per 10,000 GPU-hours」

21 天,38 次非預期中斷。大模型訓練不會一路順到底,這句等於直接寫在發表文裡承認。

然後是成績。官方的說法是,在數學、程式、grounding 和長上下文任務上,Kolibri 能對上啟用參數多達它四倍的模型,例如 Nemotron 3 Super。數學確實漂亮,AIME 2025 拿 96.9,同表的 Qwen3.6-35B-A3B 是 84.6、Nemotron 3 Super 91.7、Mistral Small 4 79.8。GPQA diamond 84.3,小贏 Qwen 的 83.4。

往下看就不是全勝了。長上下文的兩項,LongBench Pro 64.5、AA-LCR 68.3,都低於 Qwen 的 70.8 和 69.7。工具呼叫的 BFCL v4 overall 是 61.4 對 Qwen 67.2,τ²-bench telecom 94.7 對 Qwen 99.1,HumanEval+ 92.7 則低於 Nemotron 的 94.7 和 Mistral 的 92.8。

官方那句「對上四倍啟用參數」挑的對手是 Nemotron。Qwen3.6-35B-A3B 如果照命名慣例把 A3B 讀成約 3B 啟用,就跟 Kolibri 同一級,而長上下文那兩項都是它贏。

幻覺相關的 AA-Omniscience Index 也一樣有兩面。分數範圍 −100 到 100、越高越好,Kolibri 是 −32.8,比自家前代 Kolibri Origin 的 −64.0 好上一大截;但 Qwen 是 −15.3、Mistral Small 4 是 −24.0,都比它好,外部對手裡只贏 Nemotron 的 −36.5。

還有一個對不起來的地方。官方文寫它支援最長 1M tokens 的上下文,表格裡的「Longest trained length」卻是 262,144。中間那段是怎麼補上的,我沒查到,所以不把 1M 當成它的能力來看。

我的立場:資料不能出境、必須地端部署的團隊,Kolibri 值得放進候選名單,Apache 2.0 也讓它能直接進內部環境。但「主權」回答的是資料去哪裡,不回答模型答得對不對。開放權重的另一面是,部署之後答錯了,扛責任的是部署的那個團隊,不是 Aleph Alpha。這張表從頭到尾都是 Aleph Alpha 自己整理的比較,我沒看到第三方評測;等有獨立評測跑出接近的數字,我才會把它跟 Qwen 擺在同一層比。

原文來源:Aleph Alpha 官方部落格:Kolibri has landed / Hugging Face:Aleph-Alpha/Kolibri-1

二、OpenAI 一位安全人員離職投書:「The time for trial and error is over」

週末的原始新聞本來就少,真的在週六發生的幾則裡,這則分量最重。

The Atlantic 週六刊出〈I Quit OpenAI Because Its Culture Is Broken〉,作者是 David Robinson。Atlantic 原文我讀不到,以下全部是 Reuters 的轉述,我讀的是 Express Tribune 與 Investing.com 的轉載版本。

Reuters 稱他是 OpenAI 的 safety employee,在公司待了三年半,參與起草 OpenAI 的 preparedness framework,並督導過 12 次前沿模型發布的安全報告。其他媒體給他的職稱各有說法,這裡照 Reuters。

Reuters 引了他這一句:

「As the company sprints from one launch to the next, it is failing to achieve the level of care that I believe is needed.」

他批評的對象是 OpenAI 的 iterative deployment,Reuters 的解釋是先把系統放出去,出了問題再補強防護。他主張先進 AI 該比照核電與航空業的安全做法。依 Reuters 轉述,他也警告 AI 能力進展的速度,已經跑在研究人員對 alignment 的理解前面。

OpenAI 發言人的回應是:

「We’re making sure our models don’t become more capable than we can safely manage and secure, and we pause training or hold back models when we need to slow down.」

試錯本身沒有錯。它成立的前提是每次犯錯都承受得起,而且錯完之後人還在場。核電和航空不能把試錯當成主要的學習方式,因為有些錯一次就回不來。他拿這兩個產業對照,真正在吵的是 AI 現在犯的錯屬於哪一種。

OpenAI 回應說需要時會暫停。什麼時候算需要、由誰判斷,這句話沒有回答,判斷權仍在 OpenAI 自己手上。

一套內部安全流程最糟的失靈方式,是讓最熟它的人覺得只有離職、到外面講,話才會被聽到。Robinson 是不是這樣想,我不知道:手上只有他單方的說法,原文還讀不到。各家轉述他在文中舉的 Hugging Face 事件,連涉及多少個 agent 都有兩個彼此打架的數字,所以這裡一個都不引。

前天那篇寫過 OpenAI 與三名安全研究員分道揚鑣,那是另一件事。Robinson 是另一個人,主動離職,公開具名批評。兩件事隔了多久,各家說法對不上,我不寫。

原文來源:Express Tribune(Reuters 轉載) / Investing.com(Reuters 轉載)

三、Claude Code 2.1.289:權限規則被繞過的幾種寫法

2.1.289 的發布時間是 UTC 十月三日 23:07,換成台北時間是十月四日早上 7:07。昨天那篇寫的是前一版 2.1.288。這版大約 25 條,我只挑跟權限有關的。

「Fixed a Bash deny or ask rule being skipped under sandbox auto-allow when a bare variable assignment came before the command」

「Fixed Read deny rules not applying to files @-mentioned, changed, or selected in the IDE through a symlink」

同一族的還有兩條。一條是指令前面掛了環境變數前綴、而且那個值會被展開時,在沙箱自動放行的情況下,Bash 的 deny 和 ask 規則會漏抓;release 頁上的例子是把 TZ 設成 $HOME,後面接一個遞迴強制刪除的指令。另一條是在 managed 機器上,複合 shell 指令裡巢狀的那一段,deny 或 ask 規則壓不過使用者自裝 mod 的核准。

四條擺在一起看,破口長得很像。release notes 沒講規則引擎怎麼比對,以下是我從這四條描述讀出來的:規則看的是指令寫出來的樣子,實際被執行、被讀取的卻是展開或解析之後的東西。前面多一個變數賦值、檔案多繞一層 symlink、指令多包一層複合結構,規則看到的字串和實際跑的東西就分家了。

另外還有一條跟權限邊界有關:使用者自裝的 plugin 原本能改寫組織管理的 MCP server 登入工具的描述,這版修掉了。

每一條都有前提,managed 機器、沙箱自動放行、IDE 裡的 symlink。release notes 只寫修了什麼,沒寫這些繞法在一般設定下能不能觸發、有沒有被實際利用,也沒有 CVE 或 GHSA 編號。我沒有裝 2.1.289,以上沒有一條自己驗證過。

deny 清單是第一層,不是牆。它擋得住你想得到的寫法,這四種補好了,第五種還在後面。真正要擋住刪檔這類回不來的操作,得靠沙箱和最小權限,讓 agent 就算繞過規則,碰得到的東西也有限。哪天官方說明規則是在 shell 展開之後才比對,我才會把 deny 清單的份量往上調。

順帶一條小的:VSCode 版撤回了 2.1.288 對 claude auth status 的一個改動,原因寫的是它可能讓登出變得更頻繁。上一版改的,這一版就收回。

原文來源:Claude Code v2.1.289 release notes


Robinson 說試錯的時代該結束了。2.1.289 這份清單偏偏就是試錯的產物:規則先上線,有人找到繞法,下一版補上,再等下一個繞法。我希望它繼續這樣做。

能接受的試錯要滿足兩件事:錯了的代價有上限,改了什麼外人看得到。Claude Code 的規則漏洞有觸發條件、有修正紀錄,背後還能疊沙箱,兩件都勉強過關。Kolibri 把輸掉的格子印出來,算過了一半,另一半要等別人重跑那張表。OpenAI 那句需要時會暫停的回應,兩件都還看不到。

哪天 OpenAI 真的暫停了一次訓練,外面的人會從哪裡知道?