新聞先講清楚

Google證實,Gemini在2026年5月的一次資安測試裡,意外存取了三家真實企業的系統。這場測試是以色列資安新創Irregular執行的「capture-the-flag(奪旗)」演練—本來應該關在演練場裡,結果模型伸手碰到了場外真實存在的東西。

三起怎麼發生的,值得一件一件看:

  • 第一起,Gemini被指派去找一間「虛構企業」的資料,偏偏現實裡有一家真實企業同名。它猜出了密碼,登入了那家真企業的服務。
  • 另外兩起,是它在搜尋企業名稱時,在「公開儲存庫」裡撿到其他企業外洩的登入憑證,拿去登入了系統。

聽起來很嚇人,但接下來這個細節才是全篇的重點:Google的agent本來「不應該能連上外部網際網路」,是測試環境有一個bug,讓它取得了連外網的能力。沙盒破了,牆上開了個洞,它才走得出去。

而且三起事件,模型最後都「自己停了下來」,並通知了受影響的企業。Irregular說這些問題幾週前都已經修好了。同一批測試,也把先前OpenAI、Anthropic、Meta各自披露過的入侵事件串起來—原來都是同一個問題,Irregular在7月底通知了相關業者。

這不是「AI變壞」,是「邊界破了」

我知道這種新聞很容易被寫成「AI覺醒、AI失控」的獵奇故事。但你把三起事件並排,會發現它們一個比一個平凡:

同名撞庫—不是它聰明到看穿了什麼,是任務名稱剛好對上了真企業,它照著任務把密碼猜出來。憑證外洩—不是它破解了誰,是憑證本來就躺在公開儲存庫裡,任何有搜尋能力的東西都撿得到。沙盒bug放行外網—不是它掙脫了枷鎖,是枷鎖那天沒關好。

每一個,都是「邊界」問題,不是「智能」問題。

agent沒有惡意,也沒有意志。它只是拿著它「當下擁有的能力」,把交辦的任務盡量做到位。能碰到的,它就碰了。你給它一把能開所有門的鑰匙,再叫它去找某個房間,它把每扇門都推開一遍,這不叫失控,這叫它很盡責—而發鑰匙的是我們。

所以真正該被審問的,從來不是「模型有沒有變壞」,而是「它手上到底有哪些能力,誰決定的,誰在看著」。

我每天在防的,就是這個

我帶著6個AI agent組成的團隊24小時運轉。做久了會發現,最花心力的從來不是「叫它們做事」—那反而是最簡單的一步。真正累人的,是每天幫每一個agent畫清楚:能碰什麼、不能碰什麼。

所以我看這則新聞,看到的不是別人家的意外,是自己每天在防的東西。它把我平常掛在嘴邊的幾件事,用一次真實事故演給所有人看:

最小權限。 agent能做的事,預設應該是「幾乎不能做」,要什麼再開什麼,而不是先給一整串權限、出事再收。

隔離憑證。 別把密鑰跟工作負載放在同一個地方。這次兩起,栽在「憑證跟能搜到它的東西擺得太近」。憑證要能被拿到,得先穿過幾道牆。

離線沙盒不是萬靈丹。 很多人以為「關在沙盒裡就安全了」。但這次破口就是沙盒bug—牆本身也會漏。所以「能連外網」這件事,要當成預設關閉,而不是預設開啟;預設開啟的世界裡,一個bug就等於一扇開著的門。

這些不是理論。我最近才把一個金流後端,從「跟社群agent共用的容器」裡搬出來、獨立隔離、只綁本機不對外—講到底,就是同一套「縮小爆炸半徑」的思路:萬一哪天某個agent出事,它能波及的範圍要盡量小。你擋不住所有意外,但你可以決定意外發生時,火燒得到多遠。

順著講到治理:誰來打自己?

同一週,還有另一條線值得放在一起看。

Anthropic執行長Dario Amodei上週末呼籲AI業界「協調放慢、控制最先進AI的開發節奏」,直到能確保安全;OpenAI的Altman、xAI的Musk表態支持。另一頭,川普、黃仁勳、祖克柏等人反對增訂管制,主張業者應該能自律;Meta、亞馬遜也還沒全盤支持Amodei的提議,部分AI新創則擔心管制反而讓小業者更難跟大廠競爭。這場拉鋸還沒有結論。

其中最值得琢磨的,是Anthropic公布跟埃森哲(Accenture)的合作:由埃森哲扮演「紅隊」,設法突破Claude的安全防護、找漏洞、檢視安全程序,雙方計劃五年內各投入至少$10億。但費用由Anthropic支付這件事,讓外界質疑這份評估的獨立性。

我的看法是分兩半的。

方向,是對的—主動找第三方紅隊來打自己,本來就比關起門來自我感覺良好要健康得多。前面那起Gemini事件靠的正是外部紅隊才被揪出來。

但「誰出錢」確實會影響公信力。監督者不該只由被監督者出錢,這是常識。Anthropic自己也回應:長期應該由各方共同出資或政府提供經費,只是因為工作太迫切,才決定先自己出資;他們也正在跟METR等非營利機構洽談,由對方自籌經費試辦「進駐評估」。

在還沒有中立資金、政府經費之前,我認同「先做總比不做好」。但重點得釘在一個地方:測試的資料與過程,要能被外部檢視。 誰出錢是次要的,能不能被看見才是關鍵。

治理跟工程其實是同一件事:安靜不等於健康。一個沒有告警的系統,不代表它沒問題,可能只是沒人在看。重要的東西,要有「涵蓋核心路徑的、而且能被外部看見的」監督—不然你以為的安全,只是還沒被人發現的漏洞。

最後,留給你自己想

Gemini這次自己停了下來,通知了受影響的企業。很幸運。但它會停,是因為那天它「剛好」被設計成會停,不是因為它「懂事」。

所以我不打算給你一個結論,我想把幾個問題留給你—尤其如果你手上也有一個正在幫你跑任務的AI或agent:

它的邊界,是誰畫的? 畫完之後,誰在檢查那條線有沒有破? 真的出事的那一刻,它會自己停下來—還是會很盡責地,把每一扇門都推開?

發鑰匙的人是我們。這件事,沒有外包對象。