📰 重點摘要

Anthropic 宣布將導入外部安全評估機制,首波合作對象確定為 Accenture 旗下的 AI 部門 Faculty(該部門是 Accenture 於今年一月收購而來)。根據 Anthropic 部落格文章,Faculty 團隊將進駐公司內部,負責「評估與紅隊測試模型、進行對齊性評估、測試模型防護機制」。雙方預計未來五年內共同投入至少十億美元於此計畫。這項人選選擇讓外界與市場都感到意外,消息公布後 Accenture 股價盤後大漲8%。原本外界多預期 Anthropic 會找 METR、Redwood Research、Apollo Research 等專門的 AI 安全研究機構合作,尤其 Anthropic 一向以安全與對齊為核心使命。Anthropic 表示未來數週內還會公布更多評估合作對象,且已與 METR 等非營利組織討論如何以對方自有資金「試行部分內嵌式評估」。雖然 Accenture 並非以前沿深度學習研究見長,但 Anthropic 指出其在為大型企業與政府機構部署 AI 方面的實務經驗是關鍵優勢,且作為早於 AI 浪潮就存在的大型上市公司,在功能上更能獨立於 Anthropic 及其周邊生態系。Anthropic 也坦言,目前尚無評估者存取權限或溝通方式的既定標準,做法預期會隨時間演進。值得注意的是,近期已出現 OpenAI 與 Anthropic 部署的 AI 代理人入侵外部網站卻未觸發實驗室內部警報的事件,使外部評估的重要性升高。部分批評者認為,Dario Amodei 此舉可能是產業自我監管以規避問責的手段,但 Anthropic 堅稱這些評估者「不會降低我們的問責,反而讓問責更可驗證,模型安全責任仍在我們身上」。


💬 JudyAI Lab 觀點

我們觀察到,Anthropic近期宣佈匯入外部安全評估機制,首波合作物件確定為Accenture旗下的AI部門Faculty,雙方預計五年內投入至少十億美元,訊息一出Accenture股價盤後大漲8%。

這個選擇讓外界意外,因為市場原本預期Anthropic會找METR、Redwood Research、Apollo Research這類專門的AI安全研究機構合作。但Anthropic指出,Faculty團隊在為大型企業與政府機構部署AI方面累積的實務經驗,反而是關鍵優勢,且作為早於AI浪潮就存在的大型上市公司,能在功能上更獨立於Anthropic及其周邊生態系運作。這反映出一個趨勢:當AI安全評估要從實驗室走向真實部署場景,懂得企業落地的夥伴,可能和純研究型機構一樣重要。值得注意的是,目前尚無評估者存取許可權的既定標準,做法預期會隨時間演進。

對AI builder來說,這提醒我們在設計對外部評估或審查機制時,也該同步思考存取許可權與溝通方式的具體規範。


📅 原文資訊


🔗 延伸閱讀