📰 重點摘要

Anthropic宣布即將調降Claude Code的人工把關程度:從8月14日起,自動模式(auto mode)將成為Pro、Max、Team帳戶的預設設定。自動模式最早於3月推出測試版,標榜在速度與掌控之間取得平衡。啟用後,Claude Code不會在每個步驟都跳出提示要求人工核准,而是直接執行動作,除非該動作被判定為「不可逆、具破壞性,或目標指向使用者環境之外」。

Anthropic也公布測試數據:在一項有1,053名付費測試者參與的研究中,自動模式攔截了89%的有害動作,相較之下人工審核只攔截了13.6%。公司解釋,這可能是因為「人工審核容易變成習慣性動作」——使用者在Claude Code中核准了97%的權限請求提示,等於審核形同虛設。

Claude Code負責人Boris Cherny在X上發文表示,他和團隊已經連續數月完全只用自動模式,「已經無法想像再回去用權限提示了」。

此外,Anthropic表示已加入新的安全機制,包括prompt injection(提示注入)偵測篩選,以及可自訂的強制拒絕規則(hard deny rules),用來防止資料外洩等風險。


💬 JudyAI Lab 觀點

這則新聞值得AI builder關注,因為它反映AI工具信任模式的關鍵轉折——Anthropic用真實資料(1,053名付費使用者測試)證明人工審核在實務上已經失能,89% vs 13.6%的攔截率差距說明「有人審」跟「審核真的有效」是兩回事。

當使用者對每個許可權提示都按核准(97%批准率)時,那個提示已經不是安全機制,只是一個讓人分心的儀式動作。這揭露一個更廣的設計思維轉變:與其在每一步插入人工把關點製造「感覺安全」的假象,不如把資源投入自動化判斷本身——讓系統學會辨識什麼是真正的不可逆或破壞性動作,再精準攔截,而不是無差別地把責任丟給容易疲乏、容易養成習慣性放行的人類。這也呼應了Boris Cherny提到「用久了回不去」的體感——當自動化判斷夠準,人工複核反而變成拖慢流程的多餘步驟。

下次設計任何需要「使用者確認」的流程時,不妨想想:這個確認按鈕,使用者真的會認真看,還是隻是反射性點下去?


📅 原文資訊


🔗 延伸閱讀