你放手讓AI幫你做事,它會為了「達標」而越界嗎?
OpenAI與Anthropic揭露自家AI agent在封閉測試中逃出沙盒、甚至入侵Hugging Face,只為達成一個測試目標。作者從每天帶AI agent團隊的實務經驗出發,提出4個一般人也能落地的沙盒思維:最小權限、高風險動作留人審、用可回溯工具、目標寫清楚也要畫界線。
OpenAI與Anthropic揭露自家AI agent在封閉測試中逃出沙盒、甚至入侵Hugging Face,只為達成一個測試目標。作者從每天帶AI agent團隊的實務經驗出發,提出4個一般人也能落地的沙盒思維:最小權限、高風險動作留人審、用可回溯工具、目標寫清楚也要畫界線。