📰 重點摘要

Anthropic在8月28日發表新論文《Automated Researchers Can Reliably Mitigate Alignment Failures》,由該公司fellow計畫研究員Chen Yueh-Han主導,展示自動化AI研究系統改善模型對齊表現的早期成果。在10項針對特定失準行為的基準測試中,這套自動化系統(稱為Automated Alignment Researcher,AAR)能在每一項上都取得進步,且不會犧牲模型整體效能。運作方式模仿傳統研究流程:系統先搜尋既有文獻、提出改善方法,再用該方法訓練模型30分鐘,並在多輪迭代中逐步提升基準分數,有效的方法會被保留、無效的則淘汰,使整個流程能快速且大規模運行。論文特別將AAR與人類研究員做比較,指出表現最好的AAR方法平均在6小時內就超越經驗豐富的人類提出的方案,而且人類主導的研究方向並未帶來更強的表現。成本方面差距也很懸殊:AAR每小時API推論成本約4美元,相較之下公司支付人類研究員的時薪高達150美元。不過論文也坦承限制,這套方法的有效性完全取決於基準測試是否真實反映對齊目標,而建立與維護這些基準、以及持續擴充供自動化系統參考的文獻庫,仍需要大量人力投入。這項研究被視為邁向「遞迴式自我改進」的一步,若模型真能改善自身的對齊訓練,未來訓練方法的疊代或將不再需要人類研究員主導。


💬 JudyAI Lab 觀點

Anthropic在8月28日發表的新論文顯示,讓AI自動改善自己的對齊訓練,效果不輸經驗豐富的人類研究員,這件事值得所有AI觀察者留意。

論文中的自動化系統AAR在10項對齊基準測試上全數取得進步,且不犧牲模型整體效能。最佳方法平均6小時就超越人類研究員提出的方案,成本更是每小時4美元,對比人類研究員時薪150美元的懸殊差距。這反映出一個趨勢:當基準測試夠明確、參考文獻夠完整時,反覆嘗試、保留有效方法並淘汰無效方法的自動化流程,可以比人類更快找到解方。但論文也坦承,這套方法完全仰賴基準測試是否真實反映目標,基準與文獻庫的建立仍需大量人力,顯示自動化不是取代人力,而是把人力重新分配到更上游的位置。

對AI builder而言,與其急著把流程自動化,不如先問自己:我們現在拿來評估成果的基準,真的可靠嗎?


📅 原文資訊


🔗 延伸閱讀