📰 重點摘要

Piloting the world’s first double-blind AI evaluations

Google DeepMind日前發表全球首個針對專有前沿AI模型的「雙盲評測」機制,目的是解決基準測試污染(benchmark contamination)問題——也就是模型若事先「看過」測試題目,即使拿到高分也失去參考意義。此次合作對象包括新加坡AI安全研究院(Singapore AI Safety Institute)、OpenMined、AVERI與MLCommons,測試對象為Gemini Flash Lite模型,測試環境採用機密基準題庫,並在隱私保護環境中執行。

技術核心是利用Google Cloud機密運算(Confidential Computing)產品組合中的Confidential Space,建立一個加密「盒子」,讓外部評測數據與專有模型權重能同時對彼此保持不可見:評測方看不到Gemini的模型權重,Google也看不到評測方的測試題目。這解決了過去外部評測長期存在的兩難——評測方要嘛必須把測試題目交給模型提供方(承擔題目提前外洩風險),要嘛模型提供方必須交出模型權重(承擔智慧財產外洩風險)。過去雖有零紀錄協議與嚴格合約保障保密性,但這次是首度引入密碼學層級的技術性防護。

Google表示,除了內部測試外,也持續與專業研究實驗室、公民社會組織及各國AI安全研究院等外部夥伴合作,對模型進行壓力測試以找出潛在盲點。詳細技術實作與後續應用細節請見原文連結。


💬 JudyAI Lab 觀點

Google DeepMind近日推出全球首個針對前沿AI模型的「雙盲評測」機制,用意是解決基準測試汙染問題——模型若事先看過考題,拿高分就沒有意義。

這次合作物件包括新加坡AI安全研究院、OpenMined、AVERI與MLCommons,測試Gemini Flash Lite模型時採用Google Cloud的Confidential Computing,建立一個雙向不可見的加密環境:評測方看不到模型權重,Google也看不到題庫內容。過去外部評測要嘛得把題目交給模型方(冒著洩題風險),要嘛模型方得交出權重(冒著IP外洩風險),零紀錄協議只能靠合約保障。這次首度用密碼學層級的技術手段解決了這個兩難,對AI builder而言,是把「信任」從人為承諾轉成可驗證的系統設計,這種思路值得留意——當合作雙方各自有不能公開的資產時,加密沙盒可能比合約條款更可靠。

想了解Confidential Space的實際應用細節,可以追蹤原文連結後續更新。


📅 原文資訊


🔗 延伸閱讀