📰 重點摘要
台積電新研究晶片Baseten週三與Hugging Face、Goodfire AI合作推出開放權重模型的安全基礎建設新標準,並同步成立旗下研究部門Base Labs。此舉正值開放權重模型安全性爭議升溫之際——透過名為「abliteration(消融)」的技術可移除模型內建防護機制,使其變得危險。問題規模不小:目前託管開源模型的Hugging Face平台上,已列出超過6000個經abliteration處理的模型。
Base Labs將負責研發並發布用於訓練與監控開放模型的方法,公司將此定位為開放模型的「標準」,強調安全性應內建於模型訓練與部署流程中,而非事後補強。Baseten在X上表示:「我們相信開放性對AI安全是一項優勢,開放性能提供更高的模型行為透明度,最重要的是能將安全研究轉化為可執行且透明的控制機制,這點優於閉源模型。」
三方尚未公開合作的具體技術細節,但Goodfire在回覆貼文中將目標定調為「安全性必須內建於開放模型中,並由提供服務的一方負責落實」。Goodfire專注於解構AI「黑盒子」、解釋模型決策機制,被視為負責「內建」安全性的最可能人選。
Baseten今年六月完成15億美元D輪融資,估值達130億美元;Goodfire AI同樣資金雄厚,今年稍早由B Capital領投完成1.5億美元B輪融資,用於推進其模型可解釋性平台。Baseten並向更廣泛的開發者生態系發出公開邀請,希望共同貢獻此一框架。
💬 JudyAI Lab 觀點
Baseten與HuggingFace、GoodfireAI聯手成立BaseLabs,要解決開放權重模型的安全缺口——HuggingFace上已有超過6000個經消融處理、防護機制遭拆除的模型在流通。
我們認為這反映一個產業轉向:過去開放權重的風險常被當成「開放性必然的代價」,現在幾家資金雄厚的公司(Baseten估值130億美元,Goodfire完成1.5億美元B輪)要把安全性直接內建進訓練與部署流程,而不是事後補強。Goodfire專注拆解模型的決策機制,Baseten提供部署基礎設施,兩者分工把「安全」變成可執行的技術規格,而不只是口頭承諾。這也說明開放模型生態要走向成熟,單靠社群自律並不足夠,需要有人先把標準做出來。
下次選用開源模型前,可以先查一下它是否曾經過消融處理,把這當成基本安全檢查的一步。
📅 原文資訊
- 發布時間:2026-09-17T17:15
- 來源原文:https://techcrunch.com/2026/09/17/base-labs-launches-an-open-weight-ai-safety-partnership-with-hugging-face-and-goodfire/