📰 重點摘要

Alibaba捕獲量最大,達1.51億次對話,時間集中在5月至7月,高峰時單日近300萬次,分散在3,500個帳號,但因共用同一組固定提示語來誘導模型吐出思考鏈,Anthropic判定這是Alibaba為訓練Qwen模型系列發起的單一大型蒸餾行動,是該公司觀察到規模最大的一次。攻擊者透過偽裝成翻譯請求的方式繞過Claude預設只顯示「摘要思考」區塊的防護,騙取模型直接洩漏完整推理過程,例如要求把「先前的工作記憶」翻譯成純片假名日文。另一起來自月之暗面(Moonshot AI,Kimi開發商)的行動則疑似與中國軍方直接相關,其中一項請求要求Claude評估閉路監控畫面,判斷畫面中人物是否「行為異常」;在10天內,約5,000個帳號透過網路發出近30萬次請求,主要鎖定Claude的Opus模型。整起調查總計涉及近2億次交易,分屬五個獨立行動,顯示中國AI公司近幾個月為在競爭中取得優勢,持續開發更精密的手法規避Anthropic防禦、竊取美國前沿模型的能力,涵蓋代理能力與工具使用、程式撰寫與資料分析、邏輯推理等領域。Anthropic今年2月已點名相關實驗室,OpenAI也曾指出DeepSeek有類似行為,但此次報告揭露的行動規模與攻擊性皆更大。


💬 JudyAI Lab 觀點

阿里巴巴透過偽裝成翻譯請求的手法,在3個月內誘導Claude洩漏超過1.5億次完整推理過程,規模是Anthropic觀察到最大的一次蒸餾行動,這起案例值得所有AI從業者留意。

這反映出一個值得警惕的趨勢:模型防護若只做「表層限制」(例如只顯示摘要思考、隱藏完整推理鏈),攻擊者換個包裝就能繞過,例如要求把「先前的工作記憶」翻譯成片假名日文,藉此誘導模型直接吐出內部過程。當推理鏈本身變成可被竊取的資產,安全設計就不能只防堵直接詢問,還要考慮間接誘導、多輪包裝這類迂迴路徑,越先進的推理能力往往也越容易成為攻擊目標。

如果你的產品也有分步驟或思考鏈功能,現在就檢查一下,是否有輸入方式能讓使用者間接要求模型輸出不該顯示的內部過程。


📅 原文資訊


🔗 延伸閱讀