📰 重點摘要

Gemini 3.7 Flash 正式推出,距上一代 3.6 Flash 發布僅三週,主打程式開發與代理任務的更強效能。編碼能力方面,在 FrontierCode 1.1 Main 測試得分 43.6%(3.6 Flash 為 34.4%),DeepSWE v1.1 得分 65.3%(前代 49.0%),首次生成程式碼的準確率與可用於生產環境的程式碼比例都有提升,除錯與問題解決能力也明顯進步。網頁開發方面,能用更少的提示產出功能更完整、版面更正常的應用程式,並能根據截圖、圖片或完整設計系統等參考輸入,做出高度貼近原設計的 UI,在 Arena.ai 的 WebDev Arena 上 Elo 分數達 1588,優於 3.6 Flash 的 1538。在金融、法律、生物科學等知識密集領域,3.7 Flash 的推理與準確度同步提升:處理複雜文件的 GDP.pdf 測試得分 34.0%(前代 22.0%),衡量完成真實商業流程能力的 AutomationBench 得分 30.4%(前代 17.0%)。開發體驗上,新模型更能應對卡關情況、必要時主動釐清需求、更精準遵循指令,並在多步驟規劃與工具呼叫上投入更多思考,減少人工介入與重試次數。定價方面,即日起至年底提供優惠價每百萬輸入 token 0.75 美元、輸出 token 3.75 美元,為前代原價的一半。此外,Google AI Pro 與 Ultra 訂閱用戶(涵蓋 160 多國)的個人 AI 代理服務 Gemini Spark,也已同步升級採用 3.7 Flash,強化其在 Google Workspace 應用中的工具使用能力與輸出品質。


💬 JudyAI Lab 觀點

Gemini3.7Flash距離3.6Flash發布僅三週就上線,這種迭代速度本身就是這則新聞的看點——編碼與代理任務的分數同步跳升,顯示Google把「快速迭代」當成正式的產品策略,而不只是實驗室內部節奏。

對AI builder來說,值得留意的是分數提升的位置:FrontierCode與DeepSWE反映首次生成程式碼的可用性提高,AutomationBench則指向完成真實商業流程的能力,這代表模型正從「寫得出程式碼」往「能直接接手一段工作流程」移動。WebDevArena的Elo進步也說明,光靠截圖或設計系統就能還原介面的能力,正在把「畫面到程式碼」這段人力成本壓縮掉。定價腰斬到年底,等於把嘗試這條路徑的成本一起降下來。

如果手上有卡在多步驟工具呼叫或UI還原的專案,這是個用實際案例測試新模型能省下多少人工介入的好時機。


📅 原文資訊


🔗 延伸閱讀