📰 重點摘要

人工智慧領域近期動態顯示,Google DeepMind推出Gemini 3.8系列的兩款新模型:Gemini 3.8 Flash與Gemini 3.8 Flash Cyber。這是繼三週前發布3.7 Flash後,六週內推出的第三款Flash模型,顯示產品迭代速度明顯加快。Gemini 3.8 Flash定位為推理與程式撰寫能力最強的主力模型,在軟體工程、自主代理任務及專業領域的多步驟推理上,相較3.7 Flash有顯著提升,定價維持與3.7 Flash相同的優惠價,輸入token每百萬次收費0.75美元,輸出token每百萬次收費3.75美元。在DeepSWE v1.1(長週期軟體工程)基準測試中,3.8 Flash在自主解決複雜工程問題的表現上超越多數規模更大的前沿模型,且成本僅為其一小部分。此外,該模型在金融領域的Vals Finance Agent V2與法律領域的Harvey’s Legal Agent Benchmark測試中,表現優於3.7 Flash及其他前沿模型,並在HLE-Verified測試中取得54.9%的成績,展現橫跨STEM、人文與專業領域的多步驟推理能力。這些進步主要來自模型在複雜任務上展現更高的「勤奮度」,會執行額外推理步驟並反覆呼叫工具,因此在高強度設定下可能消耗更多token;開發者可依需求調整運算強度,或繼續使用3.7 Flash以維持效率優先的工作負載。另一款Gemini 3.8 Flash Cyber則是專攻資安領域的模型,在漏洞偵測與自動修補上具備前沿級表現,目前僅透過新設立的Fairwind Program提供給受信任的防禦方使用,詳細內容請見原文連結。


💬 JudyAI Lab 觀點

Gemini 3.8系列的推出節奏值得留意——距上一款Flash模型發布僅三週,六週內已是第三款,產品迭代速度明顯加快,反映AI模型競賽已進入近乎每月一輪的更新週期。

對AI builder而言,更值得關注的是效能與成本的脫鉤趨勢。3.8 Flash在DeepSWE v1.1測試中,自主解決複雜工程問題的表現超越多數規模更大的前沿模型,成本卻只是一小部分,定價也維持與3.7 Flash相同的優惠水準。這代表「更強」不再等於「更貴」,中小型模型正透過反覆呼叫工具、增加推理步驟的方式逼近甚至超越大型模型的表現。同時官方也坦言,這種「勤奮度」提升在高強度設定下會消耗更多token,效能與成本仍是需要權衡的變數,而非單向的免費升級。

對讀者的建議:若正在評估模型選型,不妨拿自己的實際任務跑一次3.7與3.8 Flash的成本效益對比,而非只看基準測試分數。


📅 原文資訊


🔗 延伸閱讀