📰 重點摘要

阿里巴巴集團週一正式發表號稱旗下目前最強大的AI模型「Qwen3.8 Max」,不過根據基準測試(benchmark)結果顯示,該模型的實際表現並未達到公司先前所宣稱的水準。測試結果指出,這款被阿里巴巴稱為「最強」的新模型,效能落後於多家中國本土及海外競爭對手。報導特別提到,阿里巴巴原先宣稱Qwen3.8 Max的表現「僅次於Fable 5」,但實測結果並不支持這項說法。在定價方面,Qwen3.8 Max的價格明顯低於中國同業月之暗面(Moonshot AI)旗下的Kimi K3模型,顯示阿里巴巴在這波中國AI模型競賽中,可能是以價格作為主要競爭策略,而非單純比拼模型效能。原文摘要並未提供更多關於Qwen3.8 Max具體基準測試分數、參數規模或與Kimi K3詳細定價對比的數字細節,詳細內容請見原文連結。整體而言,這則新聞反映出中國AI大廠在模型發表時的宣傳用語與第三方實測結果之間,出現落差的現象。


💬 JudyAI Lab 觀點

阿里巴巴週一發表號稱旗下最強模型Qwen3.8Max,但基準測試結果顯示,實際表現並未達到官方宣稱的水準,這種「宣傳話術」與「第三方實測」之間的落差,才是這則新聞真正值得關注的地方。

報導提到,阿里巴巴原先宣稱Qwen3.8Max表現僅次於Fable5,但實測結果並不支援這項說法;同時它的定價明顯低於月之暗面Kimi K3。這反映出中國這波AI模型競賽裡,不少廠商發表新品時,行銷語言容易跑在實測資料前面,而在效能難以明顯拉開差距時,價格反而成了更直接的競爭手段。對AI builder來說,這是一個提醒:評估任何新模型,「最強」「僅次於某某」這類官方用語本身不能當作依據。

下次看到類似宣稱時,先找獨立基準測試分數對照,再決定要不要匯入自己的專案。


📅 原文資訊


🔗 延伸閱讀