📰 重點摘要

Vals是一家成立於2024年的新創公司,目標是修正AI業界過時的模型基準測試(benchmarking)系統。公司成立不到兩年已迅速崛起:去年由8VC與Bloomberg Beta領投種子輪,上個月則完成由Andreessen Horowitz領投的4000萬美元A輪融資。

共同創辦人Rayan Krishnan現年25歲,曾在Palantir實習,大學時期於史丹佛就讀期間也曾在微軟與史丹佛人工智慧實驗室工作。他表示,創立Vals的契機來自於觀察到市場上不斷有能力更強的新模型快速推出,但學術界的基準測試系統卻跟不上這種前沿進展的速度。他認為,基準測試的存在意義應該是驗證模型是否真的能做到廠商所宣稱的能力。

Vals與傳統基準測試系統最大的差異在於:許多現行測試題目是公開的,模型廠商可能直接針對這些題目訓練來「作弊」;Vals則不公開具體測試內容。此外,傳統評測多偏向抽象的「智力」測驗(例如讓模型考律師資格考等知識型考試),Vals則改為評估模型在法律、金融、程式編寫等特定產業中,完成複雜實際任務的能力,重點在於檢驗模型產出的成果品質是否能與人類工作者相當。Krishnan也提到,評測不只看正面成效,也要分析模型若「不受控運作」可能帶來的負面影響。原文提及Vals具體評測哪些能力的細節,詳細內容請見原文連結。


💬 JudyAI Lab 觀點

JudyAI Lab今天觀察到一個值得注意的訊號:成立不到兩年的Vals,兩輪募資已累積4000萬美元A輪由Andreessen Horowitz領投,顯示市場對「重新定義AI評測」這件事有強烈需求。

這反映出一個產業轉向:當模型能力進展速度超過學術基準測試的更新速度,「跑分」本身就會失去意義,甚至變成廠商可以針對性訓練來美化的數字。Vals採取的兩個做法值得AI builder參考——不公開具體測試內容以避免針對性訓練,以及把評測重心從抽象知識測驗轉向法律、金融、程式編寫等具體產業任務的實際完成品質。此外,評估「模型失控時的潛在負面影響」這個角度,也提醒我們評測不該只看模型能不能做到,還要看它做錯時代價有多大。這種「以真實任務結果取代標準化考題」的思路,可能會是未來評測方法演進的方向之一。

下次選型時,不妨多問一句:這個模型的分數是在公開題庫上考出來的,還是真的完成過一次沒看過答案的實際任務。


📅 原文資訊


🔗 延伸閱讀