📰 重點摘要
Design Arena的共同創辦人Grace Li表示,這家公司在2025年畢業前幾週成立,起初是一群大學朋友試圖讓自家AI遊戲引擎跑起來。模型雖能生成可運作的遊戲,但沒有一款真正好玩,這讓團隊開始思考如何判斷一款遊戲是否有趣。他們認為人類判斷無可取代,於是著手構思如何大規模取得真實的人類回饋,最終發展出Design Arena這套AI評測工具,目前全球已有530萬使用者。許多AI公司正在尋找可規模化的使用者回饋機制,且願意付費取得,Li形容這是許多模型在設計層面難以突破的關鍵瓶頸,團隊在推出約一週後就與一家前沿實驗室(frontier lab)簽下首筆大單。
對一般使用者而言,Design Arena運作方式類似進階版的模型路由器:提供類ChatGPT的提示輸入框,並可從網站、圖片等十多種視覺格式中選擇,輸入需求、格式與風格後,系統會呈現一連串「A vs. B」對比選項,直到使用者將多個輸出結果由優到劣排序完成。真正的商業價值來自企業端,參與其中的模型可將此平台當作即時回饋來源,持續優化生成內容;由於使用者通常不在意背後是哪個模型,只追求最佳輸出,這些排序數據能精準反映真實使用者偏好。Li透露該平台目前年化經常性收入(ARR)已達6000萬美元,鞏固其作為AI產業關鍵人工評測數據來源的地位。
由於使用者須登入才能取得輸出結果,Intelligence(該公司名稱)還能追蹤不同地區與時間下審美偏好的變化,例如Li提到亞洲地區的網頁儀表板設計偏向極繁風格。這類人工評測被視為自動化基準測試的重要補充,後者雖可大規模運作,但容易遭到操弄,如上週Hugging Face遭入侵事件所示。不過人工回饋眾包並非穩賺市場,同類型新創Yupp在a16z crypto的Chris Dixon投資3300萬美元後,上線不到一年即於今年稍早關閉,儘管同樣拿下部分前沿模型客戶並號稱擁有超過130萬使用者,仍未能建立可持續的長期商業模式。
Design Arena本次由Index Ventures領投、獲得790萬美元種子輪融資,Conviction(Sarah Guo與Mike Vernal)、A*、Valkyrie等機構參與投資。詳細內容請見原文連結。
💬 JudyAI Lab 觀點
Design Arena的故事說明,AI業界正在為「模型輸出好不好」找一套可規模化的答案。這家公司靠著十多種格式的A/B對比評測,累積530萬使用者,年化經常性收入已達6000萬美元,反映出前沿實驗室願意付費取得真實人類偏好,而非只靠自動化基準測試。
這對AI builder來說是個值得留意的訊號:自動化基準測試雖然可以大規模運作,但如Hugging Face遭入侵事件所示,容易被操弄,而人工評測正好補上這塊缺口。同時Li提到的地區審美差異(如亞洲網頁設計偏好極繁風格)也顯示,使用者偏好不是單一標準,產品設計需要考慮在地脈絡。不過同類新創Yupp即使拿到3300萬美元投資與130萬使用者,仍不到一年就關閉,說明眾包人工回饋這個賽道本身並不保證能建立可持續的商業模式。
如果正在打造AI產品,不妨想想:除了自動化測試,有沒有辦法低成本收集真實使用者的「A vs. B」偏好回饋。
📅 原文資訊
- 發布時間:2026-08-03T19:28
- 來源原文:https://techcrunch.com/2026/08/03/designarena-creators-raise-7-9-million-to-bring-taste-to-ai-models/