BenchMIRT基準測試究竟測出LLM哪些真實能力
AI 新聞快訊:BenchMIRT是一套用來拆解「LLM基準測試(benchmark)到底在測什麼」的新方法,針對個別題目層級進行審計。傳統基準測試通常宣稱在衡量單一能力(例如安全性、通用推理或指令遵循),但實際上個別題目往往同時牽涉多種能力。例如BBQ這個測試模型是否依賴社會刻板印象的基準中,有一題問祖孫倆訂Ub…
AI 新聞快訊:BenchMIRT是一套用來拆解「LLM基準測試(benchmark)到底在測什麼」的新方法,針對個別題目層級進行審計。傳統基準測試通常宣稱在衡量單一能力(例如安全性、通用推理或指令遵循),但實際上個別題目往往同時牽涉多種能力。例如BBQ這個測試模型是否依賴社會刻板印象的基準中,有一題問祖孫倆訂Ub…
AI 新聞快訊:Gradio 新推出 gr.Workflow 功能,直接內建於 Gradio 框架中,讓開發者能把資料處理流程本身變成使用介面。使用者以「型別化節點」構成的圖形來描述每個步驟,Gradio 會自動產生拖放式畫布,每個節點都可獨立執行,中間結果也全程可見。同一份流程圖同時具備 REST API 功能,…
AI 新聞快訊:這則英文新聞是 AWS Strands Agents 團隊與 LeRobot、Hugging Face 合作發表的系列文章,介紹如何用 Storage Buckets 打造機器人資料閉環。我來轉成中文摘要。 這篇文章介紹 AWS 開源的 Strands Robots SDK(Apache 2.0授…
AI 新聞快訊:TutorMoments是一套新推出的評估框架預覽版,用來測試頂尖大型語言模型(LLM)在擔任家教時,能否拿捏「該出手幫忙」與「該放手讓學生自己思考」這兩者間的分寸,這是教育場景中最難拿捏的取捨之一。 這個評估方法採用「重播」形式,基礎是來自美國真實一對一數學家教課程的逐字稿。有經驗的數學老師會逐…
AI 新聞快訊:語音AI正快速取代文字成為人機互動的主要介面,涵蓋客服、醫療、教育、娛樂與個人助理等場景。過去幾年語音模型進步顯著,詞錯誤率持續下降,延遲已達到接近真人對話的速度,許多既有評測基準也逐漸逼近飽和。但實際使用者仍能感受到語音AI「哪裡怪怪的」——模型在對話過程中可能聽起來像換了個人、漏掉猶豫或不確定的…
AI 新聞快訊:微軟 Foundry 平台日前宣布整合 Hugging Face 模型,可透過 Foundry Managed Compute 部署開源與自訂權重模型。Foundry 定位為企業級 AI Agent 開發與運營平台,支援來自微軟、OpenAI、Anthropic、Meta、Mistral、DeepS…
AI 新聞快訊:Hugging Face 聯合 Cerebras、Google DeepMind 與阿里巴巴,推出一套基於 WebSocket 的全開源即時語音對話管線。整個系統採模組化設計,流程依序為:語音輸入後,先以 Nvidia 的 Parakeet 模型做語音辨識,將音訊轉為文字;接著交由 Cerebras…
AI 新聞快訊:IBM Research 推出 ScarfBench(自包含應用重構基準),專門評估 AI 代理在企業級 Java 框架遷移任務上的真實能力。現有軟體工程基準多聚焦在除錯與程式碼生成,而框架遷移的難度截然不同——不只是翻譯語法,還必須保留執行行為、調整建置系統、處理執行期依賴關係,任何一環出錯都可能…
AI 新聞快訊:機器學習中有一類核心問題:給定一批資料點,如何還原它們背後的分佈?具體而言,需要估計兩個量——密度(density)與分數(score)。密度是直方圖的平滑版本,高峰對應資料聚集處;分數則是對數密度的梯度,指向機率上升最快的方向。擴散式生成模型(如 Stable Diffusion、DALL-E)正…
AI 新聞快訊:PaddlePaddle 正式推出最新一代通用 OCR 模型 PP-OCRv6,支援文件掃描、截圖、工業標籤、場景文字等多種真實場景的文字偵測與辨識。模型家族分為三個規模層級——tiny、small、medium,參數量從 150 萬到 3,450 萬不等,其中 medium 與 small 兩個層…