BenchMIRT基準測試究竟測出LLM哪些真實能力

AI 新聞快訊:BenchMIRT是一套用來拆解「LLM基準測試(benchmark)到底在測什麼」的新方法,針對個別題目層級進行審計。傳統基準測試通常宣稱在衡量單一能力(例如安全性、通用推理或指令遵循),但實際上個別題目往往同時牽涉多種能力。例如BBQ這個測試模型是否依賴社會刻板印象的基準中,有一題問祖孫倆訂Ub…

2026-09-02 · 1 分鐘 · 36 字 · Judy

連線與運算:Gradio打造AI工作流程實戰教學

AI 新聞快訊:Gradio 新推出 gr.Workflow 功能,直接內建於 Gradio 框架中,讓開發者能把資料處理流程本身變成使用介面。使用者以「型別化節點」構成的圖形來描述每個步驟,Gradio 會自動產生拖放式畫布,每個節點都可獨立執行,中間結果也全程可見。同一份流程圖同時具備 REST API 功能,…

2026-08-25 · 1 分鐘 · 84 字 · Judy

用一站式錄製訓練部署 打通機器人開發全流程

AI 新聞快訊:這則英文新聞是 AWS Strands Agents 團隊與 LeRobot、Hugging Face 合作發表的系列文章,介紹如何用 Storage Buckets 打造機器人資料閉環。我來轉成中文摘要。 這篇文章介紹 AWS 開源的 Strands Robots SDK(Apache 2.0授…

2026-08-13 · 1 分鐘 · 97 字 · Judy

AI家教什麼時候該幫、什麼時候該放手

AI 新聞快訊:TutorMoments是一套新推出的評估框架預覽版,用來測試頂尖大型語言模型(LLM)在擔任家教時,能否拿捏「該出手幫忙」與「該放手讓學生自己思考」這兩者間的分寸,這是教育場景中最難拿捏的取捨之一。 這個評估方法採用「重播」形式,基礎是來自美國真實一對一數學家教課程的逐字稿。有經驗的數學老師會逐…

2026-08-07 · 1 分鐘 · 22 字 · Judy

真實世界語音評測:VoiceEQ用人類標準量化AI語音品質

AI 新聞快訊:語音AI正快速取代文字成為人機互動的主要介面,涵蓋客服、醫療、教育、娛樂與個人助理等場景。過去幾年語音模型進步顯著,詞錯誤率持續下降,延遲已達到接近真人對話的速度,許多既有評測基準也逐漸逼近飽和。但實際使用者仍能感受到語音AI「哪裡怪怪的」——模型在對話過程中可能聽起來像換了個人、漏掉猶豫或不確定的…

2026-07-15 · 1 分鐘 · 39 字 · Judy

Hugging Face 模型正式登陸 Foundry 託管運算平台

AI 新聞快訊:微軟 Foundry 平台日前宣布整合 Hugging Face 模型,可透過 Foundry Managed Compute 部署開源與自訂權重模型。Foundry 定位為企業級 AI Agent 開發與運營平台,支援來自微軟、OpenAI、Anthropic、Meta、Mistral、DeepS…

2026-07-07 · 1 分鐘 · 86 字 · Judy

Hugging Face 與 Cerebras 合作將 Gemma 4 導入即時語音 AI

AI 新聞快訊:Hugging Face 聯合 Cerebras、Google DeepMind 與阿里巴巴,推出一套基於 WebSocket 的全開源即時語音對話管線。整個系統採模組化設計,流程依序為:語音輸入後,先以 Nvidia 的 Parakeet 模型做語音辨識,將音訊轉為文字;接著交由 Cerebras…

2026-07-01 · 1 分鐘 · 75 字 · Judy

ScarfBench:評測 AI Agent 在企業級 Java 框架遷移任務上的基準表現

AI 新聞快訊:IBM Research 推出 ScarfBench(自包含應用重構基準),專門評估 AI 代理在企業級 Java 框架遷移任務上的真實能力。現有軟體工程基準多聚焦在除錯與程式碼生成,而框架遷移的難度截然不同——不只是翻譯語法,還必須保留執行行為、調整建置系統、處理執行期依賴關係,任何一環出錯都可能…

2026-07-01 · 1 分鐘 · 56 字 · Judy

DiScoFormer:單一 Transformer 同時估算密度與分數,跨分布通用

AI 新聞快訊:機器學習中有一類核心問題:給定一批資料點,如何還原它們背後的分佈?具體而言,需要估計兩個量——密度(density)與分數(score)。密度是直方圖的平滑版本,高峰對應資料聚集處;分數則是對數密度的梯度,指向機率上升最快的方向。擴散式生成模型(如 Stable Diffusion、DALL-E)正…

2026-06-29 · 1 分鐘 · 37 字 · Judy

PP-OCRv6 登陸 Hugging Face:支援50語言、參數規模從150萬到3450萬

AI 新聞快訊:PaddlePaddle 正式推出最新一代通用 OCR 模型 PP-OCRv6,支援文件掃描、截圖、工業標籤、場景文字等多種真實場景的文字偵測與辨識。模型家族分為三個規模層級——tiny、small、medium,參數量從 150 萬到 3,450 萬不等,其中 medium 與 small 兩個層…

2026-06-22 · 1 分鐘 · 115 字 · Judy
訂閱 AI 週報,每週精選新知:

AI 工程、交易系統、自動化實戰 — 一週一封,不灌水。