Prime Intellect 發佈 SYNTHETIC-2 開放數據集,收錄 400 萬條經驗證的推理軌跡
Prime Intellect 發佈開放數據集 SYNTHETIC-2,收錄 400 萬條經驗證的推理軌跡,涵蓋複雜強化學習任務。全球共有 1,253 張 GPU 參與生成;TOPLOC v2 的誤報率為 0.000925%,證明驗證中位成本跨模型平均比重新執行原始推理低 25 倍。
Prime Intellect 發佈開放數據集 SYNTHETIC-2,收錄 400 萬條經驗證的推理軌跡,涵蓋複雜強化學習任務。全球共有 1,253 張 GPU 參與生成;TOPLOC v2 的誤報率為 0.000925%,證明驗證中位成本跨模型平均比重新執行原始推理低 25 倍。
LlamaIndex 發佈 ParseBench,這是一項面向 AI 智能體的文件解析基準,包含約 2,000 頁人工核驗的企業文件和超過 167,000 條測試規則。它從表格、圖表、內容忠實度、語義格式及視覺定位五個維度評估 14 種方法;LlamaParse Agentic 整體得分為 84.9%,是五個關鍵維度均具競爭力的唯一受測方法。基準資料集、評估程式碼和完整研究論文均已公開。
Voice Arena 與 Hugging Face 為 Open ASR Leaderboard 加入 Monsoon en-IN 和 Monsoon hi-IN 評測集,涵蓋 Indian English 與 Hindi,令 Hindi 成為其多語言分頁首個 Indic language。
推薦理由:這批評測集把説話者背景與可接受的拼寫變體納入 ASR 評估,讓總體 WER 之外的區域差異和 Hindi 正字法誤差更容易被辨識。
Amazon 推出 SOP-Bench,這套開放基準以真實業務標準作業程序評估 AI 智能體的執行能力。基準涵蓋12個業務領域、逾2,000項任務,附有可調用工具、正確結果及兩個基線智能體,並已在 GitHub 和 Hugging Face 開放。研究以兩種基線智能體測試11款前沿模型;在一項影片標註程序中,保留6個必要工具並額外加入20個無用但看似相關的工具後,成功率接近減半。
Hugging Face 的研究提出三項測試衡量語音辨識中的基準優化,並評估 11 個常用開源 ASR 模型,發現多個模型會重現與音訊不符的基準文本。研究在所分析的 VoxPopuli 測試片段中標記出 40% 的潛在參考文本錯誤,涉及約 3% 的參考詞;呈現基準優化行為的模型在相關測試中有 18–30% 的情況會重現錯誤參考文本。
Hugging Face 與 Treble Technologies 推出並開放提交 FFASR Leaderboard,這是針對真實遠場聲學條件的開放、社羣協作 ASR 評測基準。
AssetOpsBench 是面向工業資產運維的 AI 智能體基準與評估系統,從六項質性維度評估智能體表現。它涵蓋 2.3M 個感測遙測點、4.2K 張工單及 53 種結構化失效模式,並以 881 條執行軌跡分析失敗。社羣測試中,沒有受測模型達到部署準備門檻 85 分;多智能體任務準確率為 47%,低於單智能體的 68%。
NVIDIA 發佈 Nemotron-Personas-India,一套依印度人口、地理及文化分佈合成的人物設定數據集,採用 CC BY 4.0 授權。數據集包含 21 million 個人物設定(3M 條記錄、每條 7 個設定),支援英語及以天城文、拉丁字母書寫的印地語,並有 27 個欄位和 7.7 billion tokens。
推薦理由:數據集以印度人口、地域分佈為基礎,涵蓋英語及兩種文字形式的印地語,並採 CC BY 4.0 授權,呈現其作為區域模型訓練素材的語言覆蓋與使用條件。
Hugging Face 推出 Gaia2 智能體基準及 Meta Agents Research Environments(ARE)框架,用於在更複雜、接近真實情境的環境中執行、除錯和評估智能體。
推薦理由:Gaia2 將智能體評測從唯讀檢索擴展至含模糊指令、時間要求和環境故障的互動任務,ARE 記錄執行 traces,便於分析智能體在複雜情境中的失誤。
Hugging Face Blog 介紹開源基準 TimeScope,評估視覺語言模型對 1 分鐘至 8 小時影片的理解能力。基準在長影片中插入約 5–10 秒短片,分別測試局部檢索、資訊綜合和細粒度時間感知。結果顯示模型表現會隨影片變長而下降;Gemini 2.5-Pro 是唯一在超過一小時影片上仍維持良好準確率的模型,而千問(Qwen)2.5-VL 在文字資訊綜合較強、細粒度動態辨識較弱。
Hugging Face 與 Adyen 聯合推出 DABstep,這項基準以450多項數據分析任務評估 AI 智能體的多步推理能力。任務源自 Adyen 的實際工作負載,但資料與商業背景為人工生成;基準涵蓋結構化資料和非結構化文件,並提供資料集、任務、評測、即時排行榜及基線。
Data is Better Together 社羣發佈採 Apache 2.0 授權的文生圖偏好數據集 open-image-preferences-v1,涵蓋多種生成類別、模型系列及提示詞複雜度。
Hugging Face 推出 Open FinLLM Leaderboard,評估金融大語言模型在金融任務上的表現,並以 zero-shot 測試模型在未經微調任務上的泛化能力。
Hugging Face 發佈 Docmatix 文件視覺問答數據集,包含 2.4 million 張圖片及 9.5 million 組問答,規模較先前數據集增加 240X。
BigCodeBench 團隊發布 BigCodeBench 程式碼生成基準,收錄1,140項函式級任務,涵蓋139個程式庫。基準分為 BigCodeBench-Complete 和 BigCodeBench-Instruct;GPT-4o 的 calibrated Pass@1 分別為61.1%和51.1%。團隊開源任務、測試案例、評測框架及排行榜,並提供 PyPI 安裝方式。
Artificial Analysis 推出文生圖模型排行榜與 Image Arena,以超過 45,000 次人類圖像偏好計算模型 ELO 排名。排行榜收錄 Midjourney、DALL·E、Stable Diffusion、Playground 等開源及專有模型,評測為每個模型生成超過 700 張圖像。用户可在 Image Arena 投票,投滿 30 票後查看個人化模型排名。
推薦理由:排行榜以超過 45,000 次人類圖像偏好計算 ELO,並涵蓋開源與專有模型,為比較不同文生圖模型提供同一參照。
Open Medical-LLM Leaderboard 為醫療大語言模型提供標準化評測平台,按多種醫療任務與資料集比較表現。平台以準確率為主要指標,涵蓋 MedQA、MedMCQA、PubMedQA 及 MMLU 的醫學與生物學子集。
LiveCodeBench Leaderboard 推出,基於 UC Berkeley、MIT 和 Cornell 研究人員開發的 LiveCodeBench 基準評估程式碼大語言模型。
Hugging Face 發佈 Cosmopedia,這套合成數據集旨在重現 Phi-1.5 的訓練數據,供大語言模型預訓練使用。
推薦理由:文章拆解 Cosmopedia 從種子資料、提示詞擴展到去污染與訓練的流程,並交代如何藉由受眾和文體變化擴大提示詞規模。
Hugging Face 用 327 個提示詞,比較 GPT-4 與人工評審對 4 款開源指令微調模型回答的偏好評分,結果顯示 GPT-4 評分存在位置偏差。GPT-4 也傾向偏好以 InstructGPT、GPT-4 或 ChatGPT 生成資料訓練的模型;它與人工評分在非編碼任務上的相關性為 0.5,在編碼任務上較低但仍為正值。
推薦理由:研究以偏好比較呈現人工與 GPT-4 評分差異,並拆解位置偏差及任務類型的相關性,提供檢視自動評審可靠度的具體依據。
MTEB 是一套評估文本嵌入模型在多種任務上表現的大型基準測試,並以排行榜彙整模型成績。該基準涵蓋 56 個數據集、8 類任務及最多 112 種語言,排行榜彙整 >2000 項結果。
推薦理由:MTEB 把 56 個數據集、8 類任務納入同一排行榜,並提供自行測試及提交結果的流程,方便按具體任務比較文本嵌入模型。