OpenAI 推出 MentalHealthBench 心理健康對話評測基準
OpenAI 推出 MentalHealthBench,這是一項由專家提供意見的評測基準,用於評估 AI 在貼近現實的心理健康對話中能否提供有幫助且安全的回應。
OpenAI 推出 MentalHealthBench,這是一項由專家提供意見的評測基準,用於評估 AI 在貼近現實的心理健康對話中能否提供有幫助且安全的回應。
Parallel 的智能體使用 GPT-6 Astra 研究並綜合勞動市場數據,較先前模型所需時間減半,成本亦減半。
Playco 使用 GPT-6 Astra,從同一個灰盒基礎構建三款主題遊戲原型,手動修正次數較前一模型減少 50%。
Jalapeño 是 OpenAI 自研的 AI 推理晶片,首批結果顯示其推理速度與能效領先業界。它為現代模型提供更快、能效更高的 AI 推理,並帶來更高吞吐量與更低延遲。
OpenAI 的新分析指出,熱門編碼基準 SWE-Bench Pro 存在問題,引發對 AI 模型評測可靠性與準確性的疑慮。
Hugging Face 測試開源模型使用 transformers,CLI 與 Skill 縮短大型模型耗時,卻可能降低小模型成功率。Qwen3-14B 在 classify-sentiment 任務中,clone 環境的匹配率為 100%,Skill 環境則降至 0%。agent-eval CLI 可套用於其他命令列工具,並記錄匹配率、tokens、耗時、錯誤、行為標記及執行軌跡。
推薦理由:評測不只看任務是否成功,也追蹤 tokens、耗時與操作路徑,呈現 CLI 與 Skill 對大小模型的影響並不一致。
OpenAI 推出 LifeSciBench,這是一項由專家撰寫並審核的基準,用於評估 AI 系統處理真實生命科學研究任務及決策的能力。
OpenAI 獲 Gartner 評為 2026 年企業級 AI 編碼智能體魔力象限的領導者。Codex 因創新及企業規模部署獲得認可。
OpenAI 不再評測 SWE-bench Verified,因其日益受到污染,且無法準確衡量前沿編碼進展。分析指出,該基準的測試存在缺陷,並有訓練洩漏;OpenAI 建議採用 SWE-bench Pro。
OpenAI 分享其 AI 模型在 First Proof 數學挑戰中的證明嘗試。這些嘗試用於測試模型處理專家級問題的研究級推理能力。
OpenAI 與 Paradigm 推出 EVMbench,評測 AI 智能體偵測、修補及利用高危智能合約漏洞的能力。
OpenAI 推出 FrontierScience 基準測試,評估 AI 在物理、化學和生物學領域的推理能力,以衡量 AI 邁向真實科學研究的進展。
OpenAI 推出真實場景評估框架,衡量 AI 在濕實驗室加速生物研究的能力。研究使用 GPT-5 優化分子克隆方案,並探討 AI 輔助實驗的潛力與風險。
OpenAI 推出 IndQA,這是一項用於評估 AI 系統在印度語言中表現的新基準測試。IndQA 由領域專家共同構建,涵蓋 12 種語言和 10 個知識領域,測試文化理解與推理能力。
OpenAI 推出 GDPval,這項新評測衡量模型在 44 個職業中具經濟價值的真實世界任務上的表現。
OpenAI 與 Anthropic 分享首個同類聯合安全評估的結果,雙方互相測試對方的模型。評估涵蓋對齊失準、指令遵循、模型幻覺與越獄等,並呈現相關進展、挑戰及跨實驗室合作的價值。
OpenAI 推出 HealthBench,這是一項評估醫療 AI 的新基準,透過貼近現實的情境測試模型。HealthBench 吸納 250+ 名醫生的意見,旨在為醫療領域的模型表現與安全性提供共同標準。
OpenAI 推出 PaperBench,這項 benchmark 用於評估 AI 智能體複現前沿 AI 研究的能力。
OpenAI 推出 SWE-Lancer 基準測試,探問前沿 LLM 能否透過真實世界的自由接案軟件工程工作賺取 $1 million。
這項基準測試比較文字分類、文本嵌入及視覺嵌入的推理配置,估算處理 1B 筆輸入的成本與延遲。在 nvidia-L4($0.8/hr)上,三類任務每 1B 筆輸入的成本分別為 $253.82、$409.44 和 $44,496.51;測試程式碼見 https://github.com/datavistics/encoder-analysis。
推薦理由:三類實測呈現 GPU、batch size 與並行 VUs 對成本和延遲的影響,並提供可替換模型與硬件重跑的流程,供讀者估算自有配置處理 1B 筆輸入的開支。
OpenAI 推出 SimpleQA,這是一項事實性基準測試,用來衡量語言模型回答簡短、以尋求事實答案為目的之問題的能力。
Hugging Face 推出 Open FinLLM Leaderboard,評估金融大語言模型在金融任務上的表現,並以 zero-shot 測試模型在未經微調任務上的泛化能力。
OpenAI 推出 SWE-bench Verified,這是經人工驗證的 SWE-bench 子集,可更可靠地評估 AI 模型解決真實世界軟件問題的能力。
Hugging Face 介紹如何使用 TGI Benchmarking 工具,測量 Text Generation Inference(TGI)在不同 batch size 下的吞吐量與延遲,並據此調整部署設定。
Hugging Face 推出專為希伯來語 LLM 設計的開放排行榜,以語言專屬基準評估模型對希伯來語的理解與生成能力。排行榜涵蓋希伯來語問答、情感準確度、Winograd Schema Challenge 及英希互譯四項任務,採用 few-shot 提示詞;提交模型會透過 HuggingFace Inference Endpoints 部署,並由 lighteval 經 API 評估。
Open Medical-LLM Leaderboard 為醫療大語言模型提供標準化評測平台,按多種醫療任務與資料集比較表現。平台以準確率為主要指標,涵蓋 MedQA、MedMCQA、PubMedQA 及 MMLU 的醫學與生物學子集。
LiveCodeBench Leaderboard 推出,基於 UC Berkeley、MIT 和 Cornell 研究人員開發的 LiveCodeBench 基準評估程式碼大語言模型。
MTEB 是一套評估文本嵌入模型在多種任務上表現的大型基準測試,並以排行榜彙整模型成績。該基準涵蓋 56 個數據集、8 類任務及最多 112 種語言,排行榜彙整 >2000 項結果。
推薦理由:MTEB 把 56 個數據集、8 類任務納入同一排行榜,並提供自行測試及提交結果的流程,方便按具體任務比較文本嵌入模型。
OpenAI 推出 Safety Gym,這套環境與工具用於衡量強化學習智能體在訓練期間遵守安全約束的進展。
OpenAI Five 昨日以三局兩勝制擊敗一隊排名位於第 99.95 百分位的 Dota 玩家。對手是 Blitz、Cap、Fogged、Merlini 和 MoonMeander,其中四人曾職業參與 Dota;比賽有現場觀眾,直播同時有 100,000 名觀眾觀看。
推薦理由:這場三局兩勝賽呈現 OpenAI Five 對陣 99.95 百分位 Dota 玩家時的直接結果,亦交代對手中有四人曾以職業身份參與 Dota。
OpenAI Five Benchmark 對賽現已結束;公告確認比賽完結,但未列出賽果、比分或其他賽事資訊。
OpenAI 已完成 Retro Contest 首輪賽事。競賽探索能從過往經驗中泛化的算法開發,文中未列出具體賽果。
OpenAI 推出遷移學習競賽,衡量強化學習算法能否從過往經驗中泛化。