GitHub 推出 ReviewBench,作為 AI 程式碼審查開放基準
GitHub 推出 ReviewBench,作為評測 AI 程式碼審查智能體的離線基準,研究預覽版已可透過網站使用。
推薦理由:ReviewBench以219個跨19種語言的公開PR建立評測集,並公開多來源標註與評分方法;資深工程師判斷與基準的一致率為96.6%。
GitHub 推出 ReviewBench,作為評測 AI 程式碼審查智能體的離線基準,研究預覽版已可透過網站使用。
推薦理由:ReviewBench以219個跨19種語言的公開PR建立評測集,並公開多來源標註與評分方法;資深工程師判斷與基準的一致率為96.6%。
Microsoft AI 公佈 MAI-DxO 與 Sequential Diagnosis Benchmark(SD Bench)的研究結果,稱 MAI-DxO 在 304 宗近期 NEJM 病例中診斷準確率最高達 85%,超過受測經驗豐富醫生羣組的四倍,並以較低成本得出正確診斷。
Microsoft 宣佈 Physical AI Toolchain 新增機械人推理卸載功能,支援透過 Kubernetes 工具把 AI 工作負載分配至機械人、邊緣 GPU 和雲端。
推薦理由:文章將實機工作負載的效能、電池續航與算力配置放在同一脈絡比較,並介紹以 Kubernetes 分配推理的工具,呈現卸載方案的收益與代價。