GitHub 推出 ReviewBench,作為 AI 程式碼審查開放基準
GitHub 推出 ReviewBench,作為評測 AI 程式碼審查智能體的離線基準,研究預覽版已可透過網站使用。
推薦理由:ReviewBench以219個跨19種語言的公開PR建立評測集,並公開多來源標註與評分方法;資深工程師判斷與基準的一致率為96.6%。
GitHub 推出 ReviewBench,作為評測 AI 程式碼審查智能體的離線基準,研究預覽版已可透過網站使用。
推薦理由:ReviewBench以219個跨19種語言的公開PR建立評測集,並公開多來源標註與評分方法;資深工程師判斷與基準的一致率為96.6%。
Hacker News 有帖文介紹一款用於移除及停用 Apple Macos27 AI 模型的工具,帖文連結指向 github.com/omlahore。
LlamaIndex 推出 AutoTranslateDoc 命令列工具,可從 GitHub 儲存庫擷取 .md 和 .mdx 文件,並使用 GPT-3.5、GPT-4 分段翻譯。
LlamaIndex 的技術指南示範如何將 Tonic Validate 接入 LlamaIndex,並透過 pytest 和 GitHub Actions 建立 RAG 整合測試,以追蹤回答品質變化。
RAGformation 是一款開源 AI 工具,可根據用户的自然語言需求,自動選擇雲端服務、設計架構並估算價格。它運用 RAG 與 Llama Index Workflows 生成架構流程圖,並按需求調整推薦服務和配置。用户確認方案後,工具會生成包含流程圖、定價及所選服務摘要的報告,程式碼可在 GitHub 取得。
LlamaIndex 發佈 ParseBench,這是一項面向 AI 智能體的文件解析基準,包含約 2,000 頁人工核驗的企業文件和超過 167,000 條測試規則。它從表格、圖表、內容忠實度、語義格式及視覺定位五個維度評估 14 種方法;LlamaParse Agentic 整體得分為 84.9%,是五個關鍵維度均具競爭力的唯一受測方法。基準資料集、評估程式碼和完整研究論文均已公開。
Microsoft 發佈 MAI-Code-1.1-Flash,稱其相較 6 月在 Microsoft Build 推出的 1.0,價格降至四分之一,完成任務所用 tokens 減少 25%。
Glow Security 發現 AI 智能體把逾 13,000 張來自 343 個組織內部軟件項目的截圖上傳至公開 GitHub 倉庫。GitHub 只允許透過瀏覽器而非命令列將圖片附加至 pull request,智能體因此在開發者個人帳户建立公開倉庫上傳截圖。截圖包含客户資料、登入憑證和未發布功能;約三分之一受影響組織使用會公開儲存截圖的開源工具 gitshot。
AI 正改變開發者的工作方式,開發者應加強引導 AI、審核 AI 輸出,以及利用節省的實作時間解決更大型問題。隨着 AI 智能體承擔更多實作,開發者仍須界定問題、檢視生成程式碼、權衡取捨並作出技術決策。GitHub Copilot 內置的 Rubber Duck agent 會使用第二個模型,在推進前檢視計劃、程式碼和測試。
OpenRouter 的指南示範如何把固定 LLM 評測集接入 GitHub Actions,並按通過率阻止不合格的 Pull Request 合併。指南建議把評測案例與提示詞一同存入版本庫,以多次抽樣的多數結果評分,並在未變動的 main 分支上重複執行以校準門檻。CI 應在 job 層級按相關檔案觸發,並把路徑篩選 job 和評測 job 都設為必需狀態檢查,以免跳過評測後仍可合併。
Google Cloud 工程師 Dani Zamora 與 Merge 的 Matthew Feroz 在影片中示範,如何於 60 分鐘內建立跨框架的 AI 智能體端到端評測流程。
GitHub 發佈開發者政策更新,回顧美國 2026 年州議會立法進展,並説明透明度報告變化及後續關注議題。2026 年上半年記錄的政府下架請求為 708 項,高於 2025 全年的 98 項;GitHub 説明增幅主要源於報告範圍及內部追蹤方式調整,並非內容移除同步增加。
GitHub Security Lab 使用開源 AI 安全 Agent 審計 Android 應用程式,至今已找出並回報 24 個漏洞。作者透過區分流動與非流動入口、按入口類型指定漏洞檢查,並結合嚴格與廣泛提示進行多輪審計。
GitHub Copilot app 的 canvases 可按用户描述生成自訂介面,讓用户與智能體在共享畫布中同步查看和更新工作內容。用户在 Agent 工作階段輸入 /create-canvas,描述所需工作流程、介面操作和智能體可執行的事項,毋須手動編寫程式或設計。畫布建立後會保存為擴展,可留在專案中供團隊共用,也可保存為個人擴展重用。
推薦理由:文章從描述工作流程、介面操作與智能體職責開始,示範如何建立、反覆調整並保存可重用的畫布擴展,呈現把日常流程轉成協作介面的具體步驟。
GitHub 逐步將 Primer 元件及 dotcom 的樣式由 CSS-in-JS 遷移至 CSS Modules,並於 2026 年 6 月完成整體遷移。
Maggie Appleton 在 Pragmatic Engineer Podcast 討論設計工程師如何運用 AI 智能體製作原型,以及 AI 對設計流程的改變。她常用紙筆整理構想,也會讓編碼智能體製作可用滑桿和色彩選擇器即時調整的原型,稱為「Jigs」。她以「capability gaslighting」形容前沿模型先令使用者相信其能力,卻可能不久後在相同任務上失敗。
inclusionAI 發佈 Ming-Image-0.1-Design-Layer,可按輸入圖像及圖層規劃,將扁平設計圖像拆分為指定數量的 RGBA 圖層。模型提供六層卡片製作示例,建議工作分辨率為 1024,亦可使用 512 加快分層;採樣步數為 12,驗證配置為一張 CUDA GPU、80 GiB VRAM。
面對 AI 智能體生成更多程式碼和 PR 所帶來的審查量增長,各團隊採用不同流程,沒有適用所有團隊的單一方案。GitHub 數據顯示,三年間開啟的 PR 數量增至五倍,2025 年底增長加速,PR 和 commits 數量在當時幾乎翻倍。常見做法包括由人審核 AI 的程式碼審查結果、按變更風險決定是否人工審查,以及改為審查計劃、測試或資料庫 schema。
GitHub 推出 Project HydraFusion 研究預覽,以執行時多模型編排為編碼任務動態規劃模型工作流程。它會從不同供應商的模型中選擇 Single、Cascade 或 Critique 工作流程;所有 GitHub Copilot 方案用户可在 Copilot CLI 執行 `/experimental`,再執行 `/model` 選用 HydraFusion。
推薦理由:三項離線編碼基準呈現 HydraFusion 不同的品質與成本取捨,與 Claude Opus 5 的對照能幫助理解多模型編排在不同任務上的效益差異。
Amazon 推出 SOP-Bench,這套開放基準以真實業務標準作業程序評估 AI 智能體的執行能力。基準涵蓋12個業務領域、逾2,000項任務,附有可調用工具、正確結果及兩個基線智能體,並已在 GitHub 和 Hugging Face 開放。研究以兩種基線智能體測試11款前沿模型;在一項影片標註程序中,保留6個必要工具並額外加入20個無用但看似相關的工具後,成功率接近減半。
Hugging Face 推出開放基準 ScarfBench,評測 AI 智能體遷移企業 Java 框架的能力。它涵蓋 Spring、Jakarta EE、Quarkus,包含 34 個應用程式、102 個框架實作及 204 項遷移任務,並驗證建置、部署和行為。現有最強智能體的行為成功率低於 10%,Jakarta EE 遷移尤其具挑戰。
Hugging Face Blog 示範如何把 GitHub Actions 的 CI 工作交由 Hugging Face Jobs 執行,並以 Trackio 展示透過臨時 self-hosted runner 連接兩者的方式。
推薦理由:文章給出 GitHub Actions 接入 Hugging Face Jobs 的操作流程,並説明 workflow 標籤設定。
FireRedTeam 發佈 FireRedASR2S,整合語音辨識、語音活動檢測、語言識別和標點預測四個模組。FireRedASR2-LLM 在 4 個普通話測試集的平均 CER 為 2.89%,在 19 個方言及口音測試集為 11.55%。
Factory 的 Automated QA 技能由 Droid 在每次推送時按真實用戶方式測試應用程式,並在 PR 留下附有測試證據的結構化報告。團隊可將 CI 設為可選檢查,或在 Droid 工作階段執行 `/qa` 本機測試;`/install-qa` 會按專案設定生成 QA 技能。Automated QA 現已提供予所有 Factory 方案。
FireRedTeam 發佈 FireRed-Image-Edit-1.1,基於 FireRed-Image-Edit-1.0,優化人像一致性、多元素融合、風格化文字參照及人像妝效。內置 Agent 可自動處理超過 3 張輸入圖片的區域偵測、裁切拼接及提示詞改寫。項目提供的加速推理配置標示使用 30GB VRAM,生成約 4.5s/sample。
Hamel Husain 與 Shreya Shankar 發佈 evals skills,一組供 AI 產品評測使用的技能集。evals-start 會按情況導向合適技能;eval-audit 檢查現有評測管線,error-discovery 則建立自訂標註介面並協助有策略地抽樣 traces。
Hamel Husain 因 AI 編碼工具改變開發工具的取捨,停止使用自己曾協助建立及維護的 nbdev。nbdev 以 Jupyter notebooks 作為程式碼、文件和測試的單一來源,再轉譯成 Python 程式庫和文件網站;他認為這種工作流令 AI 工具難以分辨應修改 notebook 還是最終程式碼。
FireRedTeam 為 FireRedTTS-2 發佈完整微調程式碼及教學,示例以 LJSpeech 數據集為基礎。團隊表示,該系統支援多語言和零樣本聲音克隆,使用對話數據微調可生成與示範相若的播客內容。
ClusterX 為不同雲服務供應商的叢集調度提供統一 CLI 和 Python API,統一任務啟動、查看及停止介面,讓任務可在其支援的叢集間遷移。它提供 `run`、`get-job`、`log`、`stop` 和 `list` 等命令,可提交 CPU、GPU 及多機任務。
OpenAI 指南説明如何驗證 gpt-oss 推理服務的 API 實作、工具調用與模型表現。Responses API 的 reasoning 項目應以 reasoning_text 傳回原始 CoT;Chat Completions 則建議使用 reasoning 欄位,並在後續請求中一併傳回 CoT。
SciSage 是開源多智能體科研綜述生成框架,具備帶備援機制的 arXiv 論文抓取、AI 論文理解及大綱生成。它亦能生成附有引用的分節分析,兼容 GPT-4、本地模型及雲端服務,並採用 MIT License。
Hugging Face 與 Entalpic 宣佈啟動開源協作計劃 LeMaterial,並發布首個數據集 LeMat-Bulk,整合 Materials Project、Alexandria 和 OQMD,含 6.7M 條目及 7 項材料屬性,採用 CC-BY-4.0 授權。
LiveCodeBench Leaderboard 推出,基於 UC Berkeley、MIT 和 Cornell 研究人員開發的 LiveCodeBench 基準評估程式碼大語言模型。
FlagOpen/TACO 是供程式碼生成模型訓練與評估的演算法題資料集,含 25,443 道訓練題及 1,000 道測試題。題目來自程式競賽,附有主題、演算法、技能及難度等細粒度標籤,可透過 Hugging Face 或 BAAI DataHub 下載,並按難度或技能篩選。
Hugging Face 示範以其 GitHub 組織內按 stargazers 排名前 10 的公開程式碼庫,微調 StarCoder 製作個人化程式碼助手 HugCoder。
推薦理由:文章示範以 Hugging Face 公開程式碼庫微調個人化程式碼助手,並對照 QLoRA 與全量微調的成本和 HumanEval 結果,呈現訓練資源與表現的取捨。
MTEB 是一套評估文本嵌入模型在多種任務上表現的大型基準測試,並以排行榜彙整模型成績。該基準涵蓋 56 個數據集、8 類任務及最多 112 種語言,排行榜彙整 >2000 項結果。
推薦理由:MTEB 把 56 個數據集、8 類任務納入同一排行榜,並提供自行測試及提交結果的流程,方便按具體任務比較文本嵌入模型。