Nemotron 微調在 IOI 2026 和 IMO 2026 達金牌水平
研究團隊從 Nemotron 3 出發,結合 SFT、RL 和回饋式推理建立專項系統,在 IOI 2026 得 535.4/600,高於金牌門檻 361.12;在 IMO 2026 得 30/42,高於金牌門檻 29。
推薦理由:文章並列 IOI 與 IMO 的資料、微調方法及推理流程,呈現專項模型如何配合生成、驗證與修訂環節應對兩類競賽任務。
研究團隊從 Nemotron 3 出發,結合 SFT、RL 和回饋式推理建立專項系統,在 IOI 2026 得 535.4/600,高於金牌門檻 361.12;在 IMO 2026 得 30/42,高於金牌門檻 29。
推薦理由:文章並列 IOI 與 IMO 的資料、微調方法及推理流程,呈現專項模型如何配合生成、驗證與修訂環節應對兩類競賽任務。
Technology Innovation Institute 推出 Falcon-Emirati-7B,這款基於 Falcon-H1-Arabic、專攻阿聯酋阿拉伯語方言的 7B 模型在 Alyah 得分 84.83%。
G42 旗下 Inception、MBZUAI 基礎模型研究所與 Cerebras Systems 推出 Jais 2 阿拉伯語大型語言模型系列,包含 8B 和 70B 型號。
Zyphra 預覽 ZAYA1,稱其為首個完全以 AMD 硬件、軟件及網絡堆疊端到端訓練的 AI 模型。ZAYA1-base 使用 Zyphra 內部 AMD 專用訓練堆疊,訓練總量為 14T tokens;訓練叢集由 128 個節點組成,搭載 AMD MI300X GPU,實際訓練效能超過 750 PFLOPs。
Zyphra 發佈 ZAYA1-8B,這款 MoE 模型的活躍參數少於 1 billion。該模型在部分數學和編碼基準中勝過規模大得多的開放權重模型;搭配 Markovian RSA 時,HMMT'25 得分為 89.6,並逐輪只傳送最後 4K tokens 以維持固定上下文長度。
Prime Intellect 發佈 INTELLECT-1,並稱這是首個全球協作訓練的 10B 參數語言模型。模型以 1T tokens 訓練 42 天,橫跨 5 個國家和 3 大洲,最多同時使用 112 張 H100 GPU;全球分散式訓練的計算利用率為 83%。
Prime Intellect、USC 與 Nucleic Acid Observatory 合作發佈 METAGENE-1,這是一個為疫情監測設計的 7B 參數宏基因組基礎模型。
Prime Intellect 啟動 INTELLECT-2,展開 32B 參數模型的全球分散式強化學習訓練,並開放任何人無需許可地貢獻異構算力。訓練以 QwQ-32B 為基礎,採用 DeepSeek-R1 的 GRPO 方法,聚焦可驗證的數學與編碼任務,並以系統提示詞設定思考 token 預算。
Prime Intellect 發佈 INTELLECT-2,稱這是首個透過全球分散式強化學習訓練的 32B 參數推理語言模型。訓練以跨異構運算節點的全非同步 RL 為核心,並配套推出 PRIME-RL、TOPLOC 和 SHARDCAST;模型、程式碼及數據均已開源,技術報告見 primeintellect.ai/intellect-2。
Prime Intellect 發佈 106B 參數的 INTELLECT-3 MoE 模型,並開源模型權重、訓練框架、數據集、RL 環境及評測。模型以 GLM-4.5-Air 為基礎,經 SFT 和 RL 訓練,使用 512 張 NVIDIA H200 GPU、分佈於 64 個互連節點,歷時兩個月。
Liquid AI 發佈 2.6B 參數的 LFM2.5-2.6B,這款智能體模型可完全在裝置端運行,支援規劃、工具調用及多步任務。基準測試中,它在所有指令遵循基準及幾乎所有工具使用基準領先對照模型,較大型模型則在編碼上佔優。CPU 解碼速度在 M5 Max 達 220 tokens/s、Ryzen AI Max+ 395 達 113 tokens/s,手機上為 30 tokens/s。
Aleph Alpha 發佈 Kolibri,這是一款擁有 78 billion 個參數的德英雙語開放權重模型,採用混合專家架構,每個 token 約啟用 3 billion 個參數。
Ai2 開源 AstaBrief 8B,這款模型可把研究問題和檢索到的文獻摘錄生成帶引用報告,並已在 Asta 的 Generate a report 功能中提供 Fast mode。
Ai2 開源 AstaBrief 8B 及其訓練資料,並將這款科學報告生成模型加入 Asta 的 Fast mode。它以 Qwen3-8B 為基礎,根據研究問題和檢索到的文獻摘錄一次生成附引文報告;Asta 全流程中,Fast mode 平均每份報告需時 51.1 秒,較 Thinking mode 的 178.5 秒快約 3.5 倍。
NVIDIA 發佈開放式表格基礎模型 Kumo Tabular,用於表格分類與回歸,可根據帶標籤的上下文列,在單次前向傳播中預測新列標籤,無需訓練、調參或特徵工程。
推薦理由:文章列出四項基準的結果,並以梯度提升樹、AutoGluon 等方法作對照,為表格預測模型的效能評估提供具體比較參照。
Sarvam AI 發佈 Sarvam Vision 2.1,強化表格解析、表單鍵值擷取及 Indic 手寫識別。在 olmOCR-Bench 官方集合中,模型得 87.3 分,為表列最高;在 OmniDocBench v1.6 得 94.97 分,低於 PaddleOCR-VL 1.6 的 96.01 分。
Microsoft Research 公開 GigaPath-Flash 與 GigaTIME-Flash 兩款開放權重病理基礎模型,以降低大規模病理研究的計算成本。
OpenAI 發佈 GPT-5.6 系統卡,公開模型訓練資料、部署安全模擬及生物化學能力評估。部署模擬預測 GPT-5.6 Sol 的違規內容總量與 GPT-5.5 大致相若,性相關違規率由 0.05% 升至 0.07%,心理健康相關違規回應率由 0.03% 降至 0.02%。OpenAI 將 GPT-5.6 系列的生物與化學能力列為 High,並判定三款模型均不需按 Critical 能力處理。
Google Research 發佈 TabFM,這款表格數據基礎模型以上下文學習執行分類與回歸,並可在單次前向傳遞中預測。TabFM 以結構因果模型動態生成的數億個合成資料集訓練,並在 TabArena 的 38 個分類與 13 個回歸資料集上評測。
NVIDIA 發佈 Nemotron 3.5 Content Safety,將多模態輸入、多語言覆蓋、自訂企業政策與可審計推理整合至單一 4B 模型。模型基於 Google Gemma 3 4B IT,明確訓練覆蓋 12 種語言,並承接其約 140 種語言的 zero-shot 泛化;可選 THINK mode 會輸出推理軌跡。
推薦理由:Nemotron 3.5 將多模態判定、自訂政策和可審計推理整合於 4B 模型,並附訓練資料集,提供企業安全審核的部署參考。
Hugging Face 發佈六款基於 Ettin ModernBERT encoder 的 Sentence Transformers CrossEncoder reranker,參數規模由 17.6M 至 1.00B,並公開訓練數據及完整訓練方案。
推薦理由:文章以 MTEB(eng, v2) Retrieval、NanoBEIR 及多種硬件吞吐測試比較六種尺寸,呈現 Ettin Reranker 在排序品質與速度間的取捨。
Granite 4.0 3B Vision 現已推出,是面向企業文件理解的緊湊型視覺語言模型,支援表格抽取、圖表理解及語義鍵值對抽取。模型以 LoRA adapter 形式構建於 Granite 4.0 Micro 之上,可獨立使用或配合 Docling,並以 Apache 2.0 授權在 Hugging Face 提供。
mmBERT 以 ModernBERT 為基礎推出,使用超過 3T tokens 的多語言文本訓練,並在最後階段納入 FineWeb2 的 1,833 種語言。
推薦理由:mmBERT 展示分階段擴充語言、逐步降低遮罩率的訓練設計,並報告在最後 100B tokens 才納入的低資源語言上取得明顯提升。
Google 發佈 EmbeddingGemma,一款支援 100 多種語言、具備 308M parameters 和 2K context window 的多語言嵌入模型。文章示範以 Sentence Transformers、LangChain 等工具接入模型,並在 MIRIAD 醫療檢索測試中將微調版的 NDCG@10 提升至 0.8862,基礎模型為 0.8340。
推薦理由:文章提供 EmbeddingGemma 接入多個檢索框架的程式示例,並説明查詢與文件提示詞的設定方式,方便將模型納入既有檢索流程。
Ettin Suite 發佈涵蓋 17M-1B 參數的配對編碼器與解碼器模型,兩者使用相同的 2T tokens 公開數據及訓練配方。編碼器在各項任務及規模上超越 ModernBERT,解碼器則勝過或追平 Llama 3.2 和 SmolLM2。同條件測試中,編碼器在分類和檢索任務較佔優,解碼器在生成任務較佔優;模型涵蓋六種規模,訓練數據公開且可重現。
推薦理由:Ettin 在相同的數據、模型規模與訓練配方下比較編碼器和解碼器,呈現兩類架構在分類、檢索和生成任務上的不同優勢。
Falcon-LLM Team 發佈 Falcon-H1 開放權重混合架構模型系列,涵蓋六種規模、由 0.5B 至 34B,並提供 base 與 instruction-tuned 版本。
推薦理由:文中對照 Qwen2.5-32B 的短、長上下文吞吐,並説明混合 Attention-SSM 設計,呈現 Falcon-H1 隨序列長度變化的效率取捨。
阿聯酋 Technology Innovation Institute(TII)推出 Falcon-Arabic,這款基於 Falcon 3 架構的 7B 參數模型支援阿拉伯語、英語及其他語言。它在 OALL v2 評測中勝過同規模阿拉伯語 LLM,並超越規模大至 4× 的模型。其上下文窗口為 32,000 tokens,可處理長文件並支援 RAG 等應用。
Cohere For AI 發佈 Aya Expanse 8B 和 32B 開放權重模型,並公開多語言訓練流程的技術細節。
推薦理由:文章拆解多語言訓練中的模型池數據仲裁、離線與線上偏好訓練及模型合併流程,呈現改善多語言表現的具體技術路徑。
Hugging Face 發佈 135M、360M 和 1.7B 三種 SmolLM 模型,並公開訓練語料 SmolLM-Corpus。語料包括 28B tokens 的 Cosmopedia v2、4B tokens 的 Python-Edu,以及 220B tokens 的 FineWeb-Edu;三款模型分別以 600B、600B 和 1T tokens 訓練。
推薦理由:文章梳理 SmolLM 的資料集整理流程、訓練配置與各參數級別的基準結果,並列出三種模型規模及本地運行選項,便於比較小型模型的訓練和部署取捨。
BigCode 發佈 StarCoder2 開放程式碼大語言模型系列,提供 3B、7B 和 15B 三種規模。其中,StarCoder2-15B 使用 The Stack v2 的 4+ trillion tokens 訓練,涵蓋 600+ 程式語言。
推薦理由:StarCoder2 同步公開模型、The Stack v2 數據集及訓練程式碼,並按倉庫組織訓練資料,呈現程式碼模型與數據建設的完整鏈路。