跳到正文
原文
Hugging Face Blog·· 54 分鐘前精選AI 評分75

Nemotron 微調在 IOI 2026 和 IMO 2026 達金牌水平

One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO

AI 導讀

研究團隊從 Nemotron 3 出發,結合 SFT、RL 和回饋式推理建立專項系統,在 IOI 2026 得 535.4/600,高於金牌門檻 361.12;在 IMO 2026 得 30/42,高於金牌門檻 29。

推薦理由

文章並列 IOI 與 IMO 的資料、微調方法及推理流程,呈現專項模型如何配合生成、驗證與修訂環節應對兩類競賽任務。

正文 · 繁體中文

國際資訊奧林匹克競賽(IOI)和國際數學奧林匹克競賽(IMO)考驗不同技能。IOI 要求參賽者編寫演算法和程式碼,並在嚴格的時間及提交限制下通過隱藏測試。IMO 則要求以自然語言撰寫嚴謹的證明。要在任何一項賽事中取得成功都不容易;兩項都取得成功,則反映出更廣泛的能力。

我們最近的成果顯示,Nemotron 是一個強大而靈活的基礎模型,可用來建構世界級的專用模型。我們的團隊以 Nemotron 3 為起點,運用監督式微調(SFT)、強化學習(RL)和回饋驅動的推理,打造出在 IMO 2026 和 IOI 2026 均達到金牌水平的系統。

fig_ioi_imo_gold_results_headline

賽事 Nemotron 專門化方案 成績
IOI 2026 Nemotron-3-Ultra-CC,經 SFT 訓練並使用 GenCorrect 535.4/600,高於 361.12 分的金牌門檻及人類參賽者最高分 498.27 分
IMO 2026 Nemotron 3 Ultra 通用版、SFT 及 RL 檢查點,搭配生成、驗證及改進系統 30/42,高於官方 29 分的金牌門檻

IOI 的成績來自一次即時前瞻性測試,測試遵循與人類參賽者相同的時間、網絡存取及提交限制。這是一項非官方、無人監督的基準測試,沒有納入 IOI 官方排名。IMO 系統提交的證明則由 IMO 官方評分員評分。

可重用的專門化方法

「易於微調」不應只代表模型檢查點可以接受訓練,而應代表能以清晰、可重用的方法,將能力強大的基礎模型調整至要求嚴苛的領域。

在兩個項目中,這套方法包含四個部分:

  1. 以強大的 Nemotron 基礎模型為起點。
  2. 整理領域專屬題目和高質素推理軌跡。
  3. 運用 SFT 等標準後訓練方法,並在合適時加入 RL。
  4. 配合一個推理循環,生成、評估並改進候選答案。

訓練和推理需要大量資源,但其基本方法並不陌生,而且可以重現。我們不需要為每項挑戰建立新的基礎模型,而是針對任務專門調整 Nemotron。

從一般編程能力到 IOI 金牌

在競賽編程方面,我們整理了 22,000 道題目,並生成合成推理軌跡,用以訓練兩個專用模型。總參數量為 30 billion、啟用參數量為 3 billion 的 Nemotron-3-Nano-CC,接受了 SFT 和 RL 訓練。總參數量為 550 billion、啟用參數量為 55 billion 的 Nemotron-3-Ultra-CC,則接受了 SFT 訓練。

IOI 2025 的成績變化清楚展示了專門化的價值。Nano 在後訓練前得分 130,經 SFT 後升至 280,再經 RL 後升至 291。使用 GenCorrect 後,即我們反覆生成、評估及改進的策略,Nano 得分達 468,超越 438.3 分的金牌門檻。Ultra-CC 使用相同的測試時策略,得分達 502。

fig_main_capability_progression_previous_style

這些實驗亦顯示,不同規模的模型不必採用相同的調整方式。SFT 帶來 Nano 的大部分提升,RL 則帶來幅度較小但穩定的進步。對能力更強的 Ultra 模型而言,只需一個 SFT 訓練週期,在 IOI、ICPC 和 LiveCodeBench Pro 的表現便勝過完成全部後訓練的 Nano 模型。這項發現為 IOI 2026 使用的賽事專用 Ultra-CC 系統提供了指引,該系統在 600 分中取得 535.4 分。

教會 Nemotron 作出證明、核查並修訂

IMO 專案將同一構想應用於奧林匹克數學。以 Nemotron 3 Ultra 為基礎,我們分別透過 SFT 和 RL 訓練出一個專家模型。

SFT 語料庫包含經品質篩選的 414,890 個範例,涵蓋 15,818 道不同的證明題。其用途不止於教授最終答案。數據涵蓋證明生成、修訂、驗證及元驗證,讓模型學會建構論證、找出論證中的缺漏、回應批評意見,並判斷證明是否完整。RL 模型則以 9,597 道從接近模型能力前沿的題目中選出的證明題進行訓練。

在開發實驗中,兩個經後訓練的檢查點均優於正式提供的模型。SFT 檢查點在第一輪搜尋中表現最佳,而 RL 檢查點則取得單一檢查點的最佳整體成績。兩者各有所長,因此最終系統在通用模型之外,也採用了這兩個專家模型。

每道 IMO 題目都由模型生成候選證明、評分、提出批評意見,並修訂最有希望的證明嘗試。另一個高運算量階段則選出最終提交內容。整個系統以自然語言運作,沒有使用形式化證明器、外部工具或互聯網連線。系統得分 30 分(滿分 42 分),六題中有四題取得滿分,並超越官方金牌門檻。

image

微調與測試時運算相輔相成

我們較早前的 IOI 2025 Hugging Face 貼文展示了測試時運算如何令開放權重模型達到金牌水平的表現。新結果補上重要一環:更佳的專門化,能讓推理系統產生更好的候選解答、提供更有用的批評,並作出更完善的修訂。

在 IOI 中,GenCorrect 將微調帶來的收益,進一步轉化為多輪回饋下更大的提升。在 IMO 中,採用互補的 SFT 和 RL 檢查點,比單純從單一檢查點生成更多樣本更有價值。兩者的最佳成果,都來自將能力出眾的專家模型與能夠搜尋、驗證和改進的系統結合。

這個區別很重要。獎牌並非單靠微調產生,也不是單靠暴力式抽樣得來,而是透過共同設計模型、數據與推理迴圈取得。

Hugging Face 上的開放模型、數據及訓練方案

我們希望這些成果能在競賽以外發揮作用。Nemotron Labs IMO 2026 資源合集匯集了 SFT 和 RL 檢查點、兩個訓練數據集,以及 Nemotron-IMO-Bench 這個全新基準測試,當中有 200 道奧林匹克級別題目。IMO 論文介紹了訓練方法及生成、驗證與修訂系統;NeMo-Skills 儲存庫則收錄 IMO 推理流程、提示詞、提交的證明,以及可重現的快速入門指南。至於競技編程,Hugging Face 上提供了 Nemotron-3-Ultra-CC 模型,而 IOI 論文則載有訓練方案及 GenCorrect 方法。IOI 評估和推理流程亦可在 NeMo-Skills 中找到。

IMO 和 IOI 的成果,為一個簡單構想提供了極具挑戰性的驗證:Nemotron 可經微調成為世界級的領域專家模型,再與透明的推理工作流程結合,解決人類競賽前沿的問題。

我們期待看到 Hugging Face 社羣接下來會打造出甚麼。

來源:Hugging Face Blog · huggingface.co