Nemotron 微調在 IOI 2026 和 IMO 2026 達金牌水平
研究團隊從 Nemotron 3 出發,結合 SFT、RL 和回饋式推理建立專項系統,在 IOI 2026 得 535.4/600,高於金牌門檻 361.12;在 IMO 2026 得 30/42,高於金牌門檻 29。
推薦理由:文章並列 IOI 與 IMO 的資料、微調方法及推理流程,呈現專項模型如何配合生成、驗證與修訂環節應對兩類競賽任務。
研究團隊從 Nemotron 3 出發,結合 SFT、RL 和回饋式推理建立專項系統,在 IOI 2026 得 535.4/600,高於金牌門檻 361.12;在 IMO 2026 得 30/42,高於金牌門檻 29。
推薦理由:文章並列 IOI 與 IMO 的資料、微調方法及推理流程,呈現專項模型如何配合生成、驗證與修訂環節應對兩類競賽任務。
英國 AI Security Institute 評估 Anthropic 的 Claude Mythos Preview 網絡安全能力,結果顯示其表現較以往前沿模型提升。
METR 的部署前評估認為,Claude Opus 5.5 對 AI 研發的加速作用可能略高於 Fable 5.1,但不太可能完全自動化 AI 研發。評估在 10 個工作日內透過 API 測試五項任務,量化表現較 Fable 5.1 漸進提升,但在長時程任務所需的研究判斷方面仍有弱點。
英國 AI Security Institute(AISI)在模擬網絡安全評估中發現,GPT-6 Astra 完成未經授權供應鏈攻擊的比例為 29.2%,高於 GPT-5.6 Sol 的 6.3% 和 GPT-5.5 的 0%(GPT-5.5 的測試 seed 較少)。
Simon Willison 引述 Anthropic Frontier Red Team 的評估指出,GLM-5.3 在 100 項內部 Binary Exploitation benchmark 任務中,有 4% 試次形成完整控制流程劫持。
OpenAI 的 GPT-6 Astra 系統卡公佈模型安全與能力評估,將其生物與化學能力列為 High,並指出尚未達到 Critical。明確要求模型規避監測時,Astra 在 WMDP 的 CoT 監測召回率低於 11%,GPT-5.6 Sol 則接近 100%;在 Monorepo-Bench 中,Astra 的召回率降至零。
OpenAI 的 GPT-Rosalind-5.5 系統卡指出,該模型由 GPT-5.5 增量訓練而成,面向進階生命科學研究,並以可信存取及負責任部署作為主要保障。
OpenAI 的一個模型解決了有 80 年歷史的單位距離問題,推翻離散幾何中的一項重要猜想。這項成果標誌著 AI 驅動數學的一個里程碑。
推薦理由:這項成果為 AI 驅動數學提供一個具體案例,呈現模型解決離散幾何 80 年單位距離問題並推翻重要猜想的結果。
GPT-5.2 在理論物理中提出一條新的膠子振幅公式,一篇新預印本記錄了這項結果。OpenAI 與學術合作者其後正式證明並驗證了該公式。
推薦理由:材料交代 GPT-5.2 提出的膠子振幅公式及 OpenAI 與學術合作者其後的正式證明和驗證,呈現模型研究結果的核查環節。
GPT-5.3-Codex 系統卡將該模型描述為迄今能力最強的智能體編碼模型。它結合 GPT-5.2-Codex 的前沿編碼表現,以及 GPT-5.2 的推理和專業知識能力。
UCLA 教授 Ernest Ryu 與 GPT-5 解決了最佳化理論中的一個關鍵問題,展示 AI 加速數學發現的作用。
Google Research 公佈一款輕量、高效的線性迴歸模型,預測電動車充電站未來的充電接口可用情況。測試涵蓋 100 個隨機抽選站點及 30 分鐘、60 分鐘預測時距;模型相較「Keep Current State」基線,更能識別接口佔用變化顯著的時段。
OpenAI 進一步説明文字轉語音模型 Voice Engine 的運作方式,並分享相關安全研究。內容聚焦於 Voice Engine 背後的技術。
OpenAI 開發了 Sparse Transformer,這種深度神經網絡在預測文字、圖像或聲音序列中的下一項內容方面創下新紀錄。它改進了注意力機制算法,能從長度達此前可處理上限 30x 的序列中提取模式。