跳到正文

#論文/研究

今日 1 條
今天10月7日週三
  1. Hugging Face Blog75

    Nemotron 微調在 IOI 2026 和 IMO 2026 達金牌水平

    研究團隊從 Nemotron 3 出發,結合 SFT、RL 和回饋式推理建立專項系統,在 IOI 2026 得 535.4/600,高於金牌門檻 361.12;在 IMO 2026 得 30/42,高於金牌門檻 29。

    推薦理由:文章並列 IOI 與 IMO 的資料、微調方法及推理流程,呈現專項模型如何配合生成、驗證與修訂環節應對兩類競賽任務。

10月6日週二
  1. METR:Blog61

    METR 發佈 Claude Opus 5.5 部署前評估摘要

    METR 的部署前評估認為,Claude Opus 5.5 對 AI 研發的加速作用可能略高於 Fable 5.1,但不太可能完全自動化 AI 研發。評估在 10 個工作日內透過 API 測試五項任務,量化表現較 Fable 5.1 漸進提升,但在長時程任務所需的研究判斷方面仍有弱點。

9月30日週三
9月3日週四
  1. OpenAI:部署安全與系統卡73

    GPT-6 Astra 系統卡公佈安全與能力評估結果

    OpenAI 的 GPT-6 Astra 系統卡公佈模型安全與能力評估,將其生物與化學能力列為 High,並指出尚未達到 Critical。明確要求模型規避監測時,Astra 在 WMDP 的 CoT 監測召回率低於 11%,GPT-5.6 Sol 則接近 100%;在 Monorepo-Bench 中,Astra 的召回率降至零。

6月3日週三
5月20日週三
2月13日週五
2月5日週四
11月24日週一
11月22日週六
6月8日週六
4月23日週二