跳到正文
目前篩選:模型
10月7日週三
  1. Hugging Face Blog75

    Nemotron 微調在 IOI 2026 和 IMO 2026 達金牌水平

    研究團隊從 Nemotron 3 出發,結合 SFT、RL 和回饋式推理建立專項系統,在 IOI 2026 得 535.4/600,高於金牌門檻 361.12;在 IMO 2026 得 30/42,高於金牌門檻 29。

    推薦理由:文章並列 IOI 與 IMO 的資料、微調方法及推理流程,呈現專項模型如何配合生成、驗證與修訂環節應對兩類競賽任務。

10月6日週二
  1. Prime Intellect56

    Prime Intellect 發佈 INTELLECT-2,這是首個透過全球分散式強化學習訓練的 32B 參數模型

    Prime Intellect 發佈 INTELLECT-2,稱這是首個透過全球分散式強化學習訓練的 32B 參數推理語言模型。訓練以跨異構運算節點的全非同步 RL 為核心,並配套推出 PRIME-RL、TOPLOC 和 SHARDCAST;模型、程式碼及數據均已開源,技術報告見 primeintellect.ai/intellect-2。

  2. Liquid AI 模型與工程博客69

    Liquid AI 發佈可在裝置端運行的 LFM2.5-2.6B 模型

    Liquid AI 發佈 2.6B 參數的 LFM2.5-2.6B,這款智能體模型可完全在裝置端運行,支援規劃、工具調用及多步任務。基準測試中,它在所有指令遵循基準及幾乎所有工具使用基準領先對照模型,較大型模型則在編碼上佔優。CPU 解碼速度在 M5 Max 達 220 tokens/s、Ryzen AI Max+ 395 達 113 tokens/s,手機上為 30 tokens/s。

10月5日週一
10月2日週五
9月29日週二
  1. Hugging Face Blog65

    NVIDIA Kumo Tabular 為表格預測樹立準確率與效率的新前沿

    NVIDIA 發佈開放式表格基礎模型 Kumo Tabular,用於表格分類與回歸,可根據帶標籤的上下文列,在單次前向傳播中預測新列標籤,無需訓練、調參或特徵工程。

    推薦理由:文章列出四項基準的結果,並以梯度提升樹、AutoGluon 等方法作對照,為表格預測模型的效能評估提供具體比較參照。

9月24日週四
9月1日週二
7月9日週四
  1. OpenAI:部署安全與系統卡61

    OpenAI 發佈 GPT-5.6 系統卡,列出安全評估結果

    OpenAI 發佈 GPT-5.6 系統卡,公開模型訓練資料、部署安全模擬及生物化學能力評估。部署模擬預測 GPT-5.6 Sol 的違規內容總量與 GPT-5.5 大致相若,性相關違規率由 0.05% 升至 0.07%,心理健康相關違規回應率由 0.03% 降至 0.02%。OpenAI 將 GPT-5.6 系列的生物與化學能力列為 High,並判定三款模型均不需按 Critical 能力處理。

6月30日週二
6月5日週五
  1. Hugging Face Blog62

    NVIDIA 發佈 Nemotron 3.5 Content Safety,整合多模態安全判定與自訂政策

    NVIDIA 發佈 Nemotron 3.5 Content Safety,將多模態輸入、多語言覆蓋、自訂企業政策與可審計推理整合至單一 4B 模型。模型基於 Google Gemma 3 4B IT,明確訓練覆蓋 12 種語言,並承接其約 140 種語言的 zero-shot 泛化;可選 THINK mode 會輸出推理軌跡。

    推薦理由:Nemotron 3.5 將多模態判定、自訂政策和可審計推理整合於 4B 模型,並附訓練資料集,提供企業安全審核的部署參考。

5月19日週二
  1. Hugging Face Blog66

    Hugging Face 發佈 Ettin Reranker 系列六款模型,規模涵蓋 17.6M 至 1.00B

    Hugging Face 發佈六款基於 Ettin ModernBERT encoder 的 Sentence Transformers CrossEncoder reranker,參數規模由 17.6M 至 1.00B,並公開訓練數據及完整訓練方案。

    推薦理由:文章以 MTEB(eng, v2) Retrieval、NanoBEIR 及多種硬件吞吐測試比較六種尺寸,呈現 Ettin Reranker 在排序品質與速度間的取捨。

3月31日週二
9月9日週二
9月4日週四
  1. Hugging Face Blog67

    Google 發佈 EmbeddingGemma 多語言嵌入模型

    Google 發佈 EmbeddingGemma,一款支援 100 多種語言、具備 308M parameters 和 2K context window 的多語言嵌入模型。文章示範以 Sentence Transformers、LangChain 等工具接入模型,並在 MIRIAD 醫療檢索測試中將微調版的 NDCG@10 提升至 0.8862,基礎模型為 0.8340。

    推薦理由:文章提供 EmbeddingGemma 接入多個檢索框架的程式示例,並説明查詢與文件提示詞的設定方式,方便將模型納入既有檢索流程。

7月16日週三
  1. Hugging Face Blog68

    Ettin Suite 發佈 17M-1B 參數的配對編碼器與解碼器模型

    Ettin Suite 發佈涵蓋 17M-1B 參數的配對編碼器與解碼器模型,兩者使用相同的 2T tokens 公開數據及訓練配方。編碼器在各項任務及規模上超越 ModernBERT,解碼器則勝過或追平 Llama 3.2 和 SmolLM2。同條件測試中,編碼器在分類和檢索任務較佔優,解碼器在生成任務較佔優;模型涵蓋六種規模,訓練數據公開且可重現。

    推薦理由:Ettin 在相同的數據、模型規模與訓練配方下比較編碼器和解碼器,呈現兩類架構在分類、檢索和生成任務上的不同優勢。

5月21日週三
  1. Hugging Face Blog47

    Falcon-Arabic:阿拉伯語言模型的一項突破

    阿聯酋 Technology Innovation Institute(TII)推出 Falcon-Arabic,這款基於 Falcon 3 架構的 7B 參數模型支援阿拉伯語、英語及其他語言。它在 OALL v2 評測中勝過同規模阿拉伯語 LLM,並超越規模大至 4× 的模型。其上下文窗口為 32,000 tokens,可處理長文件並支援 RAG 等應用。

10月24日週四
7月16日週二
  1. Hugging Face Blog64

    Hugging Face 發佈 135M、360M 和 1.7B 三種 SmolLM 模型及 SmolLM-Corpus

    Hugging Face 發佈 135M、360M 和 1.7B 三種 SmolLM 模型,並公開訓練語料 SmolLM-Corpus。語料包括 28B tokens 的 Cosmopedia v2、4B tokens 的 Python-Edu,以及 220B tokens 的 FineWeb-Edu;三款模型分別以 600B、600B 和 1T tokens 訓練。

    推薦理由:文章梳理 SmolLM 的資料集整理流程、訓練配置與各參數級別的基準結果,並列出三種模型規模及本地運行選項,便於比較小型模型的訓練和部署取捨。

2月28日週三
  1. Hugging Face Blog72

    BigCode 發佈 StarCoder2 模型系列及 The Stack v2 程式碼數據集

    BigCode 發佈 StarCoder2 開放程式碼大語言模型系列,提供 3B、7B 和 15B 三種規模。其中,StarCoder2-15B 使用 The Stack v2 的 4+ trillion tokens 訓練,涵蓋 600+ 程式語言。

    推薦理由:StarCoder2 同步公開模型、The Stack v2 數據集及訓練程式碼,並按倉庫組織訓練資料,呈現程式碼模型與數據建設的完整鏈路。