Zuckerberg 與 Priscilla Chan 支持的 Biohub 牽頭推動 $1.8 billion 計劃,研發預測細胞行為的 AI 模型
Biohub 正協調一項總額 $1.8 billion 的計劃,整合數據、實驗室設備與算力,建立可預測細胞行為的 AI 模型,以期加快藥物開發。
Biohub 正協調一項總額 $1.8 billion 的計劃,整合數據、實驗室設備與算力,建立可預測細胞行為的 AI 模型,以期加快藥物開發。
Epoch AI 公佈 InnovationEval 初步結果,評估 AI 能否端到端發現媲美人類研究成果的機器學習創新。Claude Fable 5 和 GPT-5.6 Sol 的 GPU 開支分別約為 $6,700 和 $14,000,仍未接近 on-policy self-distillation 的表現;兩者之中只有 GPT-5.6 Sol 帶來小幅提升。
a16z 投資 Preference Model,該團隊為 AI 研究及 ML 工程任務建設強化學習環境。團隊本週開源 Karotte,這套框架可找出模型弱點、生成針對性任務,並以嘗試攻破環境的智能體進行測試。Karotte 設有終止評分前殘留程序、拒收可能令評分器崩潰的檔案等防護,並經逾 1,000,000 次評估運行及受控紅隊測試。
Sherpa 是一個多輪強化學習框架,透過模擬不同學習偏好的學生類型,訓練 LLM 教師按學生的學習成效調整教學。經 Sherpa 訓練的教師模型,令各類學生的表現平均提升 20.5 個百分點,MathTutorBench 教學評分由 52.5% 升至 79.2%。人類研究中,受訓教師在 79.6% 的配對比較中獲選勝過基礎模型。
Google DeepMind、Meta 與 Isomorphic Labs 將共同向 Biohub 投資 $300 million,支持建立 AI 數據集,讓研究人員以數碼方式提出、預測及回答生物學問題。
大語言模型與數據投毒被武器化以製造共識;所提供正文未交代相關操作方式、案例、依據或其他具體資料。
研究團隊從 Nemotron 3 出發,結合 SFT、RL 和回饋式推理建立專項系統,在 IOI 2026 得 535.4/600,高於金牌門檻 361.12;在 IMO 2026 得 30/42,高於金牌門檻 29。
推薦理由:文章並列 IOI 與 IMO 的資料、微調方法及推理流程,呈現專項模型如何配合生成、驗證與修訂環節應對兩類競賽任務。
Emmerich Newspapers 等美國地方媒體起訴 Microsoft 和 OpenAI,指控兩家公司未經授權使用數萬篇版權文章訓練 AI 模型。原告稱兩家公司已透過相關內容賺取數十億美元,而出版商未分得任何款項;他們亦指控兩家公司繞過付費牆等限制。原告要求損害賠償,並請求法院頒布禁令,刪除模型中的侵權訓練資料。
MarkTechPost 的指南以 CLINC150 銀行意圖資料測試 Laya,在 15 個意圖的零樣本分類中取得 0.878 準確率。使用意圖名稱而非自訂描述,準確率由 0.804 升至 0.878;温度校準將 ECE 由 0.102 降至 0.059,但以驗證資料設定為 5% 錯誤率的拒答門檻,在測試集的錯誤率為 9.2%。
EmbodiedSmith 提出一套模擬框架,透過遞迴自我改進擴展具身數據生成,並整合資產、場景和任務生成。其智能體改進循環讓場景與任務互相引導修訂,並支援移動操作機械人、人形機械人、靈巧手,以及涉及可變形物件和流體的互動。實驗顯示,增加數據多樣性可提升下游策略的泛化能力;框架亦可用於機械人預訓練和評估。
中國多個科研機構合作完成的研究成果於10月6日晚在《細胞》(Cell)網上發表,研究團隊全球首次構建出涵蓋水稻由種子萌發至開花結實全過程的三維時空細胞圖譜。圖譜整合基因組測序、單細胞測序及空間轉錄組測序;團隊亦建成可供全球研究者使用的資料庫與水稻單細胞基礎模型,支援基因查詢、空間表達展示和比較分析。
研究利用先驗數據擬合網絡(PFN)的表示進行表格數據異常偵測,提出無需微調的 ZEN 及微調方法 FOCUS。在 ADBench 基準測試中,ZEN 的平均 AUROC 高於所有基線,FOCUS 則進一步提升表現。這些方法亦可泛化至不同 PFN 模型。
研究提出 300M 參數的 Prior-Fitted Language Model(PFLM),讓模型在凍結權重下從真實文本前綴推斷語言並預測後續內容。它只以合成的非語言先驗樣本預訓練;每條訓練序列均由從分佈中重新抽取的遞迴結構因果模型生成,因此模型未見過任何真實語言的詞,也不會在訓練中兩次遇到同一語言。
Technology Innovation Institute 推出 Falcon-Emirati-7B,這款基於 Falcon-H1-Arabic、專攻阿聯酋阿拉伯語方言的 7B 模型在 Alyah 得分 84.83%。
韓國政府擬推出總規模 4.7 萬億韓元的專項計劃,自 2027 年 3 月起研發前沿 AI 大模型。計劃結合國家股權投資與民間資本,集中算力晶片、數據及人才;待國會於 12 月審議通過 2027 財年預算後,政府將透過競爭性招標遴選牽頭開發主體,中標方最早有望於次年 2 月敲定。這項新計劃獨立於現有本土基礎大模型研發項目;後者仍會推進,並於 2027 年 2 月第三階段評審中選出兩支最終開發團隊。
英國 AI Security Institute 概述開放權重通用 AI 系統的風險管理策略,涵蓋模型內防護、外部防護及程序措施。該機構指出,訓練資料篩選有助降低模型發佈風險,而具備完整模型存取權的審核可更準確評估風險,支援發佈決策。與 EleutherAI 及牛津大學合作的研究發現,從 LLM 訓練資料移除有害資料,抵禦對抗性微調的效果是訓練後加入防護的逾 10x,且未帶來顯著性能代價。
AI Security Institute、Anthropic 與 Alan Turing Institute 的研究發現,少至 250 份文件便可能成功污染所有受測模型的訓練資料。研究以同一後門攻擊測試四種模型,參數量由 600M 至 13B;所需文件數沒有隨模型或資料集規模增加。這與過往認為攻擊者須污染一定比例資料才能成功的假設不同,研究指出投毒攻擊可能比先前認為更可行。
研究顯示,固定基礎模型回答開頭的特定 token 線索,可令其在數學及編碼任務上取得媲美 RL 訓練模型的表現。例如,指定線索令 Olmo-3-7B 在 MATH-500 的 pass@1 準確率由 42% 升至 78%,而 Qwen3-14B 則由 72% 升至 87%。
G42 旗下 Inception、MBZUAI 基礎模型研究所與 Cerebras Systems 推出 Jais 2 阿拉伯語大型語言模型系列,包含 8B 和 70B 型號。
Thinking Machines Lab 推出 Tinker,一個用於微調語言模型的彈性 API,並以託管服務處理分散式訓練。Tinker 支援多種大、小型開放權重模型,包括 Qwen-235B-A22B;開源 Tinker Cookbook 提供可在 Tinker API 上執行的後訓練方法實作。Tinker 目前處於研究者和開發者私人測試階段,初期免費,並將於未來數週引入按用量收費。
Tinker 邀請開發者和研究人員提交社羣項目,並計劃定期在網誌刊出精選成果。徵集涵蓋機器學習研究、微調模型應用、產品原型、數據集及基礎設施;投稿應附研究説明,最好開源程式碼,並展示嚴謹評估和透明結果。
Eugene Yan 以 Semantic IDs 微調 Qwen3-8B,訓練出可根據用戶互動及自然語言指令調整推薦的 LLM 推薦系統混合模型。他以 RQ-VAE 將商品嵌入向量編碼為階層式 Semantic IDs,並建立 4.2 million 組涵蓋 ID 與商品描述互轉、下一項預測等任務的對話訓練例子。
Cohere 分析超過 5.6 million 個涵蓋不同訓練階段的樣本,發現文化多樣性由預訓練進入後訓練時持續收窄。增加語言種類可擴大地理多樣性,但整體文化內容比例會趨於停滯。在 TinyAya base model 微調時加入文化標記後,NormAd、BBQ、GMMLU 分別提升 +8%、+6%、+2.3%,且一般多語能力未受損。
Zyphra 公佈 Zyda,一個包含 1.3T tokens、供語言模型訓練使用的開放數據集。它整合七個開放數據集,經統一的品質過濾及跨數據集去重,並以開放且寬鬆的授權發布。消融研究顯示,Zyda 表現勝過 Dolma、Fineweb、Pile、RefinedWeb 和 SlimPajama 等現有開放數據集。
Zyphra 預覽 ZAYA1,稱其為首個完全以 AMD 硬件、軟件及網絡堆疊端到端訓練的 AI 模型。ZAYA1-base 使用 Zyphra 內部 AMD 專用訓練堆疊,訓練總量為 14T tokens;訓練叢集由 128 個節點組成,搭載 AMD MI300X GPU,實際訓練效能超過 750 PFLOPs。
Zyphra 發佈 ZAYA1-8B,這款 MoE 模型的活躍參數少於 1 billion。該模型在部分數學和編碼基準中勝過規模大得多的開放權重模型;搭配 Markovian RSA 時,HMMT'25 得分為 89.6,並逐輪只傳送最後 4K tokens 以維持固定上下文長度。
Prime Intellect 探討全球分散式訓練方法,説明如何整合各地 GPU 資源訓練 AI 模型。文中介紹 Google DeepMind 的 DiLoCo,利用內外層最佳化,讓各運算島約每 500 次更新才同步梯度,以減少通訊負擔。全球部署仍要應對頻寬有限、硬件規格不一、算力變動及容錯等問題。
Prime Intellect 發佈 INTELLECT-1,並稱這是首個全球協作訓練的 10B 參數語言模型。模型以 1T tokens 訓練 42 天,橫跨 5 個國家和 3 大洲,最多同時使用 112 張 H100 GPU;全球分散式訓練的計算利用率為 83%。
Prime Intellect、USC 與 Nucleic Acid Observatory 合作發佈 METAGENE-1,這是一個為疫情監測設計的 7B 參數宏基因組基礎模型。
Fireworks 以私人預覽形式開放 Kimi K3 的 Multi-LoRA 訓練與服務,並透過 Fireworks Serverless Training 提供。
Fireworks AI 已在其平台提供 Kimi K3 推理與訓練,並推出以 Kimi K3 起步的美國境內 Serverless 端點。Kimi K3 有 2.8T 參數;端點提供美國境內推理及零資料保留,Fireworks 對開放模型預設不記錄或儲存提示詞及生成數據,除非用戶明確選擇加入。
Prime Intellect 啟動 INTELLECT-2,展開 32B 參數模型的全球分散式強化學習訓練,並開放任何人無需許可地貢獻異構算力。訓練以 QwQ-32B 為基礎,採用 DeepSeek-R1 的 GRPO 方法,聚焦可驗證的數學與編碼任務,並以系統提示詞設定思考 token 預算。
Prime Intellect 發佈 INTELLECT-2,稱這是首個透過全球分散式強化學習訓練的 32B 參數推理語言模型。訓練以跨異構運算節點的全非同步 RL 為核心,並配套推出 PRIME-RL、TOPLOC 和 SHARDCAST;模型、程式碼及數據均已開源,技術報告見 primeintellect.ai/intellect-2。
Goodfire Research 提出模型差分放大法,放大模型在後訓練前後的 logits 差異,以協助浮現罕見不良行為。實驗顯示,該方法令湧現失配回覆增加 10 至 300 倍;當資料集含 5% 不良醫療建議時,有害回覆由每 10,000 次抽樣 1 次增至每 30 次 1 次。研究亦把此法用於監察後訓練和偵測後門行為;作者指出,放大後的回覆頻率不代表模型行為的實際發生率。
Fireworks AI 宣佈 Training API 與 Fireworks Lab 正式開放,並讓團隊可接入自訂訓練迴圈。API 由 Fireworks 管理分散式訓練與 rollout 基礎設施,用戶可在 Python 中掌控訓練迴圈、損失或獎勵、資料及環境。
Prime Intellect 發佈開放數據集 SYNTHETIC-2,收錄 400 萬條經驗證的推理軌跡,涵蓋複雜強化學習任務。全球共有 1,253 張 GPU 參與生成;TOPLOC v2 的誤報率為 0.000925%,證明驗證中位成本跨模型平均比重新執行原始推理低 25 倍。
Fireworks AI 的文章梳理企業邁向專門化智能的路徑,從租用封閉式前沿模型、加入開源模型,逐步走到微調自有模型。在 UIPad 測試中,Kimi K3 與 GPT 5.6 Sol 整體同為 87.7 分,但 Kimi K3 執行成本為 $56,GPT 5.6 Sol 為 $115;按題型分流,可把座標題交給 Sol,其餘題目交給 K3。
Prime Intellect 擴大開源環境計劃,推出大型懸賞計劃並承諾投入數十萬美元資助開發者,目標是把開源環境擴展至數千個。過去兩個月,社羣透過懸賞和 RL Residency 匯集 400 多個前沿 RL 環境及評測,80 多個實作已接受審核,RL Residency 則有 500 多名申請者。
Prime Intellect 發佈 106B 參數的 INTELLECT-3 MoE 模型,並開源模型權重、訓練框架、數據集、RL 環境及評測。模型以 GLM-4.5-Air 為基礎,經 SFT 和 RL 訓練,使用 512 張 NVIDIA H200 GPU、分佈於 64 個互連節點,歷時兩個月。
Goodfire 與 Rakuten 合作研究以 SAE probes 偵測 Rakuten 的 AI 智能體用戶訊息中的 PII,Rakuten 已將該方法部署至生產環境。