跳到正文

#論文/研究

今日 3 條
今天10月7日週三
  1. Hugging Face Blog75

    Nemotron 微調在 IOI 2026 和 IMO 2026 達金牌水平

    研究團隊從 Nemotron 3 出發,結合 SFT、RL 和回饋式推理建立專項系統,在 IOI 2026 得 535.4/600,高於金牌門檻 361.12;在 IMO 2026 得 30/42,高於金牌門檻 29。

    推薦理由:文章並列 IOI 與 IMO 的資料、微調方法及推理流程,呈現專項模型如何配合生成、驗證與修訂環節應對兩類競賽任務。

  2. OpenAI News62

    OpenAI 公開內部前沿模型產生的數學成果

    OpenAI 公開由其內部前沿模型產生的一系列數學成果,並在 GitHub 儲存庫提供論文修訂與引用的相關流程,以及多項 Lean 證明形式化。儲存庫亦披露 10 份模型推理摘要、以 ChatGPT Pro 使用量估算的計算量,以及嘗試題目數統計;平均每項成果所用計算量約相當於 ChatGPT Pro 思考 3 小時。

    推薦理由:OpenAI 同時公開 Lean 證明形式化、10 份推理摘要及計算量與嘗試題目統計,讀者可由此查看數學成果以外的部分研究過程資訊。

10月6日週二
10月2日週五
  1. Google Research64

    Google Research 介紹採用 TEE 的新一代聯邦學習系統

    Google Research 公佈採用可信執行環境(TEE)的新一代聯邦學習系統,讓伺服器端的數據匿名化處理可供驗證和審計。設備上傳的訓練數據只會交由符合預先授權存取政策的 TEE 工作負載解密處理,相關政策亦發布於 Rekor 公開透明日誌。Gboard 已採用新系統推出英文及日文下一詞預測模型,模型私隱保障更強、準確度更高,計算時間亦較舊系統大幅縮短。

    推薦理由:文章比較舊式聯邦學習與 TEE 架構在服務端可驗證性上的差異,並交代存取政策公開記錄機制及 Gboard 部署後在私隱、準確度和訓練速度上的變化。

9月25日週五
  1. Google Research51

    Google Research 介紹長篇連貫影片生成研究與四套框架

    Google Research 介紹 Co-Director、CANVAS、A²RD 和 VQQA 四套框架,聚焦長篇影片生成的多鏡頭敍事連貫性。它們分別涵蓋創意編排、視覺分鏡記憶、長時序分段生成及閉環提示詞優化,並以專項基準評估。AI video co-director 在 GenAD-Bench 取得 81.4 的峯值質量分數;各框架在相應測試中改善了敍事連貫性、角色持續性或影片品質。

9月19日週六
9月18日週五
  1. Google Research53

    Google Research 探索以生成式 UI 助教師創建互動式學習內容

    Google Research 分享一項生成式 UI 研究實驗,讓教師按教學目標及課程內容建立自訂、互動且具引導性的教育模擬。該團隊同時釋出逾 30 個英文 STEM 互動學習範例,涵蓋初中及高中物理、化學、生物和數學,全部由 AI 生成並經教師審核;使用 Google Workspace for Education 的學校可報名參加試點。

9月16日週三
9月8日週二
9月4日週五
  1. Google Research70

    Google Research 與合作團隊發佈雄性果蠅大腦及中樞神經系統完整連接組圖譜

    Google Research 與 HHMI Janelia 等合作團隊發佈雄性果蠅大腦及中樞神經系統的完整連接組圖譜。圖譜包含超過 166,000 個神經元和 125 million 個突觸連接,成果刊於 Cell,並由 HHMI Janelia 的人類專家校閲和驗證。研究者可透過開源工具 Neuroglancer 查看、探索和下載圖譜,並與雌性果蠅圖譜比較神經差異及個體變異。

    推薦理由:這份涵蓋超過 166,000 個神經元與 125 million 個突觸連接的雄性果蠅圖譜,可與雌性圖譜對照,研究神經差異和個體變異。

9月2日週三
  1. Hugging Face Blog50

    BenchMIRT:LLM 基準測試實際衡量甚麼?

    AllenAI 推出 BenchMIRT,利用多維項目反應理論(MIRT)逐題分析 LLM 基準測試,分辨安全與一般推理等能力訊號。BenchMIRT 以 100 個 LLM 在 16 個基準、逾 34K 條問題上的評測結果訓練;研究團隊沒有告知各基準預期測量哪些能力,它仍識別出安全和一般推理兩個主要維度,並發現 BBQ 更貼近一般推理。

8月27日週四
8月26日週三
8月21日週五
  1. Hugging Face Blog54

    研究測量語音辨識模型的基準優化現象

    Hugging Face 的研究提出三項測試衡量語音辨識中的基準優化,並評估 11 個常用開源 ASR 模型,發現多個模型會重現與音訊不符的基準文本。研究在所分析的 VoxPopuli 測試片段中標記出 40% 的潛在參考文本錯誤,涉及約 3% 的參考詞;呈現基準優化行為的模型在相關測試中有 18–30% 的情況會重現錯誤參考文本。

8月12日週三
  1. Google Research64

    空書架還是遺失的鑰匙?Google Research 指大語言模型參數化事實性的瓶頸在於回憶

    Google Research 提出 knowledge profiling 框架及 WikiProfile 基準,發現前沿大語言模型的事實性錯誤更多源於已編碼事實難以回憶,而非未能編碼。

    推薦理由:研究以 WikiProfile 分別測量事實編碼、回憶與識別,將模型事實性錯誤區分為知識缺失或提取失敗,提供比單看答題準確率更細的診斷視角。

  2. Google Research68

    Google Research 推進 AMIE 邁向專家級視聽臨牀會診

    Google Research 展示基於 Gemini 和 Project Astra 的 AMIE (Video),在模擬即時視像會診中,核心臨牀能力獲評與基層醫生相當。

    推薦理由:研究以 300 場模擬視像會診比較 AMIE (Video)、文字版 AMIE 與基層醫生,呈現視聽感知和虛擬檢查的表現差異,並交代病人演員研究的適用邊界。

8月1日週六
7月31日週五
7月27日週一
7月23日週四
  1. Google Research59

    SymptomAI:探索以對話式 AI 智能體進行日常症狀評估

    Google Research 以 13,917 名參與者評估 SymptomAI,臨牀專家在逾 50% 個案中偏好其鑑別診斷。主動追問的智能體策略在鑑別診斷準確度上顯著優於 Base 條件;研究亦發現 SymptomAI 的呼吸道感染診斷分類與症狀報告前的 Fitbit 生理訊號變化相符。研究產生的診斷僅供研究分析,不構成確認的臨牀診斷或正式醫療評估。

  2. Google Research57

    Google Research 探索讓量子電腦從錯誤中學習

    Google Research 在 Willow 超導量子處理器上驗證強化學習控制,讓系統依錯誤檢測訊號在運算中持續校準。刻意注入控制參數漂移後,該方法使錯誤更正碼的邏輯穩定性提升 3.5 倍;專家校準後再經 RL 微調,邏輯錯誤率額外降低 20%。涵蓋數百個 qubit 和數萬個控制參數的數值模擬顯示,所需 RL 訓練迭代次數不隨系統規模變化。

7月15日週三
  1. Hugging Face Blog55

    Real World VoiceEQ 推出語音 AI 真人互動品質評測基準

    Real World VoiceEQ 是一套衡量語音 AI 真人互動品質的新基準,評估 40+ 款專有及開源語音模型,涵蓋 15+ 個評測維度和 60+ 項指標。基準以超過 1 million 次人工評分建立,評測範圍包括 ASR、TTS、S2S 和 Speech Understanding。結果顯示,各模型能力各有側重,而傳統基準可能高估模型在真實對話中的表現。

7月9日週四
  1. Google Research57

    SensorFM:邁向穿戴式健康數據的通用智能與介面

    Google Research 提出 SensorFM 大型感測器基礎模型,以來自五百萬名參與者的逾一萬億分鐘未標註穿戴式裝置訊號學習通用生理表徵。凍結模型編碼器後訓練的線性探測,在 35 項健康任務中的 34 項勝過特徵工程監督基線。在 31 份參與者檔案的評估中,加入 SensorFM 預測提升個人健康智能體摘要在五個評分維度的表現;與以真實測量值作依據的摘要評分則沒有統計顯著差異。

7月8日週三
  1. Google Research67

    Google Research 探討協同導航如何紓緩交通擠塞

    Google Research 在 10 座美國城市以 Google Maps 進行導航改道實驗,發現少於 2% 行程收到改道建議,也可提升行車速度並降低燃料消耗。

    推薦理由:研究在 10 座美國城市以全市交叉實驗測試導航改道,呈現少於 2% 行程受影響時,行車速度上升、燃料消耗下降的路網效益。

7月1日週三
6月30日週二
6月27日週六
  1. Google Research61

    Google Research 為凍結權重的 Gemini Nano v3 加入 Multi-Token Prediction,加速 Pixel 端生成

    Google Research 已將 Multi-Token Prediction(MTP)架構部署至 Pixel 9 和 10 系列的 Gemini Nano v3,透過凍結主模型權重加快裝置端文字生成。

    推薦理由:文章對照整合式 MTP head 與獨立草稿模型,説明直接利用主模型狀態如何提升候選 token 準確度,並改善 Pixel 端的速度與記憶體效率。

6月25日週四
  1. Google Research47

    以線性彈性快取優化雲端經濟效益

    Google Research 提出線性彈性快取,將頁面淘汰建模為 ski rental 問題,按即時工作負載動態調整快取容量,以降低快取管理的總擁有成本。在 Spanner 生產環境測試中,記憶體用量減少 15.5%,快取未命中僅增加 5.5%,總擁有成本約降低 5%,實際 I/O 成本影響僅 0.5%。

6月18日週四
6月17日週三
6月16日週二
6月13日週六
6月11日週四
6月8日週一
  1. Google DeepMind66

    Google DeepMind 公佈塞拉利昂 Guided Learning 試驗結果

    Google DeepMind 公佈塞拉利昂八週預先註冊試驗結果,使用 Guided Learning 的學生數學成績相較控制組提升 +0.258 個標準差,約相當於 1.2 至 1.7 年的典型學習進度。

    推薦理由:試驗同時呈現 Guided Learning 的數學成績變化、對話中的概念建構方式及不同起點學生的受益差異,勾勒 AI 輔助教學成效的多個面向。