跳到正文

#論文/研究

今日 19 條
3月10日週二
3月5日週四
  1. Google Research47

    教導 LLM 以貝葉斯方式推理

    Google Research 透過「貝葉斯教學」訓練 LLM 模仿貝葉斯助理的預測,提升推薦表現並泛化至其他任務。此方法採用監督式微調;在航班推薦測試中,未經特定訓練的 LLM 表現遠遜最優貝葉斯助理,且常在一次互動後便不再進步。

3月4日週三
2月25日週三
2月24日週二
  1. AI as Normal Technology64

    新論文《Towards a Science of AI Agent Reliability》分析 AI 智能體可靠性

    新論文評估 14 個模型,發現近 18 個月模型能力提升明顯,AI 智能體可靠性僅小幅改善。研究把可靠性拆分為一致性、穩健性、可預測性和安全性四個維度,以 12 項指標測試 GAIA 與 TauBench;可預測性是整體最弱的一環。作者建議在準確率之外同步報告可靠性各維度表現,並計劃推出 AI agent reliability index。

2月18日週三
2月16日週一
  1. 上海人工智能實驗室 InternLM:原創項目33

    InternLM/VSR:以像素引導的圖表解析方法

    Visual Self-Refine(VSR)提出像素引導的圖表解析方法,將解析轉為以渲染像素驗證並修正結果的回饋迴圈。流程先預測錨點並渲染圖表,再檢視渲染結果,依據已驗證的像素修正最終解析;專案亦提供資料處理流程和 benchmark 評估腳本。

2月13日週五
2月11日週三
  1. Google Research49

    超越一對一:以 DialogLab 編寫、模擬及測試動態人類與 AI 羣體對話

    Google Research 提出開源原型框架 DialogLab,用於編寫、模擬及測試動態人類與 AI 羣體對話。框架採用「編寫、測試、驗證」流程,並以視覺化介面及驗證儀錶板協助設計與分析對話。14 名參與者的評估顯示,人類控制模式顯著更具投入感,並普遍被認為更有效、寫實。

2月5日週四
2月4日週三
  1. Google Research59

    Google Research 與 Included Health 宣佈將開展全美對話式 AI 虛擬醫療隨機研究

    Google Research 與 Included Health 宣佈,待機構審查委員會(IRB)批准後,將在全美開展前瞻性、經參與者同意的隨機研究,評估對話式 AI 在真實虛擬醫療流程中的表現。研究將把 AI 管理患者互動的能力與限制,和標準臨牀實踐比較,從模擬研究及單中心可行性測試推進至全國規模的真實臨牀評估。

1月28日週三
  1. Google Research58

    Google Research 探討智能體系統的規模化原理及有效條件

    Google Research 團隊對 180 種智能體配置進行受控評估,提出智能體系統的量化規模化原則。在可並行的金融推理任務中,集中式協作較單智能體提升 80.9%;在 PlanCraft 的序列規劃任務中,多智能體方案則令表現下降 39–70%。研究的預測模型根據工具數量及任務可拆解程度,對 87% 未見任務配置正確識別最佳協作策略。

1月24日週六
1月23日週五
  1. Google Research44

    小模型,大成果:Google Research 以分解方法提升意圖提取效果

    Google Research提出分解式流程,令小型多模態 LLM 從網頁及手機互動軌跡提取意圖,表現勝過 CoT 提示和端到端微調。流程先逐屏摘要,再從摘要序列抽取整體意圖;測試涵蓋手機、網頁軌跡及 Gemini、Qwen2 基礎模型。Gemini 1.5 Flash 8B 配合此法,效果可媲美 Gemini 1.5 Pro,展示裝置端意圖理解的應用潛力。

1月21日週三
  1. Hugging Face Blog51

    AssetOpsBench 彌合 AI 智能體基準與工業實務的落差

    AssetOpsBench 是面向工業資產運維的 AI 智能體基準與評估系統,從六項質性維度評估智能體表現。它涵蓋 2.3M 個感測遙測點、4.2K 張工單及 53 種結構化失效模式,並以 881 條執行軌跡分析失敗。社羣測試中,沒有受測模型達到部署準備門檻 85 分;多智能體任務準確率為 47%,低於單智能體的 68%。

1月13日週二
1月10日週六
  1. Berkeley AI Research50

    資訊驅動的成像系統設計:互信息評估與 IDEAL 優化

    Berkeley AI Research 提出一套以互信息直接評估及優化成像系統的框架,並在 NeurIPS 2025 論文中驗證其對四類成像應用的預測能力。方法利用含噪測量與已知噪聲模型估算互信息,測試涵蓋彩色攝影、射電天文、無透鏡成像和顯微鏡。IDEAL 僅優化成像系統的編碼器,不需反向傳播整個解碼器;在色彩濾光片設計中,結果匹配端到端優化,並減少記憶體及計算需求。

12月18日週四
  1. OpenAI News55

    OpenAI 評估鏈式推理的可監測性

    OpenAI 推出一套評估鏈式推理可監測性的框架與評測套件,涵蓋 24 個環境中的 13 項評測。研究結果顯示,監測模型內部推理比只監測輸出有效得多,並為 AI 系統日益強大時的可擴展控制提供一條有前景的路徑。

12月17日週三
12月11日週四
  1. Google Research45

    Urania:洞察 AI 聊天機械人使用情況的差分隱私框架

    Google Research 提出 Urania,以差分隱私分析 AI 聊天機械人對話,提供端到端形式化隱私保證,避免單一對話過度影響摘要。框架透過差分隱私聚類及關鍵詞提取,再讓 LLM 僅根據經私隱保護的關鍵詞生成摘要,不接觸原始對話。與非差分隱私基線比較時,LLM 評估者在一項評測中最多有 70% 的情況偏好 Urania 的摘要。

12月9日週二
12月5日週五
12月4日週四
12月3日週三
11月25日週二
  1. Google DeepMind72

    AlphaFold 助研究人員解析心臟病關鍵蛋白 apoB100 的結構

    密蘇裏大學研究人員結合 AlphaFold 預測與冷凍電子顯微鏡(cryo-EM)影像,解析了構成「壞膽固醇」低密度脂蛋白(LDL)的關鍵蛋白 apoB100 結構。

    推薦理由:這項工作展示了 AlphaFold 的原子級結構預測如何與冷凍電鏡影像互補,協助研究人員解析 apoB100 結構,並為研究 LDL 與 ASCVD 提供結構依據。

11月24日週一
11月22日週六
11月19日週三
  1. OpenAI News32

    GPT-5.1-Codex-Max 系統卡

    這份系統卡列明 GPT-5.1-CodexMax 已實施的全面安全措施,涵蓋模型與產品層面的防護。模型層麪包括針對有害任務及提示詞注入的專門安全訓練;產品層面則包括智能體沙盒及可配置的網絡存取。

11月13日週四
11月6日週四
11月5日週三
10月30日週四
  1. Google Research62

    Google Research 公佈 PPI 系統,以差分私隱分析生成式 AI 使用情況

    Google Research 公佈可證明私隱洞察(PPI)系統,結合 LLM、TEE 與差分私隱分析生成式 AI 工具的真實使用情況,只釋出匿名化聚合結果。

    推薦理由:文章將 LLM 結構化摘要、TEE 內的資料隔離與 user-level 差分私隱聚合串成可外部檢查的流程,並以 Pixel Recorder 説明實際部署方式。

10月27日週一
10月9日週四