跳到正文

#論文/研究

今日 3 條
6月5日週五
  1. Google Research65

    Google Research 發表 PHRM 研究,探索智能手機被動監測心率與靜息心率

    Google Research 在 Nature 發表 PHRM 研究系統,透過智能手機前置鏡頭在面部解鎖後擷取 8 秒影片,於日常使用中被動估算心率(HR)及每日靜息心率(RHR)。

    推薦理由:研究結合實驗室測試與八日自由生活驗證,按膚色報告 HR 誤差,並呈現 RHR 估算覆蓋率及穿戴裝置對照,讓讀者掌握日常使用中的證據範圍。

5月20日週三
5月16日週六
  1. Google DeepMind63

    Google DeepMind 的 Co-Scientist 發掘可再利用的抗肝纖維化候選藥物

    Stanford University School of Medicine 的 Gary Peltz 團隊測試 Co-Scientist 提出的 3 種肝纖維化候選藥物,當中 2 種阻止纖維化並促進肝細胞再生。

    推薦理由:研究在同一活體人類肝細胞平台比較 Co-Scientist 與研究者挑選的藥物,呈現系統從少量相關文獻線索中找到候選藥物的案例。

4月30日週四
  1. Google DeepMind60

    Google DeepMind 宣佈 AI co-clinician 醫療研究計劃,探索醫療協作模式

    Google DeepMind 宣佈 AI co-clinician 研究計劃,探索讓 AI 在醫生專業監督下協助患者照護。在 98 個基層醫療問題的評估中,97 個案例錄得零項嚴重錯誤;在開放式藥物問答中,系統表現勝過可用的前沿 AI 系統。

    推薦理由:文章並列呈現 AI co-clinician 在證據整理、藥物問答和多模態問診的測試結果,並以醫生整體表現較佳界定其臨牀輔助定位。

4月20日週一
  1. Berkeley AI Research47

    GRASP:面向更長時域的世界模型梯度式規劃

    GRASP 是一種面向學習型世界模型的梯度式規劃器,透過虛擬狀態並行化時間步最佳化,令長時域規劃更實用。它在狀態迭代中直接加入隨機性以探索,並重塑梯度,讓動作取得清晰訊號,同時避開穿過高維視覺模型的不穩定「狀態輸入」梯度。

4月3日週五
  1. Google Research51

    Google Research 評估大語言模型行為傾向的對齊程度

    Google Research 提出一套評估大語言模型行為傾向與人類偏好對齊程度的框架,並分析 25 個大語言模型。研究將經驗證的心理問卷改編為情境判斷測試,並以 550 名參與者中每題 10 名標註者的偏好分佈作比較。結果顯示,模型在低人類共識情境仍普遍過度自信,部分模型的自我陳述亦與其在情境中的行為傾向不一致。

3月26日週四
  1. Google DeepMind64

    Google DeepMind 公開 AI 有害操縱評估工具包及研究結果

    Google DeepMind 公開一套經實證驗證的工具包及研究材料,用於評估 AI 有害操縱能力,並衡量操縱成效與模型採用操縱手法的傾向。研究涵蓋 9 項研究及逾 10,000 名來自英國、美國和印度的參與者,涉及金融、健康等高風險領域;結果顯示,不同領域的操縱成效不能互相推定,AI 在健康相關議題上達成有害操縱的效果最低。

    推薦理由:研究把有害操縱評估拆分為操縱成效與模型採用操縱手法的傾向,並發現不同領域的結果不能互相推定,為高風險情境評估提供可複用方法。

3月25日週三
  1. Google Research42

    描繪現代世界:S2Vec 如何學習城市語言

    Google Research 開發 S2Vec,透過自監督學習將建成環境特徵轉為通用嵌入向量。評測中,S2Vec 在美國人口密度及中位收入等未見地區的零樣本地理適應任務中,通常是表現最佳的單一模型,但樹冠覆蓋、海拔等環境任務仍有改進空間。S2Vec 與影像嵌入向量融合,整體通常優於單一模態。

3月18日週三
  1. Google Research70

    Google Research 探討機器學習如何改善乳癌篩查流程

    Google Research 與 NHS 合作開展兩項研究,評估 AI 單獨讀片及融入乳癌篩查雙讀仲裁流程的表現。單獨讀片評估的癌症檢出率由每 1,000 名女性 7.54 升至 9.33,AI 亦檢出原雙讀流程漏掉的間隔癌中的 25%。融入雙讀仲裁後,流程在癌症檢出敏感度和特異度上達非劣效,估計可減少 46% 的人工讀片;但仲裁者曾推翻 AI 對 93 宗陽性癌症個案作出的正確召回判斷。

    推薦理由:兩項研究分別檢視 AI 單獨讀片及加入人機仲裁後的流程,讓讀者同時衡量讀片人力效益與仲裁風險。

3月17日週二
3月12日週四
  1. Google Research73

    Google Research 推出 Groundsource,以 Gemini 將新聞報道轉化為突發洪水資料

    Google Research 推出 Groundsource,利用 Gemini 從新聞報道抽取突發洪水事件,建立涵蓋 150 多個國家的 2.6 million 筆開放歷史資料集。

    推薦理由:文章列出 Groundsource 的人工核驗數據和 GDACS 事件匹配結果,讓讀者比較新聞抽取資料的時空準確度與既有災害檔案覆蓋情況。

  2. Google Research67

    Google Research 探討 AMIE 對話式診斷 AI 在真實臨牀研究中的可行性

    Google Research 的前瞻性研究在真實門診流程中評估 AMIE 用於就診前病史採集的可行性。研究納入 100 名成人,互動由醫師即時監督且沒有觸發安全停止;AMIE 的鑑別診斷在 90% 個案中涵蓋最終診斷,前三項診斷準確率為 75%。研究屬單中心文字聊天研究,沒有對照組;PCP 的管理方案在實用性及成本效益方面較佳。

    推薦理由:這項研究將 AMIE 用於門診前病史採集,展示即時醫師監督下的安全與診斷評估,亦交代單中心、無對照設計的限制。

3月10日週二
3月5日週四
  1. Google Research47

    教導 LLM 以貝葉斯方式推理

    Google Research 透過「貝葉斯教學」訓練 LLM 模仿貝葉斯助理的預測,提升推薦表現並泛化至其他任務。此方法採用監督式微調;在航班推薦測試中,未經特定訓練的 LLM 表現遠遜最優貝葉斯助理,且常在一次互動後便不再進步。

3月4日週三
2月25日週三
2月18日週三
2月13日週五
2月11日週三
  1. Google Research49

    超越一對一:以 DialogLab 編寫、模擬及測試動態人類與 AI 羣體對話

    Google Research 提出開源原型框架 DialogLab,用於編寫、模擬及測試動態人類與 AI 羣體對話。框架採用「編寫、測試、驗證」流程,並以視覺化介面及驗證儀錶板協助設計與分析對話。14 名參與者的評估顯示,人類控制模式顯著更具投入感,並普遍被認為更有效、寫實。

2月5日週四
2月4日週三
  1. Google Research59

    Google Research 與 Included Health 宣佈將開展全美對話式 AI 虛擬醫療隨機研究

    Google Research 與 Included Health 宣佈,待機構審查委員會(IRB)批准後,將在全美開展前瞻性、經參與者同意的隨機研究,評估對話式 AI 在真實虛擬醫療流程中的表現。研究將把 AI 管理患者互動的能力與限制,和標準臨牀實踐比較,從模擬研究及單中心可行性測試推進至全國規模的真實臨牀評估。

1月28日週三
  1. Google Research58

    Google Research 探討智能體系統的規模化原理及有效條件

    Google Research 團隊對 180 種智能體配置進行受控評估,提出智能體系統的量化規模化原則。在可並行的金融推理任務中,集中式協作較單智能體提升 80.9%;在 PlanCraft 的序列規劃任務中,多智能體方案則令表現下降 39–70%。研究的預測模型根據工具數量及任務可拆解程度,對 87% 未見任務配置正確識別最佳協作策略。

1月24日週六
1月23日週五
  1. Google Research44

    小模型,大成果:Google Research 以分解方法提升意圖提取效果

    Google Research提出分解式流程,令小型多模態 LLM 從網頁及手機互動軌跡提取意圖,表現勝過 CoT 提示和端到端微調。流程先逐屏摘要,再從摘要序列抽取整體意圖;測試涵蓋手機、網頁軌跡及 Gemini、Qwen2 基礎模型。Gemini 1.5 Flash 8B 配合此法,效果可媲美 Gemini 1.5 Pro,展示裝置端意圖理解的應用潛力。

1月21日週三
  1. Hugging Face Blog51

    AssetOpsBench 彌合 AI 智能體基準與工業實務的落差

    AssetOpsBench 是面向工業資產運維的 AI 智能體基準與評估系統,從六項質性維度評估智能體表現。它涵蓋 2.3M 個感測遙測點、4.2K 張工單及 53 種結構化失效模式,並以 881 條執行軌跡分析失敗。社羣測試中,沒有受測模型達到部署準備門檻 85 分;多智能體任務準確率為 47%,低於單智能體的 68%。

1月13日週二
1月10日週六
  1. Berkeley AI Research50

    資訊驅動的成像系統設計:互信息評估與 IDEAL 優化

    Berkeley AI Research 提出一套以互信息直接評估及優化成像系統的框架,並在 NeurIPS 2025 論文中驗證其對四類成像應用的預測能力。方法利用含噪測量與已知噪聲模型估算互信息,測試涵蓋彩色攝影、射電天文、無透鏡成像和顯微鏡。IDEAL 僅優化成像系統的編碼器,不需反向傳播整個解碼器;在色彩濾光片設計中,結果匹配端到端優化,並減少記憶體及計算需求。

12月18日週四
  1. OpenAI News55

    OpenAI 評估鏈式推理的可監測性

    OpenAI 推出一套評估鏈式推理可監測性的框架與評測套件,涵蓋 24 個環境中的 13 項評測。研究結果顯示,監測模型內部推理比只監測輸出有效得多,並為 AI 系統日益強大時的可擴展控制提供一條有前景的路徑。

12月17日週三
12月11日週四
  1. Google Research45

    Urania:洞察 AI 聊天機械人使用情況的差分隱私框架

    Google Research 提出 Urania,以差分隱私分析 AI 聊天機械人對話,提供端到端形式化隱私保證,避免單一對話過度影響摘要。框架透過差分隱私聚類及關鍵詞提取,再讓 LLM 僅根據經私隱保護的關鍵詞生成摘要,不接觸原始對話。與非差分隱私基線比較時,LLM 評估者在一項評測中最多有 70% 的情況偏好 Urania 的摘要。

12月9日週二
12月5日週五
12月4日週四
12月3日週三
11月25日週二
  1. Google DeepMind72

    AlphaFold 助研究人員解析心臟病關鍵蛋白 apoB100 的結構

    密蘇裏大學研究人員結合 AlphaFold 預測與冷凍電子顯微鏡(cryo-EM)影像,解析了構成「壞膽固醇」低密度脂蛋白(LDL)的關鍵蛋白 apoB100 結構。

    推薦理由:這項工作展示了 AlphaFold 的原子級結構預測如何與冷凍電鏡影像互補,協助研究人員解析 apoB100 結構,並為研究 LDL 與 ASCVD 提供結構依據。