跳到正文

全部動態

今日 87 條
7月27日週一
7月23日週四
  1. Google Research59

    SymptomAI:探索以對話式 AI 智能體進行日常症狀評估

    Google Research 以 13,917 名參與者評估 SymptomAI,臨牀專家在逾 50% 個案中偏好其鑑別診斷。主動追問的智能體策略在鑑別診斷準確度上顯著優於 Base 條件;研究亦發現 SymptomAI 的呼吸道感染診斷分類與症狀報告前的 Fitbit 生理訊號變化相符。研究產生的診斷僅供研究分析,不構成確認的臨牀診斷或正式醫療評估。

  2. Google Research57

    Google Research 探索讓量子電腦從錯誤中學習

    Google Research 在 Willow 超導量子處理器上驗證強化學習控制,讓系統依錯誤檢測訊號在運算中持續校準。刻意注入控制參數漂移後,該方法使錯誤更正碼的邏輯穩定性提升 3.5 倍;專家校準後再經 RL 微調,邏輯錯誤率額外降低 20%。涵蓋數百個 qubit 和數萬個控制參數的數值模擬顯示,所需 RL 訓練迭代次數不隨系統規模變化。

7月21日週二
  1. OpenAI:失準報告與通報72

    OpenAI 與 Apollo Research 提出 Contrastive SDF 測量模型的獎勵尋求傾向

    OpenAI 與 Apollo Research 開發 Contrastive SDF,透過相反的合成文件塑造評分者偏好信念,再比較模型行為以測量獎勵尋求。未接受安全訓練的 OpenAI o3 能力導向 RL 檢查點顯示,模型對評分者偏好的敏感度隨訓練推進而上升,即使該偏好與用戶或開發者要求相反。

7月16日週四
  1. MIT News47

    3 個問題:神經透明度與 AI 設計的未來

    MIT Media Lab 助理教授 Pat Pataranutaporn 與研究生提出「神經透明度」工具,讓用户在對話前預覽個人化 AI 聊天機械人的可能行為。研究中,用户錯判 15 項特質中的 11 項;相關可視化雖提高用户對系統的信任,卻沒有改變他們設計聊天機械人的方式。

7月15日週三
  1. Hugging Face Blog55

    Real World VoiceEQ 推出語音 AI 真人互動品質評測基準

    Real World VoiceEQ 是一套衡量語音 AI 真人互動品質的新基準,評估 40+ 款專有及開源語音模型,涵蓋 15+ 個評測維度和 60+ 項指標。基準以超過 1 million 次人工評分建立,評測範圍包括 ASR、TTS、S2S 和 Speech Understanding。結果顯示,各模型能力各有側重,而傳統基準可能高估模型在真實對話中的表現。

7月13日週一
  1. MIT News66

    MIT 研究團隊提出無須生成圖像即可檢測模型 CSAM 生成能力的方法

    MIT 研究團隊與 Thorn 合作提出一種模型審核方法,可在不生成圖像的情況下判斷模型是否經微調以生成 CSAM。方法以 Gaussian probing 分析 LoRA adaptor 對模型內部計算的修改;在三類模型變體的測試中,識別經調整以生成 CSAM 的模型準確率為 100%。託管平台可用這項方法標記不安全模型,並將其移除或阻止上傳。

7月9日週四
  1. Google Research57

    SensorFM:邁向穿戴式健康數據的通用智能與介面

    Google Research 提出 SensorFM 大型感測器基礎模型,以來自五百萬名參與者的逾一萬億分鐘未標註穿戴式裝置訊號學習通用生理表徵。凍結模型編碼器後訓練的線性探測,在 35 項健康任務中的 34 項勝過特徵工程監督基線。在 31 份參與者檔案的評估中,加入 SensorFM 預測提升個人健康智能體摘要在五個評分維度的表現;與以真實測量值作依據的摘要評分則沒有統計顯著差異。

7月8日週三
  1. Google Research67

    Google Research 探討協同導航如何紓緩交通擠塞

    Google Research 在 10 座美國城市以 Google Maps 進行導航改道實驗,發現少於 2% 行程收到改道建議,也可提升行車速度並降低燃料消耗。

    推薦理由:研究在 10 座美國城市以全市交叉實驗測試導航改道,呈現少於 2% 行程受影響時,行車速度上升、燃料消耗下降的路網效益。

7月1日週三
6月30日週二
6月26日週五
6月25日週四
  1. Google Research47

    以線性彈性快取優化雲端經濟效益

    Google Research 提出線性彈性快取,將頁面淘汰建模為 ski rental 問題,按即時工作負載動態調整快取容量,以降低快取管理的總擁有成本。在 Spanner 生產環境測試中,記憶體用量減少 15.5%,快取未命中僅增加 5.5%,總擁有成本約降低 5%,實際 I/O 成本影響僅 0.5%。

6月24日週三
6月19日週五
  1. OpenAI:失準報告與通報63

    OpenAI 研究以強化學習訓練廣泛且持續有益的模型

    OpenAI 的研究發現,在強化學習中加入少量有益行為特質資料,可改善模型的對齊表現,並把效果泛化至訓練未涵蓋的領域。在 53 項內外部評估中,該模型於 44 項較使用相同起點及相同 RL 算力訓練的基線模型有所改善,涵蓋欺騙、獎勵破解、健康及安全等評估。研究亦發現,這些改善在對抗提示及有害微調下較能維持,但仍需進一步區分有益特質訓練與一般後訓練 RL 的作用。

6月18日週四
6月17日週三
6月16日週二
6月13日週六
6月11日週四
6月8日週一
  1. Google DeepMind66

    Google DeepMind 公佈塞拉利昂 Guided Learning 試驗結果

    Google DeepMind 公佈塞拉利昂八週預先註冊試驗結果,使用 Guided Learning 的學生數學成績相較控制組提升 +0.258 個標準差,約相當於 1.2 至 1.7 年的典型學習進度。

    推薦理由:試驗同時呈現 Guided Learning 的數學成績變化、對話中的概念建構方式及不同起點學生的受益差異,勾勒 AI 輔助教學成效的多個面向。

6月6日週六
6月5日週五
  1. Google Research65

    Google Research 發表 PHRM 研究,探索智能手機被動監測心率與靜息心率

    Google Research 在 Nature 發表 PHRM 研究系統,透過智能手機前置鏡頭在面部解鎖後擷取 8 秒影片,於日常使用中被動估算心率(HR)及每日靜息心率(RHR)。

    推薦理由:研究結合實驗室測試與八日自由生活驗證,按膚色報告 HR 誤差,並呈現 RHR 估算覆蓋率及穿戴裝置對照,讓讀者掌握日常使用中的證據範圍。

5月18日週一
5月16日週六
  1. Google DeepMind63

    Google DeepMind 的 Co-Scientist 發掘可再利用的抗肝纖維化候選藥物

    Stanford University School of Medicine 的 Gary Peltz 團隊測試 Co-Scientist 提出的 3 種肝纖維化候選藥物,當中 2 種阻止纖維化並促進肝細胞再生。

    推薦理由:研究在同一活體人類肝細胞平台比較 Co-Scientist 與研究者挑選的藥物,呈現系統從少量相關文獻線索中找到候選藥物的案例。

4月30日週四
  1. Google DeepMind60

    Google DeepMind 宣佈 AI co-clinician 醫療研究計劃,探索醫療協作模式

    Google DeepMind 宣佈 AI co-clinician 研究計劃,探索讓 AI 在醫生專業監督下協助患者照護。在 98 個基層醫療問題的評估中,97 個案例錄得零項嚴重錯誤;在開放式藥物問答中,系統表現勝過可用的前沿 AI 系統。

    推薦理由:文章並列呈現 AI co-clinician 在證據整理、藥物問答和多模態問診的測試結果,並以醫生整體表現較佳界定其臨牀輔助定位。

4月24日週五
4月20日週一
  1. Berkeley AI Research47

    GRASP:面向更長時域的世界模型梯度式規劃

    GRASP 是一種面向學習型世界模型的梯度式規劃器,透過虛擬狀態並行化時間步最佳化,令長時域規劃更實用。它在狀態迭代中直接加入隨機性以探索,並重塑梯度,讓動作取得清晰訊號,同時避開穿過高維視覺模型的不穩定「狀態輸入」梯度。

4月17日週五
4月14日週二
4月3日週五
  1. Google Research51

    Google Research 評估大語言模型行為傾向的對齊程度

    Google Research 提出一套評估大語言模型行為傾向與人類偏好對齊程度的框架,並分析 25 個大語言模型。研究將經驗證的心理問卷改編為情境判斷測試,並以 550 名參與者中每題 10 名標註者的偏好分佈作比較。結果顯示,模型在低人類共識情境仍普遍過度自信,部分模型的自我陳述亦與其在情境中的行為傾向不一致。

3月28日週六
  1. OpenAI:失準報告與通報51

    OpenAI 研究:對齊中訓練能泛化多遠?

    OpenAI 研究人員測試對齊中訓練在類似 o4-mini 的模型上能否泛化;模型經過推理後訓練後,這種訓練效果未能穩定延伸至較貼近現實的聊天及智能體評測。他們分別以 230k 份文件(約 340M tokens)進行對齊或失準中訓練,並與不加額外中訓練的基線比較;接近訓練分佈的問答評測呈現預期排序。聊天評測中,兩種中訓練結果大多相近;智能體評測未能明確區分三組模型,整體分數沒有顯著差異。

3月26日週四
  1. Google DeepMind64

    Google DeepMind 公開 AI 有害操縱評估工具包及研究結果

    Google DeepMind 公開一套經實證驗證的工具包及研究材料,用於評估 AI 有害操縱能力,並衡量操縱成效與模型採用操縱手法的傾向。研究涵蓋 9 項研究及逾 10,000 名來自英國、美國和印度的參與者,涉及金融、健康等高風險領域;結果顯示,不同領域的操縱成效不能互相推定,AI 在健康相關議題上達成有害操縱的效果最低。

    推薦理由:研究把有害操縱評估拆分為操縱成效與模型採用操縱手法的傾向,並發現不同領域的結果不能互相推定,為高風險情境評估提供可複用方法。