跳到正文

#Google

今日 14 條
3月26日週四
  1. Google DeepMind64

    Google DeepMind 公開 AI 有害操縱評估工具包及研究結果

    Google DeepMind 公開一套經實證驗證的工具包及研究材料,用於評估 AI 有害操縱能力,並衡量操縱成效與模型採用操縱手法的傾向。研究涵蓋 9 項研究及逾 10,000 名來自英國、美國和印度的參與者,涉及金融、健康等高風險領域;結果顯示,不同領域的操縱成效不能互相推定,AI 在健康相關議題上達成有害操縱的效果最低。

    推薦理由:研究把有害操縱評估拆分為操縱成效與模型採用操縱手法的傾向,並發現不同領域的結果不能互相推定,為高風險情境評估提供可複用方法。

3月25日週三
  1. Google Research62

    Google Research 推出 Vibe Coding XR,以 Gemini 和 XR Blocks 生成 Android XR 原型

    Google Research 宣佈 Vibe Coding XR,結合 Gemini 與 XR Blocks,將自然語言描述轉成具物理感知能力的 Android XR 應用,最快可在 60 秒內生成。

    推薦理由:文章展示如何以 XR Blocks 架構、範例模板和專用系統提示詞約束 Gemini,令自然語言生成的 XR 原型遵循既有 API 與互動設計規範。

  2. Google Research42

    描繪現代世界:S2Vec 如何學習城市語言

    Google Research 開發 S2Vec,透過自監督學習將建成環境特徵轉為通用嵌入向量。評測中,S2Vec 在美國人口密度及中位收入等未見地區的零樣本地理適應任務中,通常是表現最佳的單一模型,但樹冠覆蓋、海拔等環境任務仍有改進空間。S2Vec 與影像嵌入向量融合,整體通常優於單一模態。

3月18日週三
  1. Google Research70

    Google Research 探討機器學習如何改善乳癌篩查流程

    Google Research 與 NHS 合作開展兩項研究,評估 AI 單獨讀片及融入乳癌篩查雙讀仲裁流程的表現。單獨讀片評估的癌症檢出率由每 1,000 名女性 7.54 升至 9.33,AI 亦檢出原雙讀流程漏掉的間隔癌中的 25%。融入雙讀仲裁後,流程在癌症檢出敏感度和特異度上達非劣效,估計可減少 46% 的人工讀片;但仲裁者曾推翻 AI 對 93 宗陽性癌症個案作出的正確召回判斷。

    推薦理由:兩項研究分別檢視 AI 單獨讀片及加入人機仲裁後的流程,讓讀者同時衡量讀片人力效益與仲裁風險。

3月17日週二
  1. Manus:Blog66

    Manus 升級 Google Workspace 連接器,支援 Docs、Sheets、Slides 精細操作

    Manus 升級 Google Workspace 連接器,讓它可在 Docs、Sheets 和 Slides 中執行精細編輯與結構操作。升級使用 Google Workspace CLI,該開源工具由 Google Workspace 團隊在 GitHub 發佈,但並非 Google 官方支持的產品。新功能已向所有 Manus 用户開放,無需安裝或啟用,且不另收費;既有工作流維持不變。

3月12日週四
  1. Google Research76

    Google Research 在 Flood Hub 推出城市山洪預報,最長提前 24 小時

    Google Research 在 Flood Hub 推出城市山洪預報,可提前最多 24 小時預測城市地區的山洪風險。Google 使用 Gemini 分析公開新聞報道,建立 Groundsource 歷史山洪事件資料集,用於模型訓練和評估。目前系統以 20x20 公里空間解析度運作,預測人口密度每平方公里超過 100 人的區域。

    推薦理由:以 Gemini 分析公開新聞報道建立 Groundsource 山洪事件資料集,呈現缺少歷史觀測時補足模型訓練資料的做法。

  2. Google Research73

    Google Research 推出 Groundsource,以 Gemini 將新聞報道轉化為突發洪水資料

    Google Research 推出 Groundsource,利用 Gemini 從新聞報道抽取突發洪水事件,建立涵蓋 150 多個國家的 2.6 million 筆開放歷史資料集。

    推薦理由:文章列出 Groundsource 的人工核驗數據和 GDACS 事件匹配結果,讓讀者比較新聞抽取資料的時空準確度與既有災害檔案覆蓋情況。

  3. Google Research67

    Google Research 探討 AMIE 對話式診斷 AI 在真實臨牀研究中的可行性

    Google Research 的前瞻性研究在真實門診流程中評估 AMIE 用於就診前病史採集的可行性。研究納入 100 名成人,互動由醫師即時監督且沒有觸發安全停止;AMIE 的鑑別診斷在 90% 個案中涵蓋最終診斷,前三項診斷準確率為 75%。研究屬單中心文字聊天研究,沒有對照組;PCP 的管理方案在實用性及成本效益方面較佳。

    推薦理由:這項研究將 AMIE 用於門診前病史採集,展示即時醫師監督下的安全與診斷評估,亦交代單中心、無對照設計的限制。

3月7日週六
  1. Google Research64

    WAXAL 為 27 種撒哈拉以南非洲語言提供大型開放語音資源

    Google Research 推出 WAXAL 開放語音資料集,首批涵蓋 27 種撒哈拉以南非洲語言,這些語言由超過 100 million 人使用。資料包含約 1,846 小時已轉錄的自然語音 ASR 數據,以及超過 565 小時高保真 TTS 錄音,採用 CC-BY-4.0 授權開放。資料收集由非洲學術及社區組織主導,Google 表示計劃持續擴充語言範圍。

    推薦理由:WAXAL 將自然口語 ASR 與高保真 TTS 語料以 CC-BY-4.0 授權開放,呈現支援低資源語言語音技術所需的資料建置基礎。

3月5日週四
  1. Google Research47

    教導 LLM 以貝葉斯方式推理

    Google Research 透過「貝葉斯教學」訓練 LLM 模仿貝葉斯助理的預測,提升推薦表現並泛化至其他任務。此方法採用監督式微調;在航班推薦測試中,未經特定訓練的 LLM 表現遠遜最優貝葉斯助理,且常在一次互動後便不再進步。

3月4日週三
  1. Google DeepMind71

    Gemini 3.1 Flash-Lite 為大規模開發者工作負載而設

    Google DeepMind 推出 Gemini 3.1 Flash-Lite,現正以預覽版向開發者及企業開放,開發者可透過 Google AI Studio 的 Gemini API 使用,企業則可透過 Vertex AI 使用。

    推薦理由:文章把 Gemini 3.1 Flash-Lite 的定價、相較 2.5 Flash 的速度數據及質素描述並列,呈現其面向高頻工作負載的成本定位。

2月27日週五
  1. Google DeepMind76

    Google DeepMind 發佈 Nano Banana 2(Gemini 3.1 Flash Image),融合 Pro 能力與 Flash 速度

    Google DeepMind 發佈圖像生成模型 Nano Banana 2(Gemini 3.1 Flash Image),以 Flash 速度帶來 Nano Banana Pro 的世界知識、品質與推理能力。

    推薦理由:Nano Banana 2 將 Nano Banana Pro 的世界知識、視覺品質與創作控制帶到 Flash 速度,並交代其在 Google 產品中的推出範圍及 Nano Banana Pro 的保留使用方式,説明兩款模型面向的工作流程差異。

2月24日週二
  1. AI as Normal Technology64

    新論文《Towards a Science of AI Agent Reliability》分析 AI 智能體可靠性

    新論文評估 14 個模型,發現近 18 個月模型能力提升明顯,AI 智能體可靠性僅小幅改善。研究把可靠性拆分為一致性、穩健性、可預測性和安全性四個維度,以 12 項指標測試 GAIA 與 TauBench;可預測性是整體最弱的一環。作者建議在準確率之外同步報告可靠性各維度表現,並計劃推出 AI agent reliability index。

2月20日週五
  1. Google DeepMind77

    Gemini 3.1 Pro:面向最複雜任務的更智能模型

    Google DeepMind 發佈 Gemini 3.1 Pro,作為 Gemini 3 系列核心模型升級,提升複雜問題的推理能力。它在 ARC-AGI-2 取得經驗證的 77.1% 得分,推理表現超過 Gemini 3 Pro 兩倍。

    推薦理由:Gemini 3.1 Pro 在 ARC-AGI-2 取得經驗證的 77.1% 得分,並稱推理表現超過 Gemini 3 Pro 兩倍,為核心推理升級提供量化比較依據。

2月19日週四
  1. Google DeepMind75

    Google DeepMind 推出 Lyria 3 音樂生成模型,於 Gemini app 開放 beta 使用

    Google DeepMind 在 Gemini app beta 推出 Lyria 3 音樂生成模型,使用者可用文字提示或上傳照片、影片生成 30 秒音軌。系統會按提示生成歌詞,並可調整風格、人聲和節奏;音軌嵌入 SynthID,Gemini 的核驗功能亦延伸至音訊,使用者可上傳檔案詢問其是否由 Google AI 生成。

    推薦理由:Lyria 3 在 Gemini app 開放以文字、圖片或影片生成音樂,並納入 SynthID 與音訊核驗,呈現創作功能和 AI 內容識別並行的設計。

2月18日週三
2月17日週二
  1. Google DeepMind65

    Google DeepMind 與印度政府及當地機構合作,推進 AI 科學與教育應用

    Google DeepMind 宣佈與印度政府部門及當地機構建立新合作,擴大 AI 在科學與教育領域的應用。合作將向印度研究人員提供 AlphaGenome、AI Co-scientist 和 Earth AI,並推出 $30 million Google.org Impact Challenge: AI for Science。

    推薦理由:文章列出研究機構合作、AI 科學挑戰賽及教材互動化安排,呈現 Google DeepMind 在印度推進科學與教育應用的具體路徑。

2月13日週五
2月11日週三
  1. Google Research49

    超越一對一:以 DialogLab 編寫、模擬及測試動態人類與 AI 羣體對話

    Google Research 提出開源原型框架 DialogLab,用於編寫、模擬及測試動態人類與 AI 羣體對話。框架採用「編寫、測試、驗證」流程,並以視覺化介面及驗證儀錶板協助設計與分析對話。14 名參與者的評估顯示,人類控制模式顯著更具投入感,並普遍被認為更有效、寫實。

2月5日週四
2月4日週三
  1. Google Research59

    Google Research 與 Included Health 宣佈將開展全美對話式 AI 虛擬醫療隨機研究

    Google Research 與 Included Health 宣佈,待機構審查委員會(IRB)批准後,將在全美開展前瞻性、經參與者同意的隨機研究,評估對話式 AI 在真實虛擬醫療流程中的表現。研究將把 AI 管理患者互動的能力與限制,和標準臨牀實踐比較,從模擬研究及單中心可行性測試推進至全國規模的真實臨牀評估。

2月2日週一
1月30日週五
  1. Google DeepMind68

    Project Genie:用實驗原型探索無限互動世界

    Google DeepMind 開始向美國年滿 18 歲的 Google AI Ultra 訂户逐步開放 Project Genie;這款由 Genie 3、Nano Banana Pro 和 Gemini 驅動的實驗研究原型,可建立、探索及改編互動世界。

    推薦理由:原型把世界草圖、即時探索與改編放進同一體驗,並交代生成時長、物理表現和角色操控限制,可看出目前互動世界模型的使用方式與邊界。

1月28日週三
  1. Google Research58

    Google Research 探討智能體系統的規模化原理及有效條件

    Google Research 團隊對 180 種智能體配置進行受控評估,提出智能體系統的量化規模化原則。在可並行的金融推理任務中,集中式協作較單智能體提升 80.9%;在 PlanCraft 的序列規劃任務中,多智能體方案則令表現下降 39–70%。研究的預測模型根據工具數量及任務可拆解程度,對 87% 未見任務配置正確識別最佳協作策略。

1月24日週六
1月23日週五
  1. Google Research44

    小模型,大成果:Google Research 以分解方法提升意圖提取效果

    Google Research提出分解式流程,令小型多模態 LLM 從網頁及手機互動軌跡提取意圖,表現勝過 CoT 提示和端到端微調。流程先逐屏摘要,再從摘要序列抽取整體意圖;測試涵蓋手機、網頁軌跡及 Gemini、Qwen2 基礎模型。Gemini 1.5 Flash 8B 配合此法,效果可媲美 Gemini 1.5 Pro,展示裝置端意圖理解的應用潛力。

1月16日週五
  1. Google DeepMind47

    D4RT:教 AI 看見四維世界

    Google DeepMind 推出 D4RT,這是一個統一的 AI 模型,可重建並追蹤跨越空間與時間的 4D 場景。測試中,D4RT 比此前方法快 18x 至 300x;在單顆 TPU 上,約 5 秒即可處理 1 分鐘影片,而舊方法最多需 10 分鐘。其查詢式 Transformer 架構支援點追蹤、點雲重建及相機姿態估計,應用方向包括機械人、擴增實境與世界模型。

1月14日週三
  1. Google Research70

    Google 發佈 MedGemma 1.5 4B,介紹 MedASR 醫療語音轉文字模型

    Google 發佈開放醫療多模態模型 MedGemma 1.5 4B,新增 CT、MRI、病理全切片及胸部 X 光時間序列等醫療影像處理能力。其基準結果較 MedGemma 1 4B 提升,例如 CT 疾病分類準確率為 61%(58%),MRI 為 65%(51%),醫療文本 EHRQA 為 90%(68%)。

    推薦理由:MedGemma 1.5 4B 在多項醫療影像與文本基準上較前代提升,文中列出的具體分數可用來比較不同任務的改進幅度。

  2. Google DeepMind72

    Veo 3.1 Ingredients to Video 更新,提升影片一致性與創意並加入原生直向及 1080p、4K 輸出

    Google DeepMind 更新 Veo 3.1 Ingredients to Video,提升參考圖像生成影片的一致性與表現,並加入原生 9:16 直向輸出及 1080p、4K 升頻。

    推薦理由:更新同時處理參考圖像影片中的角色、背景與物件一致性,並加入原生直向及高解像度輸出,可看出 Veo 3.1 如何覆蓋短片創作與專業製作需求。

1月13日週二
12月22日週一
  1. Manus:Blog60

    Manus 推出 Design View,支援視覺資產生成與編輯

    Manus 推出 Design View,這項 Manus Agent 擴展功能把視覺資產的生成、局部修改及文字編輯整合到同一設計工作流程。用户可在手機應用程式中按住圖像選取區域,以語音或文字輸入修改指令,亦可一次提交多個區域的編輯。Manus 表示,Design View 即日起向所有用户開放,設計模式由 Google 的 Nano Banana Pro 提供支援。

12月19日週五
  1. Google Research52

    Google Research 回顧 2025 年研究突破與應用成果

    Google Research 回顧 2025 年研究成果,涵蓋生成模型、生成式 UI、量子計算、AI 科學工具及氣候、醫療與教育應用。Gemini 3 引入生成式 UI,可按提示詞生成互動介面;Gemma 擴展至 140 多種語言。效能研究顯示,使用 Learn Your Way 的學生在保留測試中的得分高 11 個百分點。

12月17日週三
12月13日週六
  1. Google DeepMind78

    Google DeepMind 更新 Gemini 2.5 Flash Native Audio,推出即時語音翻譯測試版

    Google DeepMind 更新 Gemini 2.5 Flash Native Audio,提升其處理複雜工作流、遵循指令及進行多輪語音對話的能力。它在 ComplexFuncBench Audio 得分為 71.5%,開發者指令遵循率由 84% 升至 90%;目前已在 Vertex AI 正式提供,並以預覽版開放 Gemini API。

    推薦理由:更新同時改善即時語音 Agent 的函數調用、指令遵循與多輪對話,並以 ComplexFuncBench Audio 的 71.5% 得分呈現多步函數調用表現。

12月11日週四
  1. Google DeepMind52

    Google DeepMind 擴大與英國 AI 安全研究所(AISI)的研究合作

    Google DeepMind 宣佈透過新的諒解備忘錄擴大與英國 AI 安全研究所(AISI)的合作,將合作範圍由模型測試延伸至更廣泛的基礎安全研究。研究涵蓋監測 AI 推理過程、探討社會與情感影響,以及評估 AI 對經濟系統的潛在影響。合作亦包括分享專有模型、數據和研究想法,並共同發布報告、開展研究及進行技術討論。