跳到正文

Google / Gemini

Google 與 DeepMind 的 AI 動態:Gemini 系列、Veo 影片模型、研究成果與產品生態的持續追蹤。

最新精選

第 41–60 條 · 共 98 條
5月16日週六
  1. Google DeepMind63

    Google DeepMind 的 Co-Scientist 發掘可再利用的抗肝纖維化候選藥物

    Stanford University School of Medicine 的 Gary Peltz 團隊測試 Co-Scientist 提出的 3 種肝纖維化候選藥物,當中 2 種阻止纖維化並促進肝細胞再生。

    推薦理由:研究在同一活體人類肝細胞平台比較 Co-Scientist 與研究者挑選的藥物,呈現系統從少量相關文獻線索中找到候選藥物的案例。

5月12日週二
  1. Google DeepMind64

    Google DeepMind 公佈 Co-Scientist 多智能體科研系統,並將推出 Hypothesis Generation 實驗工具

    Google DeepMind 公佈以 Gemini 構建的 Co-Scientist 多智能體科研系統,將逐步向研究人員開放。Hypothesis Generation 實驗工具將於未來數週開始推出,研究人員可在 labs.google/science 登記意向;系統以專職智能體生成、辯論和演化假設,再用 Elo-based tournament 排序並交叉核查文獻與數據。

    推薦理由:Co-Scientist 以多智能體迭代生成、辯論和篩選科研假設,肝纖維化案例亦列出一項候選藥物在實驗室阻斷 91% 疤痕相關反應的結果。

4月30日週四
  1. Google DeepMind60

    Google DeepMind 宣佈 AI co-clinician 醫療研究計劃,探索醫療協作模式

    Google DeepMind 宣佈 AI co-clinician 研究計劃,探索讓 AI 在醫生專業監督下協助患者照護。在 98 個基層醫療問題的評估中,97 個案例錄得零項嚴重錯誤;在開放式藥物問答中,系統表現勝過可用的前沿 AI 系統。

    推薦理由:文章並列呈現 AI co-clinician 在證據整理、藥物問答和多模態問診的測試結果,並以醫生整體表現較佳界定其臨牀輔助定位。

4月23日週四
  1. Google Research73

    Google Photos 在 Auto frame 中推出照片視角重構功能

    Google Photos 的 Auto frame 現已提供照片視角重構功能,會自動調整相機視點並補全原照片未拍到的畫面區域。方法先估算 3D 點圖與相機參數,再以生成式潛在擴散模型補全重新渲染後的空缺。這項功能會處理符合條件且包含人物的照片,重構版本列為 Auto frame 候選中的第二個版本。

    推薦理由:文章説明它如何把照片視為 3D 場景,重設相機位置並補出鏡頭外內容,呈現傳統裁切和縮放無法做到的視角修正。

4月16日週四
  1. Google DeepMind68

    Google DeepMind 發佈 Gemini 3.1 Flash TTS,加入音訊標籤細調語音表現

    Google DeepMind 發佈 Gemini 3.1 Flash TTS,提升文字轉語音的可控性、表現力與品質,並加入音訊標籤細調語音表現。模型支援 70+ 種語言及原生多説話者對話,在 Artificial Analysis TTS leaderboard 的 Elo 分數為 1,211。

    推薦理由:文章聚焦音訊標籤如何細調語氣、節奏與表達,並列出 Gemini 3.1 Flash TTS 面向開發者、企業及 Workspace 用户的推出渠道。

4月3日週五
4月2日週四
  1. Hugging Face Blog85

    Google DeepMind 發佈 Gemma 4 多模態模型系列,五種尺寸登陸 Hugging Face

    Google DeepMind 的 Gemma 4 多模態模型系列已登陸 Hugging Face,提供五種尺寸,支援圖像、文字及部分型號的音訊輸入。模型採 Apache 2 授權,最大上下文窗口為 256K;31B 和 26B A4B 的 text-only LMArena 估算分數分別為 1452 和 1441,後者有 4B 啟用參數。

    推薦理由:文章列出五種 Gemma 4 規格、上下文窗口和音訊支援差異,並整理多個推理與微調框架的接入方式,可供比較型號特點及部署路徑。

3月29日週日
  1. Google DeepMind65

    Google DeepMind 探索 AI 時代的滑鼠遊標,介紹 Gemini 在 Chrome 的指向提問功能

    Google DeepMind 介紹 AI 指針的設計原則與實驗演示,並宣佈即日起可在 Chrome 用指針向 Gemini 提問網頁內容。這套設計以四項原則為核心,讓指針結合視覺和語義上下文及語音,減少使用者撰寫詳細提示詞的需要。Magic Pointer 將即將在 Googlebook 推出。

    推薦理由:文章以四項交互原則説明 AI 指針如何減少提示詞負擔,並列出 Gemini 在 Chrome 的現有功能及 Googlebook 即將推出的 Magic Pointer。

3月26日週四
  1. Google DeepMind73

    Google DeepMind 推出 Gemini 3.1 Flash Live,提升語音 AI 的自然度與可靠性

    Google DeepMind 推出 Gemini 3.1 Flash Live,提升即時語音對話的精準度並降低延遲。它在 ComplexFuncBench Audio 得分 90.8%,在 Scale AI 的 Audio MultiChallenge 開啟 thinking 時得分 36.1%。

    推薦理由:原文以兩項語音基準呈現多步函數調用與複雜指令跟隨表現,並列出開發者、企業及一般用户的使用入口,可對照其能力與部署場景。

  2. Google DeepMind64

    Google DeepMind 公開 AI 有害操縱評估工具包及研究結果

    Google DeepMind 公開一套經實證驗證的工具包及研究材料,用於評估 AI 有害操縱能力,並衡量操縱成效與模型採用操縱手法的傾向。研究涵蓋 9 項研究及逾 10,000 名來自英國、美國和印度的參與者,涉及金融、健康等高風險領域;結果顯示,不同領域的操縱成效不能互相推定,AI 在健康相關議題上達成有害操縱的效果最低。

    推薦理由:研究把有害操縱評估拆分為操縱成效與模型採用操縱手法的傾向,並發現不同領域的結果不能互相推定,為高風險情境評估提供可複用方法。

3月25日週三
  1. Google Research62

    Google Research 推出 Vibe Coding XR,以 Gemini 和 XR Blocks 生成 Android XR 原型

    Google Research 宣佈 Vibe Coding XR,結合 Gemini 與 XR Blocks,將自然語言描述轉成具物理感知能力的 Android XR 應用,最快可在 60 秒內生成。

    推薦理由:文章展示如何以 XR Blocks 架構、範例模板和專用系統提示詞約束 Gemini,令自然語言生成的 XR 原型遵循既有 API 與互動設計規範。

3月18日週三
  1. Google Research70

    Google Research 探討機器學習如何改善乳癌篩查流程

    Google Research 與 NHS 合作開展兩項研究,評估 AI 單獨讀片及融入乳癌篩查雙讀仲裁流程的表現。單獨讀片評估的癌症檢出率由每 1,000 名女性 7.54 升至 9.33,AI 亦檢出原雙讀流程漏掉的間隔癌中的 25%。融入雙讀仲裁後,流程在癌症檢出敏感度和特異度上達非劣效,估計可減少 46% 的人工讀片;但仲裁者曾推翻 AI 對 93 宗陽性癌症個案作出的正確召回判斷。

    推薦理由:兩項研究分別檢視 AI 單獨讀片及加入人機仲裁後的流程,讓讀者同時衡量讀片人力效益與仲裁風險。

3月12日週四
  1. Google Research76

    Google Research 在 Flood Hub 推出城市山洪預報,最長提前 24 小時

    Google Research 在 Flood Hub 推出城市山洪預報,可提前最多 24 小時預測城市地區的山洪風險。Google 使用 Gemini 分析公開新聞報道,建立 Groundsource 歷史山洪事件資料集,用於模型訓練和評估。目前系統以 20x20 公里空間解析度運作,預測人口密度每平方公里超過 100 人的區域。

    推薦理由:以 Gemini 分析公開新聞報道建立 Groundsource 山洪事件資料集,呈現缺少歷史觀測時補足模型訓練資料的做法。

  2. Google Research73

    Google Research 推出 Groundsource,以 Gemini 將新聞報道轉化為突發洪水資料

    Google Research 推出 Groundsource,利用 Gemini 從新聞報道抽取突發洪水事件,建立涵蓋 150 多個國家的 2.6 million 筆開放歷史資料集。

    推薦理由:文章列出 Groundsource 的人工核驗數據和 GDACS 事件匹配結果,讓讀者比較新聞抽取資料的時空準確度與既有災害檔案覆蓋情況。

  3. Google Research67

    Google Research 探討 AMIE 對話式診斷 AI 在真實臨牀研究中的可行性

    Google Research 的前瞻性研究在真實門診流程中評估 AMIE 用於就診前病史採集的可行性。研究納入 100 名成人,互動由醫師即時監督且沒有觸發安全停止;AMIE 的鑑別診斷在 90% 個案中涵蓋最終診斷,前三項診斷準確率為 75%。研究屬單中心文字聊天研究,沒有對照組;PCP 的管理方案在實用性及成本效益方面較佳。

    推薦理由:這項研究將 AMIE 用於門診前病史採集,展示即時醫師監督下的安全與診斷評估,亦交代單中心、無對照設計的限制。

3月7日週六
  1. Google Research64

    WAXAL 為 27 種撒哈拉以南非洲語言提供大型開放語音資源

    Google Research 推出 WAXAL 開放語音資料集,首批涵蓋 27 種撒哈拉以南非洲語言,這些語言由超過 100 million 人使用。資料包含約 1,846 小時已轉錄的自然語音 ASR 數據,以及超過 565 小時高保真 TTS 錄音,採用 CC-BY-4.0 授權開放。資料收集由非洲學術及社區組織主導,Google 表示計劃持續擴充語言範圍。

    推薦理由:WAXAL 將自然口語 ASR 與高保真 TTS 語料以 CC-BY-4.0 授權開放,呈現支援低資源語言語音技術所需的資料建置基礎。

3月4日週三
  1. Google DeepMind71

    Gemini 3.1 Flash-Lite 為大規模開發者工作負載而設

    Google DeepMind 推出 Gemini 3.1 Flash-Lite,現正以預覽版向開發者及企業開放,開發者可透過 Google AI Studio 的 Gemini API 使用,企業則可透過 Vertex AI 使用。

    推薦理由:文章把 Gemini 3.1 Flash-Lite 的定價、相較 2.5 Flash 的速度數據及質素描述並列,呈現其面向高頻工作負載的成本定位。

2月27日週五
  1. Google DeepMind76

    Google DeepMind 發佈 Nano Banana 2(Gemini 3.1 Flash Image),融合 Pro 能力與 Flash 速度

    Google DeepMind 發佈圖像生成模型 Nano Banana 2(Gemini 3.1 Flash Image),以 Flash 速度帶來 Nano Banana Pro 的世界知識、品質與推理能力。

    推薦理由:Nano Banana 2 將 Nano Banana Pro 的世界知識、視覺品質與創作控制帶到 Flash 速度,並交代其在 Google 產品中的推出範圍及 Nano Banana Pro 的保留使用方式,説明兩款模型面向的工作流程差異。