Google Research 介紹生成式 UI:為各類提示生成客製化視覺互動體驗
Google Research 介紹生成式 UI 實作,Gemini app 今日起推出 dynamic view 和 visual layout 兩項實驗,Google Search 的 AI Mode 亦加入生成式互動介面。
推薦理由:文章對照生成式 UI 與標準 LLM 輸出及專家設計網站的偏好結果,並交代生成有時需一分鐘以上及輸出偶有不準確的限制。
Google 與 DeepMind 的 AI 動態:Gemini 系列、Veo 影片模型、研究成果與產品生態的持續追蹤。
Google Research 介紹生成式 UI 實作,Gemini app 今日起推出 dynamic view 和 visual layout 兩項實驗,Google Search 的 AI Mode 亦加入生成式互動介面。
推薦理由:文章對照生成式 UI 與標準 LLM 輸出及專家設計網站的偏好結果,並交代生成有時需一分鐘以上及輸出偶有不準確的限制。
Google DeepMind 與 Google Research 發佈 WeatherNext 2,預報生成速度快 8 倍,並提供細至每小時解析度的全球天氣預測。
推薦理由:WeatherNext 2 與前代 WeatherNext 的比較覆蓋 0–15 天內 99.9% 的變量與預報時效,並列出單顆 TPU 每項預測少於一分鐘的耗時,便於同時衡量預報表現與計算效率。
Google DeepMind 推出研究智能體 SIMA 2,將 Gemini 推理能力整合至虛擬 3D 遊戲,使其能理解目標、規劃行動並與用户對話。它能將在不同遊戲中學到的概念遷移,也可透過試錯及 Gemini 回饋利用自身經驗繼續訓練,並在 Genie 3 生成的新世界中嘗試執行任務。
推薦理由:SIMA 2 結合 Gemini 推理、跨遊戲技能遷移與自生成經驗訓練,並交代長程任務、記憶和精細鍵盤滑鼠操作的限制。
Google Research 公佈可證明私隱洞察(PPI)系統,結合 LLM、TEE 與差分私隱分析生成式 AI 工具的真實使用情況,只釋出匿名化聚合結果。
推薦理由:文章將 LLM 結構化摘要、TEE 內的資料隔離與 user-level 差分私隱聚合串成可外部檢查的流程,並以 Pixel Recorder 説明實際部署方式。
Google 發佈 EmbeddingGemma,一款支援 100 多種語言、具備 308M parameters 和 2K context window 的多語言嵌入模型。文章示範以 Sentence Transformers、LangChain 等工具接入模型,並在 MIRIAD 醫療檢索測試中將微調版的 NDCG@10 提升至 0.8862,基礎模型為 0.8340。
推薦理由:文章提供 EmbeddingGemma 接入多個檢索框架的程式示例,並説明查詢與文件提示詞的設定方式,方便將模型納入既有檢索流程。
Gemma 3n 已接入多個主流開源工具庫,並推出 E2B、E4B 兩種尺寸的 base 與 instruct 版本。支援工具包括 Transformers、timm、MLX、llama.cpp、Transformers.js 和 Ollama;兩款模型實際參數量為 5B 和 8B,GPU 記憶體佔用約相當於 2B 和 4B 模型。
推薦理由:文章並列模型的實際參數量、GPU 記憶體需求和多個工具庫的接入方式,方便衡量 Gemma 3n 本地多模態部署時的硬件門檻與工具選擇。
Google 發佈 Gemma 3 開放權重模型系列,提供 1B、4B、12B、27B 四種規模及預訓練、指令微調版本。4B、12B、27B 版本支援圖像和文字、140+ 種語言及 128k tokens 上下文;1B 版本僅支援文字和英文,提供 32k 上下文。
推薦理由:文章整理 Gemma 3 各版本的上下文、圖像與語言支援差異,並列出 Transformers、MLX 和 llama.cpp 的推理入口,方便比較使用路徑。
Google 發佈 SigLIP 2 多語言視覺語言編碼器系列,加入新的訓練目標以提升語義理解、定位及密集特徵表現。訓練加入圖像描述與區域定位解碼器、自蒸餾的 Global-Local Loss 和 Masked Prediction Loss,並提供動態解析度 naflex 版本。
推薦理由:SigLIP 2 把解碼器監督、自蒸餾與遮罩預測納入訓練,並提供動態解析度版本,展示提升局部語義表徵與適應不同長寬比的訓練思路。
Google 發佈 PaliGemma 2 視覺語言模型,提供 3B、10B、28B 三種規模及 224x224、448x448、896x896 三種輸入解析度。
推薦理由:PaliGemma 2 將前代單一 3B 規格擴展至 3B、10B、28B,並提供三種輸入解析度,呈現下游微調時在品質與效率間選擇的彈性。
Google DeepMind 與 Hugging Face 宣佈在 Transformers v4.46.0 推出 SynthID Text,讓生成時可加入文字水印,並透過分類器檢測水印。
推薦理由:文章梳理 SynthID Text 從生成端配置到分類器訓練的部署流程,並説明改寫、翻譯與事實性回答對水印效果的限制,便於評估適用場景。
Google 發佈 Gemma 2 2B、ShieldGemma 安全分類模型及 Gemma Scope 稀疏自編碼器套件。Gemma 2 2B 有 2.6B 參數,補充既有 9B、27B 版本,並可作 Gemma 2 27B 的輔助模型,最高提速 3x 且不損失品質。
推薦理由:這次更新同時涵蓋小型模型部署、安全內容分類與模型內部分析,讀者可據此比較 Gemma 系列在推理、安全防護及可解釋性研究中的用途。
Google 發佈 Gemma 2,提供 9B 和 27B 兩種參數規模的基礎版與指令微調版,合共四個開放權重模型。Gemma 2 每隔一層採用滑動窗口注意力,其餘層使用全局注意力;9B 模型採用知識蒸餾預訓練。Hugging Face Hub 已提供四個模型,並介紹 Transformers 整合、Inference Endpoints 部署及 TRL 微調示例。
推薦理由:文章並列 Gemma 2 9B 與 Mistral 7B、Llama 3 8B 等模型在 MMLU、GSM8K 等基準的成績,提供小型開放模型效能比較的具體參照。
Google 發佈 PaliGemma,一系列可接收圖像與文字並輸出文字的開源視覺語言模型。模型結合 SigLIP-So400m 圖像編碼器與 Gemma-2B 文字解碼器,提供 PT、Mix、FT 三類檢查點及 224x224、448x448、896x896 三種解像度。PaliGemma 是單輪模型,不適用於對話;Mix 檢查點適合以自由文字提示進行通用推理,但僅供研究用途。
推薦理由:文章整理 PT、Mix、FT 檢查點的用途,並指出高解像度會增加記憶體需求、多數任務的質素提升有限,有助按任務需要選擇模型。
Hugging Face 推出 Deploy on Google Cloud 整合,讓用户可把 Hub 上的開放模型部署至 Vertex AI 或 GKE。所有帶有「text-generation-inference」標籤的模型均獲支援;Vertex Model Garden 提供數百個熱門開放 LLM 的即用測試硬件配置。
推薦理由:這項整合串起 Hugging Face 模型探索與 Google Cloud 部署,並為數百個熱門開放 LLM 提供測試硬件配置,呈現更直接的雲端部署流程。
Google 發佈面向程式碼的大語言模型家族 CodeGemma,推出 2B base、7B base 和 7B instruct 三種版本。模型以 Gemma checkpoint 為基礎,額外訓練 500 billion tokens,三款模型均採用 8K token 上下文窗口。
推薦理由:文章交代 CodeGemma 三種版本的用途,並列出 HumanEval 表現及 Hugging Face 的部署與量化整合,方便比較版本定位、基準表現和使用路徑。
Google 發佈 Gemma 開放大語言模型系列,提供 2B、7B 兩種規模,各有基礎版與指令微調版,所有版本的上下文窗口為 8K tokens。Hugging Face 將模型上架 Hub,整合 Transformers 4.38、Google Cloud 和 Inference Endpoints,並提供以 TRL 微調的示例。
推薦理由:文中將 Gemma 2B、7B 基礎模型與其他開放模型的 LLM Leaderboard 成績並列,呈現其不同參數規模下的相對表現。
Hugging Face Blog 梳理對話智能體的訓練方法,涵蓋 IFT、SFT、RLHF 和 CoT。文中指出,IFT 所需指令數據僅為數百例量級,SFT 以人工標註改善有用性和安全性,RLHF 則根據人類偏好訓練獎勵模型,再用強化學習訓練對話智能體。
推薦理由:文章把 IFT、SFT、RLHF 與 CoT 放在對話智能體訓練脈絡中梳理,並比較多個系統的訓練資料和評估方向,呈現各方法的分工。
OpenAI 與 DeepMind 安全團隊合作開發了一種演算法,透過人類判斷兩種候選行為何者較好,推斷人類想要甚麼。他們將減少人類撰寫目標函數的需要視為構建安全 AI 系統的一步,因以簡單代理目標代表複雜目標,或把目標設定得稍有偏差,都可能導致不良甚至危險行為。
推薦理由:材料呈現以人類比較兩種候選行為的回饋推斷其意願的演算法思路,並連結到降低複雜目標函數設定偏差的安全目標。