聖地亞哥 NeurIPS 2025:NAVER 的 AI 現況與未來
NAVER 在聖地亞哥舉行的 NeurIPS 2025 展示 9 篇研究論文及最新技術示範,研究聚焦效率、可控性與真實世界 AI。其中,KVzip 的記憶體節省幅度最高達 4 倍、速度提升接近 2 倍;CodeGEMM 令 70B 模型運行速度最高提升 8.93 倍。NAVER 亦提出 C-SEO Bench,並以開源方式發布數據集、程式碼及基準。
NAVER 在聖地亞哥舉行的 NeurIPS 2025 展示 9 篇研究論文及最新技術示範,研究聚焦效率、可控性與真實世界 AI。其中,KVzip 的記憶體節省幅度最高達 4 倍、速度提升接近 2 倍;CodeGEMM 令 70B 模型運行速度最高提升 8.93 倍。NAVER 亦提出 C-SEO Bench,並以開源方式發布數據集、程式碼及基準。
NAVER Cloud 的研究提出 Autiverse,一款以 AI 引導自閉症青少年透過漫畫日誌整理日常經歷的平板應用程式。它以 ABC 模型加入情緒元素,形成 A-B-C-E 四格結構,並透過逐步提問、核對和補充細節,協助孩子組織敍事。相關論文將於 ACM CHI 2026 發表。
Prism 提出動態稀疏注意力框架,用於原生以 2K 訓練聯合影片音訊生成模型。框架按時空區域的視覺變化及音訊對影片的影響,動態調整區塊形狀和每個查詢的稀疏度。實驗顯示,相比全注意力,Prism 的訓練速度提升 2.5 倍,生成質素亦更高。
MIT 與合作機構研究人員開發 xvr,將術中 X 光與患者術前 3D 醫學影像配準;模型約 5 分鐘即可適配新患者,並在數秒內完成亞毫米精度配準。系統以患者 CT 或 MRI 進行物理模擬,生成合成 X 光,並使用逾 2,000 名患者的全身 3D 掃描預訓練基礎模型。在涵蓋 5 間醫院的資料測試中,xvr 的準確度和穩健性比其他 AI 方法高一個數量級。
Google Earth AI 介紹實驗性行星預測引擎(PPE),可根據自然語言查詢自主完成地理空間資料搜尋、整理、模型訓練與評估。測試中,21 項 CDC 健康指標的平均 R² 為 76.8%,高於人工專家流程的 60.0%;尼日利亞糧食安全由 ADM1 下採樣至 ADM2,R² 為 66.1%,基線為 31.5%。
Google Research 提出 AgentHands,將 LLM 回應轉化為與語音同步、能配合 XR 空間場景的手勢。系統透過物件註冊、手勢事件和字級時間戳協調語音播放與動畫;研究以 N = 12 名參與者進行受試者內測試,使用蘭花護理和 3D 打印機操作任務,比較 AgentHands 與純語音基線。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,將匿名聚合流動模式融入地點表示,增強語言模型對地點動態功能的理解。在未見地點的測試中,到訪意向預測相對提升最高 81.9%,價格水平分類提升 75.1%,繁忙程度估算準確度提升 24.7%。
Google Research 展示基於 Gemini 和 Project Astra 的 AMIE (Video),在模擬即時視像會診中,核心臨牀能力獲評與基層醫生相當。
推薦理由:研究以 300 場模擬視像會診比較 AMIE (Video)、文字版 AMIE 與基層醫生,呈現視聽感知和虛擬檢查的表現差異,並交代病人演員研究的適用邊界。
Google Research 提出 SensorFM 大型感測器基礎模型,以來自五百萬名參與者的逾一萬億分鐘未標註穿戴式裝置訊號學習通用生理表徵。凍結模型編碼器後訓練的線性探測,在 35 項健康任務中的 34 項勝過特徵工程監督基線。在 31 份參與者檔案的評估中,加入 SensorFM 預測提升個人健康智能體摘要在五個評分維度的表現;與以真實測量值作依據的摘要評分則沒有統計顯著差異。
Google Research 分享兩項關於皮膚狀況 AI 的研究,發現 AI 輔助能提高參與者辨認病況的能力,但標準 AI 組判斷後續步驟的準確度沒有顯著提升。
Google DeepMind 宣佈 AI co-clinician 研究計劃,探索讓 AI 在醫生專業監督下協助患者照護。在 98 個基層醫療問題的評估中,97 個案例錄得零項嚴重錯誤;在開放式藥物問答中,系統表現勝過可用的前沿 AI 系統。
推薦理由:文章並列呈現 AI co-clinician 在證據整理、藥物問答和多模態問診的測試結果,並以醫生整體表現較佳界定其臨牀輔助定位。
Google Research 提出 MapTrace,以合成數據訓練多模態大語言模型(MLLM)在地圖上追蹤有效路徑,應對模型難以理解空間幾何與拓撲關係的問題。
Google 提出 Natively Adaptive Interfaces(NAI)框架,以多模態 AI 工具建立更個人化、具適應性的無障礙應用介面。NAI 主張按情境資訊作出設計決策,並以動態、由智能體驅動的模組取代靜態導覽。Gemini 原型可將即時影片轉為互動音訊描述,讓使用者即時查詢畫面細節。
Google Research提出分解式流程,令小型多模態 LLM 從網頁及手機互動軌跡提取意圖,表現勝過 CoT 提示和端到端微調。流程先逐屏摘要,再從摘要序列抽取整體意圖;測試涵蓋手機、網頁軌跡及 Gemini、Qwen2 基礎模型。Gemini 1.5 Flash 8B 配合此法,效果可媲美 Gemini 1.5 Pro,展示裝置端意圖理解的應用潛力。
Google Research 回顧 2025 年研究成果,涵蓋生成模型、生成式 UI、量子計算、AI 科學工具及氣候、醫療與教育應用。Gemini 3 引入生成式 UI,可按提示詞生成互動介面;Gemma 擴展至 140 多種語言。效能研究顯示,使用 Learn Your Way 的學生在保留測試中的得分高 11 個百分點。
Google DeepMind 與 Kaggle 推出 FACTS Benchmark Suite,透過四項基準評估大語言模型的事實準確性。套件包含更新版 Grounding Benchmark - v2,以及 Parametric、Search、Multimodal 三項基準,並公開提供 3,513 個例子;Kaggle 管理私有保留集並維護公開排行榜。
Google Research 推出 Massive Sound Embedding Benchmark(MSEB),以統一框架評估八項機器聽覺能力。基準涵蓋語義與聲學任務,並可評估不同類型的模型;初步實驗顯示,現有聲音表徵在八項任務上仍有明顯提升空間。
Google DeepMind公佈生物圈研究進展,涵蓋森林砍伐風險預測、地球物種分佈製圖,以及生物聲學模型 Perch 的更新。
Google Research 在 UIST’25 發表 StreetReaderAI 概念驗證原型,結合情境感知即時 AI 與無障礙導航,探索讓盲人及低視力人士使用 Street View。
Hugging Face Blog 介紹開源基準 TimeScope,評估視覺語言模型對 1 分鐘至 8 小時影片的理解能力。基準在長影片中插入約 5–10 秒短片,分別測試局部檢索、資訊綜合和細粒度時間感知。結果顯示模型表現會隨影片變長而下降;Gemini 2.5-Pro 是唯一在超過一小時影片上仍維持良好準確率的模型,而千問(Qwen)2.5-VL 在文字資訊綜合較強、細粒度動態辨識較弱。
Hugging Face 發佈 Docmatix 文件視覺問答數據集,包含 2.4 million 張圖片及 9.5 million 組問答,規模較先前數據集增加 240X。
擴散模型大幅推進圖像、音訊和影片生成,但依賴反覆採樣流程,令生成速度較慢。
OpenAI 發現,CLIP 中有些神經元在同一概念以字面、符號或概念方式呈現時,均會作出反應。這或可解釋 CLIP 為何能準確分類出人意料的概念視覺呈現,也有助理解 CLIP 及類似模型學到的聯想與偏見。