跳到正文

全部動態

今日 8 條
1月18日週日
1月16日週五
  1. Google DeepMind47

    D4RT:教 AI 看見四維世界

    Google DeepMind 推出 D4RT,這是一個統一的 AI 模型,可重建並追蹤跨越空間與時間的 4D 場景。測試中,D4RT 比此前方法快 18x 至 300x;在單顆 TPU 上,約 5 秒即可處理 1 分鐘影片,而舊方法最多需 10 分鐘。其查詢式 Transformer 架構支援點追蹤、點雲重建及相機姿態估計,應用方向包括機械人、擴增實境與世界模型。

  2. OpenAI News76

    ChatGPT Go 現已全球推出

    OpenAI 宣佈 ChatGPT Go 現已全球開放,提供 GPT-5.2 Instant 的擴大使用權限、更高使用上限及更長記憶。OpenAI 表示,ChatGPT Go 令全球使用進階 AI 更可負擔。

    推薦理由:全球開放與 GPT-5.2 Instant 使用權限、使用上限和記憶長度的變化,呈現 ChatGPT Go 擴大可用性的具體內容。

1月15日週四
1月14日週三
  1. Google Research70

    Google 發佈 MedGemma 1.5 4B,介紹 MedASR 醫療語音轉文字模型

    Google 發佈開放醫療多模態模型 MedGemma 1.5 4B,新增 CT、MRI、病理全切片及胸部 X 光時間序列等醫療影像處理能力。其基準結果較 MedGemma 1 4B 提升,例如 CT 疾病分類準確率為 61%(58%),MRI 為 65%(51%),醫療文本 EHRQA 為 90%(68%)。

    推薦理由:MedGemma 1.5 4B 在多項醫療影像與文本基準上較前代提升,文中列出的具體分數可用來比較不同任務的改進幅度。

  2. Google DeepMind72

    Veo 3.1 Ingredients to Video 更新,提升影片一致性與創意並加入原生直向及 1080p、4K 輸出

    Google DeepMind 更新 Veo 3.1 Ingredients to Video,提升參考圖像生成影片的一致性與表現,並加入原生 9:16 直向輸出及 1080p、4K 升頻。

    推薦理由:更新同時處理參考圖像影片中的角色、背景與物件一致性,並加入原生直向及高解像度輸出,可看出 Veo 3.1 如何覆蓋短片創作與專業製作需求。

1月13日週二
1月10日週六
  1. Berkeley AI Research50

    資訊驅動的成像系統設計:互信息評估與 IDEAL 優化

    Berkeley AI Research 提出一套以互信息直接評估及優化成像系統的框架,並在 NeurIPS 2025 論文中驗證其對四類成像應用的預測能力。方法利用含噪測量與已知噪聲模型估算互信息,測試涵蓋彩色攝影、射電天文、無透鏡成像和顯微鏡。IDEAL 僅優化成像系統的編碼器,不需反向傳播整個解碼器;在色彩濾光片設計中,結果匹配端到端優化,並減少記憶體及計算需求。

1月9日週五
1月8日週四
1月7日週三
1月6日週二
1月5日週一
1月2日週五
  1. OpenAI News38

    OpenAI Grove Cohort 2 開放申請

    OpenAI Grove Cohort 2 現已開放申請,這是一項為期 5 週、面向從尚未有構想到已有產品等不同階段個人的創辦人計劃。參與者可獲 $50K API 額度、提前使用 AI 工具,以及 OpenAI 團隊提供的實作指導。

12月23日週二
12月22日週一
12月19日週五
  1. Google Research52

    Google Research 回顧 2025 年研究突破與應用成果

    Google Research 回顧 2025 年研究成果,涵蓋生成模型、生成式 UI、量子計算、AI 科學工具及氣候、醫療與教育應用。Gemini 3 引入生成式 UI,可按提示詞生成互動介面;Gemma 擴展至 140 多種語言。效能研究顯示,使用 Learn Your Way 的學生在保留測試中的得分高 11 個百分點。

12月18日週四
  1. OpenAI News55

    OpenAI 評估鏈式推理的可監測性

    OpenAI 推出一套評估鏈式推理可監測性的框架與評測套件,涵蓋 24 個環境中的 13 項評測。研究結果顯示,監測模型內部推理比只監測輸出有效得多,並為 AI 系統日益強大時的可擴展控制提供一條有前景的路徑。

  2. OpenAI News46

    OpenAI 與美國能源部深化合作

    OpenAI 與美國能源部簽署諒解備忘錄,深化 AI 與先進運算合作,以支持科學發現。協議以正在進行的國家實驗室合作為基礎,並建立在能源部體系內運用 AI 開展高影響力研究的框架。

  3. Hugging Face Blog65

    Transformers v5 重設分詞器架構,提升透明度與模組化

    Transformers v5 將分詞器架構與訓練所得的詞彙、合併規則分離,並在類別中明確呈現正規化器等組件。相較 v4 每個模型各有 slow/fast 兩套實作,v5 改為每個模型一個檔案,預設採用 Rust-based TokenizersBackend;分詞器類別亦可直接實例化並用自有語料訓練。

    推薦理由:文章對照 v4 與 v5,説明分離分詞器架構和訓練詞彙後,如何更直接檢查組件,並沿用模型架構訓練自訂分詞器。

12月17日週三
  1. OpenAI News34

    OpenAI 推出面向新聞機構的 OpenAI Academy

    OpenAI 推出與 American Journalism Project 及 The Lenfest Institute 共同建立的 OpenAI Academy for News Organizations,協助新聞編輯室有效運用 AI。學院提供培訓、實用案例及負責任使用指引,支援記者、編輯和出版商在報道及營運中採用 AI。

  2. OpenAI News69

    OpenAI 開放開發者提交 ChatGPT 應用,獲批後列入產品內目錄

    OpenAI 現已開放開發者提交應用,供 ChatGPT 審核及發布;獲批應用會出現在新的產品內目錄,方便用户發現。更新的工具、指南和 Apps SDK 可協助開發者構建原生於聊天的體驗,把現實世界操作帶入 ChatGPT。

    推薦理由:這項更新交代了 ChatGPT 應用提交審核、獲批發布及目錄展示的流程,並列出供開發者使用的工具、指南和 Apps SDK。

12月16日週二
12月13日週六
  1. Google DeepMind78

    Google DeepMind 更新 Gemini 2.5 Flash Native Audio,推出即時語音翻譯測試版

    Google DeepMind 更新 Gemini 2.5 Flash Native Audio,提升其處理複雜工作流、遵循指令及進行多輪語音對話的能力。它在 ComplexFuncBench Audio 得分為 71.5%,開發者指令遵循率由 84% 升至 90%;目前已在 Vertex AI 正式提供,並以預覽版開放 Gemini API。

    推薦理由:更新同時改善即時語音 Agent 的函數調用、指令遵循與多輪對話,並以 ComplexFuncBench Audio 的 71.5% 得分呈現多步函數調用表現。