跳到正文

全部動態

今日 82 條
1月14日週三
  1. Google Research70

    Google 發佈 MedGemma 1.5 4B,介紹 MedASR 醫療語音轉文字模型

    Google 發佈開放醫療多模態模型 MedGemma 1.5 4B,新增 CT、MRI、病理全切片及胸部 X 光時間序列等醫療影像處理能力。其基準結果較 MedGemma 1 4B 提升,例如 CT 疾病分類準確率為 61%(58%),MRI 為 65%(51%),醫療文本 EHRQA 為 90%(68%)。

    推薦理由:MedGemma 1.5 4B 在多項醫療影像與文本基準上較前代提升,文中列出的具體分數可用來比較不同任務的改進幅度。

1月6日週二
1月5日週一
12月23日週二
12月18日週四
12月17日週三
12月13日週六
  1. Google DeepMind78

    Google DeepMind 更新 Gemini 2.5 Flash Native Audio,推出即時語音翻譯測試版

    Google DeepMind 更新 Gemini 2.5 Flash Native Audio,提升其處理複雜工作流、遵循指令及進行多輪語音對話的能力。它在 ComplexFuncBench Audio 得分為 71.5%,開發者指令遵循率由 84% 升至 90%;目前已在 Vertex AI 正式提供,並以預覽版開放 Gemini API。

    推薦理由:更新同時改善即時語音 Agent 的函數調用、指令遵循與多輪對話,並以 ComplexFuncBench Audio 的 71.5% 得分呈現多步函數調用表現。

12月11日週四
  1. OpenAI News67

    GPT-5.2 推進科學與數學研究

    OpenAI 表示,GPT-5.2 是其目前在數學與科學領域最強的模型,並在 GPQA Diamond 和 FrontierMath 等基準上取得新的最佳成績。文章列舉其求解一個尚未解決的理論問題,以及生成可靠數學證明的案例,展示基準表現如何轉化為實際研究進展。

    推薦理由:文章把 GPQA Diamond、FrontierMath 的基準表現連結到求解尚未解決的理論問題和生成可靠數學證明的案例,呈現 GPT-5.2 在研究任務中的具體落點。

  2. OpenAI News71

    OpenAI 發佈面向日常專業工作的 GPT-5.2

    OpenAI 發佈 GPT-5.2,稱其為面向日常專業工作的最先進前沿模型,具備最先進的推理、長上下文理解、編碼和視覺能力。GPT-5.2 可在 ChatGPT 和 OpenAI API 中使用,以支援更快、更可靠的智能體工作流。

    推薦理由:原文交代 GPT-5.2 的能力定位及 ChatGPT、OpenAI API 的使用入口,讀者可瞭解它面向的專業工作與智能體工作流。

12月9日週二
12月3日週三
  1. Mistral AI77

    Mistral AI 發佈 Mistral 3 模型系列,包含 Ministral 3 與 Mistral Large 3

    Mistral AI 發佈 Mistral 3 模型系列,包含 14B、8B、3B 三款 Ministral 3,以及 Mistral Large 3。Ministral 3 的每種尺寸均提供 base、instruct 和 reasoning 版本,具備圖像理解能力;全系列均按 Apache 2.0 授權釋出。

    推薦理由:Mistral 3 覆蓋 3B 至 675B 的模型規模,並列出邊緣端與資料中心的部署路徑,可供比較開源模型的部署選擇。

12月1日週一
11月24日週一
11月22日週六
11月20日週四
  1. Google DeepMind75

    使用 Nano Banana Pro(Gemini 3 Pro Image)構建圖像應用

    Google DeepMind 發佈 Nano Banana Pro(Gemini 3 Pro Image),並以付費預覽方式向開發者開放。模型具備更準確的文字渲染和圖像本地化能力,支援 2K 和 4k 解析度;啟用 Google Search grounding 時,亦可連接即時網頁內容。

    推薦理由:文章把 Nano Banana Pro 的文字渲染、本地化能力與接入方式,連同相較 Gemini 2.5 Flash Image 的成本和延遲取捨一併交代。

11月19日週三
  1. Google Research75

    Google Research 介紹即時語音到語音翻譯模型,標準延遲為 2 秒

    Google Research 介紹端到端即時語音到語音翻譯模型,以原説話者聲線輸出譯音,標準延遲為 2 秒。模型採用串流架構及時間同步訓練資料,支援英語與西班牙語、德語、法語、意大利語、葡萄牙語之間的雙向翻譯。相關功能已在 Google Meet 伺服器端提供,並作為 Pixel 10 的內置裝置端功能推出;Pixel Voice Translate 採用級聯式流程以擴大語言覆蓋。

    推薦理由:文章説明串流架構如何配合時間同步訓練資料,把語音互譯的標準延遲控制在 2 秒,並以原説話者聲線輸出譯音,可瞭解低延遲與個人化如何結合。

11月17日週一
  1. Google DeepMind72

    Google DeepMind 與 Google Research 發佈 WeatherNext 2 天氣預測模型

    Google DeepMind 與 Google Research 發佈 WeatherNext 2,預報生成速度快 8 倍,並提供細至每小時解析度的全球天氣預測。

    推薦理由:WeatherNext 2 與前代 WeatherNext 的比較覆蓋 0–15 天內 99.9% 的變量與預報時效,並列出單顆 TPU 每項預測少於一分鐘的耗時,便於同時衡量預報表現與計算效率。

11月13日週四
  1. Google DeepMind66

    Google DeepMind 推出 SIMA 2:能在虛擬 3D 世界中遊玩、推理並與你一同學習的智能體

    Google DeepMind 推出研究智能體 SIMA 2,將 Gemini 推理能力整合至虛擬 3D 遊戲,使其能理解目標、規劃行動並與用户對話。它能將在不同遊戲中學到的概念遷移,也可透過試錯及 Gemini 回饋利用自身經驗繼續訓練,並在 Genie 3 生成的新世界中嘗試執行任務。

    推薦理由:SIMA 2 結合 Gemini 推理、跨遊戲技能遷移與自生成經驗訓練,並交代長程任務、記憶和精細鍵盤滑鼠操作的限制。

11月12日週三
  1. OpenAI News67

    GPT-5.1:更聰明、對話感更強的 ChatGPT

    OpenAI 正在升級 GPT-5 系列,以更温暖、能力更強的模型和新增的 ChatGPT 語氣、風格自訂方式推出 GPT-5.1。GPT-5.1 今天開始向付費用户逐步推出。

    推薦理由:GPT-5.1 更新同時涵蓋模型能力與 ChatGPT 語氣、風格自訂,並交代先向付費用户推出,便於把握其功能變化和開放範圍。

11月7日週五
10月29日週三
10月28日週二
10月26日週日
9月30日週二
  1. OpenAI News67

    OpenAI 發佈 Sora 2 影片生成模型

    OpenAI 推出 Sora 2,這是一款可生成同步對白與音效的影片生成模型。材料並指出,Sora 產品已不再提供。

    推薦理由:這則材料同時交代 Sora 2 的同步對白與音效生成能力,以及 Sora 產品已不再提供的狀態,讓讀者掌握模型能力介紹與產品供應情況。

  2. OpenAI News66

    OpenAI 發佈 Sora 2 系統卡,介紹影片及音訊生成模型

    OpenAI 發佈 Sora 2 系統卡,介紹這款基於 Sora 的影片與音訊生成模型。Sora 2 加入過往影片模型較難實現的能力,包括更準確的物理表現、更清晰的寫實效果、同步音訊、更強的可控性及更廣的風格範圍。

    推薦理由:Sora 2 系統卡將其能力置於既有影片模型的比較脈絡中,並列出物理表現、同步音訊與風格範圍等變化。

9月29日週一
9月22日週一
9月15日週一
  1. OpenAI News63

    OpenAI 在 GPT-5 系統卡補充説明中介紹 GPT-5-Codex

    OpenAI 在 GPT-5 系統卡補充説明中介紹 GPT-5-Codex,這是針對 Codex 中 AI 智能體編碼進一步優化的 GPT-5 版本。它會按任務複雜度動態調整思考投入,簡單對話查詢或小任務回應較快,複雜任務則獨立工作更長時間。

    推薦理由:補充説明交代 GPT-5-Codex 面向 Codex 中的 AI 智能體編碼,並説明它如何按任務複雜度調整思考投入。

9月12日週五
9月9日週二
9月4日週四
  1. Hugging Face Blog67

    Google 發佈 EmbeddingGemma 多語言嵌入模型

    Google 發佈 EmbeddingGemma,一款支援 100 多種語言、具備 308M parameters 和 2K context window 的多語言嵌入模型。文章示範以 Sentence Transformers、LangChain 等工具接入模型,並在 MIRIAD 醫療檢索測試中將微調版的 NDCG@10 提升至 0.8862,基礎模型為 0.8340。

    推薦理由:文章提供 EmbeddingGemma 接入多個檢索框架的程式示例,並説明查詢與文件提示詞的設定方式,方便將模型納入既有檢索流程。

8月28日週四
  1. OpenAI News76

    OpenAI 發佈 gpt-realtime 語音對語音模型並更新 Realtime API

    OpenAI 發佈更先進的語音對語音模型 gpt-realtime,並為 Realtime API 加入新 API 能力。更新包括 MCP server 支援、圖像輸入及 SIP 電話呼叫支援。

    推薦理由:公告同時列出語音對語音模型與 Realtime API 的更新,並點明 MCP server、圖像輸入及 SIP 電話呼叫支援,方便掌握本次功能範圍。