跳到正文

模型發佈

新模型的發佈、開源與迭代:大模型廠商的旗艦更新、開源權重放出、性能與價格變化的第一時間記錄。

194條精選相關主題產品更新論文研究開源生態

最新精選

第 81–100 條 · 共 194 條
11月19日週三
  1. Google Research75

    Google Research 介紹即時語音到語音翻譯模型,標準延遲為 2 秒

    Google Research 介紹端到端即時語音到語音翻譯模型,以原説話者聲線輸出譯音,標準延遲為 2 秒。模型採用串流架構及時間同步訓練資料,支援英語與西班牙語、德語、法語、意大利語、葡萄牙語之間的雙向翻譯。相關功能已在 Google Meet 伺服器端提供,並作為 Pixel 10 的內置裝置端功能推出;Pixel Voice Translate 採用級聯式流程以擴大語言覆蓋。

    推薦理由:文章説明串流架構如何配合時間同步訓練資料,把語音互譯的標準延遲控制在 2 秒,並以原説話者聲線輸出譯音,可瞭解低延遲與個人化如何結合。

11月17日週一
  1. Google DeepMind72

    Google DeepMind 與 Google Research 發佈 WeatherNext 2 天氣預測模型

    Google DeepMind 與 Google Research 發佈 WeatherNext 2,預報生成速度快 8 倍,並提供細至每小時解析度的全球天氣預測。

    推薦理由:WeatherNext 2 與前代 WeatherNext 的比較覆蓋 0–15 天內 99.9% 的變量與預報時效,並列出單顆 TPU 每項預測少於一分鐘的耗時,便於同時衡量預報表現與計算效率。

11月13日週四
  1. Google DeepMind66

    Google DeepMind 推出 SIMA 2:能在虛擬 3D 世界中遊玩、推理並與你一同學習的智能體

    Google DeepMind 推出研究智能體 SIMA 2,將 Gemini 推理能力整合至虛擬 3D 遊戲,使其能理解目標、規劃行動並與用户對話。它能將在不同遊戲中學到的概念遷移,也可透過試錯及 Gemini 回饋利用自身經驗繼續訓練,並在 Genie 3 生成的新世界中嘗試執行任務。

    推薦理由:SIMA 2 結合 Gemini 推理、跨遊戲技能遷移與自生成經驗訓練,並交代長程任務、記憶和精細鍵盤滑鼠操作的限制。

11月12日週三
  1. OpenAI News67

    GPT-5.1:更聰明、對話感更強的 ChatGPT

    OpenAI 正在升級 GPT-5 系列,以更温暖、能力更強的模型和新增的 ChatGPT 語氣、風格自訂方式推出 GPT-5.1。GPT-5.1 今天開始向付費用户逐步推出。

    推薦理由:GPT-5.1 更新同時涵蓋模型能力與 ChatGPT 語氣、風格自訂,並交代先向付費用户推出,便於把握其功能變化和開放範圍。

10月1日週三
  1. Sam Altman:Blog84

    Sora App 推出,結合新模型 Sora 2,支援創作、分享和觀看影片

    Sam Altman 宣佈推出 Sora App,結合新模型 Sora 2,並提供影片創作、分享和觀看功能。Cameo 功能可讓用户把自己和朋友加入影片,團隊為角色一致性投入大量工作。產品設有防止深偽肖像濫用、處理令人不安或違法內容的措施,並會定期檢視 Sora 對用户情緒和身心狀況的影響;作者亦提出長期用户滿意度、用户控制動態及優先創作等原則。

    推薦理由:文章列出 Sora 在用户滿意度、動態控制和創作方面的原則,並交代深偽肖像濫用防護及定期檢視用户身心狀況的安排。

9月30日週二
  1. OpenAI News67

    OpenAI 發佈 Sora 2 影片生成模型

    OpenAI 推出 Sora 2,這是一款可生成同步對白與音效的影片生成模型。材料並指出,Sora 產品已不再提供。

    推薦理由:這則材料同時交代 Sora 2 的同步對白與音效生成能力,以及 Sora 產品已不再提供的狀態,讓讀者掌握模型能力介紹與產品供應情況。

  2. OpenAI News66

    OpenAI 發佈 Sora 2 系統卡,介紹影片及音訊生成模型

    OpenAI 發佈 Sora 2 系統卡,介紹這款基於 Sora 的影片與音訊生成模型。Sora 2 加入過往影片模型較難實現的能力,包括更準確的物理表現、更清晰的寫實效果、同步音訊、更強的可控性及更廣的風格範圍。

    推薦理由:Sora 2 系統卡將其能力置於既有影片模型的比較脈絡中,並列出物理表現、同步音訊與風格範圍等變化。

9月15日週一
  1. OpenAI News63

    OpenAI 在 GPT-5 系統卡補充説明中介紹 GPT-5-Codex

    OpenAI 在 GPT-5 系統卡補充説明中介紹 GPT-5-Codex,這是針對 Codex 中 AI 智能體編碼進一步優化的 GPT-5 版本。它會按任務複雜度動態調整思考投入,簡單對話查詢或小任務回應較快,複雜任務則獨立工作更長時間。

    推薦理由:補充説明交代 GPT-5-Codex 面向 Codex 中的 AI 智能體編碼,並説明它如何按任務複雜度調整思考投入。

9月9日週二
9月4日週四
  1. Hugging Face Blog67

    Google 發佈 EmbeddingGemma 多語言嵌入模型

    Google 發佈 EmbeddingGemma,一款支援 100 多種語言、具備 308M parameters 和 2K context window 的多語言嵌入模型。文章示範以 Sentence Transformers、LangChain 等工具接入模型,並在 MIRIAD 醫療檢索測試中將微調版的 NDCG@10 提升至 0.8862,基礎模型為 0.8340。

    推薦理由:文章提供 EmbeddingGemma 接入多個檢索框架的程式示例,並説明查詢與文件提示詞的設定方式,方便將模型納入既有檢索流程。

8月28日週四
  1. OpenAI News76

    OpenAI 發佈 gpt-realtime 語音對語音模型並更新 Realtime API

    OpenAI 發佈更先進的語音對語音模型 gpt-realtime,並為 Realtime API 加入新 API 能力。更新包括 MCP server 支援、圖像輸入及 SIP 電話呼叫支援。

    推薦理由:公告同時列出語音對語音模型與 Realtime API 的更新,並點明 MCP server、圖像輸入及 SIP 電話呼叫支援,方便掌握本次功能範圍。

8月7日週四
  1. OpenAI News75

    OpenAI 介紹 GPT-5,稱其為迄今最佳 AI 系統

    OpenAI 介紹 GPT-5,稱其為迄今最佳 AI 系統,並指其智能較此前所有模型有顯著提升。GPT-5 在編碼、數學、寫作、健康及視覺感知等方面均達到最先進水平。

    推薦理由:原文以此前模型作比較,並列出編碼、數學、寫作、健康及視覺感知等表現領域,讓讀者掌握 GPT-5 公佈的能力範圍。

8月5日週二
  1. OpenAI News76

    OpenAI 發佈迄今能力最強的開放權重模型

    OpenAI 今日發佈其迄今能力最強的開放權重模型,稱這是讓先進 AI 在全球更開放、靈活且更容易取得的重要一步。該公司表示,其使命是讓盡可能多人都能使用 AI;AI 的下一個前沿不只關乎能力,也關乎誰能使用它。

  2. Hugging Face Blog91

    OpenAI 發佈開源 GPT OSS 模型系列

    OpenAI 發佈 GPT OSS 開源模型系列,包含 117B 參數的 gpt-oss-120b 和 21B 參數的 gpt-oss-20b。兩款均為 MoE 推理模型,採用 MXFP4 4-bit 量化;gpt-oss-120b 可在單張 80 GB GPU 運行,gpt-oss-20b 可在 16GB 記憶體內運行。

    推薦理由:文章將兩款模型的量化方式、硬件需求與多種部署路徑整理在一起,便於評估本地推理的資源門檻及接入方式。

  3. OpenAI News84

    OpenAI 發佈 gpt-oss-120b 和 gpt-oss-20b 兩款開放權重語言模型

    OpenAI 發佈 gpt-oss-120b 和 gpt-oss-20b 兩款低成本開放權重語言模型,採用 Apache 2.0 授權。它們在推理任務上優於規模相近的開放模型,並具備良好工具使用能力,亦針對消費級硬件高效部署作最佳化。

    推薦理由:推理表現、工具使用能力與消費級硬件部署資訊一併呈現,便於從能力和部署兩方面理解兩款開放權重模型的取向。