跳到正文

全部動態

今日 82 條
5月16日週六
5月15日週五
  1. Hugging Face Blog63

    Granite Embedding Multilingual R2 發佈兩款 Apache 2.0 多語嵌入模型,支援 32K 上下文

    IBM Granite 發佈兩款採 Apache 2.0 授權的多語嵌入模型:97M 參數的 granite-embedding-97m-multilingual-r2 和 311M 參數的 granite-embedding-311m-multilingual-r2。

    推薦理由:文章提供 97M 與 311M 版本在多語檢索、長文及程式碼基準的比較,並交代 Matryoshka 維度選項對儲存與部署取捨的影響。

5月7日週四
5月5日週二
4月30日週四
4月28日週二
  1. Hugging Face Blog72

    NVIDIA 發佈 Nemotron 3 Nano Omni 長上下文多模態模型,面向文件分析、音訊與影片理解及智能體電腦操作

    NVIDIA 發佈 Nemotron 3 Nano Omni,這款長上下文多模態模型面向文件分析、音訊與影片理解、智能體電腦操作及通用推理。

    推薦理由:文章並列 Nemotron 3 Nano Omni、Nemotron Nano V2 VL 與 Qwen3-Omni 的多項基準結果,另列系統效率數據,提供文件、影音和 GUI 任務的比較依據。

4月24日週五
4月23日週四
4月22日週三
4月16日週四
  1. Google DeepMind68

    Google DeepMind 發佈 Gemini 3.1 Flash TTS,加入音訊標籤細調語音表現

    Google DeepMind 發佈 Gemini 3.1 Flash TTS,提升文字轉語音的可控性、表現力與品質,並加入音訊標籤細調語音表現。模型支援 70+ 種語言及原生多説話者對話,在 Artificial Analysis TTS leaderboard 的 Elo 分數為 1,211。

    推薦理由:文章聚焦音訊標籤如何細調語氣、節奏與表達,並列出 Gemini 3.1 Flash TTS 面向開發者、企業及 Workspace 用户的推出渠道。

4月14日週二
4月13日週一
4月9日週四
  1. Hugging Face Blog61

    Waypoint-1.5 提升互動世界保真度並擴展本地硬件支援

    Overworld 推出 Waypoint-1.5 即時影片世界模型,提升視覺保真度並擴大可本地運行的硬件範圍。桌面硬件 RTX 3090 至 5090 可生成最高 720p、60 FPS 的即時環境;另有面向更廣泛消費級硬件(包括遊戲筆電)的 360p 版本,Apple Silicon Mac 支援即將推出。

    推薦理由:Waypoint-1.5 分設 720p 與 360p 檔位,並列明 RTX 3090 至 5090 可達最高 720p、60 FPS,呈現其畫質與本地硬件覆蓋方案。

4月4日週六
  1. FireRedTeam:原創語音與多模態項目59

    FireRedTeam 發佈 FireRed-Image-Edit-1.1,優化人像一致性等編輯能力

    FireRedTeam 發佈 FireRed-Image-Edit-1.1,基於 FireRed-Image-Edit-1.0,優化人像一致性、多元素融合、風格化文字參照及人像妝效。內置 Agent 可自動處理超過 3 張輸入圖片的區域偵測、裁切拼接及提示詞改寫。項目提供的加速推理配置標示使用 30GB VRAM,生成約 4.5s/sample。

4月3日週五
4月2日週四
  1. Hugging Face Blog85

    Google DeepMind 發佈 Gemma 4 多模態模型系列,五種尺寸登陸 Hugging Face

    Google DeepMind 的 Gemma 4 多模態模型系列已登陸 Hugging Face,提供五種尺寸,支援圖像、文字及部分型號的音訊輸入。模型採 Apache 2 授權,最大上下文窗口為 256K;31B 和 26B A4B 的 text-only LMArena 估算分數分別為 1452 和 1441,後者有 4B 啟用參數。

    推薦理由:文章列出五種 Gemma 4 規格、上下文窗口和音訊支援差異,並整理多個推理與微調框架的接入方式,可供比較型號特點及部署路徑。

3月31日週二
3月26日週四
  1. Google DeepMind73

    Google DeepMind 推出 Gemini 3.1 Flash Live,提升語音 AI 的自然度與可靠性

    Google DeepMind 推出 Gemini 3.1 Flash Live,提升即時語音對話的精準度並降低延遲。它在 ComplexFuncBench Audio 得分 90.8%,在 Scale AI 的 Audio MultiChallenge 開啟 thinking 時得分 36.1%。

    推薦理由:原文以兩項語音基準呈現多步函數調用與複雜指令跟隨表現,並列出開發者、企業及一般用户的使用入口,可對照其能力與部署場景。

3月24日週二
  1. Mistral AI66

    Mistral AI 發佈 4B 參數語音生成模型 Voxtral TTS

    Mistral AI 發佈 4B 參數的 Voxtral TTS,支援 9 種語言語音生成。在典型的 10 秒語音樣本和 500 characters 輸入下,模型延遲為 70ms;人評顯示其自然度高於 ElevenLabs Flash v2.5,TTFA 相近。

    推薦理由:原文以人評比較 Voxtral TTS 與 ElevenLabs Flash v2.5 的自然度和 TTFA,並列出模型延遲及 API 定價,提供評估語音智能體應用的具體依據。

3月17日週二
3月6日週五
3月5日週四
3月4日週三
  1. Google DeepMind71

    Gemini 3.1 Flash-Lite 為大規模開發者工作負載而設

    Google DeepMind 推出 Gemini 3.1 Flash-Lite,現正以預覽版向開發者及企業開放,開發者可透過 Google AI Studio 的 Gemini API 使用,企業則可透過 Vertex AI 使用。

    推薦理由:文章把 Gemini 3.1 Flash-Lite 的定價、相較 2.5 Flash 的速度數據及質素描述並列,呈現其面向高頻工作負載的成本定位。

2月27日週五
  1. Google DeepMind76

    Google DeepMind 發佈 Nano Banana 2(Gemini 3.1 Flash Image),融合 Pro 能力與 Flash 速度

    Google DeepMind 發佈圖像生成模型 Nano Banana 2(Gemini 3.1 Flash Image),以 Flash 速度帶來 Nano Banana Pro 的世界知識、品質與推理能力。

    推薦理由:Nano Banana 2 將 Nano Banana Pro 的世界知識、視覺品質與創作控制帶到 Flash 速度,並交代其在 Google 產品中的推出範圍及 Nano Banana Pro 的保留使用方式,説明兩款模型面向的工作流程差異。

2月24日週二
2月20日週五
  1. Google DeepMind77

    Gemini 3.1 Pro:面向最複雜任務的更智能模型

    Google DeepMind 發佈 Gemini 3.1 Pro,作為 Gemini 3 系列核心模型升級,提升複雜問題的推理能力。它在 ARC-AGI-2 取得經驗證的 77.1% 得分,推理表現超過 Gemini 3 Pro 兩倍。

    推薦理由:Gemini 3.1 Pro 在 ARC-AGI-2 取得經驗證的 77.1% 得分,並稱推理表現超過 Gemini 3 Pro 兩倍,為核心推理升級提供量化比較依據。

2月13日週五
2月12日週四
  1. OpenAI News67

    OpenAI 發佈 GPT-5.3-Codex-Spark 即時編碼模型

    OpenAI 發佈 GPT-5.3-Codex-Spark,並稱其為首個即時編碼模型,生成速度快 15x,具備 128k 上下文窗口。目前以研究預覽形式向 ChatGPT Pro 用户提供。

    推薦理由:公告列出生成速度、上下文窗口及研究預覽的適用對象,讓讀者可同時瞭解 GPT-5.3-Codex-Spark 的性能宣稱與目前開放範圍。

2月5日週四
1月29日週四
1月20日週二
  1. Hugging Face Blog67

    Overworld 推出 Waypoint-1 即時互動影片擴散模型

    Overworld 發佈 Waypoint-1,這款即時互動影片擴散模型可透過文字、滑鼠和鍵盤控制,並按控制輸入逐影格生成。模型以 10,000 小時配有控制輸入及文字描述的多樣化遊戲影片訓練,並以 self-forcing 後訓練,令訓練更貼近逐影格推理。

    推薦理由:Waypoint-1 從訓練之初便以互動體驗為目標,與常見的先用預訓練影片模型、再微調簡化控制輸入的做法形成對照。

1月16日週五
  1. Google DeepMind47

    D4RT:教 AI 看見四維世界

    Google DeepMind 推出 D4RT,這是一個統一的 AI 模型,可重建並追蹤跨越空間與時間的 4D 場景。測試中,D4RT 比此前方法快 18x 至 300x;在單顆 TPU 上,約 5 秒即可處理 1 分鐘影片,而舊方法最多需 10 分鐘。其查詢式 Transformer 架構支援點追蹤、點雲重建及相機姿態估計,應用方向包括機械人、擴增實境與世界模型。