Mistral AI 發佈 Mistral Large 4 公開預覽版,權重月底開放,並稱其為歐美最強開源模型
Mistral AI 發佈 Mistral Large 4(ML4)公開預覽版,用戶即日起可在 Mistral Studio 體驗預覽版 API,模型權重將於月底開放下載。
Mistral AI 發佈 Mistral Large 4(ML4)公開預覽版,用戶即日起可在 Mistral Studio 體驗預覽版 API,模型權重將於月底開放下載。
ElevenLabs 推出 Scribe v2,面向大規模批量轉錄、字幕製作及字幕生成,並提升對長篇、複雜錄音的處理穩定性與準確度。Scribe v2 在業界標準基準測試中錄得最低詞錯誤率,支援最多 100 個詞語或短語的關鍵詞提示,以及涵蓋最多 56 個類別、附精確時間戳的實體偵測。
Prime Intellect 啟動 INTELLECT-2,展開 32B 參數模型的全球分散式強化學習訓練,並開放任何人無需許可地貢獻異構算力。訓練以 QwQ-32B 為基礎,採用 DeepSeek-R1 的 GRPO 方法,聚焦可驗證的數學與編碼任務,並以系統提示詞設定思考 token 預算。
Cohere 發佈 Embed 5 嵌入模型系列,分為面向最高檢索品質的 Pro 和麪向低延遲、高流量工作的 Fast,兩款均支援多模態輸入、100+ 種語言及 128K-token 上下文窗口。
Cloudflare 發佈 Clef 和 Clef-flash 兩款面向 AI 智能體的決策模型,可對輸入同時回答多個預設問題並輸出各選項的概率,供下游程式路由、升級或轉交人工。
Google DeepMind 推出 Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS,支援自訂聲線、逐句控制表演及雙人對話生成。
推薦理由:兩款 TTS 模型涵蓋逐句演繹與長篇生成,Flash TTS 另可自訂聲線;聲音複製設有同意驗證,生成音訊加入 SynthID 水印,呈現創作控制與防護安排。
Midjourney 已更新 V8.2 編輯模型,以改善圖像品質。過去 24 小時如曾遇到問題,請再次試用並繼續提供意見。更多更新即將推出。
FireRedTeam 發佈 FireRedASR2S,整合語音辨識、語音活動檢測、語言識別和標點預測四個模組。FireRedASR2-LLM 在 4 個普通話測試集的平均 CER 為 2.89%,在 19 個方言及口音測試集為 11.55%。
OpenAI 將於 2026 年 2 月 13 日在 ChatGPT 退役 GPT-4o、GPT-4.1、GPT-4.1 mini 和 OpenAI o4-mini。這項安排與此前已宣佈的 GPT-5(Instant、Thinking 和 Pro)退役同步;API 目前沒有變更。
FireRedTeam 為 FireRedTTS-2 發佈完整微調程式碼及教學,示例以 LJSpeech 數據集為基礎。團隊表示,該系統支援多語言和零樣本聲音克隆,使用對話數據微調可生成與示範相若的播客內容。
OpenAI 介紹 API 新一代音訊模型,文字轉語音模型可按開發者指示採用特定説話方式。例如,開發者可要求模型「像富有同理心的客服智能體那樣説話」,為語音智能體提供更多自訂空間。
推薦理由:開發者可用指示控制文字轉語音模型的説話方式,例如採用富有同理心的客服智能體語氣,讓語音智能體的表達方式有更多自訂空間。
Mistral AI 推出 Mistral OCR 文件理解 API,可解析圖片與 PDF,並抽取文字、圖像、表格及公式。API mistral-ocr-latest 已在 la Plateforme 開放,每美元可處理 1000 頁,批次推理下每美元可處理頁數約增至兩倍;Mistral OCR 亦可在 le Chat 免費試用。
推薦理由:Mistral OCR 可解析 PDF、圖片中的表格與公式,並支援 JSON 輸出,展示文件接入 RAG 與 Agent 工作流的實際做法。
OpenAI 開發的 Dota 2 機械人在遵循標準賽事規則的 1v1 對局中擊敗世界頂尖職業選手。機械人從零開始透過自我對弈學習,沒有使用模仿學習或樹搜索。OpenAI 將此視為朝建立能在涉及真實人類的混亂複雜情境中完成明確目標的 AI 系統邁出的一步。
推薦理由:這則公告同時交代對局成果與訓練方式,呈現自我對弈在規則明確、局勢複雜且有人類參與的遊戲環境中的應用。