inclusionAI 發佈 Ming-Image-0.1-Design 6B 文生圖模型
inclusionAI 發佈 Ming-Image-0.1-Design,這款 6B 文生圖模型面向 UI、資訊圖表、海報等文字密集的視覺設計。模型可生成完整視覺構圖並支援透明背景 RGBA 輸出,建議解像度為 2048 x 2048,或採用 1024 x 1024 加快生成。建議採樣步數為 12,驗證配置為一張配備 80 GiB VRAM 的 CUDA GPU,授權為 MIT License。
inclusionAI 發佈 Ming-Image-0.1-Design,這款 6B 文生圖模型面向 UI、資訊圖表、海報等文字密集的視覺設計。模型可生成完整視覺構圖並支援透明背景 RGBA 輸出,建議解像度為 2048 x 2048,或採用 1024 x 1024 加快生成。建議採樣步數為 12,驗證配置為一張配備 80 GiB VRAM 的 CUDA GPU,授權為 MIT License。
inclusionAI 發佈 Realtime-Venus 全雙工互動系統,提供視聽版 Realtime-Venus-Omni 與音訊版 Realtime-Venus-Audio,兩者均為 9B。
Google DeepMind 發佈 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking,前者面向規模化與成本效率,後者針對高複雜度任務。
推薦理由:文章區分兩款模型在規模化成本效率與高複雜度任務上的定位,並列出語音代理基準成績,方便比較其應用取向。
Epoch AI 的 ECI 比較顯示,GPT-6 Astra 在數學基準測試領先,但未在軟件工程領先。比較涵蓋 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Kimi K3,並以數學及軟件工程專項 ECI 評估模型能力;專項分數可與一般 ECI 比較。
OpenMOSS 開源 MOSS-Transcribe-Diarize 0.9B,這款端到端音訊理解模型可在單次處理中完成長篇多説話人音訊轉寫、説話人分離及時間戳標註。模型支援 50+ 種語言,亦可選擇輸出聲學事件標註。整體表現更高的 MOSS-Transcribe-Diarize Pro 可透過線上 playground 使用。
inclusionAI 發佈 SingProbe 串流護欄探針,以 Qwen/Qwen3.5-397B-A17B 的生成隱藏狀態逐 token 評估意圖、安全性及幻覺風險。
inclusionAI 發佈 SingProbe,這是一款基於 Qwen/Qwen3.5-27B 的逐 token 串流防護探針,可評分查詢意圖、回應不安全性及幻覺風險。
inclusionAI 發佈 SingProbe 串流安全探針,基於 Qwen/Qwen3-4B-Instruct-2507 逐 token 評估查詢意圖、回應不安全性及幻覺風險。
inclusionAI 發佈基於 Qwen/Qwen3-0.6B 的 SingProbe,利用生成時隱藏狀態逐 token 評估查詢意圖、回應安全性及幻覺風險。
inclusionAI 發佈 Hy3-singprobe,這款基於 tencent/Hy3 隱藏狀態的串流防護探針可逐 token 評分查詢意圖、回應安全性及幻覺風險。
inclusionAI 發佈 SingProbe 串流安全探針,重用 openai/gpt-oss-20b 生成時的隱藏狀態,逐 token 評估查詢意圖、回應不安全性及幻覺風險。
inclusionAI 發佈基於 google/gemma-4-31B-it 的 SingProbe 串流護欄。它復用基座模型生成時的隱藏狀態,逐 token 評估查詢意圖、回應安全性和幻覺風險,無需另跑安全模型。
AGIBOT 發佈 GE-Act 2.0 原生世界-動作模型,並以零樣本測試報告訓練數據擴大時既有技能表現提升、新能力逐步出現。
IBM 與 NASA 開源 NASA-IBM Lunar Foundation Model,整合數十年美國及日本月球任務的多模態觀測資料。在冰區識別中,模型的錯誤率比用於冰區探測的 SwinV2 降低 22%;在 100 米/像素撞擊坑檢測中,較以撞擊坑檢測訓練的 Swin 模型高近 19%,並使用一半訓練資料。
DeepSeek-V4.1-Flash 正式發佈,是 DeepSeek 新架構系列中最小的模型,並支援原生多模態視覺理解。
OpenAI 介紹 GPT-6 Astra,稱其為面向商業用途能力最強的模型。它具備進階推理、電腦操作能力,以及更強的寫作與設計判斷能力。
FireRedTeam 公開 FireRedTTS3 語音生成與編輯系統,並提供 FireRedTTS3-Base 和 FireRedTTS3-Instruct 兩個版本的模型與 PyTorch 程式碼。
FireRedTeam 發佈 FireRedAudio,一款以共用 9B 參數 LLM 為基礎、涵蓋音訊理解與語音生成的音訊語言模型。Audio Encoder 負責理解、RedAE pathway 負責生成;模型支援 ASR、音訊理解、零樣本及指令式 TTS、語音編輯,並可處理最長一小時的錄音。除 ASR 外,其他功能只支援中文和英文。
OpenMOSS 團隊與 MOSI.AI 發佈開源語音生成模型 MOSS-TTS-Nano,參數量為 0.1B,支援 20 種語言。模型提供聲音複製和串流生成,並採用 Audio Tokenizer + LLM 純自回歸架構。ONNX CPU 版本在團隊測試中處理效率接近原版的 2 倍,並可在 MacBook Air M4 單核流暢運行。
OpenMOSS 團隊開源 MOSS-Audio,推出 4B、8B 的 Instruct 和 Thinking 版本。模型支援語音、環境音及音樂理解、音訊描述、時間感知問答與複雜推理,並採用跨層特徵注入和時間標記設計。在 MMAU、MMAU-Pro、MMAR 和 MMSU 四項通用音訊理解基準中,MOSS-Audio-8B-Thinking 的平均準確率為 71.08。
Google DeepMind 與 Google Research 發佈 WeatherNext 3,利用即時地球同步衞星資料逐小時生成全球天氣預報,部分地表變數解析度達 5 公里。
推薦理由:WeatherNext 3 以即時衞星觀測支援逐小時全球預報,並為部分變數提供 5 公里解析度;文中列出降水預測相對 IMERG、MRMS 等基線的 CRPS 改善幅度。
NeoMME 推出 260M 和 800M 兩種規模的多語言多模態編碼器,並提供用於視覺文件檢索的 NeoMME-Retriever。模型從零開始以單一雙向 Transformer 處理文字 token 和原始圖像 patch;NeoMME-Retriever 單次前向傳播可輸出密集與 late-interaction 嵌入向量。
Playco 使用 GPT-6 Astra,從同一個灰盒基礎構建三款主題遊戲原型,手動修正次數較前一模型減少 50%。
OpenAI 推出 GPT-6 Astra,稱其為迄今最智能、最符合對齊要求的模型。OpenAI 表示,模型在電腦操作、編碼、網絡安全及科學領域具備最先進能力。
ARC Prize 評測顯示,OpenAI GPT-6 Astra 在 ARC-AGI-3 Semi-Private 的 Standard harness 得分為 62.7%,Provider Adapter harness 的最高分為 99.9%。
OpenAI 的 GPT-6 Astra 系統卡公佈模型安全與能力評估,將其生物與化學能力列為 High,並指出尚未達到 Critical。明確要求模型規避監測時,Astra 在 WMDP 的 CoT 監測召回率低於 11%,GPT-5.6 Sol 則接近 100%;在 Monorepo-Bench 中,Astra 的召回率降至零。
OpenAI 的 GPT-6 Astra 安全概覽指出,該模型是其目前廣泛部署中能力最強的模型。它也是首個在 Preparedness Framework 下達到網絡安全能力 Critical 級別的模型。
推薦理由:這段安全概覽同時交代 GPT-6 Astra 的部署定位與網絡安全能力級別,可供讀者把模型能力描述放回 Preparedness Framework 的評估框架理解。
Google DeepMind 發佈 Gemini 3.8 Flash 與 Gemini 3.8 Flash Cyber,並稱 Gemini 3.8 Flash 是其迄今推理與編碼能力最強的模型,速度和成本與 3.7 Flash 相同。
推薦理由:兩款模型共享基礎智能,普通版面向長程編碼與智能體任務,Cyber 版則限可信防守者使用,提供漏洞發現與修補能力。
Intern Lumina U2 推理代碼已公開,Ascend 訓練權重已上架 Hugging Face;NVIDIA 權重、訓練代碼與技術報告將後續推出。模型為 16B-A1B MoE,採用基於 AToken 的 8-codebook 視覺表示,支援文字問答、文生圖、圖像編輯及圖像、影片和 3D 理解。
Google Research 發佈 TimesFM-3,一款原生支援多變量零樣本預測的時間序列基礎模型,可在單次前向傳播中預測多條相關序列。它有 330 million parameters,使用超過 1 trillion time points 的真實及合成時間序列資料預訓練,並能結合多個目標、歷史協變量和已知未來協變量,無需任務專用微調。
Microsoft Research 公開 GigaPath-Flash 與 GigaTIME-Flash 兩款開放權重病理基礎模型,以降低大規模病理研究的計算成本。
Midjourney 已更新 V8.2 編輯模型,以改善圖像品質。過去 24 小時如曾遇到問題,請再次試用並繼續提供意見。更多更新即將推出。
Midjourney 開放所有用戶測試首個 V8.2 圖像編輯模型,支援按指令編輯圖片,以及最多同時使用 4 張參考圖生成圖片。模型亦可修改圖片指定區域、擴展畫布,並支援 personalization、moodboards 和 srefs。
Google DeepMind 發佈 Gemini 3.5 Transcribe,這是一款面向智能語音互動的語音轉文字模型。它可透過 Live API 以低於一秒的延遲進行即時串流,亦可經 Interactions API 處理預錄音訊,提供説話者歸屬及逐字時間戳。
推薦理由:材料同時提供串流與非串流 WER,以及相較 Chirp 3 的最終轉錄時間改善幅度,讓準確度與延遲兩項表現有具體數據可供對照。
IBM Granite 團隊詳述 Granite 4.2 推理模型系列的構建流程,涵蓋架構、訓練方法及評測結果。該系列有 3B、8B、30B 三種稠密、僅解碼器模型,均由 Granite-4.1 base models 後訓練;後者以約 15T tokens 預訓練,並透過五階段策略將上下文窗口延至 512K tokens。
推薦理由:文中並列三種規模共用的訓練主線,以及 8B、30B 額外加入真實環境 Agentic RL 的分支,可據此理解各規模訓練階段和智能體能力培養的差異。
IBM 發佈 Granite 4.2 語言模型,提供 3B、8B 和 30B 參數版本,並加入原生逐步推理與工具調用能力,面向企業智能體工作流程。模型基於 Granite 4.0 foundation models,採多階段強化學習;8B 和 30B 版本另經 agentic RL,並以 1 trillion tokens 的合成程式碼訓練,採 Apache 2.0 授權。
DeepSeek 已在 DeepSeek API 平台提供實驗性多模態視覺理解模型 DeepSeek-V4-Flash-Vision-Exp,可透過 `model='deepseek-v4-flash-vision-exp'` 調用。
Google DeepMind 發佈 Gemini 3.7 Flash,稱其在編碼、知識工作及網頁開發工作流上較 Gemini 3.6 Flash 有所提升。
推薦理由:文章列出 Gemini 3.7 Flash 在編碼、網頁開發和複雜文件基準上的對比數據,並交代入門價格,便於衡量效能與成本取捨。
DeepSeek-V4-Pro GA 版本已在 APP、Web 和 API 上線,API 呼叫方式不變,將模型名稱設為 `deepseek-v4-pro` 即可使用最新版。
Google DeepMind 發佈 SL2T 多語言手語轉文字模型,為 Gboard 和 Live Transcribe 帶來手語轉文字功能,首階段支援 ASL 至英文。
推薦理由:SL2T 以簽署者的身體姿態座標直接翻譯成文字,原始影片會即時丟棄,呈現其輸入處理方式與私隱保護設計。