Google DeepMind 推出 Gemini Omni 1.1 Flash,新增影片生成控制並支援最高 4K 輸出
Google DeepMind 推出 Gemini Omni 1.1 Flash,為影片生成加入場景延伸、首尾幀控制、影片參考輸入及 1080p 或 4K 輸出。
推薦理由:場景延伸可分析最多10秒的既有影片,並以10秒增量延長至累計40秒;配合首尾幀指定,呈現更長影片創作中的控制方式。
AI 產品與應用的功能上新、改版與商業化動態——誰家的產品變強了、變貴了、能用了。
Google DeepMind 推出 Gemini Omni 1.1 Flash,為影片生成加入場景延伸、首尾幀控制、影片參考輸入及 1080p 或 4K 輸出。
推薦理由:場景延伸可分析最多10秒的既有影片,並以10秒增量延長至累計40秒;配合首尾幀指定,呈現更長影片創作中的控制方式。
Mistral 推出 Agentic Search,讓模型透過多步檢索搜尋、查看、導覽及核實複雜文件中的資料。在 FinanceBench 金融文件測試中,正確率由 26.7% 升至 86%;OfficeQA Pro 表格密集的多文件問題則由 6.3% 升至 51.9%。
推薦理由:FinanceBench 和 OfficeQA Pro 的基準數據呈現 Agentic Search 相較單次 RAG 的準確率提升,也量化延遲與 token 使用量變化。
Replit 透過由 GPT-5.6 Luna 驅動的 Free Mode 擴大軟件創作入口。Free Mode 讓任何人把想法轉化為可運作的軟件,並稱毋須擔心 token 費用。
OpenAI 開始在 ChatGPT 測試廣告,以支持免費使用。測試安排包括清晰標示廣告、維持答案獨立、提供強力私隱保障,並保留用户控制。
推薦理由:材料列出 OpenAI 測試 ChatGPT 廣告時的設計邊界,包括清晰標示、答案獨立、私隱保障及用户控制,呈現其支持免費使用時採取的安排。
OpenAI 向 100,000 名學術研究人員免費提供 ChatGPT 最先進 AI 模型的使用權,以加速科學研究、協作與發現。
推薦理由:免費使用權涵蓋 100,000 名學術研究人員,讓讀者可把握這項科研支持安排所面向的羣體與規模。
OpenAI 推出 ChatGPT 的 Health 功能,讓符合資格的美國用户安全連接醫療紀錄和 Apple Health。用户可藉此獲取更個人化的洞察,並更瞭解自身健康。
推薦理由:材料交代了 Health 的適用對象、可連接的健康資料來源及預期用途,便於瞭解這項功能的使用範圍。
Diffusers 現已原生支援 Nunchaku Lite 的 4-bit 擴散模型推理,預量化檢查點可用 `from_pretrained()` 載入,無須獨立推理引擎或本機編譯 CUDA。
推薦理由:文章説明 Nunchaku Lite 在 Diffusers 的原生載入方式,並以 RTX PRO 6000 基準量化呈現延遲與顯存變化。
Pollen Robotics 發佈開源、低成本的 Grabette 手持式系統,可記錄人工操作示範並轉成機械人訓練數據集。裝置配備兩部攝影機,瀏覽器處理流程透過 RTAB-MAP 執行 SLAM,並輸出 LeRobot 格式數據;Grabette 的物料清單成本約 490€。
推薦理由:Grabette 把手持式示範、SLAM 軌跡處理與 LeRobot 數據集串成採集流程,並以 200 段示範呈現訓練及機械臂評估的端到端用法。
Hugging Face 更新 vLLM 的 Transformers 建模後端,令多種相容 LLM 架構的推理吞吐量達到或超過 vLLM 手寫原生實作。測試涵蓋 Qwen3-4B 單 GPU、Qwen3-32B 張量並行,以及 Qwen3-235B-A22B-FP8 MoE 在同一 8×H100 節點上的數據並行與專家並行,三者均達到或超越原生實作吞吐量。
推薦理由:文章以三種不同規模及並行配置的 Qwen3 模型對照 vLLM 手寫實作,並説明 torch.fx 分析與運行時融合如何使相容模型達到原生推理速度。
Hugging Face 與 Microsoft 將每週更新的精選開放權重模型目錄加入 Microsoft Foundry Model Catalog,並可一鍵部署至 Foundry Managed Compute。
推薦理由:文章梳理模型篩選、權重預置和執行環境掃描的上架流程,説明企業如何在私有網絡內部署而毋須連出 Hugging Face Hub。
LeRobot v0.6.0 新增世界模型策略、統一六項模擬基準的 lerobot-eval,以及用於部署和收集人工修正資料的 lerobot-rollout CLI。
推薦理由:版本把策略部署、人工接管修正與資料回訓串成可重複流程,並以統一 CLI 整合六項模擬基準,呈現機械人學習由實作到評估的工作流。
Hugging Face Storage 現已成為 SkyPilot 的一級儲存後端,可透過 hf:// URL 將 Bucket 或 Hub 倉庫接入跨雲任務。
推薦理由:這項整合把模型與數據集的存放位置和 GPU 雲端選擇分開,並明確呈現讀取不收 egress 費與跨雲寫回仍需付費的成本差異。
Google Research 將建築物屋頂反射率數據集擴展至 9 個國家的 50+ 座城市,並透過新推出的 Heat Resilience Earth Engine App 開放使用。
推薦理由:數據細化至單棟建築並覆蓋 9 個國家的 50+ 座城市,讓城市規劃者可據此識別優先採用高反射屋頂的地點。
Google DeepMind 將 computer use 內建於 Gemini 3.5 Flash,讓開發者可構建能在瀏覽器、流動裝置及桌面環境操作的智能體。
推薦理由:從獨立提供的 Gemini 2.5 computer use 模型,到納入 Gemini 3.5 Flash 內建工具,這次更新呈現電腦操作能力的產品整合變化。
Mistral AI 為 Connectors 推出多項管理與安全功能,涵蓋工作區及組織層級的存取控制、具 connector scope 的 API keys、多帳户連接器,以及 MCP 連線除錯。
推薦理由:這次更新把企業連接器的權限、執行身份與故障定位納入同一套控制,呈現智能體投入組織日常工作所需的治理環節。
Hugging Face 推出 Discover Tool,作為 Agentic Resource Discovery(ARD)規範的參考實作,讓智能體可在執行時搜尋並發現能力。
推薦理由:ARD 把能力發現由預先安裝轉為跨登錄表搜尋,Hugging Face Discover 可按需求將 Space 呈現為技能或 MCP 伺服器。
Hugging Face 重建 hf CLI,讓它按使用情境為人類與 AI 智能體提供不同格式的輸出,並以可直接執行的提示引導後續操作。
推薦理由:Claude Code 與 Codex 參與 18 項 Hub 任務的多輪測試,文章並列成功率與 token 用量,呈現 hf CLI 相較 curl/Python SDK 在多步操作上的差異。
Google Research 將水文建模框架以 Apache 2.0 許可證開源,供研究人員及預報機構訓練 AI 洪水預報模型。這個 Python 套件以 PyTorch 實作河流預報模型,包含 LSTM 架構與使用 Caravan 歷史河流數據的訓練流程,並可加入本地數據訓練或微調。
推薦理由:CHMI 開發 adapter 將框架接入 Delft-FEWS,具體展示 AI 水文模型如何納入既有預報工作流,亦為其他機構提供整合參考。
OpenAI 宣佈,其前沿模型與 Codex 現已在 AWS 正式提供,為企業提供透過既有 AWS 環境使用 OpenAI 的途徑。企業可沿用熟悉的 AWS 控制措施及採購流程,並加快由評估走向生產。
推薦理由:這項可用性變化讓企業沿用既有 AWS 環境、控制措施及採購流程接入 OpenAI,並加快由評估推進至生產。
Mistral AI 推出 Vibe,將長流程工作任務與程式開發整合至同一個 AI 智能體。Work Mode 可跨企業工具處理知識搜尋、資料分析、文件撰寫及排程任務;Code Mode 支援網頁端遠端編碼,並推出 VS Code 擴充功能及更新 Vibe CLI。
推薦理由:Vibe 將企業知識檢索、多步工作流程與程式碼任務收進同一智能體,並展示可檢視執行過程及設定權限的工作方式。