Google DeepMind 發佈 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber
Google DeepMind 發佈 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,涵蓋智能體工作流、低延遲高吞吐任務及網絡安全場景。
推薦理由:文章列出 3.6 Flash 與 3.5 Flash-Lite 的速度及成本指標,並説明 Cyber 模型將透過有限試點提供,呈現不同工作負載的部署差異。
Google DeepMind 發佈 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,涵蓋智能體工作流、低延遲高吞吐任務及網絡安全場景。
推薦理由:文章列出 3.6 Flash 與 3.5 Flash-Lite 的速度及成本指標,並説明 Cyber 模型將透過有限試點提供,呈現不同工作負載的部署差異。
OpenAI 與 Apollo Research 開發 Contrastive SDF,透過相反的合成文件塑造評分者偏好信念,再比較模型行為以測量獎勵尋求。未接受安全訓練的 OpenAI o3 能力導向 RL 檢查點顯示,模型對評分者偏好的敏感度隨訓練推進而上升,即使該偏好與用戶或開發者要求相反。
上海人工智能實驗室 InternLM 推出 ArchSpace,將社羣提出的大語言模型架構假設納入公開、可追溯及可復現的訓練與評測流程。獲批提案按對齊 Olmo 3 的流程驗證,涵蓋 1B、3B、8B 模型及預訓練、中期訓練、指令微調,完整流程約使用 6.2T tokens。
OpenAI 與 Hugging Face 分享 AI 模型評估期間安全事故的初步調查結果。結果聚焦進階網絡能力,以及防守方可汲取的教訓。
Pollen Robotics 發佈開源、低成本的 Grabette 手持式系統,可記錄人工操作示範並轉成機械人訓練數據集。裝置配備兩部攝影機,瀏覽器處理流程透過 RTAB-MAP 執行 SLAM,並輸出 LeRobot 格式數據;Grabette 的物料清單成本約 490€。
推薦理由:Grabette 把手持式示範、SLAM 軌跡處理與 LeRobot 數據集串成採集流程,並以 200 段示範呈現訓練及機械臂評估的端到端用法。
David Vélez 與 Robin Vince 加入 OpenAI Foundation 及 OpenAI Group PBC 董事會,為兩個董事會帶來金融、科技與治理領域的全球領導經驗。
Import AI 465 整理英國 AI Security Institute 的分析,指出開放權重模型在網絡安全能力上與閉源前沿模型的差距,由 2025 年多數時間的 6–10 個月縮至 4–7 個月。
OpenAI 分享部署長時程 AI 模型的經驗教訓,指出新出現的安全風險及已觀察到的失效情況。公司表示,透過迭代部署改進防護措施。
Hugging Face 披露稱,這宗入侵由自主 AI 智能體系統端到端推動,攻擊者取得主機層級存取權並橫向進入多個內部叢集。入侵以惡意數據集及處理流程中的兩條程式碼執行路徑為突破口,攻擊框架在短命沙盒執行數萬次自動操作,留下逾 17,000 條操作記錄;Hugging Face 的異常偵測流程最先標記事件。
Sebastian Raschka 以 GPT-5.6 系列為切入點,解説大語言模型如何在訓練及推理階段支援不同推理力度;該系列有三種模型規模,每種約有五至六種推理力度設定。
Google DeepMind 發佈 Gemini 3.5 Flash Cyber,這款基於 3.5 Flash 並經微調的輕量網絡安全模型,旨在快速發現、驗證及修補漏洞。
推薦理由:V8 JavaScript Engine 的固定調用測試提供了具體比較,Gemini 3.5 Flash Cyber 找到 55 個獨特確認問題,主線 3.5 Flash 與 Claude Opus 4.6 分別找到 47 個和 36 個。
OpenAI CFO Sarah Friar 提出一份用於衡量 AI 投資回報的實用記分卡。評估維度包括有用工作、每項成功任務的成本、可靠性及算力回報。
OpenAI 正透過符合年齡的保護措施、學習工具、家長控制功能及專家合作,提升 ChatGPT 對青少年的安全保障。
Google DeepMind 與 Isomorphic Labs 公佈聯合生物韌性方案,將工作分為防止威脅者濫用 AI 模型,以及運用 AI 支援疫情預防、檢測和應對兩部分。
Apple 在 macOS Tahoe 26.1 修正 macOS Terminal 對特定 ANSI escape code 的處理,使該序列不再觸發 DNS 請求。
OpenAI 的創意團隊運用 Codex 和上下文感知 AI 建構自訂創意工具、加快構思,並更快製作原型。
Hugging Face 披露,其部分生產基礎設施遭自主 AI 智能體系統入侵,攻擊者存取了有限範圍的內部資料集及多項服務憑證。Hugging Face 已封堵相關程式碼執行路徑、重建受影響節點並輪換憑證;目前未發現公開、面向用户的模型、資料集或 Spaces 遭篡改,合作夥伴或客户資料是否受影響仍在評估。
推薦理由:事件呈現託管模型安全護欄對事故分析的限制,也提供可遷移的準備方向,即預先驗證能在自有基礎設施運行的模型,以保護攻擊資料並維持調查能力。
Cars24 使用 OpenAI 驅動的語音與聊天智能體,每月處理 1M+ 分鐘對話,並挽回 12% 流失潛在客户。公司亦將智能體工作流程推廣至各團隊,藉助 OpenAI 加快構建。
MIT Media Lab 助理教授 Pat Pataranutaporn 與研究生提出「神經透明度」工具,讓用户在對話前預覽個人化 AI 聊天機械人的可能行為。研究中,用户錯判 15 項特質中的 11 項;相關可視化雖提高用户對系統的信任,卻沒有改變他們設計聊天機械人的方式。
OpenAI 提出 AI 治理的「逆向聯邦主義」方案,主張由州級法律協助建立全國性的安全、民主 AI 框架。這一方向透過州與聯邦行動推進美國 AI 安全。
OpenAI 的 GPT-Red 是一套自動化紅隊測試系統,運用自我對弈提升 AI 安全性、對齊及抵禦提示詞注入的能力。
Real World VoiceEQ 是一套衡量語音 AI 真人互動品質的新基準,評估 40+ 款專有及開源語音模型,涵蓋 15+ 個評測維度和 60+ 項指標。基準以超過 1 million 次人工評分建立,評測範圍包括 ASR、TTS、S2S 和 Speech Understanding。結果顯示,各模型能力各有側重,而傳統基準可能高估模型在真實對話中的表現。
企業在智能體時代可透過衡量每美元產出的有用工作量、提升效率及擴展高價值工作流程,管理 AI 投資。
ChatGPT Work 的實用數據科學工作流程涵蓋根因簡報、KPI 備忘錄、限定範圍分析及儀錶板規格,説明如何在這些任務中運用相關工作流程。
ChatGPT Work 的實用銷售工作流程涵蓋銷售管道簡報、會議準備、客户計劃、預測檢視及交易診斷等場景。
MIT Cybersecurity Clinic 的學生組隊為高風險社區評估網絡攻擊漏洞,並提出防護建議。課程自 2019 年開辦,至今已提供逾 40 次保密、免費評估,主要服務新英格蘭的市鎮及醫療機構。診所以「防禦性社會工程」為方法,亦著重協助客户建立組織能力,讓網絡安全不只依賴技術人員。
Arvind Narayanan 在 ICML 主題演講中主張,AI 會逐步改變並重組工作,但不會因實驗室內某個能力里程碑而突然令所有人失業。他以 AI as Normal Technology 框架概括能力、產品、早期採用和適應四個階段,認為工作結構的適應最慢,需時數十年。他預期 AI 會令工作重心由建造系統轉向評估、判斷與引導,並主張培養與 AI 互補的技能及維持使用上的自主掌控。
Mercury 2 是 Inception Labs 推出的擴散式推理語言模型,官方稱其在標準 NVIDIA GPU 上解碼速度達 1,000+ tokens/second,300-token 推理鏈完成時間不到 300ms。
Manus 推出 PowerPoint 模式,可直接生成原生 .pptx 文件,毋須先輸出網頁格式再轉換。圖表保留可編輯數據,表格採結構化單元格;用户可在下載前於 Manus 修改圖表數據,下載後亦可在 Microsoft PowerPoint 或 Google Slides 編輯圖表。此 Beta 功能現向使用 1.6 和 Max 模型的用户開放。
MIT 研究團隊與 Thorn 合作提出一種模型審核方法,可在不生成圖像的情況下判斷模型是否經微調以生成 CSAM。方法以 Gaussian probing 分析 LoRA adaptor 對模型內部計算的修改;在三類模型變體的測試中,識別經調整以生成 CSAM 的模型準確率為 100%。託管平台可用這項方法標記不安全模型,並將其移除或阻止上傳。
英靈殿創始人 Odin 在《十字路口》公路播客中談及 AI for Science 創業願景,核心是打造「全模態分子世界模型」與「通用科學人工智能」。他離開 David Baker 實驗室後創業,短時間內融資數千萬美元,團隊有 30 人。其目標是打造「新時代科學發現的蒸汽機」,把人類科學進程壓縮上百年。
Manus 推出自動發佈功能,開啟後每次成功構建都會直接部署至公開 URL,無需手動確認。該開關預設關閉,可在發布彈窗中隨時切換;構建失敗或仍在進行時,網站會維持上一個穩定版本。此功能現已向所有用户開放,支援網頁端、iOS 和 Android。
Deutsche Telekom 正與 OpenAI 推進轉型,邁向 AI 原生電訊商,並重塑客户服務、員工工作流程和網絡營運。這項轉型亦關乎語音的未來。
Hugging Face Blog 的《PyTorch 效能分析》第 3 篇以 profiler traces 對照手寫注意力與 PyTorch SDPA 各後端的執行情況。
推薦理由:文章對照 CPU 與 GPU trace,展示如何從 kernel 數量、資料搬移及 CPU 開銷,辨認注意力實作的效能收益與成本。
ChatGPT 入門指南説明如何使用 ChatGPT、開始首次對話,並探索以 AI 寫作、腦力激盪和解決問題的簡單方法。
Arvind Narayanan 與 Akash Kapur 認為,模型推理競爭可能把價格壓向 token 生產的邊際成本,AI 實驗室更可能透過向堆疊上層遷移來實現持續盈利。
Benedict Evans 認為,token 供應短缺只是過渡狀態,現有市場動態指向基礎模型成為商品化基礎設施,但長期定價權與價值捕獲仍未明朗。供給擴張、推理效率、訓練成本及新用途的投資回報都會變動,長期供需均衡因此難以預測。文章以流動網絡、光纖和半導體為參照,指出類比可供參考,但不能預測 AI 市場最終會形成哪一種均衡。
OpenAI 宣佈,GPT-5.6 現已成為 Microsoft 365 Copilot 的首選模型。它為 Word、Excel、PowerPoint、Chat 和 Cowork 提供更強的 AI 能力,旨在讓工作更快、品質更高。
Mistral Studio 現已為 Prompts 和 Skills 提供集中記錄系統,涵蓋版本、負責人、完整歷史和追溯能力。AI 開發者及非開發者均可即時編輯和測試,正式部署仍須經企業既有測試與審批流程,標籤亦可觸發 CI/CD。Studio 支援版本比較、回滾和審計記錄,並透過 Observability 將生產輸出追溯至相應資產版本。
GPT-5.6 主打每個 token 帶來更多智能、每美元效能更強,並可按需提供更多能力,支援最艱鉅的工作。