OpenAI 發佈 GPT-5.6 系統卡,列出安全評估結果
OpenAI 發佈 GPT-5.6 系統卡,公開模型訓練資料、部署安全模擬及生物化學能力評估。部署模擬預測 GPT-5.6 Sol 的違規內容總量與 GPT-5.5 大致相若,性相關違規率由 0.05% 升至 0.07%,心理健康相關違規回應率由 0.03% 降至 0.02%。OpenAI 將 GPT-5.6 系列的生物與化學能力列為 High,並判定三款模型均不需按 Critical 能力處理。
OpenAI 發佈 GPT-5.6 系統卡,公開模型訓練資料、部署安全模擬及生物化學能力評估。部署模擬預測 GPT-5.6 Sol 的違規內容總量與 GPT-5.5 大致相若,性相關違規率由 0.05% 升至 0.07%,心理健康相關違規回應率由 0.03% 降至 0.02%。OpenAI 將 GPT-5.6 系列的生物與化學能力列為 High,並判定三款模型均不需按 Critical 能力處理。
Manus 推出 Branch,讓用户從既有對話節點建立並行會話,並保留該節點之前的指令、文件和對話歷史。原始會話保持不變,各分支使用獨立的上下文副本,可從同一節點建立多個分支。Branch 面向所有用户開放,適用於標準 Manus 對話會話,目前不支援 Web Builder 會話。
OpenAI 説明其與政府及國家安全領域建立合作夥伴關係的方針。相關原則包括負責任地使用 AI、民主問責及公共安全。
OpenAI 的新分析指出,熱門編碼基準 SWE-Bench Pro 存在問題,引發對 AI 模型評測可靠性與準確性的疑慮。
Mistral AI 發佈 8B 模型 Robostral Navigate,讓機械人根據 RGB 圖像和自然語言指令自主導航。模型在 R2R-CE 已見及未見驗證集分別取得 79.4% 和 76.6% 成功率;未見集成績較最佳單相機方案高 9.7 個百分點,較採用深度感測或多相機的最佳系統高 4.5 個百分點。
OpenAI Academy 與 Walton Family Foundation 正為 K–12 教育工作者帶來實作型 AI Skills Jams,協助他們培養可應用於課堂的實用 AI 技能。
Hugging Face 更新 vLLM 的 Transformers 建模後端,令多種相容 LLM 架構的推理吞吐量達到或超過 vLLM 手寫原生實作。測試涵蓋 Qwen3-4B 單 GPU、Qwen3-32B 張量並行,以及 Qwen3-235B-A22B-FP8 MoE 在同一 8×H100 節點上的數據並行與專家並行,三者均達到或超越原生實作吞吐量。
推薦理由:文章以三種不同規模及並行配置的 Qwen3 模型對照 vLLM 手寫實作,並説明 torch.fx 分析與運行時融合如何使相容模型達到原生推理速度。
OpenAI 介紹 GPT-Live,將其定位為面向自然人機互動的新一代語音模型,並稱其現正為 ChatGPT Voice 提供支援。
Hugging Face 與 Amazon SageMaker AI 推出深連結整合,讓開發者可從受支援的模型頁面一鍵進入 SageMaker Studio 的微調或部署流程,並預載所選模型。新流程會在數秒內自動建立已配置權限的 Studio 網域;Studio 亦會顯示 G5、G6 GPU 配額的可用情況。
Google Research 在 10 座美國城市以 Google Maps 進行導航改道實驗,發現少於 2% 行程收到改道建議,也可提升行車速度並降低燃料消耗。
推薦理由:研究在 10 座美國城市以全市交叉實驗測試導航改道,呈現少於 2% 行程受影響時,行車速度上升、燃料消耗下降的路網效益。
Hugging Face 與 Microsoft 將每週更新的精選開放權重模型目錄加入 Microsoft Foundry Model Catalog,並可一鍵部署至 Foundry Managed Compute。
推薦理由:文章梳理模型篩選、權重預置和執行環境掃描的上架流程,説明企業如何在私有網絡內部署而毋須連出 Hugging Face Hub。
MUFG 使用 ChatGPT Enterprise 建設 AI 原生組織,改善工作流程,並大規模提供 AI 驅動的金融服務。
Australian Payments Plus 使用 ChatGPT Enterprise 和 Codex,加快應對支付業務的複雜性。AP+ 節省時間、改善品質,並以人類判斷為核心。
LeRobot v0.6.0 新增世界模型策略、統一六項模擬基準的 lerobot-eval,以及用於部署和收集人工修正資料的 lerobot-rollout CLI。
推薦理由:版本把策略部署、人工接管修正與資料回訓串成可重複流程,並以統一 CLI 整合六項模擬基準,呈現機械人學習由實作到評估的工作流。
Hugging Face Storage 現已成為 SkyPilot 的一級儲存後端,可透過 hf:// URL 將 Bucket 或 Hub 倉庫接入跨雲任務。
推薦理由:這項整合把模型與數據集的存放位置和 GPU 雲端選擇分開,並明確呈現讀取不收 egress 費與跨雲寫回仍需付費的成本差異。
Hugging Face 為 Kernels 項目推出重大更新,新增 Hub 的 kernel 倉庫類型(https://huggingface.co/kernels),並加入可信發佈者及程式碼簽署機制。
Google DeepMind 與 A24 宣佈建立首創研究合作夥伴關係,合作將涵蓋多個研發項目,並協助藝術家發展新工作流程與技術。合作初期聚焦連結尖端科技與新一代娛樂,具體目標、技術成果及創作里程碑將隨時間演進。Google 亦已投資 A24。
Mistral AI 發佈 Leanstral 1.5,這款 Apache-2.0 授權模型總參數量為 119B、活躍參數為 6B,面向 Lean 4 形式化驗證。
推薦理由:文章不只列出形式化數學基準,也以 AVL 樹複雜度證明及 57 個程式庫的漏洞排查,呈現 Leanstral 1.5 將定理證明延伸至實際程式驗證的應用。
MIT 校長 Sally Kornbluth 在 Washington Post Live 討論如何透過好奇心導向研究與教育,培育能引領美國應對 AI 時代的下一代人才。她主張保留基礎學科、加強道德、公民與倫理教育,並讓學生把 AI 作為增強工具,透過團隊協作學習。她警告,聯邦資金雖已撥予大學,款項大多尚未發放;若缺少好奇心導向研究資助,創新及人才培育管道可能枯竭。
Berkeley Artificial Intelligence Research(BAIR)Lab 慶祝 2026 屆博士畢業生,展示他們在機械人、大語言模型推理、電腦視覺、生成模型及 AI 安全等領域的研究。畢業生曾發表研究、建構具實際影響的系統並指導同儕,去向包括教職與博士後、業界研究實驗室及初創公司;部分人仍在探索下一步。
Ethan Mollick 指出,隨着 AI 系統能持續處理更長任務,工作模式正由人與聊天機器人協作,轉向把工作交給 Agent 執行並由人管理。Epoch 的測試指出,Opus 4.7 獨立工作 14 小時,建成一個相當於人類工程師需花 2-17 週完成的軟件套件,token 成本為 $251。
Hugging Face 推出開放基準 ScarfBench,評測 AI 智能體遷移企業 Java 框架的能力。它涵蓋 Spring、Jakarta EE、Quarkus,包含 34 個應用程式、102 個框架實作及 204 項遷移任務,並驗證建置、部署和行為。現有最強智能體的行為成功率低於 10%,Jakarta EE 遷移尤其具挑戰。
Google Research 將建築物屋頂反射率數據集擴展至 9 個國家的 50+ 座城市,並透過新推出的 Heat Resilience Earth Engine App 開放使用。
推薦理由:數據細化至單棟建築並覆蓋 9 個國家的 50+ 座城市,讓城市規劃者可據此識別優先採用高反射屋頂的地點。
Google DeepMind 推出 Nano Banana 2 Lite,並首次向開發者開放 Gemini Omni Flash。
推薦理由:兩款模型分別面向高速批量圖像生成與影片生成、對話式編輯,文中列出成本、延遲及 API 限制,可供評估多媒體工作流的取捨。
Google Research 發佈 TabFM,這款表格數據基礎模型以上下文學習執行分類與回歸,並可在單次前向傳遞中預測。TabFM 以結構因果模型動態生成的數億個合成資料集訓練,並在 TabArena 的 38 個分類與 13 個回歸資料集上評測。
OpenAI Signals 的新數據顯示,ChatGPT 在全球的使用普及正在擴大。用户增加使用量、探索更多能力,並帶動不同地區及語言的增長。
Every Eval Ever(EEE)與 Hugging Face Community Evals 現已互通,評測結果可同步顯示於 Hugging Face 模型頁面及基準排行榜,並連回 EEE 完整記錄。
OpenAI 推出 GeneBench-Pro,這項新基準使用複雜的真實世界數據集,測試 AI 在基因組學、生物學及科學研究中的表現。
Manus 的 Mobbin 連接器可把 Mobbin 中經驗證的應用介面與流程研究,直接轉化為應用程式、簡報、行業分析或設計評審。連接器可搜尋截圖、分析多步使用者流程及檢視網站板塊,並將參考資料融入工作流程。使用者須持有付費 Mobbin Pro 或 Team 計劃;Manus 只會在任務獲授權時讀取資料,連接器為唯讀。
OpenAI 的新報告描繪 AI 可能如何重塑歐盟各地的工作崗位。報告指出,部分職業可能面臨自動化、增長或工作流程變化。
Hamel Husain 指出,AI 產品若難以評測,往往也難以讓用戶核實輸出,因此產品設計應先降低驗證難度。文章以數據智能體、體育課教案工具和工傷賠償醫療報告工具為例,提出展示來源與假設、提供可核查的中間產物,並把輸出拆成較小的審核單位。這樣可降低標註成本,並為自動評測提供更明確的依據。
HP Inc. 擴大與 OpenAI 的 Frontier 戰略合作夥伴關係。合作將 AI 部署至客户體驗、軟件開發及企業營運。
Google Research 已將 Multi-Token Prediction(MTP)架構部署至 Pixel 9 和 10 系列的 Gemini Nano v3,透過凍結主模型權重加快裝置端文字生成。
推薦理由:文章對照整合式 MTP head 與獨立草稿模型,説明直接利用主模型狀態如何提升候選 token 準確度,並改善 Pixel 端的速度與記憶體效率。
OpenAI 預覽新一代模型 GPT-5.6 Sol,其程式編寫、科學及網絡安全能力更強,並配備 OpenAI 最先進的安全技術堆疊。
OpenAI 公開 GPT-5.6 Preview 系統卡,説明模型的安全評估、部署模擬及生物與化學能力判定。部署模擬預測 GPT-5.6 Sol 的不允許內容違規總量與 GPT-5.5 大致相同;其中不允許的性內容比例由 0.05% 升至 0.07%,違規心理健康回應則由 0.03% 降至 0.02%。
Hugging Face Blog 示範用一條命令在 HF Jobs 上以 vLLM 啟動私有、OpenAI-compatible 的 LLM 端點。內容提供 curl 和 Python OpenAI client 呼叫範例,並示範以 SSH、Gradio 及 Pi 延伸使用;每次請求須附上具該 Job 讀取權限的 HF token。
推薦理由:文章把 HF Jobs、vLLM 與 OpenAI-compatible API 的部署、驗證和停止流程串成可複用命令,並説明私有端點的 token 權限與成本控制。
Google Research 提出線性彈性快取,將頁面淘汰建模為 ski rental 問題,按即時工作負載動態調整快取容量,以降低快取管理的總擁有成本。在 Spanner 生產環境測試中,記憶體用量減少 15.5%,快取未命中僅增加 5.5%,總擁有成本約降低 5%,實際 I/O 成本影響僅 0.5%。
Google Research 的研究發現,讓大語言模型生成推理軌跡,可喚回關閉推理時幾乎無法取出的參數化知識。研究以 Gemini-2.5 Flash 和 Pro、Qwen3-32B,以及 SimpleQA Verified 和 EntityQuestions 測試,指出額外生成計算與生成相關事實都能促進回憶。
Google DeepMind 將 computer use 內建於 Gemini 3.5 Flash,讓開發者可構建能在瀏覽器、流動裝置及桌面環境操作的智能體。
推薦理由:從獨立提供的 Gemini 2.5 computer use 模型,到納入 Gemini 3.5 Flash 內建工具,這次更新呈現電腦操作能力的產品整合變化。
Mistral AI 為 Connectors 推出多項管理與安全功能,涵蓋工作區及組織層級的存取控制、具 connector scope 的 API keys、多帳户連接器,以及 MCP 連線除錯。
推薦理由:這次更新把企業連接器的權限、執行身份與故障定位納入同一套控制,呈現智能體投入組織日常工作所需的治理環節。