潛在推理架構或會削弱 CoT 這項最有力的監督工具
Redwood Research 分析認為,轉向潛在推理架構可能削弱 CoT 的監督作用,令 AI 模型的推理更難理解和監察。文章區分 CoT 對完成任務的必要性,以及模型以文字表達推理的傾向,指出潛在架構可能削弱前者,並進一步減弱後者。
Redwood Research 分析認為,轉向潛在推理架構可能削弱 CoT 的監督作用,令 AI 模型的推理更難理解和監察。文章區分 CoT 對完成任務的必要性,以及模型以文字表達推理的傾向,指出潛在架構可能削弱前者,並進一步減弱後者。
Maggie Appleton 在 Pragmatic Engineer Podcast 討論設計工程師如何運用 AI 智能體製作原型,以及 AI 對設計流程的改變。她常用紙筆整理構想,也會讓編碼智能體製作可用滑桿和色彩選擇器即時調整的原型,稱為「Jigs」。她以「capability gaslighting」形容前沿模型先令使用者相信其能力,卻可能不久後在相同任務上失敗。
Shadow roots 透過互動範例解説 shadow DOM,展示樣式封裝、繼承、slots、parts 及 JavaScript 存取方式。它們會建立隔離的 DOM 樹,包含私有樣式表與元素,並以特定且受控的方式與頁面 DOM 互動。
Microsoft 宣佈 Physical AI Toolchain 新增機械人推理卸載功能,支援透過 Kubernetes 工具把 AI 工作負載分配至機械人、邊緣 GPU 和雲端。
推薦理由:文章將實機工作負載的效能、電池續航與算力配置放在同一脈絡比較,並介紹以 Kubernetes 分配推理的工具,呈現卸載方案的收益與代價。
OpenAI Academy 屆滿兩年,並把 AI 技能帶給更多社羣。
Google DeepMind 推出 Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS,支援自訂聲線、逐句控制表演及雙人對話生成。
推薦理由:兩款 TTS 模型涵蓋逐句演繹與長篇生成,Flash TTS 另可自訂聲線;聲音複製設有同意驗證,生成音訊加入 SynthID 水印,呈現創作控制與防護安排。
Sakana AI 宣佈,Jürgen Schmidhuber 將在兼任現有職務的同時加入公司,出任首席科學顧問,並參與新成立的 RSI Lab。他將定期前往東京與團隊合作,並支援日本 AI 生態系;RSI Lab 旨在形成持續累積的科學發現循環,以提升機器智能。
Radical Numerics CEO Eric Nguyen 在 Latent Space 訪談中將生物安全描述為 AI 軍備競賽,認為提升生物能力的模型也能幫助防禦追趕,並稱目前防禦仍落後。
OpenAI 將 Daybreak 計劃的使用權延伸至烏克蘭政府,以支援民用基礎設施的網絡防禦。
Harvey 透過 GPT-6 Astra 產出結構更清晰、能顧及上下文的法律文件草稿,讓律師可把精力集中於策略工作。
Cursor 推出 Rollouts 與 Security Reviewer 兩款軟件開發 Bots,前者監控變更由 PR 到生產環境的過程,後者在每個 PR 檢查程式碼庫中的安全問題並提供修復建議。
Anthropic 在 8 月以兩週衝刺,將 claude.ai 和 Claude 桌面應用程式的核心用戶體驗整體加快至原來約 3 倍。
推薦理由:這次衝刺展示了以可重複基準、CI 效能門檻和分階段上線構成優化閉環的方法,並由工程師把關改動風險與用戶體驗。
OpenAI 行政總裁 Sam Altman 在聯合國安全理事會發言,討論 AI 安全、人類控制與國際合作。
OpenAI 推出 MentalHealthBench,這是一項由專家提供意見的評測基準,用於評估 AI 在貼近現實的心理健康對話中能否提供有幫助且安全的回應。
Anthropic 發佈 Claude Opus 5.5,Latent Space 表示將其即時設為 AINews 後續內容的預設模型。Anthropic 表示其多數任務表現接近 Claude Fable 5.1,運行成本較 Opus 5 低 40%;文中補充,這項成本降幅適用於 medium 預設設定,API token 標價則下調 20%。
推薦理由:報道並列 Claude Opus 5.5 與 GPT-6 Sol、GPT-6 Luna 的能力主張和價格變化,也區分 token 標價降幅與每任務成本,呈現不同降價口徑。
Simon Willison 與 Jesse Vincent 將於 10 月 14 日在三藩市舉辦智能體工程交流活動,面向使用編程智能體或基於其開發項目的人士。活動以非正式展示交流形式進行,鼓勵分享尚未公開的實驗或未完成項目;毋須準備簡報,亦不作產品推介。
ChatGPT Ads 正擴展至東南亞及台灣。這項擴展讓符合資格的企業能透過新途徑觸及超過 60 個國家的受眾。
弋途科技完成近億元人民幣 Pre-B 輪融資,AICAR 正式上線。截至目前,公司已服務超過 70% 的國內頭部車企及主流合資品牌,數十款車型規模化量產上車,累計交付達百萬級。本輪資金將用於加速 AICAR 規模化推廣,並推進與自研端側模型深度結合的下一代 AICAR 落地。
Airbnb 正擴大工程團隊使用 GPT-6 Astra 及 OpenAI 前沿模型的範圍。此舉旨在協助工程團隊修復錯誤、設計系統並加快交付。
Redwood Research 發現,提示詞加入無意義填充 token 後,GPT-6-Astra 在多項推理與數學評測的提升幅度高於其他受測模型。在 4-hop natural facts 評測中,其成績由約 10-20% 升至約 50%;舊版 AIME 題目則由約 60-70% 升至約 90%,填充 token 的效益在約 8,192 tokens 時達峯值。
Grab 與 OpenAI 推出區域計劃 GO Forward with AI,協助東南亞 30,000 名合作夥伴培養實用 AI 技能。
Modal 為編碼智能體優化月之暗面 Kimi K2.6 推理服務,相關服務每日處理數千億 token,累計處理萬億級 token。優化令單副本每用戶解碼速度提升 2.8x,每 GPU 的跨用戶 token 吞吐量提升 5.6x。方法涵蓋推測解碼、KV 快取與負載感知路由,並從單副本優化延伸至多副本部署。
AGIBOT 與長隆啟動具身 AI 園區部署,逾 300 台機械人進駐娛樂、教育、訪客服務及酒店營運場景。首階段位於 Chimelong Spaceship Park;AGIBOT、長隆與 China Mobile 建立專用 5G-A 網絡,配合多機協調及安全措施。合作並向長隆交付 AGIBOT 生產線下線的第 20,000 台機械人,另宣佈成立聚焦文旅具身 AI 的聯合研究院。
GPT-6 改進提示詞快取,提升快取命中率,並加入新診斷功能、明確斷點,以及可降低延遲和成本的控制項。
@therealcornpop 指出,使用 AI 撰寫 TikTok 和 YouTube 腳本的痕跡十分明顯。常見特徵包括「不是 X,而是 Y」等 AI 慣用句、三段式結構,以及標點密集、斷續怪異的句式;這類內容缺乏鮮明的個人聲音,也看不出作者對主題的觀點。
OpenAI 發佈 GPT-6 Sol 和 Luna 兩款模型,稱兩者將前沿智能帶入日常工作,並在能力與成本之間採取不同取向。
《The Pragmatic Engineer》訪問 Microsoft Windows 團隊,分析 Windows 在作業系統層整合 AI 智能體與本地模型的計劃。
Simon Willison 開發 llm-typesafe 0.1a0 插件,為 LLM 加入 TypeSafe AI 新 Jev 模型的支援。Jev 可處理是非型「noul」問題、選擇題及評分題;安裝指令為 `llm install llm-typesafe`,並須以 `llm keys set typesafe` 設定 API key。
Apple 宣佈新款 Mac mini 和 Mac Studio 今日開售,Mac mini 配備 M6 或 M5 Pro,Mac Studio 則配備 M5 Max 或 M5 Ultra。
NVIDIA 發佈 Isaac ROS 5.0,加入讓開發者與 AI 智能體協作構建機械人的工作流,並支援 ROS Lyrical 和 Ubuntu 24.04。
推薦理由:Isaac ROS 5.0 把智能體工作流、可重用技能和平台支援納入開源機械人開發,呈現開發工具銜接 Jetson 部署的實作路徑。
這份指南説明如何在 Claude 和 Claude Code 中使用 Opus 5.5,涵蓋提示詞撰寫、長任務管理及結果核查。指南建議明確説明任務完成條件,在 CLAUDE.md 設定長任務何時繼續或停止,並將任務清單存入檔案追蹤進度;大型審查和遷移則可分派給子智能體,再核查各自證據。
Parallel 的智能體使用 GPT-6 Astra 研究並綜合勞動市場數據,較先前模型所需時間減半,成本亦減半。
Timnit Gebru 與 Emily M. Bender 指出,今夏企業圍繞 AI 模型漏洞、數學突破和超級智能的宣傳,常被媒體以人格化敍事放大,而專家後續檢視提出了不同解讀。她們認為,把事件描述成「失控模型」或迫近的超級智能,會把注意力從企業責任轉向假想中的機器風險,也淡化數據中心造成的氣候、健康、電費與用水影響。她們呼籲決策者和公眾放慢決策步伐,聽取獨立專家的意見,不要只依賴企業宣傳。
小米推出 MiMo-V2.6-Pro,該模型在 Artificial Analysis Intelligence Index 得 46 分,排名開放權重模型首位。
推薦理由:文中並列模型榜單、RL 訓練成本與將開源的環境配方,呈現這次發佈由模型權重延伸至後訓練流程的技術脈絡。
非侵入式 AI 腦機接口公司華超神控完成 2 億元人民幣 Pre-A 輪融資,由雲啟資本與紅杉中國聯合領投。比鄰星投資、元禾控股、徐匯科創投、德石投資跟投,經緯創投和德聯資本持續加註;所募資金將用於產品研發、核心人才引進、臨牀研究推進和 AI 基礎設施建設。公司以超聲神經調控、多模態讀腦和 AI 神經解碼為核心技術路徑,佈局科研、臨牀、科技三條產品線。
OpenAI 概述前沿模型及安全防護措施的第三方 AI 安全評估優先事項與原則。評估原則聚焦嚴謹性、安全性及獨立性。
vllm-metal 把 vLLM 的排程器、分頁 KV cache 和 OpenAI 相容伺服器帶到 Apple Silicon,並以 MLX 和 Metal 執行模型。
OpenClaw 正加入可選的決策模型支援,讓平台支援的功能及插件使用另行設定的模型,且不會取代對話模型。Plugin SDK 提供共用 API `api.runtime.decisions.evaluate`;TypeSafe adapter 支援託管版 Jev 及本地 System One 伺服器,例如 Kev。
Together AI 介紹端點 Rollouts 功能,讓用戶以 canary、blue-green 或 rolling 策略,將生產流量由來源部署切換至目標部署。
Hugging Face 宣佈,oMLX 創作者兼維護者 Jun Kim 加入團隊,並會繼續領導 oMLX。oMLX 維持 Apache 2.0 授權,項目將轉為獲資助並持續維護;Hugging Face 預期這有助提升穩定性,並希望加快開發。Hugging Face 亦希望以 oMLX 作為新想法的試驗場,並加快將 transformers 模型定義轉成不同引擎可使用的 MLX 參考實作。