Mistral AI 開源 Leanstral,推出面向 Lean 4 的程式碼形式化證明智能體
Mistral AI 開源 Leanstral,一款為 Lean 4 設計、用於程式碼生成與形式化證明的程式碼智能體,採用 6B active parameters。
Mistral AI 開源 Leanstral,一款為 Lean 4 設計、用於程式碼生成與形式化證明的程式碼智能體,採用 6B active parameters。
Codex Security 不依賴傳統 SAST,因此不包含 SAST 報告,而改用 AI 驅動的約束推理與驗證尋找真實漏洞。這種做法可減少誤報。
Manus 推出桌面應用程式核心功能「我的電腦」,讓雲端智能體透過終端命令讀取、分析和編輯本機檔案,並啟動及控制本機應用程式。用户可新增並授權本機資料夾;執行每項命令前須明確批准,亦可選擇「始終允許」或「僅允許一次」。該功能現已向 macOS 和 Windows 用户開放。
推薦理由:Manus 將雲端智能體延伸至本機檔案與應用程式,並透過命令授權讓自動化能力與用户對本機操作的控制並存。
Google Research 在 Flood Hub 推出城市山洪預報,可提前最多 24 小時預測城市地區的山洪風險。Google 使用 Gemini 分析公開新聞報道,建立 Groundsource 歷史山洪事件資料集,用於模型訓練和評估。目前系統以 20x20 公里空間解析度運作,預測人口密度每平方公里超過 100 人的區域。
推薦理由:以 Gemini 分析公開新聞報道建立 Groundsource 山洪事件資料集,呈現缺少歷史觀測時補足模型訓練資料的做法。
Google Research 推出 Groundsource,利用 Gemini 從新聞報道抽取突發洪水事件,建立涵蓋 150 多個國家的 2.6 million 筆開放歷史資料集。
推薦理由:文章列出 Groundsource 的人工核驗數據和 GDACS 事件匹配結果,讓讀者比較新聞抽取資料的時空準確度與既有災害檔案覆蓋情況。
Google Research 的前瞻性研究在真實門診流程中評估 AMIE 用於就診前病史採集的可行性。研究納入 100 名成人,互動由醫師即時監督且沒有觸發安全停止;AMIE 的鑑別診斷在 90% 個案中涵蓋最終診斷,前三項診斷準確率為 75%。研究屬單中心文字聊天研究,沒有對照組;PCP 的管理方案在實用性及成本效益方面較佳。
推薦理由:這項研究將 AMIE 用於門診前病史採集,展示即時醫師監督下的安全與診斷評估,亦交代單中心、無對照設計的限制。
ChatGPT 在智能體工作流程中,透過限制高風險操作及保護敏感資料,防範提示詞注入與社交工程攻擊。這套防護設計著重約束風險操作,並保障工作流程中的敏感資料。
Wayfair 使用 OpenAI 模型改善電商支援及商品目錄準確度,並提升支援速度。其應用包括自動分流支援工單,以及大規模改善數以百萬計商品屬性。
IH-Challenge 訓練模型優先遵循可信指令,改善前沿大語言模型的指令層級。此訓練亦提升模型的安全可引導性,以及抵禦提示詞注入攻擊的能力。
ChatGPT 推出數學與科學的互動式視覺解釋,讓學生可即時探索公式、變數和概念。
推薦理由:這項更新交代了互動式視覺解釋涵蓋公式、變數與概念探索,呈現 ChatGPT 用於數學和科學學習的具體形式。
Hugging Face 在 Hub 推出 Storage Buckets,為頻繁變動的 ML 產物提供非版本化 S3 類物件儲存。Buckets 建基於 Xet,以分塊及跨檔案去重減少重複傳輸;Enterprise 計費按去重後的儲存量計算。
推薦理由:文章交代 Buckets 與版本化倉庫分別承擔工作層和發布層,並説明 Xet 去重如何減少重複傳輸及 Enterprise 的計費儲存量。
評測者在相同的三類電商場景下實測 9 款 AI 網站建構工具,並按設計品質、品牌呈現、電商完整度和可編輯性比較表現。測試中,Squarespace Blueprint AI 的設計輸出較穩定,Wix AI 兼顧生成與編輯,Shopify 側重電商基建而非 AI 建站,Manus 則可製作自訂計算器和產品配置器。文章亦提醒,跨平台遷移通常無法帶走設計系統與版面,AI 文案仍需人工修改。
OpenAI 正在收購 AI 安全平台 Promptfoo,該平台協助企業在開發期間識別並修復 AI 系統中的漏洞。
LeRobot 團隊發佈 v0.5.0,擴展機械人硬件、策略模型、資料集處理及模擬環境支援。版本加入 Unitree G1 人形機械人完整支援(包括全身控制)、Pi0-FAST 自回歸 VLA 及 Real-Time Chunking,並新增 EnvHub 以從 Hugging Face Hub 載入模擬環境,亦整合 NVIDIA IsaacLab-Arena。
推薦理由:版本把人形機械人控制、即時推理、模擬環境和資料提速納入同次更新,呈現 LeRobot 從硬件接入至訓練工具鏈的擴展範圍。
Google Research 推出 WAXAL 開放語音資料集,首批涵蓋 27 種撒哈拉以南非洲語言,這些語言由超過 100 million 人使用。資料包含約 1,846 小時已轉錄的自然語音 ASR 數據,以及超過 565 小時高保真 TTS 錄音,採用 CC-BY-4.0 授權開放。資料收集由非洲學術及社區組織主導,Google 表示計劃持續擴充語言範圍。
推薦理由:WAXAL 將自然口語 ASR 與高保真 TTS 語料以 CC-BY-4.0 授權開放,呈現支援低資源語言語音技術所需的資料建置基礎。
OpenAI 的 Codex Security 現已進入研究預覽,是一款 AI 應用程式安全智能體。它會分析專案脈絡,以更高信心、較少雜訊偵測、驗證並修補複雜漏洞。
Sarvam AI 開源 Sarvam 30B 和 Sarvam 105B 兩款從零訓練的推理模型,並提供 API、權重下載及本地推理範例。兩者採用 MoE Transformer 架構,分別以 16T 和 12T tokens 預訓練,並在印度使用 IndiaAI Mission 提供的算力訓練。
Balyasny Asset Management 結合嚴謹的模型評估、全面運用 OpenAI 平台及智能體工作流程,重塑投資研究。
Manus 以同一提示測試 8 款 AI 作品集製作工具,按設計質素、AI 對提示詞的理解與執行、發布選項及轉化導向比較,Manus 與 Replit 均獲 9/10。文章列 Manus 為整體首選,其免費版每日提供 300 積分,並可免費發佈至 manus.space 子域名;Lovable 則列為最佳免費選項,每日有 5 積分並可一鍵部署。文中指出,多數工具須付費方案才能連接自訂網域。
Manus 以相同的 Solace Studio 提示詞測試 7 個 AI 應用程式建構平台,並在文中將自家工具列為整體首選。測試中,Manus 從單一提示詞生成包含預約日曆、Stripe 付款及管理員面板的功能原型;Replit 也嘗試生成完整堆疊,但需具備一定技術經驗以作驗證和除錯。文章指出,多數其他平台先生成視覺介面,部分後端功能需要另行設定或手動構建。
Manus 在 2026 年以同一段 8 分鐘素材測試 10 款 AI 影片剪輯平台,比較它們減少剪輯時間、保留創作控制權及將長片改編為短片的表現。評測涵蓋 Manus、Adobe Premiere、Veed.io、Wisecut、DaVinci Resolve、Descript、CapCut、Runway、OpusClip 和 Filmora。
NXP 分享將機械人 AI 部署到嵌入式平台的實踐指南,涵蓋數據集錄製、ACT 與 SmolVLA 微調,以及 i.MX 95 上的 VLA 推理優化。實驗以把茶包放入杯中為任務,使用 3 部攝影機;文章建議保留獨立驗證集,並以非同步方式計算下一動作區塊,但推理時間須短於當前動作執行時間。
OpenAI 介紹 CoT-Control,並發現推理模型難以控制自身思維鏈,進一步凸顯可監控性作為 AI 安全保障的作用。
OpenAI 發佈 GPT-5.4,並稱其為面向專業工作的能力最強、效率最高的前沿模型。該模型具備最先進的編碼、電腦操作和工具搜索能力,並有 1M-token 上下文窗口。
OpenAI 分享新工具、認證及評估資源,協助學校和大學縮小 AI 能力差距並拓展機遇。這些資源旨在確保教育界使用 AI 能帶來機會。
Hugging Face 推出 Modular Diffusers,讓使用者以可重用區塊組合擴散模型流程,作為現有 DiffusionPipeline 的更靈活、可組合替代方案。
推薦理由:文章以現成流程、自訂區塊及 Hub 分享示例,展示如何把擴散工作流拆成可檢視、替換並重新組合的元件。
OpenAI 推出由 GPT-5.4 驅動的 ChatGPT for Excel,並新增金融應用程式整合,以加快受監管環境中的建模、研究與分析。
德甲球會 VfL Wolfsburg 正把 ChatGPT 發展為全球會的共同能力。球會以人為本而非着眼試點,藉此擴展效率、創意與知識,同時保留其足球身份。
OpenAI 推出 Adoption 新聞頻道,內容聚焦把 AI 進展轉化為商業優勢的實用見解與框架。
五種 AI 價值模型展示領導者如何循序推進 AI,從提升員工 AI 熟練度走向流程重塑。這個推進次序可建立持久的業務優勢。
Google Research 透過「貝葉斯教學」訓練 LLM 模仿貝葉斯助理的預測,提升推薦表現並泛化至其他任務。此方法採用監督式微調;在航班推薦測試中,未經特定訓練的 LLM 表現遠遜最優貝葉斯助理,且常在一次互動後便不再進步。
新預印本將 single-minus 振幅延伸至引力子,GPT-5.2 Pro 協助推導及驗證量子引力中的非零引力子樹振幅。
Axios 運用 AI 支援地方記者、簡化新聞編輯室工作流程,並大規模提供高影響力的地方新聞報道。Axios 營運總監 Allison Murphy 説明瞭這些做法。
OpenAI 推出 Learning Outcomes Measurement Suite,以評估 AI 對學生學習的影響。該套件可跨不同教育環境,隨時間衡量這種影響。
Google DeepMind 推出 Gemini 3.1 Flash-Lite,現正以預覽版向開發者及企業開放,開發者可透過 Google AI Studio 的 Gemini API 使用,企業則可透過 Vertex AI 使用。
推薦理由:文章把 Gemini 3.1 Flash-Lite 的定價、相較 2.5 Flash 的速度數據及質素描述並列,呈現其面向高頻工作負載的成本定位。
Hamel Husain 與 Shreya Shankar 發佈 evals skills,一組供 AI 產品評測使用的技能集。evals-start 會按情況導向合適技能;eval-audit 檢查現有評測管線,error-discovery 則建立自訂標註介面並協助有策略地抽樣 traces。
OpenAI 説明與 Department of War 的合約安排,涵蓋安全紅線、法律保障,以及 AI 系統在機密環境中的部署方式。
推薦理由:內容從安全紅線、法律保障和機密環境部署三方面呈現合約安排,提供理解政府機密場景中 AI 系統部署的具體切入點。
OpenAI 宣佈獲得 $110B 新投資,投前估值為 $730B。SoftBank 和 NVIDIA 各投入 $30B,Amazon 投入 $50B。
推薦理由:公告把融資總額、投前估值與三家出資方的金額拆分列明,讀者可同時掌握本輪資金規模及各方投入比例。
OpenAI 與 Amazon 宣佈戰略合作,將 OpenAI 的 Frontier 平台帶至 AWS。合作亦將擴展 AI 基礎設施、客製模型及企業 AI 智能體。
推薦理由:合作將 Frontier 平台帶至 AWS,並涉及基礎設施、客製模型及企業智能體,可由此瞭解雙方合作涵蓋的企業 AI 範圍。
OpenAI 在 Amazon Bedrock 推出面向 AI 智能體的有狀態執行環境 Stateful Runtime for Agents。該環境為由 OpenAI 驅動的多步驟 AI 工作流程提供持久化編排、記憶與安全執行。