Google DeepMind 發佈衡量 AGI 進展的認知框架,並聯手 Kaggle 啟動評測黑客松
Google DeepMind 發佈衡量 AI 邁向 AGI 進展的認知框架,提出 10 項假設對通用智能重要的認知能力。框架建議以涵蓋各能力的任務、具人口代表性的成人基準,以及 AI 相對人類表現分佈的比較,分三階段評估系統。
Google DeepMind 發佈衡量 AI 邁向 AGI 進展的認知框架,提出 10 項假設對通用智能重要的認知能力。框架建議以涵蓋各能力的任務、具人口代表性的成人基準,以及 AI 相對人類表現分佈的比較,分三階段評估系統。
OpenAI 發佈 GPT-5.4 mini 和 nano,兩者是 GPT-5.4 的較小、更快速版本。它們針對編碼、工具使用、多模態推理,以及高用量 API 和子智能體工作負載作最佳化。
OpenAI Japan 公佈 Japan Teen Safety Blueprint,為使用生成式 AI 的青少年引入更完善的年齡保護、家長控制及身心健康保障措施。
美國人每天向 ChatGPT 發送近 300 萬則詢問薪酬與收入的訊息,這些查詢有助縮小薪資資訊差距。
Mistral AI 發佈 Mistral Small 4,將 Magistral 的推理、Pixtral 的多模態及 Devstral 的智能體編碼能力整合至單一模型。
推薦理由:Mistral Small 4 整合指令、推理、多模態及智能體編碼能力,並列出相較 Mistral Small 3 的吞吐數據,可供比較單一模型承接多類任務時的效率表現。
Mistral AI 宣佈成為 NVIDIA Nemotron Coalition 創始成員,並計劃與 NVIDIA 共同開發前沿開源 AI 模型。聯盟首個項目是在 NVIDIA DGX Cloud 訓練基礎模型,支撐即將推出的 NVIDIA Nemotron 4 系列;相關模型將開源,供後訓練與專門化。Mistral AI 亦宣佈發佈 Mistral Small 4。
推薦理由:聯盟首個基礎模型將在 NVIDIA DGX Cloud 訓練,支撐 NVIDIA Nemotron 4 系列,並作為開源後訓練與專門化的共同基礎。
Mistral AI 開源 Leanstral,一款為 Lean 4 設計、用於程式碼生成與形式化證明的程式碼智能體,採用 6B active parameters。
Codex Security 不依賴傳統 SAST,因此不包含 SAST 報告,而改用 AI 驅動的約束推理與驗證尋找真實漏洞。這種做法可減少誤報。
Google Research 在 Flood Hub 推出城市山洪預報,可提前最多 24 小時預測城市地區的山洪風險。Google 使用 Gemini 分析公開新聞報道,建立 Groundsource 歷史山洪事件資料集,用於模型訓練和評估。目前系統以 20x20 公里空間解析度運作,預測人口密度每平方公里超過 100 人的區域。
推薦理由:以 Gemini 分析公開新聞報道建立 Groundsource 山洪事件資料集,呈現缺少歷史觀測時補足模型訓練資料的做法。
Google Research 推出 Groundsource,利用 Gemini 從新聞報道抽取突發洪水事件,建立涵蓋 150 多個國家的 2.6 million 筆開放歷史資料集。
推薦理由:文章列出 Groundsource 的人工核驗數據和 GDACS 事件匹配結果,讓讀者比較新聞抽取資料的時空準確度與既有災害檔案覆蓋情況。
Google Research 的前瞻性研究在真實門診流程中評估 AMIE 用於就診前病史採集的可行性。研究納入 100 名成人,互動由醫師即時監督且沒有觸發安全停止;AMIE 的鑑別診斷在 90% 個案中涵蓋最終診斷,前三項診斷準確率為 75%。研究屬單中心文字聊天研究,沒有對照組;PCP 的管理方案在實用性及成本效益方面較佳。
推薦理由:這項研究將 AMIE 用於門診前病史採集,展示即時醫師監督下的安全與診斷評估,亦交代單中心、無對照設計的限制。
ChatGPT 在智能體工作流程中,透過限制高風險操作及保護敏感資料,防範提示詞注入與社交工程攻擊。這套防護設計著重約束風險操作,並保障工作流程中的敏感資料。
Wayfair 使用 OpenAI 模型改善電商支援及商品目錄準確度,並提升支援速度。其應用包括自動分流支援工單,以及大規模改善數以百萬計商品屬性。
IH-Challenge 訓練模型優先遵循可信指令,改善前沿大語言模型的指令層級。此訓練亦提升模型的安全可引導性,以及抵禦提示詞注入攻擊的能力。
ChatGPT 推出數學與科學的互動式視覺解釋,讓學生可即時探索公式、變數和概念。
推薦理由:這項更新交代了互動式視覺解釋涵蓋公式、變數與概念探索,呈現 ChatGPT 用於數學和科學學習的具體形式。
Hugging Face 在 Hub 推出 Storage Buckets,為頻繁變動的 ML 產物提供非版本化 S3 類物件儲存。Buckets 建基於 Xet,以分塊及跨檔案去重減少重複傳輸;Enterprise 計費按去重後的儲存量計算。
推薦理由:文章交代 Buckets 與版本化倉庫分別承擔工作層和發布層,並説明 Xet 去重如何減少重複傳輸及 Enterprise 的計費儲存量。
OpenAI 正在收購 AI 安全平台 Promptfoo,該平台協助企業在開發期間識別並修復 AI 系統中的漏洞。
LeRobot 團隊發佈 v0.5.0,擴展機械人硬件、策略模型、資料集處理及模擬環境支援。版本加入 Unitree G1 人形機械人完整支援(包括全身控制)、Pi0-FAST 自回歸 VLA 及 Real-Time Chunking,並新增 EnvHub 以從 Hugging Face Hub 載入模擬環境,亦整合 NVIDIA IsaacLab-Arena。
推薦理由:版本把人形機械人控制、即時推理、模擬環境和資料提速納入同次更新,呈現 LeRobot 從硬件接入至訓練工具鏈的擴展範圍。
Google Research 推出 WAXAL 開放語音資料集,首批涵蓋 27 種撒哈拉以南非洲語言,這些語言由超過 100 million 人使用。資料包含約 1,846 小時已轉錄的自然語音 ASR 數據,以及超過 565 小時高保真 TTS 錄音,採用 CC-BY-4.0 授權開放。資料收集由非洲學術及社區組織主導,Google 表示計劃持續擴充語言範圍。
推薦理由:WAXAL 將自然口語 ASR 與高保真 TTS 語料以 CC-BY-4.0 授權開放,呈現支援低資源語言語音技術所需的資料建置基礎。
OpenAI 的 Codex Security 現已進入研究預覽,是一款 AI 應用程式安全智能體。它會分析專案脈絡,以更高信心、較少雜訊偵測、驗證並修補複雜漏洞。
Balyasny Asset Management 結合嚴謹的模型評估、全面運用 OpenAI 平台及智能體工作流程,重塑投資研究。
NXP 分享將機械人 AI 部署到嵌入式平台的實踐指南,涵蓋數據集錄製、ACT 與 SmolVLA 微調,以及 i.MX 95 上的 VLA 推理優化。實驗以把茶包放入杯中為任務,使用 3 部攝影機;文章建議保留獨立驗證集,並以非同步方式計算下一動作區塊,但推理時間須短於當前動作執行時間。
OpenAI 介紹 CoT-Control,並發現推理模型難以控制自身思維鏈,進一步凸顯可監控性作為 AI 安全保障的作用。
OpenAI 發佈 GPT-5.4,並稱其為面向專業工作的能力最強、效率最高的前沿模型。該模型具備最先進的編碼、電腦操作和工具搜索能力,並有 1M-token 上下文窗口。
OpenAI 分享新工具、認證及評估資源,協助學校和大學縮小 AI 能力差距並拓展機遇。這些資源旨在確保教育界使用 AI 能帶來機會。
Hugging Face 推出 Modular Diffusers,讓使用者以可重用區塊組合擴散模型流程,作為現有 DiffusionPipeline 的更靈活、可組合替代方案。
推薦理由:文章以現成流程、自訂區塊及 Hub 分享示例,展示如何把擴散工作流拆成可檢視、替換並重新組合的元件。
OpenAI 推出由 GPT-5.4 驅動的 ChatGPT for Excel,並新增金融應用程式整合,以加快受監管環境中的建模、研究與分析。
德甲球會 VfL Wolfsburg 正把 ChatGPT 發展為全球會的共同能力。球會以人為本而非着眼試點,藉此擴展效率、創意與知識,同時保留其足球身份。
OpenAI 推出 Adoption 新聞頻道,內容聚焦把 AI 進展轉化為商業優勢的實用見解與框架。
五種 AI 價值模型展示領導者如何循序推進 AI,從提升員工 AI 熟練度走向流程重塑。這個推進次序可建立持久的業務優勢。
Google Research 透過「貝葉斯教學」訓練 LLM 模仿貝葉斯助理的預測,提升推薦表現並泛化至其他任務。此方法採用監督式微調;在航班推薦測試中,未經特定訓練的 LLM 表現遠遜最優貝葉斯助理,且常在一次互動後便不再進步。
新預印本將 single-minus 振幅延伸至引力子,GPT-5.2 Pro 協助推導及驗證量子引力中的非零引力子樹振幅。
Axios 運用 AI 支援地方記者、簡化新聞編輯室工作流程,並大規模提供高影響力的地方新聞報道。Axios 營運總監 Allison Murphy 説明瞭這些做法。
OpenAI 推出 Learning Outcomes Measurement Suite,以評估 AI 對學生學習的影響。該套件可跨不同教育環境,隨時間衡量這種影響。
Google DeepMind 推出 Gemini 3.1 Flash-Lite,現正以預覽版向開發者及企業開放,開發者可透過 Google AI Studio 的 Gemini API 使用,企業則可透過 Vertex AI 使用。
推薦理由:文章把 Gemini 3.1 Flash-Lite 的定價、相較 2.5 Flash 的速度數據及質素描述並列,呈現其面向高頻工作負載的成本定位。
OpenAI 説明與 Department of War 的合約安排,涵蓋安全紅線、法律保障,以及 AI 系統在機密環境中的部署方式。
推薦理由:內容從安全紅線、法律保障和機密環境部署三方面呈現合約安排,提供理解政府機密場景中 AI 系統部署的具體切入點。
OpenAI 宣佈獲得 $110B 新投資,投前估值為 $730B。SoftBank 和 NVIDIA 各投入 $30B,Amazon 投入 $50B。
推薦理由:公告把融資總額、投前估值與三家出資方的金額拆分列明,讀者可同時掌握本輪資金規模及各方投入比例。
OpenAI 與 Amazon 宣佈戰略合作,將 OpenAI 的 Frontier 平台帶至 AWS。合作亦將擴展 AI 基礎設施、客製模型及企業 AI 智能體。
推薦理由:合作將 Frontier 平台帶至 AWS,並涉及基礎設施、客製模型及企業智能體,可由此瞭解雙方合作涵蓋的企業 AI 範圍。
OpenAI 在 Amazon Bedrock 推出面向 AI 智能體的有狀態執行環境 Stateful Runtime for Agents。該環境為由 OpenAI 驅動的多步驟 AI 工作流程提供持久化編排、記憶與安全執行。
OpenAI 與 Microsoft 聯合聲明表示,雙方將繼續在研究、工程及產品開發方面緊密合作。這項合作延續多年來的深入協作與共同成果。