OpenAI 與 Microsoft 聯合聲明
OpenAI 與 Microsoft 聯合聲明表示,雙方將繼續在研究、工程及產品開發方面緊密合作。這項合作延續多年來的深入協作與共同成果。
OpenAI 與 Microsoft 聯合聲明表示,雙方將繼續在研究、工程及產品開發方面緊密合作。這項合作延續多年來的深入協作與共同成果。
Google DeepMind 發佈圖像生成模型 Nano Banana 2(Gemini 3.1 Flash Image),以 Flash 速度帶來 Nano Banana Pro 的世界知識、品質與推理能力。
推薦理由:Nano Banana 2 將 Nano Banana Pro 的世界知識、視覺品質與創作控制帶到 Flash 速度,並交代其在 Google 產品中的推出範圍及 Nano Banana Pro 的保留使用方式,説明兩款模型面向的工作流程差異。
OpenAI 與太平洋西北國家實驗室合作推出 DraftNEPABench,評估 AI 編碼智能體加快聯邦許可審批的能力。該 benchmark 顯示,AI 有望將 NEPA 草案撰寫時間最多縮短 15%,並展示現代化基礎設施審查的潛力。
OpenAI 與 Figma 推出新的 Codex 整合,連接程式碼與設計,讓團隊能在實作環節與 Figma 畫布之間切換。這項整合讓團隊可以更快迭代並交付。
OpenAI 最新威脅報告探討惡意行為者如何將 AI 模型與網站及社交平台結合使用。報告亦分析這類活動對偵測與防禦工作的意義。
OpenAI 的 Codex 提示詞指南介紹如何透過 API 使用 gpt-5.3-codex,並配置編碼智能體的提示詞與工具。指南建議一般互動式編碼採用 medium reasoning effort,較難任務可選 high 或 xhigh,並移除要求模型預先提供計劃、前言或執行期間狀態更新的提示。
OpenAI 任命 Arvind KC 出任首席人事官,協助公司擴大規模並強化企業文化。其職責亦包括帶領 AI 時代工作方式的演變。
新論文評估 14 個模型,發現近 18 個月模型能力提升明顯,AI 智能體可靠性僅小幅改善。研究把可靠性拆分為一致性、穩健性、可預測性和安全性四個維度,以 12 項指標測試 GAIA 與 TauBench;可預測性是整體最弱的一環。作者建議在準確率之外同步報告可靠性各維度表現,並計劃推出 AI agent reliability index。
Inception Labs 發佈 Mercury 2 推理語言模型,透過擴散模型並行修訂生成回應,主打低延遲推理。官方列出其在 NVIDIA Blackwell GPUs 上達 1,009 tokens/sec,並稱生成速度提升 >5x;價格為 $0.25/1M input tokens、$0.75/1M output tokens。
OpenAI 不再評測 SWE-bench Verified,因其日益受到污染,且無法準確衡量前沿編碼進展。分析指出,該基準的測試存在缺陷,並有訓練洩漏;OpenAI 建議採用 SWE-bench Pro。
OpenAI 宣佈 Frontier Alliance Partners,協助企業將 AI 試點項目轉入生產環境,並以安全、可擴展的方式部署智能體。
Manus 推出分步指南,教小企業主在 30 分鐘內使用 Manus 和 Gmail、無需編寫程式碼,構建 AI 客户支援智能體。智能體每天兩次檢查 Gmail 收件箱中的新支援郵件,參考知識庫起草個人化回覆;用户審批後才會發送,亦可批量批准整個支援郵件隊列。
OpenAI 分享其 AI 模型在 First Proof 數學挑戰中的證明嘗試。這些嘗試用於測試模型處理專家級問題的研究級推理能力。
Sarvam AI 開放 Indus 限量測試,這個模型體驗介面由其 105B 主權模型驅動。Indus 現階段聚焦印度語境下的準確度、實用性、效率與對齊。服務正以有限運算容量逐步開放,初期用戶或需加入等候名單。
GGML 團隊加入 Hugging Face,並將持續維護 llama.cpp;Hugging Face 會為項目提供長期資源支持。團隊仍將 100% 時間用於維護,並對技術方向及社羣保有完全自主權與領導權;項目會繼續 100% 開源並由社羣推動。雙方計劃讓 transformers library 的模型定義更順暢地用於 llama.cpp,並改善 ggml 軟件封裝及本地模型部署體驗。
推薦理由:文章交代 GGML 團隊加入後 llama.cpp 的維護自主權與資源支持,也列出連接 transformers library 模型定義及改善本地部署體驗的方向。
Benedict Evans 分析 OpenAI 的競爭處境,指出其模型與其他前沿模型能力接近,且龐大用戶羣的使用深度和黏性有限。文中稱 OpenAI 有 8-900m 用戶,只有 5% 的 ChatGPT 用戶付費,80% 用戶在 2025 年發送少於 1,000 則訊息。他進一步質疑,巨額算力投資與全棧平台構想是否足以建立網絡效應,並指出生成式 AI 的新產品體驗仍待創造。
Google DeepMind 發佈 Gemini 3.1 Pro,作為 Gemini 3 系列核心模型升級,提升複雜問題的推理能力。它在 ARC-AGI-2 取得經驗證的 77.1% 得分,推理表現超過 Gemini 3 Pro 兩倍。
推薦理由:Gemini 3.1 Pro 在 ARC-AGI-2 取得經驗證的 77.1% 得分,並稱推理表現超過 Gemini 3 Pro 兩倍,為核心推理升級提供量化比較依據。
OpenAI 承諾向 The Alignment Project 投入 $7.5M,資助獨立的 AI 對齊研究。這項資助將加強全球應對 AGI 安全與保安風險的工作。
OpenAI 推出 OpenAI for India,透過建設本地基礎設施、助力企業及提升勞動力技能,擴大 AI 在印度各地的可及性。
Google DeepMind 在 Gemini app beta 推出 Lyria 3 音樂生成模型,使用者可用文字提示或上傳照片、影片生成 30 秒音軌。系統會按提示生成歌詞,並可調整風格、人聲和節奏;音軌嵌入 SynthID,Gemini 的核驗功能亦延伸至音訊,使用者可上傳檔案詢問其是否由 Google AI 生成。
推薦理由:Lyria 3 在 Gemini app 開放以文字、圖片或影片生成音樂,並納入 SynthID 與音訊核驗,呈現創作功能和 AI 內容識別並行的設計。
OpenAI 與 Paradigm 推出 EVMbench,評測 AI 智能體偵測、修補及利用高危智能合約漏洞的能力。
Gradio 6 的 gr.HTML 現支援自訂 HTML 模板、作用域 CSS 與 JavaScript 互動,讓 LLM 可把前端、後端和狀態管理整合到單一 Python 檔案,構建互動式 Web 應用。
Google Research 提出 MapTrace,以合成數據訓練多模態大語言模型(MLLM)在地圖上追蹤有效路徑,應對模型難以理解空間幾何與拓撲關係的問題。
Google DeepMind 宣佈與印度政府部門及當地機構建立新合作,擴大 AI 在科學與教育領域的應用。合作將向印度研究人員提供 AlphaGenome、AI Co-scientist 和 Earth AI,並推出 $30 million Google.org Impact Challenge: AI for Science。
推薦理由:文章列出研究機構合作、AI 科學挑戰賽及教材互動化安排,呈現 Google DeepMind 在印度推進科學與教育應用的具體路徑。
Anthropic 在 Claude Platform 推出 Claude Sonnet 4.6,定位為兼顧速度與智能的日常任務模型,智能體搜尋表現提升且 token 消耗較少。
Visual Self-Refine(VSR)提出像素引導的圖表解析方法,將解析轉為以渲染像素驗證並修正結果的回饋迴圈。流程先預測錨點並渲染圖表,再檢視渲染結果,依據已驗證的像素修正最終解析;專案亦提供資料處理流程和 benchmark 評估腳本。
Manus 推出 Manus Agents,讓用户今天起可透過 Telegram 使用 Manus,並向所有訂閲層級開放;Telegram 是首個支援渠道。用户在 Manus 工作區的 Agents 標籤頁掃描 QR code,約一分鐘即可連接,無需命令列、設定檔或 API tokens。
GPT-5.2 在理論物理中提出一條新的膠子振幅公式,一篇新預印本記錄了這項結果。OpenAI 與學術合作者其後正式證明並驗證了該公式。
推薦理由:材料交代 GPT-5.2 提出的膠子振幅公式及 OpenAI 與學術合作者其後的正式證明和驗證,呈現模型研究結果的核查環節。
OpenAI 為 ChatGPT 推出 Lockdown Mode 及 Elevated Risk 標籤。兩者旨在協助機構防範提示詞注入與 AI 驅動的資料外洩。
OpenAI 推出開源工具包 GABRIEL,利用 GPT 將定性文本和圖像轉化為定量數據,協助社會科學家大規模分析研究。工具以開源形式提供。
OpenAI 建立結合速率限制、用量追蹤與 credits 的即時存取系統,支援 Sora 和 Codex 持續存取。
Hugging Face 製作 CUDA kernel 技能,Claude 和 Codex 依此為 diffusers 與 transformers 目標產生可運行的 kernel。
推薦理由:文章拆解如何把 GPU 架構知識、PyTorch 整合範式與基準測試流程封裝成技能,讓編碼智能體產出可構建、可測試的 CUDA kernel 專案。
Justin Curl 與合著者指出,AI 能力提升不會自動降低消費者取得理想法律結果的成本,制度與工作流程中的瓶頸可能抵銷生產力增益。文章將瓶頸歸納為限制 AI 法律服務的監管規則、訴訟與合約談判中的對抗性,以及人類法官和法律專業人員的處理速度。作者討論調整職業監管、司法程序及律師角色等改革,並指出法律工作產出變便宜,不等於客户更容易取得所需法律結果。
Google DeepMind 發佈 Gemini 3 Deep Think 重大升級,面向科學、研究與工程領域的複雜挑戰。
推薦理由:文章列出數學、編程及科學基準的具體成績,並交代 Gemini app 與 Gemini API 的開放方式,呈現本次升級的評測範圍和使用入口。
作者以同一份 4 頁林肯市發展報告測試 8 款免費 PDF 轉 PPT 工具,認為 Manus 和 Gamma 較能產出可用簡報。Manus 將報告中的市場指標轉成數據圖表;Gamma 的設計風格較一致,但採用的 AI 圖像較通用。Smallpdf 和 iLovePDF 只轉換格式,Slidesgo 未使用原 PDF 內容,而 PresentationsAI 免費版無法匯出。
Manus 的文章以兩組相同提示詞比較 Manus 與 Synthesia,測試顯示 Synthesia 動態較自然,Manus 更能遵循場景細節。企業影片提示要求生成 30 秒影片,Manus 輸出 30 秒,Synthesia 則約 8 秒,兩者的動畫都有瑕疵。文章認為 Synthesia 更適合專業化身影片,Manus 則較適合重視創意自由和多步驟工作流程的用户。
Manus 以同一組 PR 案例評測 9 款 AI 代碼審查工具,涵蓋錯誤修復、重構、依賴更新和權限邊界。結果顯示,各工具在安全關鍵邏輯的風險檢測深度上差異明顯,工作流原生整合不代表分析更深入。Manus 在明確框定為安全審查的授權反轉測試中,生成了著重失敗模式、影響和補救步驟的報告,但未原生嵌入 PR 討論串作為自動審查員。
OpenAI 發佈 GPT-5.3-Codex-Spark,並稱其為首個即時編碼模型,生成速度快 15x,具備 128k 上下文窗口。目前以研究預覽形式向 ChatGPT Pro 用户提供。
推薦理由:公告列出生成速度、上下文窗口及研究預覽的適用對象,讓讀者可同時瞭解 GPT-5.3-Codex-Spark 的性能宣稱與目前開放範圍。
OpenAI 技術人員 Ryan Lopopolo 探討 Harness 工程,聚焦在智能體優先的世界中如何運用 Codex。
Google Research 提出開源原型框架 DialogLab,用於編寫、模擬及測試動態人類與 AI 羣體對話。框架採用「編寫、測試、驗證」流程,並以視覺化介面及驗證儀錶板協助設計與分析對話。14 名參與者的評估顯示,人類控制模式顯著更具投入感,並普遍被認為更有效、寫實。