Cursor 獲得 AIUC-1 智能體安全與可靠性認證
Cursor 宣佈已取得 AIUC-1 認證,該認證結合組織控制措施審計與產品智能體的對抗性測試。經兩輪、數千個場景測試,Cursor 的 IDE 和雲端智能體防護措施符合要求,並在正常及對抗性條件下保持有效。維持認證須至少每季接受一次測試、每年進行一次全面審計;報告可經 trust.cursor.com 信任門户取得。
Cursor 宣佈已取得 AIUC-1 認證,該認證結合組織控制措施審計與產品智能體的對抗性測試。經兩輪、數千個場景測試,Cursor 的 IDE 和雲端智能體防護措施符合要求,並在正常及對抗性條件下保持有效。維持認證須至少每季接受一次測試、每年進行一次全面審計;報告可經 trust.cursor.com 信任門户取得。
OpenAI 的 GPT-5.6 建構指南聚焦初創公司如何運用 GPT-5.6,更快、更具成本效益地構建 AI 智能體。指南亦涵蓋更智能的模型選擇,以及 Responses API 的新能力。
OpenAI 預覽新的 API 服務層 Ultrafast,為 GPT-5.6 Sol 提供最高 14× 的速度提升。該服務由 Cerebras 提供支援,輸出速度最高可達每秒 750 個 token。
OpenAI 任命 Dali Rajic 出任首席營收官,負責領導其全球營收組織,並協助企業充分實現 AI 的全部價值。
OlmoEarth Studio 新增自訂嵌入向量匯出功能,輸出可用於下游分析的 COG。使用者可設定研究區域、時間範圍、編碼器、解析度及影像來源;文章示範相似度搜尋、少樣本分割、變化檢測和 PCA 探索。以 60 個標註像素訓練的分類器取得 weighted F1 = 0.84,匯出檔可用於 QGIS、GDAL、rasterio 等工具。
DeepSeek-V4-Pro GA 版本已在 APP、Web 和 API 上線,API 呼叫方式不變,將模型名稱設為 `deepseek-v4-pro` 即可使用最新版。
Google DeepMind 發佈 SL2T 多語言手語轉文字模型,為 Gboard 和 Live Transcribe 帶來手語轉文字功能,首階段支援 ASL 至英文。
推薦理由:SL2T 以簽署者的身體姿態座標直接翻譯成文字,原始影片會即時丟棄,呈現其輸入處理方式與私隱保護設計。
Google Research 提出 knowledge profiling 框架及 WikiProfile 基準,發現前沿大語言模型的事實性錯誤更多源於已編碼事實難以回憶,而非未能編碼。
推薦理由:研究以 WikiProfile 分別測量事實編碼、回憶與識別,將模型事實性錯誤區分為知識缺失或提取失敗,提供比單看答題準確率更細的診斷視角。
Hamel Husain 列出其 AI 產品工程長文選集,題材包括 AI 評測、產品開發、LLM 評估及工程工具。他與人共同教授的 AI Evals for Engineers and PMs 已有逾 5,000 名學生,來自 500 多間公司,包括 OpenAI、Anthropic 和 Google。
OpenAI 研究揭示企業正採用智能體 AI,並使用 ChatGPT 和 Codex。前沿企業在 AI 採用方面正拉開差距。
RingCentral 使用 ChatGPT Work 和 Codex 加速 AI 產品開發,並集中工程與營運部門的營運情報。相關應用涵蓋工程至營運。
Cursor 與 SpaceXAI 共同發佈 Grok 4.6,該模型基於 Grok 4.5,重點面向長時間運行的智能體及更複雜的互動和視覺工作。它在多項智能體編程和知識工作基準測試中展現前沿智能水平,並在由九項基準測試構成的 Artificial Analysis Intelligence Index 上與 GPT-5.6 Sol 持平。
Google Research 展示基於 Gemini 和 Project Astra 的 AMIE (Video),在模擬即時視像會診中,核心臨牀能力獲評與基層醫生相當。
推薦理由:研究以 300 場模擬視像會診比較 AMIE (Video)、文字版 AMIE 與基層醫生,呈現視聽感知和虛擬檢查的表現差異,並交代病人演員研究的適用邊界。
OpenAI 開始在 ChatGPT 測試廣告,以支持免費使用。測試安排包括清晰標示廣告、維持答案獨立、提供強力私隱保障,並保留用户控制。
推薦理由:材料列出 OpenAI 測試 ChatGPT 廣告時的設計邊界,包括清晰標示、答案獨立、私隱保障及用户控制,呈現其支持免費使用時採取的安排。
OpenAI 與 AWS 現透過 Amazon Bedrock 提供 Daybreak 網絡安全能力,支援企業安全工作流程。
Sarvam 與 AI4Bharat 建立 Indic DiarBench,這是一個涵蓋印度憲法列定全部 22 種語言、聯合評估語音識別與説話人分段的開放基準數據集。數據集包含 108 小時自然即興語音,每段錄音有 2–9 名説話者,並涵蓋重疊發言、近場及遠場會議,以及 YouTube 真實對話。轉錄文本和帶説話人歸屬的時間戳均經人工核驗。
OpenAI CFO Sarah Friar 分享打造 AI 原生財務職能的五點啟示,內容涵蓋自動化預測、加強控制與 AI 投資回報。這些經驗聚焦財務職能的 AI 原生建構。
NVIDIA Magpie Multilingual TTS 最新版本擴展至 12 種語言,是一款 364M 參數、開放權重的語音合成模型,可部署於自有基礎設施並按工作負載調校。
Manus 將恢復獨立營運,並於 2026 年 8 月 23 至 24 日(SGT)刪除部分用户在 2025 年 12 月 29 日或之後產生的數據。這是 Manus 與 Meta 分拆及遵守特定司法管轄區監管要求的一部分,並非安全事件所致。受影響用户可於 8 月 23 日 07:59(SGT)前備份,並於 8 月 25 日 08:00(SGT)起恢復數據;未受影響用户可照常使用。
OpenAI 致函德州州長 Greg Abbott,闡述其對在德州負責任地發展 AI 基礎設施的承諾。信中支持可靠、透明且惠及德州居民的增長。
OpenAI 讓獲批的 Daybreak 合作夥伴使用其前沿網絡安全模型,向客户提供獲授權、受管治的網絡安全服務。
OpenAI 公佈網絡安全專用模型 GPT-5.6-Cyber,該模型透過 Daybreak Red 提供,用於經授權的漏洞研究、漏洞利用驗證及安全測試。相關頁面:https://openai.com/index/expanding-daybreak-as-the-cyber-defense-window-narrows
Virgin Atlantic 藉助 ChatGPT Work 協助團隊串聯客户旅程中的各項訊號。這項應用正加快研究、產品規劃與決策。
Zapier 的企業市場推廣團隊使用 ChatGPT Work 改造核心流程,以減少潛在客户漏斗中的流失。團隊亦用它製作宣傳活動素材並自動化報告。
Meta 發佈 Muse Glimmer,一款由 Muse 蒸餾而來、面向本地智能體應用的多模態 30B 模型,採用 Apache 2.0 授權。模型由 2B ViT-style 視覺編碼器和 28B 文字解碼器組成,支援圖像、影片輸入及多模態工具調用。
推薦理由:文章把 Muse Glimmer 的本地智能體定位、30B 架構與 transformers、llama.cpp、vLLM 等入口連起來,提供從本地推理到託管部署的實作參考。
OpenAI 已在 ChatGPT Business 推出 Premium seats,提供 5x 使用量,且不設五小時使用上限。方案亦為每位團隊成員提供彈性席位選項。
HSP GRUPPE 使用 ChatGPT Enterprise 提升生產力和工作質素,並為税務諮詢及客户服務創造更多容量。
Sarvam AI 在 Sarvam Epoch 公佈 Sarvam 105B 的對話及工作智能體版本,並介紹 Sarvam Vision 2.0、Saaras V4 和研究預覽版 Bulbul V4。
OpenAI 改進 ChatGPT 中的 GPT-5.6 Sol,提升其準確度與一致性,並擴大免費用户使用 GPT-5.6 Luna 的範圍。免費用户可與 GPT-5.6 Luna 進行不限量的日常聊天。
推薦理由:公告交代 GPT-5.6 Sol 在準確度與一致性上的提升,並説明免費用户可與 GPT-5.6 Luna 進行不限量的日常聊天,呈現模型調整與使用範圍的變化。
OpenAI 與美國心理學會合作推進以證據為本的指引、資源及保障措施,聚焦負責任使用 AI 與青年心理健康。
OpenAI Signals 數據呈現全球各地使用 ChatGPT 的情況,涵蓋各國採用情況、使用趨勢及不斷演變的使用行為。
OpenAI 更新 GPT-5.6 Sol 和 GPT-5.6 Luna,並公佈青少年安全、生物與化學能力及網絡安全評估。U18 評估中,兩款模型表現與受測的 GPT-5.5 版本大致相若,未觀察到統計顯著差異;評估涵蓋高難度案例,結果不代表相關行為在一般使用中的出現頻率。
研究團隊以兩篇未公開 AI 論文的研究問題測試前沿 AI 智能體,提供數千美元的 API 額度及算力和 6 天時間,兩篇智能體論文均遭原作者明確否決。團隊分析逾百小時的執行記錄後,指出智能體缺乏開放式研究所需的判斷力,亦未能有效運用資源、回應反饋、回退或遵循具體指示。作者表示研究僅涵蓋兩篇論文,結果仍屬初步,並計劃定期進行「shadow evaluations」以持續評估。
OpenAI 説明近期涉及其模型的第三方網絡安全評估事件,並提出新防護措施,以強化 AI 模型的測試與評估。
MIT 研究團隊以 AI 指引演算法為鈉金屬電池篩選溶劑,找出體積最小、表現最佳的候選分子 DMFSA。演算法在 24 小時內生成 100,000 個候選分子,經篩選後選出 27 個進行實驗測試。小分子溶劑有助鈉離子更快移動,研究旨在兼顧快速充放電與電解質穩定性。
Mistral AI 發佈 Shieldstral,一款 3B 開放權重多模態安全分類器,可用自然語言政策評估文字與圖像,無須重新訓練。它將內容審核設計為可在推理時指定政策的二元問答,並輸出校準後的安全分數;Mistral 稱其在多項基準上匹配或超越模型規模最高達其 7x 的開放權重安全模型。
推薦理由:將審核政策置於推理時的自然語言問題中,使同一個 3B 模型可按部署情境調整文字與圖像判斷,無須重新訓練。
MIT 及其他機構的研究人員發現,AI 輔助可提升非專家與臨牀醫生診斷皮膚病的準確度,但可解釋 AI 對兩組人的影響不同。非專家尤其依賴 LLM 解釋,錯誤輸出會拉低其判斷;臨牀醫生則在只看模型預測、沒有解釋時表現最佳。研究人員認為,先讓使用者提出診斷假設,再提供 AI 建議,或可降低對模型的過度依賴。
OpenAI 為 ChatGPT Work 和 Codex 推出新的教育外掛,面向 K–12 教師、大專院校教育工作者及學生。外掛協助他們學習、教學、研究和構建。
OpenAI 回應 Apple 提起的訴訟,稱其缺乏根據,並澄清有關 OpenAI 員工的説法。OpenAI 亦公開相關訊息,記錄事件經過。
Alexander Rakhlin 獲任 MIT 統計與數據科學中心(SDSC)下一任主任,接替自 2021 年起擔任主任的 Ankur Moitra。Rakhlin 自 2016 年起以訪問教授身份參與 SDSC,並於 2018 年正式加入 MIT;他表示將深化跨學科聯繫,推動 SDSC 成為 MIT 在數據科學與 AI 嚴謹基礎研究方面的據點。