跳到正文

全部動態

今日 448 條
8月13日週四
  1. Cursor Blog54

    Cursor 獲得 AIUC-1 智能體安全與可靠性認證

    Cursor 宣佈已取得 AIUC-1 認證,該認證結合組織控制措施審計與產品智能體的對抗性測試。經兩輪、數千個場景測試,Cursor 的 IDE 和雲端智能體防護措施符合要求,並在正常及對抗性條件下保持有效。維持認證須至少每季接受一次測試、每年進行一次全面審計;報告可經 trust.cursor.com 信任門户取得。

  2. OpenAI News18

    GPT-5.6 建構者指南

    OpenAI 的 GPT-5.6 建構指南聚焦初創公司如何運用 GPT-5.6,更快、更具成本效益地構建 AI 智能體。指南亦涵蓋更智能的模型選擇,以及 Responses API 的新能力。

  3. Hugging Face Blog53

    OlmoEarth Studio 新增自訂嵌入向量匯出功能

    OlmoEarth Studio 新增自訂嵌入向量匯出功能,輸出可用於下游分析的 COG。使用者可設定研究區域、時間範圍、編碼器、解析度及影像來源;文章示範相似度搜尋、少樣本分割、變化檢測和 PCA 探索。以 60 個標註像素訓練的分類器取得 weighted F1 = 0.84,匯出檔可用於 QGIS、GDAL、rasterio 等工具。

8月12日週三
  1. Google Research64

    空書架還是遺失的鑰匙?Google Research 指大語言模型參數化事實性的瓶頸在於回憶

    Google Research 提出 knowledge profiling 框架及 WikiProfile 基準,發現前沿大語言模型的事實性錯誤更多源於已編碼事實難以回憶,而非未能編碼。

    推薦理由:研究以 WikiProfile 分別測量事實編碼、回憶與識別,將模型事實性錯誤區分為知識缺失或提取失敗,提供比單看答題準確率更細的診斷視角。

  2. Hamel Husain 長文9

    AI 產品工程筆記

    Hamel Husain 列出其 AI 產品工程長文選集,題材包括 AI 評測、產品開發、LLM 評估及工程工具。他與人共同教授的 AI Evals for Engineers and PMs 已有逾 5,000 名學生,來自 500 多間公司,包括 OpenAI、Anthropic 和 Google。

  3. Google Research68

    Google Research 推進 AMIE 邁向專家級視聽臨牀會診

    Google Research 展示基於 Gemini 和 Project Astra 的 AMIE (Video),在模擬即時視像會診中,核心臨牀能力獲評與基層醫生相當。

    推薦理由:研究以 300 場模擬視像會診比較 AMIE (Video)、文字版 AMIE 與基層醫生,呈現視聽感知和虛擬檢查的表現差異,並交代病人演員研究的適用邊界。

8月11日週二
  1. OpenAI News61

    OpenAI 開始在 ChatGPT 測試廣告,以支持免費使用

    OpenAI 開始在 ChatGPT 測試廣告,以支持免費使用。測試安排包括清晰標示廣告、維持答案獨立、提供強力私隱保障,並保留用户控制。

    推薦理由:材料列出 OpenAI 測試 ChatGPT 廣告時的設計邊界,包括清晰標示、答案獨立、私隱保障及用户控制,呈現其支持免費使用時採取的安排。

  2. Sarvam AI55

    Indic DiarBench:面向印度語言的聯合説話人分段與語音識別基準數據集

    Sarvam 與 AI4Bharat 建立 Indic DiarBench,這是一個涵蓋印度憲法列定全部 22 種語言、聯合評估語音識別與説話人分段的開放基準數據集。數據集包含 108 小時自然即興語音,每段錄音有 2–9 名説話者,並涵蓋重疊發言、近場及遠場會議,以及 YouTube 真實對話。轉錄文本和帶説話人歸屬的時間戳均經人工核驗。

  3. Manus:Blog67

    Manus 致用户公開信:將恢復獨立營運,部分用户數據將被刪除

    Manus 將恢復獨立營運,並於 2026 年 8 月 23 至 24 日(SGT)刪除部分用户在 2025 年 12 月 29 日或之後產生的數據。這是 Manus 與 Meta 分拆及遵守特定司法管轄區監管要求的一部分,並非安全事件所致。受影響用户可於 8 月 23 日 07:59(SGT)前備份,並於 8 月 25 日 08:00(SGT)起恢復數據;未受影響用户可照常使用。

8月10日週一
  1. Hugging Face Blog77

    Meta 發佈 Muse Glimmer 30B 多模態模型,採用 Apache 2.0 授權並面向本地智能體應用

    Meta 發佈 Muse Glimmer,一款由 Muse 蒸餾而來、面向本地智能體應用的多模態 30B 模型,採用 Apache 2.0 授權。模型由 2B ViT-style 視覺編碼器和 28B 文字解碼器組成,支援圖像、影片輸入及多模態工具調用。

    推薦理由:文章把 Muse Glimmer 的本地智能體定位、30B 架構與 transformers、llama.cpp、vLLM 等入口連起來,提供從本地推理到託管部署的實作參考。

8月7日週五
8月6日週四
  1. OpenAI News73

    OpenAI 改進 ChatGPT 中的 GPT-5.6 Sol,並擴大免費用户使用 GPT-5.6 Luna 的範圍

    OpenAI 改進 ChatGPT 中的 GPT-5.6 Sol,提升其準確度與一致性,並擴大免費用户使用 GPT-5.6 Luna 的範圍。免費用户可與 GPT-5.6 Luna 進行不限量的日常聊天。

    推薦理由:公告交代 GPT-5.6 Sol 在準確度與一致性上的提升,並説明免費用户可與 GPT-5.6 Luna 進行不限量的日常聊天,呈現模型調整與使用範圍的變化。

8月5日週三
  1. AI as Normal Technology62

    AI 智能體尚未能進行開放式 AI 研究

    研究團隊以兩篇未公開 AI 論文的研究問題測試前沿 AI 智能體,提供數千美元的 API 額度及算力和 6 天時間,兩篇智能體論文均遭原作者明確否決。團隊分析逾百小時的執行記錄後,指出智能體缺乏開放式研究所需的判斷力,亦未能有效運用資源、回應反饋、回退或遵循具體指示。作者表示研究僅涵蓋兩篇論文,結果仍屬初步,並計劃定期進行「shadow evaluations」以持續評估。

  2. MIT News44

    MIT 研究團隊破解鈉金屬電池的溶劑難題

    MIT 研究團隊以 AI 指引演算法為鈉金屬電池篩選溶劑,找出體積最小、表現最佳的候選分子 DMFSA。演算法在 24 小時內生成 100,000 個候選分子,經篩選後選出 27 個進行實驗測試。小分子溶劑有助鈉離子更快移動,研究旨在兼顧快速充放電與電解質穩定性。

8月4日週二
  1. Mistral AI62

    Mistral AI 發佈 3B 多模態安全分類器 Shieldstral

    Mistral AI 發佈 Shieldstral,一款 3B 開放權重多模態安全分類器,可用自然語言政策評估文字與圖像,無須重新訓練。它將內容審核設計為可在推理時指定政策的二元問答,並輸出校準後的安全分數;Mistral 稱其在多項基準上匹配或超越模型規模最高達其 7x 的開放權重安全模型。

    推薦理由:將審核政策置於推理時的自然語言問題中,使同一個 3B 模型可按部署情境調整文字與圖像判斷,無須重新訓練。

  2. MIT News64

    皮膚病診斷中的 AI 輔助效果因使用者專業程度而異

    MIT 及其他機構的研究人員發現,AI 輔助可提升非專家與臨牀醫生診斷皮膚病的準確度,但可解釋 AI 對兩組人的影響不同。非專家尤其依賴 LLM 解釋,錯誤輸出會拉低其判斷;臨牀醫生則在只看模型預測、沒有解釋時表現最佳。研究人員認為,先讓使用者提出診斷假設,再提供 AI 建議,或可降低對模型的過度依賴。

  3. MIT News40

    Alexander Rakhlin 獲任 MIT 統計與數據科學中心主任

    Alexander Rakhlin 獲任 MIT 統計與數據科學中心(SDSC)下一任主任,接替自 2021 年起擔任主任的 Ankur Moitra。Rakhlin 自 2016 年起以訪問教授身份參與 SDSC,並於 2018 年正式加入 MIT;他表示將深化跨學科聯繫,推動 SDSC 成為 MIT 在數據科學與 AI 嚴謹基礎研究方面的據點。