思考以喚回記憶:推理如何解鎖大語言模型中的參數化知識
Google Research 的研究發現,讓大語言模型生成推理軌跡,可喚回關閉推理時幾乎無法取出的參數化知識。研究以 Gemini-2.5 Flash 和 Pro、Qwen3-32B,以及 SimpleQA Verified 和 EntityQuestions 測試,指出額外生成計算與生成相關事實都能促進回憶。
Google Research 的研究發現,讓大語言模型生成推理軌跡,可喚回關閉推理時幾乎無法取出的參數化知識。研究以 Gemini-2.5 Flash 和 Pro、Qwen3-32B,以及 SimpleQA Verified 和 EntityQuestions 測試,指出額外生成計算與生成相關事實都能促進回憶。
Google DeepMind 將 computer use 內建於 Gemini 3.5 Flash,讓開發者可構建能在瀏覽器、流動裝置及桌面環境操作的智能體。
推薦理由:從獨立提供的 Gemini 2.5 computer use 模型,到納入 Gemini 3.5 Flash 內建工具,這次更新呈現電腦操作能力的產品整合變化。
Mistral AI 為 Connectors 推出多項管理與安全功能,涵蓋工作區及組織層級的存取控制、具 connector scope 的 API keys、多帳户連接器,以及 MCP 連線除錯。
推薦理由:這次更新把企業連接器的權限、執行身份與故障定位納入同一套控制,呈現智能體投入組織日常工作所需的治理環節。
OpenAI 與 Broadcom 推出 Jalapeño,這款自訂 AI 晶片專為 LLM 推理打造,旨在提升 AI 系統的效能、效率及擴展規模。
Hugging Face 與 Treble Technologies 推出並開放提交 FFASR Leaderboard,這是針對真實遠場聲學條件的開放、社羣協作 ASR 評測基準。
GPT-5 Pro 協助免疫學家 Derya Unutmaz 解開一宗困擾 3 年的免疫學謎團,並提供有關 T 細胞行為的見解。這項突破可能支持癌症及自身免疫研究。
OpenAI 透過 Appia Foundation 協助建立先進 AI 的共同標準,並支持評估框架、安全實踐與全球合作。
Mistral AI 發佈文件解析模型 Mistral OCR 4,除提取文字外亦輸出邊界框、區塊類型和信心分數,並支援 170 種語言、10 個語言組別。獨立人工偏好評估的平均勝率為 72%,模型在 OlmOCRBench 得分 85.20;官方提醒自動基準存在評分侷限,建議以自有文件評估。
推薦理由:文章列明 OCR 4 的結構化輸出和自動基準評分侷限,為企業按自身文件評估解析、檢索及資料管線提供具體參照。
Omio 正運用 OpenAI 打造對話式旅行體驗、加快產品開發,並轉型為 AI 原生公司。
OpenAI 推出 Patch the Planet,這項 Daybreak 倡議旨在協助開源維護者運用 AI 和專家審查尋找、驗證並修復漏洞。
OpenAI 推出 Daybreak 工具,包括 Codex Security 和 GPT-5.5-Cyber,協助組織大規模尋找、驗證及修補漏洞。Daybreak 旨在協助全球所有組織加強安全防護。
Jason Liu 使用 Codex 保留脈絡並管理複雜專案。這讓工作得以延續至單一提示詞以外,支援長時間任務。
Samsung Electronics 向全球員工部署 ChatGPT Enterprise 和 Codex。OpenAI 稱,這是其規模最大的企業 AI 部署之一。
推薦理由:這則公告提供企業級 AI 落地的具體案例,交代 Samsung Electronics 面向全球員工部署的產品,也呈現 OpenAI 對此次部署規模的定位。
OpenAI 為 ChatGPT Enterprise 推出全新用量分析及更新版支出控制。這些功能協助機構管理成本,並更有信心地擴展 AI。
GPT-5.5 Instant 改善 ChatGPT 對健康與保健問題的回應,並提升推理、上下文運用及溝通清晰度。相關評估參考醫師意見。
研究人員使用 OpenAI 推理模型協助診斷兒童罕見遺傳病,並在此前未解的病例中識別出 18 項新診斷。
推薦理由:文中同時交代模型介入的診斷場景與未解病例結果,提供觀察 AI 參與兒童罕見遺傳病研究的一個具體切面。
Hugging Face 測試開源模型使用 transformers,CLI 與 Skill 縮短大型模型耗時,卻可能降低小模型成功率。Qwen3-14B 在 classify-sentiment 任務中,clone 環境的匹配率為 100%,Skill 環境則降至 0%。agent-eval CLI 可套用於其他命令列工具,並記錄匹配率、tokens、耗時、錯誤、行為標記及執行軌跡。
推薦理由:評測不只看任務是否成功,也追蹤 tokens、耗時與操作路徑,呈現 CLI 與 Skill 對大小模型的影響並不一致。
GLM-5.2 發佈,將最大上下文長度由 200K 擴至 1M tokens,並強化長程任務與編碼能力。它在 Terminal-Bench 2.1 和 SWE-bench Pro 分別取得 81.0、62.1,高於 GLM-5.1 的 63.5、58.4。
推薦理由:文章並列長程編碼基準成績與 IndexShare、MTP 的效率改動,讓讀者可對照模型性能數據和 1M-token 上下文的工程支撐。
Hugging Face 推出 Discover Tool,作為 Agentic Resource Discovery(ARD)規範的參考實作,讓智能體可在執行時搜尋並發現能力。
推薦理由:ARD 把能力發現由預先安裝轉為跨登錄表搜尋,Hugging Face Discover 可按需求將 Space 呈現為技能或 MCP 伺服器。
OpenAI 推出 LifeSciBench,這是一項由專家撰寫並審核的基準,用於評估 AI 系統處理真實生命科學研究任務及決策的能力。
Google Research 發佈由 Farmscapes 2020 像素地圖轉製的英格蘭農地向量數據集,列出樹籬、石牆與樹叢等細尺度生態要素。
OpenAI 推出 Deployment Simulation,透過真實對話資料預測 AI 模型部署前的行為。該方法旨在提升安全性及評估準確度。
OpenAI 推出 Partner Network,並投入 $150M 支援全球合作夥伴。這項計劃旨在加快企業 AI 的採用、部署與轉型。
Google Research 分享兩項關於皮膚狀況 AI 的研究,發現 AI 輔助能提高參與者辨認病況的能力,但標準 AI 組判斷後續步驟的準確度沒有顯著提升。
OpenAI Academy 推出三門課程,協助人們培養實用 AI 技能、建立可重複使用的工作流程,並在日常工作中應用 AI 智能體。
Preply 使用 OpenAI 推出 AI 生成的課堂摘要,提供個人化回饋及語言學習練習,將 AI 用於個人化語言學習。
天體物理學家 Chi-kwan Chan 使用 Codex 建構黑洞模擬,協助科學家研究極端物理,並檢驗 Einstein 的廣義相對論。
Hugging Face Blog 第二篇 PyTorch 效能分析教程,從 nn.Linear 追蹤至 GeGLU MLP。
推薦理由:文章對比 eager、torch.compile 與 Liger,展示 MLP 融合如何減少 HBM 往返,以及固定形狀特化與跨形狀通用的取捨。
OpenAI 計劃收購 Ona,以安全、持久的雲端環境擴展 Codex。此舉將支援 AI 智能體在企業工作流程中長時間運行。
推薦理由:這宗收購把雲端環境與 Codex 的擴展連結起來,可從中瞭解 OpenAI 如何將長時間運行的 AI 智能體延伸至企業工作流程。
BBVA 將 ChatGPT Enterprise 擴展至 100,000 名員工,並與 OpenAI 合作。合作旨在加快全球銀行業的 AI 轉型。
OpenAI 支持歐盟《AI 內容透明度實務守則》,推進內容來源追溯標準及工具建設,協助公眾理解 AI 生成內容。
OpenAI 開放企業透過 Oracle Cloud 使用 OpenAI 模型與 Codex,並可利用現有承諾建構及部署 AI。此方式涵蓋企業安全與治理。
Google Research 提出 Regularized f-Divergence Kernel Tests,以相對距離檢驗審核機器遺忘,並於 AISTATS 2026 發表。
Google DeepMind 發佈實驗性開放模型 DiffusionGemma,透過文字擴散並行生成文字,在專用 GPU 上文字生成最高快 4 倍。
推薦理由:DiffusionGemma 的優勢集中於低至中等批次的單加速器推理,高 QPS 雲端服務則可能收益較小並增加服務成本。
Google DeepMind 宣佈最高 $10M 的多智能體 AI 安全研究資助計劃,面向全球研究人員徵集申請。
LSEG 使用 OpenAI,在全球業務中擴大可信 AI 的應用規模。此舉加速洞察產出、縮短發布週期,並賦能 4,000 名員工。
Google DeepMind 發佈 Gemini 3.5 Live Translate,這款音訊模型可自動識別 70+ 種語言,並進行近乎即時的語音轉語音翻譯。
推薦理由:模型以連續生成譯語音訊取代逐輪等待,並透過 API、Google Meet 和 Google Translate 進入開發、企業會議及日常翻譯場景,呈現其部署路徑。
Google DeepMind 發佈 Gemma 4 12B,定位為可在筆記型電腦本機運行的多模態模型,並為中型模型加入原生音訊輸入。它採用免多模態編碼器架構,將視覺和音訊輸入直接整合至 LLM backbone;標準基準表現接近 26B MoE,總記憶體佔用不足其一半。Gemma 4 12B 以 Apache 2.0 授權釋出,可透過 LM Studio、Ollama 等工具試用。
推薦理由:Gemma 4 12B 的免編碼器設計、接近 26B MoE 的基準表現與較低記憶體佔用,提供比較中型多模態模型架構和本機部署定位的具體依據。
Google DeepMind 推出 Google DeepMind Accelerator: Robotics,選出 15 家歐洲機械人初創參加為期 3 個月的計劃。入選團隊可接觸 Google 的 AI stack 及 Gemini robotics models,並獲 Google DeepMind 與 Google 團隊提供技術指導和產品指引。
Nextdoor 工程師使用 Codex 搭配 GPT-5.5,調查難以重現的問題並跨平台開發。其工作亦聚焦產品成果。