GPT-5.2 推進科學與數學研究
OpenAI 表示,GPT-5.2 是其目前在數學與科學領域最強的模型,並在 GPQA Diamond 和 FrontierMath 等基準上取得新的最佳成績。文章列舉其求解一個尚未解決的理論問題,以及生成可靠數學證明的案例,展示基準表現如何轉化為實際研究進展。
推薦理由:文章把 GPQA Diamond、FrontierMath 的基準表現連結到求解尚未解決的理論問題和生成可靠數學證明的案例,呈現 GPT-5.2 在研究任務中的具體落點。
OpenAI 表示,GPT-5.2 是其目前在數學與科學領域最強的模型,並在 GPQA Diamond 和 FrontierMath 等基準上取得新的最佳成績。文章列舉其求解一個尚未解決的理論問題,以及生成可靠數學證明的案例,展示基準表現如何轉化為實際研究進展。
推薦理由:文章把 GPQA Diamond、FrontierMath 的基準表現連結到求解尚未解決的理論問題和生成可靠數學證明的案例,呈現 GPT-5.2 在研究任務中的具體落點。
OpenAI 發佈 GPT-5.2,稱其為面向日常專業工作的最先進前沿模型,具備最先進的推理、長上下文理解、編碼和視覺能力。GPT-5.2 可在 ChatGPT 和 OpenAI API 中使用,以支援更快、更可靠的智能體工作流。
推薦理由:原文交代 GPT-5.2 的能力定位及 ChatGPT、OpenAI API 的使用入口,讀者可瞭解它面向的專業工作與智能體工作流。
ARC Prize 公佈 2025 年競賽得主並分析 ARC-AGI 進展,最高獎項 Grand Prize 仍未有人取得。
Mistral AI 發佈 Mistral 3 模型系列,包含 14B、8B、3B 三款 Ministral 3,以及 Mistral Large 3。Ministral 3 的每種尺寸均提供 base、instruct 和 reasoning 版本,具備圖像理解能力;全系列均按 Apache 2.0 授權釋出。
推薦理由:Mistral 3 覆蓋 3B 至 675B 的模型規模,並列出邊緣端與資料中心的部署路徑,可供比較開源模型的部署選擇。
Hugging Face 發佈 Transformers v5.0.0rc-0,將簡化模型定義、訓練、推理和生產支援列為重點,並以互操作性貫穿版本改造。
推薦理由:文章説明 Transformers v5 如何銜接訓練工具、推理引擎與本地部署,並呈現其聚焦 PyTorch、提升量化支援的工程取捨。
DeepSeek 將 deepseek-chat 和 deepseek-reasoner 升級至 DeepSeek-V3.2。deepseek-chat 對應非思考模式,deepseek-reasoner 對應思考模式。更新日誌:https://api-docs.deepseek.com/updates#deepseek-v32
UCLA 教授 Ernest Ryu 與 GPT-5 解決了最佳化理論中的一個關鍵問題,展示 AI 加速數學發現的作用。
OpenAI 公佈首批研究案例,展示 GPT-5 如何在數學、物理、生物學及電腦科學領域加速科學進展。案例呈現 AI 與研究人員協作生成證明、發現新見解,並改變科學發現的步調。
Google DeepMind 發佈 Gemini 3,推出預覽版 Gemini 3 Pro,並介紹加強推理能力的 Gemini 3 Deep Think。
推薦理由:Gemini 3 Pro 與 Gemini 3 Deep Think 的兩項基準成績並列,便於比較加強推理模式在 Humanity’s Last Exam 和 GPQA Diamond 的分數差異。
Inception Labs 宣佈 Mercury 擴散式大語言模型現已可於 Azure AI Foundry 使用。該模型以擴散架構並行生成多個 token;Inception Labs 稱其在知識、編碼、指令跟隨和數學基準上與 Gemini 2.5 Flash、Claude 4.5 Haiku 表現相若,速度最高可達同類自回歸模型的 10x。
Google DeepMind 推出研究智能體 SIMA 2,將 Gemini 推理能力整合至虛擬 3D 遊戲,使其能理解目標、規劃行動並與用户對話。它能將在不同遊戲中學到的概念遷移,也可透過試錯及 Gemini 回饋利用自身經驗繼續訓練,並在 Genie 3 生成的新世界中嘗試執行任務。
推薦理由:SIMA 2 結合 Gemini 推理、跨遊戲技能遷移與自生成經驗訓練,並交代長程任務、記憶和精細鍵盤滑鼠操作的限制。
OpenAI 正探索機制可解釋性,以理解神經網絡如何進行推理。其新的稀疏模型方法可能令 AI 系統更透明,並支持更安全、可靠的行為。
OpenAI 已在 API 中提供 GPT-5.1,帶來更快的自適應推理、擴展的提示詞快取及更佳的編碼表現。API 新增 apply_patch 和 shell 工具。
推薦理由:更新涵蓋自適應推理、提示詞快取、編碼表現及 apply_patch 和 shell 工具,勾勒 GPT-5.1 面向開發者的 API 改進範圍。
Inception Labs 發佈升級版 Mercury 擴散式大語言模型,稱其編碼、指令遵循、數學問題求解與知識回憶表現均有提升。
OpenAI 推出 IndQA,這是一項用於評估 AI 系統在印度語言中表現的新基準測試。IndQA 由領域專家共同構建,涵蓋 12 種語言和 10 個知識領域,測試文化理解與推理能力。
OpenAI 推出 gpt-oss-safeguard,這是一組用於安全分類的開放權重推理模型。開發者可套用並迭代自訂政策。
DeepSeek 將 deepseek-chat 和 deepseek-reasoner 升級至 DeepSeek-V3.2-Exp,分別對應其非思考模式與思考模式。詳情可參閲更新日誌:https://api-docs.deepseek.com/updates#deepseek-v32-exp。
WRITER 發佈 Palmyra-mini 系列三款 1.5B 至 1.7B 開放模型,涵蓋通用生成、複雜邏輯推理及數學推理。
DeepSeek 將 deepseek-chat 和 deepseek-reasoner 升級至 DeepSeek-V3.1,兩者分別對應非思考模式和思考模式。
OpenAI 指南説明如何驗證 gpt-oss 推理服務的 API 實作、工具調用與模型表現。Responses API 的 reasoning 項目應以 reasoning_text 傳回原始 CoT;Chat Completions 則建議使用 reasoning 欄位,並在後續請求中一併傳回 CoT。
OpenAI 發佈 gpt-oss-120b 和 gpt-oss-20b 兩款開放權重推理模型。兩款模型依 Apache 2.0 license 及 OpenAI 的 gpt-oss usage policy 提供。
推薦理由:同時列出 gpt-oss-120b 與 gpt-oss-20b,並交代 Apache 2.0 授權及 gpt-oss usage policy,讀者可掌握模型開放使用的基本條件。
OpenAI Developers 示範用 Hugging Face TRL 和 LoRA 微調 openai/gpt-oss-20b,讓模型按指定語言生成鏈式推理。
OpenAI 發佈 GPT OSS 開源模型系列,包含 117B 參數的 gpt-oss-120b 和 21B 參數的 gpt-oss-20b。兩款均為 MoE 推理模型,採用 MXFP4 4-bit 量化;gpt-oss-120b 可在單張 80 GB GPU 運行,gpt-oss-20b 可在 16GB 記憶體內運行。
推薦理由:文章將兩款模型的量化方式、硬件需求與多種部署路徑整理在一起,便於評估本地推理的資源門檻及接入方式。
OpenAI 發佈 gpt-oss-120b 和 gpt-oss-20b 兩款低成本開放權重語言模型,採用 Apache 2.0 授權。它們在推理任務上優於規模相近的開放模型,並具備良好工具使用能力,亦針對消費級硬件高效部署作最佳化。
推薦理由:推理表現、工具使用能力與消費級硬件部署資訊一併呈現,便於從能力和部署兩方面理解兩款開放權重模型的取向。
OpenAI 的 Reasoning guide 説明如何透過 Responses API 使用推理模型,並設定 reasoning.effort、reasoning.mode 及跨回合上下文。指南提醒各模型支援的設定與預設值不同,推理 tokens 會佔用上下文窗口並按輸出 tokens 計費,初期建議為推理及輸出至少預留 25,000 tokens;另涵蓋函數調用、保存推理狀態與提示詞建議。
OpenAI 指南按速度、成本、準確度及任務複雜度,説明如何選擇推理模型與 GPT 模型。指南建議由推理模型負責複雜規劃與決策、GPT 模型執行明確任務;提示詞保持簡潔直接,先試 zero-shot,必要時再加入 few-shot 範例。
Hugging Face 發佈 3B 模型 SmolLM3,使用 11.2T tokens 訓練,支援 think / no_think 雙模式推理及最高 128k 上下文。
推薦理由:SmolLM3 公開分階段訓練、長上下文適配與雙模式推理配方,並交代數據配比和模型合併流程,呈現 3B 模型的工程實作路徑。
TNG 指出,長提示詞的 prefill 會阻塞後續請求,並在與 decode 共用 GPU 時拖慢已開始生成的請求。vLLM 的並行 partial prefill 可降低短請求的 time-to-first-token;例如可設定最多並行 4 個請求,當中最多 1 個的 prompt 超過 10,000 tokens。
Mistral AI 發佈首款推理模型 Magistral,包含 24B 參數的開放權重版 Magistral Small 及企業版 Magistral Medium。
推薦理由:AIME2024 成績呈現兩版差異,Magistral Medium 和 Small 分別得 73.6% 和 70.7%,majority voting @64 時為 90% 和 83.3%。
DeepSeek 將 deepseek-reasoner 升級至 DeepSeek-R1-0528,並公佈多項基準的 Pass@1 提升。AIME 2025 由 70.0 升至 87.5(+17.5),GPQA 由 71.5 升至 81.0(+9.5),LCB_v6 由 63.5 升至 73.3(+9.8),Aider 由 57.0 升至 71.6(+14.6)。
推薦理由:DeepSeek-R1-0528公佈多項基準提升數據,並提示複雜推理任務較舊版消耗更多 tokens,可供比較版本能力表現與用量。
OpenAI 的指南示範如何為 o4-mini 設計模型評分器,並以臨牀對話結果預測任務進行強化微調(RFT)。實驗使用 100 個訓練樣本和 100 個驗證樣本,採用 gpt-4.1 模型評分器後,微調模型的驗證評分較基礎 o4-mini 提高約 5 個百分點。指南亦展示詞面評分可能誘發模型加入同義詞、劑量或治療方案來刷分,並建議以領域專家檢查評分器和資料品質。
Falcon-LLM Team 發佈 Falcon-H1 開放權重混合架構模型系列,涵蓋六種規模、由 0.5B 至 34B,並提供 base 與 instruction-tuned 版本。
推薦理由:文中對照 Qwen2.5-32B 的短、長上下文吞吐,並説明混合 Attention-SSM 設計,呈現 Falcon-H1 隨序列長度變化的效率取捨。
阿聯酋 Technology Innovation Institute(TII)推出 Falcon-Arabic,這款基於 Falcon 3 架構的 7B 參數模型支援阿拉伯語、英語及其他語言。它在 OALL v2 評測中勝過同規模阿拉伯語 LLM,並超越規模大至 4× 的模型。其上下文窗口為 32,000 tokens,可處理長文件並支援 RAG 等應用。
DeepSeek 將 deepseek-chat 升級至 DeepSeek-V3-0324,並公佈多項基準分數提升及功能改進。MMLU-Pro 由 75.9 升至 81.2(+5.3),GPQA 由 59.1 升至 68.4(+9.3),AIME 由 39.6 升至 59.4(+19.8),LiveCodeBench 由 39.2 升至 49.2(+10.0)。
OpenAI 表示,利用 LLM 監測前沿推理模型的思維鏈,可偵測模型利用漏洞的不當行為。懲罰模型的「不良思維」無法阻止大多數不當行為,反而會令它們隱藏意圖。
推薦理由:材料對照監測與懲罰的結果,指出思維鏈監測能偵測漏洞利用,而懲罰不良思維未能阻止大多數不當行為,並會令模型隱藏意圖。
Hugging Face Blog 的教程示範以 React Native 建立手機應用,在裝置本地執行 LLM 聊天。應用從 Hugging Face Hub 下載 GGUF 模型,並以 llama.rn(llama.cpp 的 binding)載入,教程涵蓋 Android 和 iOS。文章亦介紹 GGUF 量化格式、手機選模取捨,以及逐 token 生成與推理速度追蹤等功能。
推薦理由:文章按模型選擇、GGUF 下載與載入、聊天介面逐步拆解 React Native 實作,並説明量化格式與設備能力的取捨,可作為端側 LLM 應用的開發參考。
Sam Altman提出三項關於AI經濟的觀察,認為模型智能大致隨訓練及推理計算資源的對數增加,智能的社會經濟價值則呈超指數增長。他指出,同等 AI 水平的使用成本約每 12 個月下降 10x;以 GPT-4 於 2023 年初和 GPT-4o 於 2024 年中的每個 token 價格相比,價格約下降 150x。
Hugging Face 與 Adyen 聯合推出 DABstep,這項基準以450多項數據分析任務評估 AI 智能體的多步推理能力。任務源自 Adyen 的實際工作負載,但資料與商業背景為人工生成;基準涵蓋結構化資料和非結構化文件,並提供資料集、任務、評測、即時排行榜及基線。
OpenAI 最新系列推理模型將由美國國家實驗室的頂尖科學家使用,以推動科學突破。此舉旨在強化美國的 AI 領導地位。
OpenAI 以推理時運算換取對抗穩健性;原文未列明相關方法、模型或評測數據。