跳到正文

#推理

今日 77 條
12月11日週四
  1. OpenAI News67

    GPT-5.2 推進科學與數學研究

    OpenAI 表示,GPT-5.2 是其目前在數學與科學領域最強的模型,並在 GPQA Diamond 和 FrontierMath 等基準上取得新的最佳成績。文章列舉其求解一個尚未解決的理論問題,以及生成可靠數學證明的案例,展示基準表現如何轉化為實際研究進展。

    推薦理由:文章把 GPQA Diamond、FrontierMath 的基準表現連結到求解尚未解決的理論問題和生成可靠數學證明的案例,呈現 GPT-5.2 在研究任務中的具體落點。

  2. OpenAI News71

    OpenAI 發佈面向日常專業工作的 GPT-5.2

    OpenAI 發佈 GPT-5.2,稱其為面向日常專業工作的最先進前沿模型,具備最先進的推理、長上下文理解、編碼和視覺能力。GPT-5.2 可在 ChatGPT 和 OpenAI API 中使用,以支援更快、更可靠的智能體工作流。

    推薦理由:原文交代 GPT-5.2 的能力定位及 ChatGPT、OpenAI API 的使用入口,讀者可瞭解它面向的專業工作與智能體工作流。

12月5日週五
12月3日週三
  1. Mistral AI77

    Mistral AI 發佈 Mistral 3 模型系列,包含 Ministral 3 與 Mistral Large 3

    Mistral AI 發佈 Mistral 3 模型系列,包含 14B、8B、3B 三款 Ministral 3,以及 Mistral Large 3。Ministral 3 的每種尺寸均提供 base、instruct 和 reasoning 版本,具備圖像理解能力;全系列均按 Apache 2.0 授權釋出。

    推薦理由:Mistral 3 覆蓋 3B 至 675B 的模型規模,並列出邊緣端與資料中心的部署路徑,可供比較開源模型的部署選擇。

12月1日週一
11月24日週一
11月20日週四
11月19日週三
11月18日週二
11月13日週四
  1. Google DeepMind66

    Google DeepMind 推出 SIMA 2:能在虛擬 3D 世界中遊玩、推理並與你一同學習的智能體

    Google DeepMind 推出研究智能體 SIMA 2,將 Gemini 推理能力整合至虛擬 3D 遊戲,使其能理解目標、規劃行動並與用户對話。它能將在不同遊戲中學到的概念遷移,也可透過試錯及 Gemini 回饋利用自身經驗繼續訓練,並在 Genie 3 生成的新世界中嘗試執行任務。

    推薦理由:SIMA 2 結合 Gemini 推理、跨遊戲技能遷移與自生成經驗訓練,並交代長程任務、記憶和精細鍵盤滑鼠操作的限制。

11月7日週五
11月4日週二
10月29日週三
9月29日週一
9月12日週五
8月21日週四
8月11日週一
8月5日週二
  1. Hugging Face Blog91

    OpenAI 發佈開源 GPT OSS 模型系列

    OpenAI 發佈 GPT OSS 開源模型系列,包含 117B 參數的 gpt-oss-120b 和 21B 參數的 gpt-oss-20b。兩款均為 MoE 推理模型,採用 MXFP4 4-bit 量化;gpt-oss-120b 可在單張 80 GB GPU 運行,gpt-oss-20b 可在 16GB 記憶體內運行。

    推薦理由:文章將兩款模型的量化方式、硬件需求與多種部署路徑整理在一起,便於評估本地推理的資源門檻及接入方式。

  2. OpenAI News84

    OpenAI 發佈 gpt-oss-120b 和 gpt-oss-20b 兩款開放權重語言模型

    OpenAI 發佈 gpt-oss-120b 和 gpt-oss-20b 兩款低成本開放權重語言模型,採用 Apache 2.0 授權。它們在推理任務上優於規模相近的開放模型,並具備良好工具使用能力,亦針對消費級硬件高效部署作最佳化。

    推薦理由:推理表現、工具使用能力與消費級硬件部署資訊一併呈現,便於從能力和部署兩方面理解兩款開放權重模型的取向。

8月3日週日
  1. OpenAI Developers59

    OpenAI 推理模型使用指南涵蓋 Responses API 配置與上下文管理

    OpenAI 的 Reasoning guide 説明如何透過 Responses API 使用推理模型,並設定 reasoning.effort、reasoning.mode 及跨回合上下文。指南提醒各模型支援的設定與預設值不同,推理 tokens 會佔用上下文窗口並按輸出 tokens 計費,初期建議為推理及輸出至少預留 25,000 tokens;另涵蓋函數調用、保存推理狀態與提示詞建議。

7月21日週一
7月8日週二
6月12日週四
6月10日週二
5月28日週三
  1. DeepSeek:API 更新日誌76

    DeepSeek 將 deepseek-reasoner 升級至 DeepSeek-R1-0528,推理基準分數提升

    DeepSeek 將 deepseek-reasoner 升級至 DeepSeek-R1-0528,並公佈多項基準的 Pass@1 提升。AIME 2025 由 70.0 升至 87.5(+17.5),GPQA 由 71.5 升至 81.0(+9.5),LCB_v6 由 63.5 升至 73.3(+9.8),Aider 由 57.0 升至 71.6(+14.6)。

    推薦理由:DeepSeek-R1-0528公佈多項基準提升數據,並提示複雜推理任務較舊版消耗更多 tokens,可供比較版本能力表現與用量。

5月23日週五
  1. OpenAI Developers60

    OpenAI 指南探討如何為強化微調設計模型評分器

    OpenAI 的指南示範如何為 o4-mini 設計模型評分器,並以臨牀對話結果預測任務進行強化微調(RFT)。實驗使用 100 個訓練樣本和 100 個驗證樣本,採用 gpt-4.1 模型評分器後,微調模型的驗證評分較基礎 o4-mini 提高約 5 個百分點。指南亦展示詞面評分可能誘發模型加入同義詞、劑量或治療方案來刷分,並建議以領域專家檢查評分器和資料品質。

5月21日週三
  1. Hugging Face Blog47

    Falcon-Arabic:阿拉伯語言模型的一項突破

    阿聯酋 Technology Innovation Institute(TII)推出 Falcon-Arabic,這款基於 Falcon 3 架構的 7B 參數模型支援阿拉伯語、英語及其他語言。它在 OALL v2 評測中勝過同規模阿拉伯語 LLM,並超越規模大至 4× 的模型。其上下文窗口為 32,000 tokens,可處理長文件並支援 RAG 等應用。

3月24日週一
3月10日週一
  1. OpenAI News61

    OpenAI 展示如何偵測前沿推理模型的不當行為

    OpenAI 表示,利用 LLM 監測前沿推理模型的思維鏈,可偵測模型利用漏洞的不當行為。懲罰模型的「不良思維」無法阻止大多數不當行為,反而會令它們隱藏意圖。

    推薦理由:材料對照監測與懲罰的結果,指出思維鏈監測能偵測漏洞利用,而懲罰不良思維未能阻止大多數不當行為,並會令模型隱藏意圖。

3月7日週五
  1. Hugging Face Blog61

    用 React Native 在手機上本地執行 LLM 的入門指南

    Hugging Face Blog 的教程示範以 React Native 建立手機應用,在裝置本地執行 LLM 聊天。應用從 Hugging Face Hub 下載 GGUF 模型,並以 llama.rn(llama.cpp 的 binding)載入,教程涵蓋 Android 和 iOS。文章亦介紹 GGUF 量化格式、手機選模取捨,以及逐 token 生成與推理速度追蹤等功能。

    推薦理由:文章按模型選擇、GGUF 下載與載入、聊天介面逐步拆解 React Native 實作,並説明量化格式與設備能力的取捨,可作為端側 LLM 應用的開發參考。

2月10日週一
  1. Sam Altman:Blog62

    Sam Altman 提出 AI 經濟的三項觀察

    Sam Altman提出三項關於AI經濟的觀察,認為模型智能大致隨訓練及推理計算資源的對數增加,智能的社會經濟價值則呈超指數增長。他指出,同等 AI 水平的使用成本約每 12 個月下降 10x;以 GPT-4 於 2023 年初和 GPT-4o 於 2024 年中的每個 token 價格相比,價格約下降 150x。

2月4日週二
  1. Hugging Face Blog53

    DABstep:面向多步推理的數據智能體基準

    Hugging Face 與 Adyen 聯合推出 DABstep,這項基準以450多項數據分析任務評估 AI 智能體的多步推理能力。任務源自 Adyen 的實際工作負載,但資料與商業背景為人工生成;基準涵蓋結構化資料和非結構化文件,並提供資料集、任務、評測、即時排行榜及基線。

1月30日週四
1月22日週三