GPT-6 系列模型指南
OpenAI 的 GPT-6 系列模型指南説明初創企業如何選擇 GPT-6 模型、調整推理力度,並準備投入生產的工作流程。指南亦涵蓋改善提示詞與技能,以及協調工具。
OpenAI 的 GPT-6 系列模型指南説明初創企業如何選擇 GPT-6 模型、調整推理力度,並準備投入生產的工作流程。指南亦涵蓋改善提示詞與技能,以及協調工具。
NVIDIA 宣佈 DGX Spark 64GB 配置將於 10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 開售,起價 $4,999。
Google DeepMind 發佈前沿模型 Gemini 4 Argon,面向軟件工程、企業知識工作及網絡安全等複雜長流程任務。其輸出 token 上限由 64K 提至 1M,在 DeepSWE v1.1 得分 77.9%,並在 LVBench 得分 91.7%。
推薦理由:Gemini 4 Argon 將輸出上限由 64K 提至 1M tokens,文章把這項擴容與處理更長、更複雜工作流程的能力相連。
Amazon Bedrock 現已在首爾支援 Claude Opus 5 和 Claude Sonnet 5 的區域內推理,並在新加坡支援 Claude Sonnet 5。
NVIDIA 發佈開放式表格基礎模型 Kumo Tabular,用於表格分類與回歸,可根據帶標籤的上下文列,在單次前向傳播中預測新列標籤,無需訓練、調參或特徵工程。
推薦理由:文章列出四項基準的結果,並以梯度提升樹、AutoGluon 等方法作對照,為表格預測模型的效能評估提供具體比較參照。
Microsoft Research 介紹 Quine,一個結合生物學多模態世界模型與互動式研究流程的 AI 研究系統,並開放首屆 Quine Fellows 計劃申請。
推薦理由:Quine 將跨生物模態的世界模型接入文獻、科研工具與實驗迴圈,並以胰臟癌細胞狀態轉換案例展示預測如何進入濕實驗驗證。
OpenAI 介紹 GPT-6 Astra,稱其為面向商業用途能力最強的模型。它具備進階推理、電腦操作能力,以及更強的寫作與設計判斷能力。
OpenAI 分享一份針對 Navier–Stokes 千禧年大獎難題的 AI 生成解答。材料包括解説稿,以及以 Lean 撰寫的形式化證明。
推薦理由:材料同時附上解説稿與 Lean 形式化證明,讀者可對照文字論證及形式化證明檢視這份 AI 生成解答。
Google DeepMind 發佈 Gemini 3.8 Flash 與 Gemini 3.8 Flash Cyber,並稱 Gemini 3.8 Flash 是其迄今推理與編碼能力最強的模型,速度和成本與 3.7 Flash 相同。
推薦理由:兩款模型共享基礎智能,普通版面向長程編碼與智能體任務,Cyber 版則限可信防守者使用,提供漏洞發現與修補能力。
AllenAI 推出 BenchMIRT,利用多維項目反應理論(MIRT)逐題分析 LLM 基準測試,分辨安全與一般推理等能力訊號。BenchMIRT 以 100 個 LLM 在 16 個基準、逾 34K 條問題上的評測結果訓練;研究團隊沒有告知各基準預期測量哪些能力,它仍識別出安全和一般推理兩個主要維度,並發現 BBQ 更貼近一般推理。
IBM Granite 團隊詳述 Granite 4.2 推理模型系列的構建流程,涵蓋架構、訓練方法及評測結果。該系列有 3B、8B、30B 三種稠密、僅解碼器模型,均由 Granite-4.1 base models 後訓練;後者以約 15T tokens 預訓練,並透過五階段策略將上下文窗口延至 512K tokens。
推薦理由:文中並列三種規模共用的訓練主線,以及 8B、30B 額外加入真實環境 Agentic RL 的分支,可據此理解各規模訓練階段和智能體能力培養的差異。
OpenAI 預覽新的 API 服務層 Ultrafast,為 GPT-5.6 Sol 提供最高 14× 的速度提升。該服務由 Cerebras 提供支援,輸出速度最高可達每秒 750 個 token。
Google Research 提出 knowledge profiling 框架及 WikiProfile 基準,發現前沿大語言模型的事實性錯誤更多源於已編碼事實難以回憶,而非未能編碼。
推薦理由:研究以 WikiProfile 分別測量事實編碼、回憶與識別,將模型事實性錯誤區分為知識缺失或提取失敗,提供比單看答題準確率更細的診斷視角。
Google DeepMind 發佈 Gemini Robotics ER 2,這款面向機械人的具身推理模型可理解連續影片、編排多步任務,並支援多機械人協作。它在任務進度分類達 57.4% 準確率,關鍵時刻定位達 91.3% 準確率、平均絕對距離為 0.96s。
推薦理由:文章將影片進度追蹤與多機械人協作納入模型更新,並提供任務評測數據,讓讀者掌握 Gemini Robotics ER 2 的具身推理能力變化。
GPT-5.6 提升 AI 在模型、推理及智能體工作流程各方面的效率,有助於讓每一美元帶來更多實用智能。
Diffusers 現已原生支援 Nunchaku Lite 的 4-bit 擴散模型推理,預量化檢查點可用 `from_pretrained()` 載入,無須獨立推理引擎或本機編譯 CUDA。
推薦理由:文章説明 Nunchaku Lite 在 Diffusers 的原生載入方式,並以 RTX PRO 6000 基準量化呈現延遲與顯存變化。
Mistral AI 發佈 Leanstral 1.5,這款 Apache-2.0 授權模型總參數量為 119B、活躍參數為 6B,面向 Lean 4 形式化驗證。
推薦理由:文章不只列出形式化數學基準,也以 AVL 樹複雜度證明及 57 個程式庫的漏洞排查,呈現 Leanstral 1.5 將定理證明延伸至實際程式驗證的應用。
Google Research 發佈 TabFM,這款表格數據基礎模型以上下文學習執行分類與回歸,並可在單次前向傳遞中預測。TabFM 以結構因果模型動態生成的數億個合成資料集訓練,並在 TabArena 的 38 個分類與 13 個回歸資料集上評測。
Google Research 已將 Multi-Token Prediction(MTP)架構部署至 Pixel 9 和 10 系列的 Gemini Nano v3,透過凍結主模型權重加快裝置端文字生成。
推薦理由:文章對照整合式 MTP head 與獨立草稿模型,説明直接利用主模型狀態如何提升候選 token 準確度,並改善 Pixel 端的速度與記憶體效率。
Google Research 的研究發現,讓大語言模型生成推理軌跡,可喚回關閉推理時幾乎無法取出的參數化知識。研究以 Gemini-2.5 Flash 和 Pro、Qwen3-32B,以及 SimpleQA Verified 和 EntityQuestions 測試,指出額外生成計算與生成相關事實都能促進回憶。
OpenAI 與 Broadcom 推出 Jalapeño,這款自訂 AI 晶片專為 LLM 推理打造,旨在提升 AI 系統的效能、效率及擴展規模。
GPT-5 Pro 協助免疫學家 Derya Unutmaz 解開一宗困擾 3 年的免疫學謎團,並提供有關 T 細胞行為的見解。這項突破可能支持癌症及自身免疫研究。
GPT-5.5 Instant 改善 ChatGPT 對健康與保健問題的回應,並提升推理、上下文運用及溝通清晰度。相關評估參考醫師意見。
研究人員使用 OpenAI 推理模型協助診斷兒童罕見遺傳病,並在此前未解的病例中識別出 18 項新診斷。
推薦理由:文中同時交代模型介入的診斷場景與未解病例結果,提供觀察 AI 參與兒童罕見遺傳病研究的一個具體切面。
GLM-5.2 發佈,將最大上下文長度由 200K 擴至 1M tokens,並強化長程任務與編碼能力。它在 Terminal-Bench 2.1 和 SWE-bench Pro 分別取得 81.0、62.1,高於 GLM-5.1 的 63.5、58.4。
推薦理由:文章並列長程編碼基準成績與 IndexShare、MTP 的效率改動,讓讀者可對照模型性能數據和 1M-token 上下文的工程支撐。
Google DeepMind 發佈實驗性開放模型 DiffusionGemma,透過文字擴散並行生成文字,在專用 GPU 上文字生成最高快 4 倍。
推薦理由:DiffusionGemma 的優勢集中於低至中等批次的單加速器推理,高 QPS 雲端服務則可能收益較小並增加服務成本。
Google DeepMind 發佈 Gemma 4 12B,定位為可在筆記型電腦本機運行的多模態模型,並為中型模型加入原生音訊輸入。它採用免多模態編碼器架構,將視覺和音訊輸入直接整合至 LLM backbone;標準基準表現接近 26B MoE,總記憶體佔用不足其一半。Gemma 4 12B 以 Apache 2.0 授權釋出,可透過 LM Studio、Ollama 等工具試用。
推薦理由:Gemma 4 12B 的免編碼器設計、接近 26B MoE 的基準表現與較低記憶體佔用,提供比較中型多模態模型架構和本機部署定位的具體依據。
NVIDIA 發佈 Nemotron 3.5 Content Safety,將多模態輸入、多語言覆蓋、自訂企業政策與可審計推理整合至單一 4B 模型。模型基於 Google Gemma 3 4B IT,明確訓練覆蓋 12 種語言,並承接其約 140 種語言的 zero-shot 泛化;可選 THINK mode 會輸出推理軌跡。
推薦理由:Nemotron 3.5 將多模態判定、自訂政策和可審計推理整合於 4B 模型,並附訓練資料集,提供企業安全審核的部署參考。
JetBrains 發佈 Mellum2,一款以自然語言和程式碼從零訓練的 12B MoE 模型,每個 token 啟用 2.5B 參數。模型採 Apache 2.0 授權,適用於路由、RAG、摘要、子智能體及高吞吐程式功能等工作負載。
OpenAI 的一個模型解決了有 80 年歷史的單位距離問題,推翻離散幾何中的一項重要猜想。這項成果標誌著 AI 驅動數學的一個里程碑。
推薦理由:這項成果為 AI 驅動數學提供一個具體案例,呈現模型解決離散幾何 80 年單位距離問題並推翻重要猜想的結果。
Berkeley AI Research 梳理自適應並行推理(Adaptive Parallel Reasoning,APR)的研究進展,將其界定為模型在推理時自行決定何時並行、分配多少執行緒及如何協調控制流的範式。
Google DeepMind 宣佈 AI co-clinician 研究計劃,探索讓 AI 在醫生專業監督下協助患者照護。在 98 個基層醫療問題的評估中,97 個案例錄得零項嚴重錯誤;在開放式藥物問答中,系統表現勝過可用的前沿 AI 系統。
推薦理由:文章並列呈現 AI co-clinician 在證據整理、藥物問答和多模態問診的測試結果,並以醫生整體表現較佳界定其臨牀輔助定位。
Granite Team(IBM)詳述 Granite 4.1 的 3B、8B 和 30B 模型構建流程,涵蓋預訓練、監督式微調和多階段強化學習。預訓練以約 15T tokens 分五階段進行,並將上下文窗口擴至最高 512K tokens;其後以約 4.1M 經整理樣本作微調,採用 on-policy GRPO 配合 DAPO loss 進行強化學習。
推薦理由:文章梳理 Granite 4.1 從約 15T tokens 預訓練、約 4.1M 樣本微調到多階段強化學習的流程,呈現 dense 模型的訓練設計取捨。
NVIDIA 發佈 Nemotron 3 Nano Omni,這款長上下文多模態模型面向文件分析、音訊與影片理解、智能體電腦操作及通用推理。
推薦理由:文章並列 Nemotron 3 Nano Omni、Nemotron Nano V2 VL 與 Qwen3-Omni 的多項基準結果,另列系統效率數據,提供文件、影音和 GUI 任務的比較依據。
深度求索(DeepSeek)發佈 DeepSeek-V4,Pro、Flash 系列各有 instruct 與 base 版本,四款 checkpoint 均支援 1M-token 上下文。
推薦理由:文章把 KV cache 成本、混合注意力設計與智能體工作流串連起來,並以基準數據呈現長上下文能力在工具任務中的表現。
GRASP 是一種面向學習型世界模型的梯度式規劃器,透過虛擬狀態並行化時間步最佳化,令長時域規劃更實用。它在狀態迭代中直接加入隨機性以探索,並重塑梯度,讓動作取得清晰訊號,同時避開穿過高維視覺模型的不穩定「狀態輸入」梯度。
OpenAI 推出 GPT-Rosalind,這是一款旨在加速藥物發現、基因組分析、蛋白質推理及科學研究工作流程的前沿推理模型。
Google DeepMind 發佈 Gemma 4 開放模型家族,提供 E2B、E4B、26B MoE 和 31B Dense 四種尺寸,並採用 Apache 2.0 授權。
推薦理由:Gemma 4 提供從手機端到工作站的多種尺寸,並列出排行榜名次與上下文窗口,便於比較本地部署時的硬件需求和能力差異。
Mistral AI 發佈 Mistral Small 4,將 Magistral 的推理、Pixtral 的多模態及 Devstral 的智能體編碼能力整合至單一模型。
推薦理由:Mistral Small 4 整合指令、推理、多模態及智能體編碼能力,並列出相較 Mistral Small 3 的吞吐數據,可供比較單一模型承接多類任務時的效率表現。
Mistral AI 開源 Leanstral,一款為 Lean 4 設計、用於程式碼生成與形式化證明的程式碼智能體,採用 6B active parameters。