跳到正文
目前篩選:模型
  1. 英國 AI Security Institute:Blog76

    英國 AI Security Institute 評估 OpenAI GPT-5.5 的網絡安全能力

    英國 AI Security Institute 評估中,GPT-5.5 的 Expert 級進階任務平均通過率為 71.4%,高於 Mythos Preview 的 68.6%。

    推薦理由:報告分別測試進階網絡任務、企業攻擊鏈及工控模擬,並交代結果與測試限制,呈現 GPT-5.5 網絡安全能力的不同面向。

  1. Artificial Analysis 完整文章76

    GPT-6 Sol 和 Luna 價格約減半,推進成本效率前沿

    Artificial Analysis 的評測指出,GPT-6 Sol 和 Luna 定價約為 GPT-5.6 的一半,Intelligence Index 分數大致持平。

    推薦理由:文章並列價格、單項任務成本與多項基準結果,呈現降本幅度與不同能力變化並不一致,並指出 GDPval-AA v2.1 的回退與交付內容縮短相關。

  2. Artificial Analysis 完整文章77

    GPT-6.1 Sol 取代僅發佈 7 天的 GPT-6 Sol,Intelligence Index 接近 GPT-6 Astra

    GPT-6.1 Sol 取代僅發佈 7 天的 GPT-6 Sol,其 Intelligence Index 比 GPT-6 Astra 低 1 分,最高 effort 下的每項 Intelligence Index 任務成本不到後者四分之一。

    推薦理由:這篇評測以同一框架對照 GPT-6.1 Sol、GPT-6 Sol 和 GPT-6 Astra 的 Intelligence Index 分數與單項任務成本,為比較新版本接近 Astra 分數時的成本取捨提供具體依據。

  1. OpenAI News68

    OpenAI 發佈 GPT-6.1 Sol,稱其智能接近 Astra,API 輸入及輸出 token 價格為 Astra 標準價五分之一

    OpenAI 發佈 GPT-6.1 Sol,稱其面向編碼、電腦操作及專業工作,智能水平接近 Astra。其 API 輸入及輸出 token 價格均為 Astra 標準 API 對應價格的五分之一。

    推薦理由:公告把 GPT-6.1 Sol 的工作場景定位與 Astra 標準 API 輸入、輸出 token 價格作比較,便於瞭解其能力主張與定價定位。

  1. Latent Space83

    Anthropic 發佈 Claude Opus 5.5 並成為 AINews 預設模型,OpenAI 推出降價版 GPT-6 Sol 與 GPT-6 Luna

    Anthropic 發佈 Claude Opus 5.5,Latent Space 表示將其即時設為 AINews 後續內容的預設模型。Anthropic 表示其多數任務表現接近 Claude Fable 5.1,運行成本較 Opus 5 低 40%;文中補充,這項成本降幅適用於 medium 預設設定,API token 標價則下調 20%。

    推薦理由:報道並列 Claude Opus 5.5 與 GPT-6 Sol、GPT-6 Luna 的能力主張和價格變化,也區分 token 標價降幅與每任務成本,呈現不同降價口徑。

  1. OpenAI News74

    GPT-6 Astra 安全概覽:網絡安全能力達 Preparedness Framework 的 Critical 級別

    OpenAI 的 GPT-6 Astra 安全概覽指出,該模型是其目前廣泛部署中能力最強的模型。它也是首個在 Preparedness Framework 下達到網絡安全能力 Critical 級別的模型。

    推薦理由:這段安全概覽同時交代 GPT-6 Astra 的部署定位與網絡安全能力級別,可供讀者把模型能力描述放回 Preparedness Framework 的評估框架理解。

  1. OpenAI News73

    OpenAI 改進 ChatGPT 中的 GPT-5.6 Sol,並擴大免費用户使用 GPT-5.6 Luna 的範圍

    OpenAI 改進 ChatGPT 中的 GPT-5.6 Sol,提升其準確度與一致性,並擴大免費用户使用 GPT-5.6 Luna 的範圍。免費用户可與 GPT-5.6 Luna 進行不限量的日常聊天。

    推薦理由:公告交代 GPT-5.6 Sol 在準確度與一致性上的提升,並説明免費用户可與 GPT-5.6 Luna 進行不限量的日常聊天,呈現模型調整與使用範圍的變化。

  1. OpenAI News67

    OpenAI 模型解決 80 年單位距離問題並推翻離散幾何重要猜想

    OpenAI 的一個模型解決了有 80 年歷史的單位距離問題,推翻離散幾何中的一項重要猜想。這項成果標誌著 AI 驅動數學的一個里程碑。

    推薦理由:這項成果為 AI 驅動數學提供一個具體案例,呈現模型解決離散幾何 80 年單位距離問題並推翻重要猜想的結果。

  1. OpenAI News73

    GPT-5.2 推導出理論物理學新結果,提出膠子振幅公式

    GPT-5.2 在理論物理中提出一條新的膠子振幅公式,一篇新預印本記錄了這項結果。OpenAI 與學術合作者其後正式證明並驗證了該公式。

    推薦理由:材料交代 GPT-5.2 提出的膠子振幅公式及 OpenAI 與學術合作者其後的正式證明和驗證,呈現模型研究結果的核查環節。

  1. OpenAI News67

    OpenAI 發佈 GPT-5.3-Codex-Spark 即時編碼模型

    OpenAI 發佈 GPT-5.3-Codex-Spark,並稱其為首個即時編碼模型,生成速度快 15x,具備 128k 上下文窗口。目前以研究預覽形式向 ChatGPT Pro 用户提供。

    推薦理由:公告列出生成速度、上下文窗口及研究預覽的適用對象,讓讀者可同時瞭解 GPT-5.3-Codex-Spark 的性能宣稱與目前開放範圍。

  1. OpenAI News62

    OpenAI 發佈 GPT-5.2-Codex 編碼模型

    OpenAI 表示,GPT-5.2-Codex 是其最先進的編碼模型,具備長程推理、大規模程式碼轉換及增強的網絡安全能力。

  1. OpenAI News67

    GPT-5.2 推進科學與數學研究

    OpenAI 表示,GPT-5.2 是其目前在數學與科學領域最強的模型,並在 GPQA Diamond 和 FrontierMath 等基準上取得新的最佳成績。文章列舉其求解一個尚未解決的理論問題,以及生成可靠數學證明的案例,展示基準表現如何轉化為實際研究進展。

    推薦理由:文章把 GPQA Diamond、FrontierMath 的基準表現連結到求解尚未解決的理論問題和生成可靠數學證明的案例,呈現 GPT-5.2 在研究任務中的具體落點。

  2. OpenAI News71

    OpenAI 發佈面向日常專業工作的 GPT-5.2

    OpenAI 發佈 GPT-5.2,稱其為面向日常專業工作的最先進前沿模型,具備最先進的推理、長上下文理解、編碼和視覺能力。GPT-5.2 可在 ChatGPT 和 OpenAI API 中使用,以支援更快、更可靠的智能體工作流。

    推薦理由:原文交代 GPT-5.2 的能力定位及 ChatGPT、OpenAI API 的使用入口,讀者可瞭解它面向的專業工作與智能體工作流。

  1. OpenAI News69

    GPT-5.1 現已向開發者開放 API,帶來多項能力更新

    OpenAI 已在 API 中提供 GPT-5.1,帶來更快的自適應推理、擴展的提示詞快取及更佳的編碼表現。API 新增 apply_patch 和 shell 工具。

    推薦理由:更新涵蓋自適應推理、提示詞快取、編碼表現及 apply_patch 和 shell 工具,勾勒 GPT-5.1 面向開發者的 API 改進範圍。

  1. OpenAI News67

    GPT-5.1:更聰明、對話感更強的 ChatGPT

    OpenAI 正在升級 GPT-5 系列,以更温暖、能力更強的模型和新增的 ChatGPT 語氣、風格自訂方式推出 GPT-5.1。GPT-5.1 今天開始向付費用户逐步推出。

    推薦理由:GPT-5.1 更新同時涵蓋模型能力與 ChatGPT 語氣、風格自訂,並交代先向付費用户推出,便於把握其功能變化和開放範圍。

  1. OpenAI News67

    OpenAI 發佈 Sora 2 影片生成模型

    OpenAI 推出 Sora 2,這是一款可生成同步對白與音效的影片生成模型。材料並指出,Sora 產品已不再提供。

    推薦理由:這則材料同時交代 Sora 2 的同步對白與音效生成能力,以及 Sora 產品已不再提供的狀態,讓讀者掌握模型能力介紹與產品供應情況。

  2. OpenAI News66

    OpenAI 發佈 Sora 2 系統卡,介紹影片及音訊生成模型

    OpenAI 發佈 Sora 2 系統卡,介紹這款基於 Sora 的影片與音訊生成模型。Sora 2 加入過往影片模型較難實現的能力,包括更準確的物理表現、更清晰的寫實效果、同步音訊、更強的可控性及更廣的風格範圍。

    推薦理由:Sora 2 系統卡將其能力置於既有影片模型的比較脈絡中,並列出物理表現、同步音訊與風格範圍等變化。