跳到正文

#編碼

今日 1 條
2月2日週一
1月28日週三
1月9日週五
12月18日週四
12月11日週四
  1. OpenAI News71

    OpenAI 發佈面向日常專業工作的 GPT-5.2

    OpenAI 發佈 GPT-5.2,稱其為面向日常專業工作的最先進前沿模型,具備最先進的推理、長上下文理解、編碼和視覺能力。GPT-5.2 可在 ChatGPT 和 OpenAI API 中使用,以支援更快、更可靠的智能體工作流。

    推薦理由:原文交代 GPT-5.2 的能力定位及 ChatGPT、OpenAI API 的使用入口,讀者可瞭解它面向的專業工作與智能體工作流。

12月9日週二
11月25日週二
11月19日週三
  1. Google DeepMind81

    Google 發佈 Antigravity 智能體開發平台,免費開放公開預覽

    Google 推出 Antigravity 智能體開發平台,並免費開放公開預覽。平台保留 AI IDE 編輯器,另設以智能體為核心的 Manager,支援瀏覽器控制及非同步互動,讓智能體自主規劃和執行端到端軟件任務;Artifacts 可供使用者檢視工作成果並提供回饋。

    推薦理由:Antigravity 將 IDE 編輯與 Agent Manager 分成不同工作介面,並以任務級 Artifacts、驗證結果和非同步回饋呈現及修正智能體工作。

11月13日週四
10月10日週五
10月7日週二
  1. Hugging Face Blog66

    BigCodeArena 以實際執行程式碼端到端評估程式生成模型

    BigCodeArena 推出以程式碼實際執行評估程式生成模型的平台,讓使用者並排比較模型、測試輸出並投票。平台支援 10 種語言和 8 種執行環境,並已收集逾 14,000 段對話及 4,731 個投票樣本。

    推薦理由:平台把程式實際執行和互動測試納入模型比較,並按程式語言與執行環境拆分結果,呈現總體排名之外的表現差異。

10月6日週一
9月15日週一
  1. OpenAI News63

    OpenAI 在 GPT-5 系統卡補充説明中介紹 GPT-5-Codex

    OpenAI 在 GPT-5 系統卡補充説明中介紹 GPT-5-Codex,這是針對 Codex 中 AI 智能體編碼進一步優化的 GPT-5 版本。它會按任務複雜度動態調整思考投入,簡單對話查詢或小任務回應較快,複雜任務則獨立工作更長時間。

    推薦理由:補充説明交代 GPT-5-Codex 面向 Codex 中的 AI 智能體編碼,並説明它如何按任務複雜度調整思考投入。

8月7日週四
  1. OpenAI News75

    OpenAI 介紹 GPT-5,稱其為迄今最佳 AI 系統

    OpenAI 介紹 GPT-5,稱其為迄今最佳 AI 系統,並指其智能較此前所有模型有顯著提升。GPT-5 在編碼、數學、寫作、健康及視覺感知等方面均達到最先進水平。

    推薦理由:原文以此前模型作比較,並列出編碼、數學、寫作、健康及視覺感知等表現領域,讓讀者掌握 GPT-5 公佈的能力範圍。

7月30日週三
7月11日週五
  1. Mistral AI67

    Mistral AI 發佈 Devstral Medium 和升級版 Devstral Small 1.1,強化智能體編碼能力

    Mistral AI 推出 Devstral Medium,並將 Devstral Small 升級至 1.1,兩者聚焦對不同提示詞及智能體框架的泛化能力。Devstral Small 1.1 採 Apache 2.0 授權,參數量為 24B,在 SWE-Bench Verified 得分 53.6%;Devstral Medium 得分 61.6%。

    推薦理由:Devstral Small 1.1 採 Apache 2.0 授權並可本地部署,Devstral Medium 支援 API 和私有基礎設施部署;對照 SWE-Bench Verified 分數,可比較兩者的模型表現、開放方式與部署選項,並據此判斷不同工作環境的適配差異。

6月4日週三
5月28日週三
5月22日週四
5月21日週三
5月7日週三
  1. Mistral AI67

    Mistral AI 發佈 Mistral Medium 3,主打效能、成本與企業部署

    Mistral AI 發佈 Mistral Medium 3,定位為兼顧效能、成本與企業部署的語言模型。Mistral AI 稱,該模型在各項基準測試中的表現達到 Claude Sonnet 3.7 的 90% 或以上,API 定價為每 M token 輸入 $0.4、輸出 $2;亦可部署於任何雲端,包括使用 4 張或以上 GPU 的自託管環境。

    推薦理由:文章將 Mistral Medium 3 與 Claude Sonnet 3.7 的基準表現、API 定價和自託管條件放在一起比較,呈現企業部署時效能、成本與部署方式之間的核心取捨。

4月14日週一
  1. OpenAI News71

    OpenAI 將 GPT-4.1 模型系列引入 API,並推出首款 nano 模型

    OpenAI 將 GPT-4.1 新模型系列引入 API,並同步推出首款 nano 模型。OpenAI 表示,該系列整體有所改進,尤其在編碼、指令遵循和長上下文理解方面提升顯著,並即日起向全球開發者開放。

    推薦理由:公告列出 API 開放時間、改進方向及 nano 型號,讓開發者掌握此次 GPT-4.1 更新的發布範圍。

3月20日週四
3月7日週五
  1. Hugging Face Blog61

    用 React Native 在手機上本地執行 LLM 的入門指南

    Hugging Face Blog 的教程示範以 React Native 建立手機應用,在裝置本地執行 LLM 聊天。應用從 Hugging Face Hub 下載 GGUF 模型,並以 llama.rn(llama.cpp 的 binding)載入,教程涵蓋 Android 和 iOS。文章亦介紹 GGUF 量化格式、手機選模取捨,以及逐 token 生成與推理速度追蹤等功能。

    推薦理由:文章按模型選擇、GGUF 下載與載入、聊天介面逐步拆解 React Native 實作,並説明量化格式與設備能力的取捨,可作為端側 LLM 應用的開發參考。

3月6日週四
2月18日週二
2月7日週五
  1. Mistral AI75

    Mistral AI 推出全新 le Chat,面向生活與工作場景

    Mistral AI 推出全新 le Chat AI 助手,面向生活與工作場景,並開始提供 iOS、Android 版本及 Pro、Team 方案。它支援網頁搜尋、文件上傳與摘要、圖像生成及沙盒程式碼執行;Flash Answers 預覽版向所有用户開放,速度最高可達 ~1000 words / sec。

    推薦理由:le Chat 整合文件分析、Code interpreter、圖像生成與日常助理用途,並以免費、Pro、Team及企業私有部署方案覆蓋不同場景。

1月13日週一
  1. Mistral AI64

    Mistral AI 發佈 Codestral 25.01,程式碼生成及補全速度約提升 2 倍

    Mistral AI 發佈程式碼模型 Codestral 25.01,稱其架構和 tokenizer 經改進,生成及補全程式碼的速度約為原版 2 倍。在所列基準中,Codestral-2501 的 HumanEvalFIM 平均分為 85.9%,高於 Codestral-2405 的 82.1%。

    推薦理由:文中列出 Codestral 25.01 與舊版及其他模型的程式基準,並交代速度變化和部署入口,便於對照補全表現與採用方式。

12月19日週四
10月3日週四
9月24日週二
8月13日週二