OpenAI 為 GPT‑4o 推出原生圖像生成
OpenAI 在 GPT‑4o 中推出原生圖像生成,並提升文字渲染與指令遵循能力。原文亦提及 ChatGPT Images 2.5。
推薦理由:原生圖像生成之外,文字渲染與指令遵循是明確列出的改進點,讀者可據此掌握 GPT‑4o 圖像功能此次更新的着力處。
AI 產品與應用的功能上新、改版與商業化動態——誰家的產品變強了、變貴了、能用了。
OpenAI 在 GPT‑4o 中推出原生圖像生成,並提升文字渲染與指令遵循能力。原文亦提及 ChatGPT Images 2.5。
推薦理由:原生圖像生成之外,文字渲染與指令遵循是明確列出的改進點,讀者可據此掌握 GPT‑4o 圖像功能此次更新的着力處。
OpenAI 介紹 API 新一代音訊模型,文字轉語音模型可按開發者指示採用特定説話方式。例如,開發者可要求模型「像富有同理心的客服智能體那樣説話」,為語音智能體提供更多自訂空間。
推薦理由:開發者可用指示控制文字轉語音模型的説話方式,例如採用富有同理心的客服智能體語氣,讓語音智能體的表達方式有更多自訂空間。
Hugging Face 已將首批模型與數據集倉庫由 LFS 遷移至 Xet 儲存,總量 4.5 TB,並把 Hub 約 6% 的下載流量切至 Xet 基礎設施。
推薦理由:文章以首批倉庫遷移為例,交代下載開銷與節點負載失衡如何在真實流量下浮現,以及分階段遷移如何避免服務中斷。
Mistral AI 推出 Mistral OCR 文件理解 API,可解析圖片與 PDF,並抽取文字、圖像、表格及公式。API mistral-ocr-latest 已在 la Plateforme 開放,每美元可處理 1000 頁,批次推理下每美元可處理頁數約增至兩倍;Mistral OCR 亦可在 le Chat 免費試用。
推薦理由:Mistral OCR 可解析 PDF、圖片中的表格與公式,並支援 JSON 輸出,展示文件接入 RAG 與 Agent 工作流的實際做法。
Hugging Face 與 JFrog 合作,將 JFrog 掃描器整合至 Hugging Face Hub,以分析模型權重中的程式碼並減少誤報。現有 picklescan 按模組名稱作模式匹配,JFrog 則會解析程式碼、檢查潛在惡意用法,並可捕捉 pickle 與 Keras Lambda layers 的相關利用方式。
推薦理由:JFrog 會解析模型權重中的程式碼,補充 picklescan 以模組名稱作模式匹配的檢查方式,並讓公開模型倉庫自動納入掃描。
Hugging Face 推出 FastRTC,這是一個讓開發者以 Python 建構即時音訊與影片 AI 應用的通訊程式庫。它內置語音偵測與輪次控制,提供支援 WebRTC 的 Gradio UI,並可將 Stream 掛載至 FastAPI 應用;亦支援 WebSocket。程式庫另提供語音轉文字、文字轉語音等工具,並可接駁不同 LLM、語音 API 或語音到語音模型。
推薦理由:FastRTC 將語音偵測、輪次控制和即時通訊整合起來,並提供 Gradio 測試介面及 FastAPI 部署方式,展示以 Python 搭建即時語音應用的實作流程。
Mistral AI 推出全新 le Chat AI 助手,面向生活與工作場景,並開始提供 iOS、Android 版本及 Pro、Team 方案。它支援網頁搜尋、文件上傳與摘要、圖像生成及沙盒程式碼執行;Flash Answers 預覽版向所有用户開放,速度最高可達 ~1000 words / sec。
推薦理由:le Chat 整合文件分析、Code interpreter、圖像生成與日常助理用途,並以免費、Pro、Team及企業私有部署方案覆蓋不同場景。
OpenAI 推出 deep research,這個智能體會運用推理整合大量網上資訊,並替用户完成多步驟研究任務。功能現時向 Pro 用户開放,Plus 和 Team 用户隨後可用。
推薦理由:公告交代 deep research 如何處理網上資訊整合與多步驟研究任務,並列出 Pro、Plus、Team 的開放次序,方便了解其適用工作場景。
Hugging Face 將 fal、Replicate、Sambanova 和 Together AI 四家無伺服器推理服務整合至 Hub 模型頁面及 JS、Python SDK。用户可使用自己的供應商 API key 直接呼叫並由供應商收費,也可透過 Hugging Face 路由請求,按供應商標準 API 價格計費且不加價。
推薦理由:四家無伺服器推理服務接入 Hub 模型頁面及 SDK,文章亦交代自帶供應商 API key 與 Hugging Face 路由的調用和計費差異,便於評估接入方式。
Hugging Face 為 smolagents 加入視覺支援,使視覺語言模型可原生用於智能體流程。圖片可以在 agent.run() 時一次傳入,也可透過 step callback 動態加入 ActionStep;文章並以 helium 示範視覺網頁瀏覽智能體。
推薦理由:文章整理了 smolagents 接收初始圖片與逐步加入截圖的兩種方式,並以網頁瀏覽智能體示範如何用 callback 更新執行記憶。
Hugging Face 推出 smolagents,讓語言模型智能體可用程式碼編寫動作。它提供以程式碼運作的 CodeAgent,也支援以 JSON/text 編寫動作的 ToolCallingAgent,並可透過 E2B 在沙盒環境執行。
推薦理由:文章説明程式碼表達動作在組合與重用上的優勢,並展示 smolagents 仍支援 JSON/text 工具調用。
Hugging Face 推出 Synthetic Data Generator,讓用户以自然語言描述需求,無需編寫程式碼即可生成文字分類或聊天數據集。
推薦理由:文章展示由自然語言描述生成分類或聊天數據集,再用 Argilla 審核並交由 AutoTrain 訓練模型的流程,也説明如何自訂模型與生成配置。
Hugging Face 的 83 款開源模型現可透過 Amazon Bedrock Marketplace 部署,模型端點由 Amazon SageMaker JumpStart 管理,並支援 Amazon Bedrock API。
推薦理由:材料交代 Hugging Face 的 83 款開源模型如何在 Bedrock Marketplace 部署,以及 SageMaker JumpStart 管理端點、Bedrock API 負責調用的服務銜接方式。
Mistral AI 為 le Chat 推出多項免費 beta 更新,新增網頁搜尋、Canvas、文件與圖像理解、圖像生成及智能體功能。文件與圖像理解由 Pixtral Large 與一款實驗模型支援,圖像生成則採用 Black Forest Labs 的 Flux Pro。新功能將於未來數週逐步推出。
推薦理由:網頁搜尋、Canvas、文件與圖像理解、圖像生成及可分享智能體同列免費 beta,呈現 le Chat 將對話延伸至知識工作多個環節的產品方向。
Mistral AI 推出 Batch API,讓 La Plateforme 上的 Mistral 模型以批次方式處理高流量請求,成本比同步 API 呼叫低 50%。
推薦理由:Batch API 將高流量請求的成本降至同步 API 呼叫的一半,並以檔案提交、處理後下載的流程,適合不要求同步回覆的批量任務。
OpenAI 推出 ChatGPT search,提供快速、及時的答案,並附上相關網頁來源連結。
推薦理由:ChatGPT search 提供快速、及時的答案並附相關網頁來源連結,材料呈現了它的核心搜尋回答形式。
Google DeepMind 與 Hugging Face 宣佈在 Transformers v4.46.0 推出 SynthID Text,讓生成時可加入文字水印,並透過分類器檢測水印。
推薦理由:文章梳理 SynthID Text 從生成端配置到分類器訓練的部署流程,並説明改寫、翻譯與事實性回答對水印效果的限制,便於評估適用場景。
Hugging Face 發佈 Transformers.js v3,新增 WebGPU 支援和量化格式選擇,支援架構總數增至 120 種。官方稱 WebGPU 最高可比 WASM 快 100 倍;此版本另提供 25 個示例專案與範本,以及超過 1200 個已轉換模型。
推薦理由:這次更新把 WebGPU、量化格式選擇及 120 種架構納入同一 JavaScript 庫,並兼容 Node.js、Deno、Bun,展示其瀏覽器與伺服器端部署路徑。
Gradio 5 推出穩定版,讓開發者可用 Python 建構面向生產環境的機器學習網頁應用,並改進效能、介面、即時串流及網絡安全。
推薦理由:Gradio 5 將 SSR、低延遲串流與網絡安全改進納入穩定版,並交代 Gradio 4.x 應用的相容條件,方便開發者評估升級影響。
OpenAI 推出 Realtime API,開發者現可在應用程式中構建快速語音到語音體驗。