OpenAI 為微調 API 加入圖像支援,開發者可用圖像與文本微調 GPT-4o
OpenAI 為微調 API 加入圖像支援,開發者現在可用圖像與文本微調 GPT-4o。此功能旨在提升 GPT-4o 的視覺能力。
推薦理由:這項更新把圖像納入 GPT-4o 的微調資料,並可與文本一同使用,讓開發者能用兩種資料形式針對視覺能力進行調整。
AI 產品與應用的功能上新、改版與商業化動態——誰家的產品變強了、變貴了、能用了。
OpenAI 為微調 API 加入圖像支援,開發者現在可用圖像與文本微調 GPT-4o。此功能旨在提升 GPT-4o 的視覺能力。
推薦理由:這項更新把圖像納入 GPT-4o 的微調資料,並可與文本一同使用,讓開發者能用兩種資料形式針對視覺能力進行調整。
OpenAI 在 API 提供 Prompt Caching,對模型近期見過的輸入自動提供折扣。詳情見 https://openai.com/index/api-prompt-caching
推薦理由:這項功能將模型近期見過的輸入與自動折扣直接連結,讓讀者瞭解 API 對重複輸入的費用處理方式。
OpenAI 的 API 模型蒸餾可在 OpenAI 平台上,使用大型前沿模型的輸出微調較具成本效益的模型。
推薦理由:這項 API 流程把大型前沿模型的輸出用於微調較具成本效益的模型,概述了在 OpenAI 平台內進行模型蒸餾的基本做法。
Hugging Face 在 Hub 的資料集頁面推出 SQL Console,讓用户直接在瀏覽器以 SQL 查詢和篩選資料集。它由 DuckDB WASM 驅動,不需伺服器或後端;非 Parquet 格式的資料集會自動轉換前 5GB,查詢結果可匯出為 Parquet,公開資料集的結果亦可透過連結分享。
推薦理由:SQL Console 以 DuckDB WASM 在瀏覽器查詢資料集,並示範用 SQL 將 Alpaca 格式轉為對話格式,提供一個可參照的資料整理流程。
HuggingChat 推出 Community Tools,讓使用者可把 Hugging Face 上的公開 Space 轉成模型可直接調用的工具。這些工具可用於理解圖片、生成影片或文字轉語音,也可建立文件 RAG 工具。建立助手時最多可選 3 個工具;該功能目前仍屬實驗階段。
推薦理由:文章展示如何把公開 Space、自建 Gradio 工具和文件 RAG 接入 HuggingChat,並在助手中組合最多 3 個工具,提供從建立到配置的實操路徑。
OpenAI 現已開放 GPT-4o 微調。
Hugging Face 在 Transformers 中提供統一工具調用 API,讓同一套程式碼可跨多個熱門模型系列使用。API 支援 Mistral、Cohere、NousResearch 和 Llama;Transformers 亦加入輔助功能、完整文件與範例,並可將 Python 函式自動轉為 JSON schema。
推薦理由:文章説明統一 API 如何簡化工具定義與聊天紀錄格式,也交代模型輸出的工具呼叫仍需自行解析,呈現目前統一機制的範圍與缺口。
Mistral AI 宣佈在 La Plateforme 開放旗下旗艦及專用模型自訂,並推出 Agents 早期版本及 mistralai 1.0 客户端 SDK。
推薦理由:這次發布把模型自訂、Agents 工作流程與客户端 SDK 更新並列,呈現 Mistral AI 如何涵蓋應用構建中的模型調整、流程編排和程式接入環節。
OpenAI 在 API 中推出 Structured Outputs,模型輸出現在可可靠遵循開發者提供的 JSON Schema。
推薦理由:這項 API 更新説明 Structured Outputs 的核心作用,讓模型輸出可靠遵循開發者提供的 JSON Schema。
Hugging Face 的 TGI 推出 Multi-LoRA serving,讓單一基礎模型可按請求動態選用不同 LoRA adapter,以一個部署服務多個微調模型。文中以 mistralai/Mistral-7B-v0.1 示範,載入 30 個 adapter 時 VRAM 增幅為 3%;實際可載入數量取決於 GPU 資源和所部署模型。
推薦理由:文章以 TGI 的部署及調用示例,展示單一基礎模型按請求選用不同 LoRA adapter 的做法,並比較多模型部署的成本與擴展管理。
Hugging Face 與 KerasHub 宣佈共用模型保存格式,讓 Hugging Face Hub 上部分 Transformers 模型可直接載入 KerasHub。首批涵蓋 Gemma 1、Gemma 2、Llama 3 和 PaliGemma;KerasHub 可透過 TensorFlow、JAX 或 PyTorch 後端運行這些模型。
推薦理由:共享模型保存格式讓受支援架構的 Transformers 模型可直接載入 KerasHub,並透過 TensorFlow、JAX 或 PyTorch 後端運行,呈現跨框架使用的實際路徑。
Hugging Face 在 TRL 引入 RLOO Trainer,這是一種較 PPO 更易實作、較省 GPU 記憶體的線上 RLHF 訓練方法。測試顯示,RLOO 約比 PPO 少用 50–70% vRAM,1B 模型快 2 倍、6.9B 模型最高快 3 倍;6.9B checkpoint 的 GPT4 評審偏好率為 78.7%(k=2)。
推薦理由:文章對照 RLOO 與 PPO 的 GPU 記憶體用量、訓練速度及回答勝率,並披露 bf16 下 RLOO 有較多批次資料的梯度被清零。
Artificial Analysis 推出文生圖模型排行榜與 Image Arena,以超過 45,000 次人類圖像偏好計算模型 ELO 排名。排行榜收錄 Midjourney、DALL·E、Stable Diffusion、Playground 等開源及專有模型,評測為每個模型生成超過 700 張圖像。用户可在 Image Arena 投票,投滿 30 票後查看個人化模型排名。
推薦理由:排行榜以超過 45,000 次人類圖像偏好計算 ELO,並涵蓋開源與專有模型,為比較不同文生圖模型提供同一參照。
Mistral AI 在 la Plateforme 推出模型客製化方案,提供自有基礎設施微調 SDK、無伺服器微調服務和客製訓練三種入口。開源工具 mistral-finetune 採用 LoRA 訓練範式;平台微調服務目前支援 Mistral 7B 和 Mistral Small,並使用 LoRA adapters,以保留基礎模型知識及提升服務效率。
推薦理由:Mistral AI 同時提供開源微調 SDK、la Plateforme 無伺服器微調服務及客製訓練,呈現不同基礎設施與資料需求下的模型調整途徑。
Hugging Face 宣佈把 AMD Instinct MI300 整合至平台,透過 Transformers、text-generation-inference 等工具部署模型時無需改動程式碼。
推薦理由:文章比較 Azure MI300X 與 MI250 執行 Llama 3 70B 推理和微調的結果,並公開基準程式碼,便於核對性能差異及復現測試。
OpenAI 改進 ChatGPT 數據分析功能,加入表格和圖表互動能力。用户可直接從 Google Drive 和 Microsoft OneDrive 添加檔案。
推薦理由:更新將表格與圖表互動、直接從 Google Drive 和 Microsoft OneDrive 添加檔案納入 ChatGPT 數據分析,呈現這次功能改進涵蓋的操作範圍。
Hugging Face 發佈 Transformers Agents 2.0,新增 ReactCodeAgent 和 ReactJsonAgent,能根據過往觀察迭代。框架以簡潔、模組化,以及工具和提示詞透明為設計目標。使用 Llama-3-70B-Instruct 的智能體在完整 GAIA 基準中排名第 4,超越多個基於 GPT-4 的智能體。
推薦理由:文中比較 Code 與 JSON 智能體在不同模型上的表現,並展示 Llama-3-70B-Instruct 智能體於 GAIA 的名次,可作為評估 Agent 架構與模型搭配的具體參照。
Hugging Face 引入 Artificial Analysis LLM Performance Leaderboard,集中比較逾 100 個無伺服器 LLM API 端點的品質、價格與速度。
推薦理由:榜單把逾 100 個無伺服器 LLM API 端點的品質、價格與速度指標集中呈現,並以多種提示長度和並行查詢組合供工程師比較。
OpenAI 推出 ChatGPT API 和 Whisper API。
OpenAI 宣佈 GPT-4 API 正式開放使用,並表示 GPT-3.5 Turbo、DALL·E 和 Whisper APIs 亦已正式開放。OpenAI 同時公佈 Completions API 舊模型的棄用計劃,稱相關舊模型將於 2024 年初退役。
推薦理由:公告並列 GPT-4 API 等服務的正式可用狀態與 Completions API 舊模型退役安排,讀者可據此辨識不同 API 的變更範圍。