OpenAI DevDay:結構化輸出專題環節
OpenAI DevDay 的專題環節探討了活動中分享的結構化輸出技術,內容聚焦 structured outputs、JSON 與 schema。
OpenAI DevDay 的專題環節探討了活動中分享的結構化輸出技術,內容聚焦 structured outputs、JSON 與 schema。
OpenAI 的 Computer Use API 指南説明,模型可透過瀏覽器或桌面介面填表、測試使用者流程或完成應用程式任務,應用程式負責提供環境並執行模型要求。
OpenAI 的 Predicted Outputs 指南説明,Chat Completions 可透過 `prediction` 參數提供預測文本,在輸出內容大致已知時加快 API 回應。
OpenAI 的語音智能體指南比較 GPT-Live、Realtime API 與分階段語音管線,説明三種架構各自適用的場景。指南涵蓋 GPT-Live 的 Client delegation 和 Responses delegation,以及可逐階段檢視或轉換文字的管線設計。
OpenAI 的內建工具指南整理了可用工具,以及在 Responses API、Agents API 和 Agents SDK 中的接入方式。所列工具包括網頁搜尋、檔案搜尋、函數呼叫、遠端 MCP、Skills、Shell、電腦操作、圖像生成、tool search 和 Programmatic Tool Calling。
Manus 團隊分享構建 Manus 的 AI 智能體上下文工程經驗,提出管理上下文、工具選擇與記憶的設計原則。文章建議保持提示詞前綴穩定、避免在迭代中動態增刪工具,並把檔案系統作為可恢復的外部記憶;另指出應在上下文中保留失敗記錄,並持續重述待辦目標。文中提到 Manus 平均輸入與輸出 token 比例約為 100:1,典型任務平均約有 50 次工具呼叫。
OpenAI 示範如何在 Image API 和 Responses 圖像生成工具中設定 input_fidelity="high",以保留輸入圖片的關鍵細節。指南提供人像、標誌、局部物件編輯及多圖合成示例,並説明多圖輸入時首張圖片可保留更豐富的紋理細節。該設定會比預設值消耗更多 image input tokens。
OpenAI Developers 的 Building agents 學習專題介紹構建 AI 智能體的核心概念與實作流程,涵蓋模型選擇、工具使用、編排和最佳實踐。
OpenAI Developers 提供一套面向開發者的 AI 應用開發學習路線,按四階段涵蓋基礎概念、應用開發、測試與評估,以及規模化和維護。內容介紹如何透過 Responses API 或 Agents SDK 建置智能體,並説明 RAG 用於引入知識、微調用於調整模型行為,以及用 evals 和 guardrails 測試與約束應用。
Hugging Face 分享其官方 MCP Server 的建置經驗,説明 AI 助手如何透過 hf.co/mcp 存取 Hub 及 Spaces 上的 AI 應用。
推薦理由:文章拆解遠端 MCP Server 在傳輸模式、連線狀態與資源開銷上的取捨,並以 Hugging Face 的部署配置呈現決策脈絡。
Hugging Face Blog 示範如何透過 Gradio MCP 伺服器為 LLM 接入工具能力,並以 Flux.1 Kontext[dev] 展示按文字指令編輯圖片。
推薦理由:文章以 Flux.1 Kontext[dev] 示範將 Hugging Face Spaces 的 MCP 服務接入 Cursor,並交代圖片須使用公開 URL,呈現從選擇服務到設定客户端的實作流程。
Hugging Face Blog 示範如何使用 Sentence Transformers 訓練及微調稀疏嵌入模型,介紹 SPLADE、Inference-free SPLADE、CSR 架構,以及資料、損失函數、評估器和訓練器的配置。
推薦理由:文章按 SPLADE、Inference-free SPLADE 與 CSR 的適用情境梳理架構選擇,並以實作例子串連資料、損失函數和評估器配置。
TNG 指出,長提示詞的 prefill 會阻塞後續請求,並在與 decode 共用 GPU 時拖慢已開始生成的請求。vLLM 的並行 partial prefill 可降低短請求的 time-to-first-token;例如可設定最多並行 4 個請求,當中最多 1 個的 prompt 超過 10,000 tokens。
OpenAI Developers 的 Cookbook 以收據審核為例,示範如何以 evals 驅動 LLM 應用從原型逐步走向生產環境。指南從少量標註資料建立收據抽取與審核流程,設計分步及端到端評測,並把錯誤率連結至業務成本以安排改進優先次序。案例比較 o4-mini 與 gpt-4.1-mini,並介紹透過提示詞、示例、模型選擇及持續監測改善系統。
OpenAI Developers 的指南示範如何用 OpenAI Agents SDK 建立多智能體流程,將複雜投資研究任務拆分給多個專家智能體。
OpenAI 發佈 o3/o4-mini 函數呼叫指南,説明如何透過開發者提示詞、工具描述和 Responses API 改善函數呼叫表現。指南建議明確規定工具的使用邊界及呼叫次序、把參數構造規則置前,並盡可能將 `strict` 設為 `true`。
OpenAI 的指南示範如何為 o4-mini 設計模型評分器,並以臨牀對話結果預測任務進行強化微調(RFT)。實驗使用 100 個訓練樣本和 100 個驗證樣本,採用 gpt-4.1 模型評分器後,微調模型的驗證評分較基礎 o4-mini 提高約 5 個百分點。指南亦展示詞面評分可能誘發模型加入同義詞、劑量或治療方案來刷分,並建議以領域專家檢查評分器和資料品質。
Hugging Face Diffusers 文章比較五種量化後端在 FLUX.1-dev 上的記憶體佔用與推理時間。BF16 載入後約佔 31.447 GB,bitsandbytes 4-bit 為 12.584 GB、推理需 12 秒;torchao int4_weight_only 為 10.635 GB,但推理需 109 秒。
OpenAI 的指南介紹 Responses API 託管 MCP 工具,讓模型連接遠端 MCP 伺服器並直接調用工具。指南説明工具清單載入與快取、預設呼叫審批,並建議用 allowed_tools 限定可用工具,以降低 token 開銷和延遲。
OpenAI Developers 示範使用 Evals API 的 `responses` 數據源,從日誌比較 gpt-4o-mini 與 gpt-4.1-mini 對 OpenAI SDK 程式碼檔案的解釋品質。
OpenAI Developers 的筆記本比較透過 OpenAI API 與 Agents SDK 進行語音轉文字的多種方法,並提供由檔案上載至即時串流的示例。
Gradio 不只是另一個 UI 函式庫,而是透過介面與 API 連接機器學習模型的框架,並提供效能、安全及回應能力保障。它可從單一實作自動生成 REST API 端點及 API 文件,並提供 API Recorder(4.26 引入)、Gradio 5.0 的伺服器端渲染(SSR)、佇列管理和即時串流等功能。
OpenAI Developers 的 cookbook 示範以 Responses API 建立 RAG 多工具工作流程,按查詢將請求路由至內置工具或外部工具。示例結合內置網絡搜尋與 Pinecone 向量資料庫檢索,並展示先搜尋網頁、再查詢 Pinecone,將工具結果交回 API 生成答案。
OpenAI 的 Cookbook 示範以 Realtime API 和 WebSockets 搭建多語言單向語音翻譯流程,讓講者輸入音訊並把不同語言的譯音轉送至聽眾端。
Open R1 的指南示範如何在本機設定 OlympicCoder 7B,並將它接入 VS Code 作為編碼助手。流程使用 LM Studio 載入 LMStudio Community 的 4bit GGUF 版本,再透過 Continue.dev 連接至本機服務 http://localhost:1234/v1。
Hugging Face Blog 的教程示範以 React Native 建立手機應用,在裝置本地執行 LLM 聊天。應用從 Hugging Face Hub 下載 GGUF 模型,並以 llama.rn(llama.cpp 的 binding)載入,教程涵蓋 Android 和 iOS。文章亦介紹 GGUF 量化格式、手機選模取捨,以及逐 token 生成與推理速度追蹤等功能。
推薦理由:文章按模型選擇、GGUF 下載與載入、聊天介面逐步拆解 React Native 實作,並説明量化格式與設備能力的取捨,可作為端側 LLM 應用的開發參考。
Mistral AI 的 TranscriptToPRDTicket 智能體工作流程可將會議逐字稿自動轉成產品需求文件(PRD)及開發工單。其中 PRDAgent 與 TicketCreationAgent 均由 Mistral Large 2 驅動,並可在 Linear 或 Jira 建立工單。完整實作已提供於 Google Colab notebook,供使用者開始部署及按需自訂。
Hugging Face Blog 的 hlky 和 Sayak 介紹一套建立影片生成模型微調資料集的三階段工具流程,讓社羣能自行製作小型資料集。流程以 yt-dlp 下載影片、用 Video to Scenes 切成短片,再以影格或全片指標篩選,並用 Florence-2 生成字幕、辨識物件及進行 OCR;也可用 Qwen2.5 為整段影片加字幕。
以 ChatGPT 打造自訂數學導師,聚焦 ChatGPT 與個人化輔導;正文未提供設計流程、具體功能或其他規格。
ChatGPT 可用於尋找美甲靈感。
ChatGPT 被用於捕捉大比目魚;原文未提供具體方法或捕捉結果。
Hugging Face Diffusers 團隊梳理多款開源影片生成模型的能力與限制,並介紹 Diffusers 對影片生成、推理優化及微調的支援。
推薦理由:文章整理多款開源影片模型的資源需求,並以 HunyuanVideo 不同優化設定的數據,呈現量化、卸載和 VAE tiling 對顯存與推理時間的實際取捨。
OpenAI 的範例 notebook 示範呼叫 Completions Usage API 和 Costs API,擷取用量及費用數據並製作監測圖表。程式以分頁方式讀取 API 回應,交由 pandas 整理,再用 matplotlib 繪製每日 token 用量與成本,並按模型、項目及 `line_item` 分組查看統計。
Hugging Face Blog 介紹 NVIDIA 的 LogitsProcessorZoo,示範如何透過 logits 處理器控制語言模型的生成結果。示例涵蓋調整輸出長度、依據提示詞引導內容、強制加入指定結尾短語,以及讓模型在選擇題中只輸出選項。
動畫師 Lyndon Barrois 以 Sora 創造新世界,並分享如何把 Sora 作為説故事工具;內容聚焦其作為創作工具的使用方式。
OpenAI 呼籲產品團隊把 AI 用於產品工作;現有內容只提出這項建議,未説明具體工具、功能或實施方式。
Hugging Face Blog 發佈 EU AI Act 開源開發者指南,梳理法規對 AI 系統及 GPAI 模型的適用範圍與分級義務。指南聚焦有限風險 AI 系統和非系統性風險開源 GPAI 模型,涵蓋披露 AI 互動、以機器可讀格式標記合成內容、提供訓練內容摘要及尊重版權 opt-out 等要求。
推薦理由:文章區分有限風險 AI 系統與非系統性風險開源 GPAI 模型,梳理透明標示、訓練內容摘要及版權 opt-out 等合規要求。
這篇教程逐步拆解 Transformer 位置編碼的設計,從整數、二進制及正弦方案推導至 RoPE。文章解釋 RoPE 如何對 query 和 key 向量的分量成對旋轉,令注意力點積帶入相對位置資訊,同時不改變向量範數。文中也介紹如何分開處理各維度的位置資訊,以延伸至多維資料。
推薦理由:文章從位置編碼的設計需求出發,逐步比較整數、二進制與正弦方案,並推導 RoPE 如何以旋轉在注意力計算中表達相對位置。
Hugging Face 示範以自訂 Docker 映像,將 Speech-to-Speech(S2S)流程部署至 Hugging Face Inference Endpoints。
推薦理由:文章把多模型語音流程拆解為自訂 Docker 映像、端點設定和 WebSocket 音訊服務等步驟,提供部署複雜推理管線時可參照的實作路徑。
Hugging Face Blog 示範以 Dask 和 Coiled 把 FineWeb-Edu 網頁分類流程,從 pandas 本機處理 100 行擴展至雲端多 GPU 處理 211 million 行。
推薦理由:FineWeb-Edu 分類案例呈現了由 pandas 本機小批次測試,擴展至 Dask 與 Coiled 雲端多 GPU 處理 211 million 行資料的完整流程,為大型資料集推理提供可參照的工程做法。