OpenAI Agents SDK 快速入門:建立 Agent、加入工具及設定 handoffs
OpenAI Agents SDK 快速入門示範如何建立並執行 Agent、加入工具,並以 handoffs 將問題交由不同專家 Agent 處理。指南亦介紹多輪對話可透過 result.to_input_list()、session=... 或 previous_response_id / conversation_id 延續,並附上 SDK 安裝和 API key 設定步驟。
OpenAI Agents SDK 快速入門示範如何建立並執行 Agent、加入工具,並以 handoffs 將問題交由不同專家 Agent 處理。指南亦介紹多輪對話可透過 result.to_input_list()、session=... 或 previous_response_id / conversation_id 延續,並附上 SDK 安裝和 API key 設定步驟。
OpenAI 語音應用指南介紹三種語音智能體架構:GPT-Live 搭配獨立後端、Realtime API 在單一會話中處理語音、推理與工具使用,以及可逐階段檢視或替換元件的串接式語音管線。指南列出任務與工具結果、對話時序、語音與語言、會話可靠性等評估面向,並建議以 Crawl、Walk、Run 逐步增加測試複雜度。
頁面目前只顯示人機驗證,要求訪客確認自己不是自動化程式;vimeo.com 亦提示須先檢查連線安全。頁面未提供「Launch apps with evaluations」的實際內容,因此無法確認其做法或細節。
OpenAI 指南按速度、成本、準確度及任務複雜度,説明如何選擇推理模型與 GPT 模型。指南建議由推理模型負責複雜規劃與決策、GPT 模型執行明確任務;提示詞保持簡潔直接,先試 zero-shot,必要時再加入 few-shot 範例。
OpenAI 的微調最佳實踐指南列出改善微調效果的數據與超參數調整方法,並指出其微調平台已不再向新用户開放。指南建議檢查訓練數據的品質、分佈、一致性及格式,建立測試集,並在訓練樣本中保留有效提示詞;數據品質和分佈合適後,再增加樣本量。
OpenAI 的 Python SDK 指南介紹多智能體編排的兩種方式,即由 LLM 規劃和決策,或由程式碼控制流程,兩者也可混合使用。SDK 常見模式包括由管理者 Agent 透過 `Agent.as_tool()` 調用專家,或由分流 Agent 透過 handoffs 將對話交給專家接手當前回合。
OpenAI Developers 歸納出七項 LLM 應用延遲優化原則,涵蓋 token 處理、減少請求、並行執行、改善用户等待體驗及避免不必要地使用 LLM。
OpenAI Developers 分享在品質、效能與開支之間取得合適取捨的策略,重點是平衡準確度、延遲與成本。
OpenAI 的音訊與語音指南按應用場景介紹 GPT-Live、Realtime API 及專用音訊 API 的選用方式。
OpenAI Realtime API 的即時轉錄指南説明如何建立即時音訊轉錄工作階段,接收隨語音到達的逐步文本,並在提交每個音訊回合後取得最終轉錄。指南建議使用 gpt-live-transcribe,伺服器端音訊管線可用 WebSocket,瀏覽器音訊可用 WebRTC。較高的 delay 會讓模型取得更多音訊上下文並可能改善詞錯誤率,設定應以具代表性的真實音訊測試。
OpenAI Developers 的 Agents SDK 頁面標題為「解鎖智能體能力」,但目前可見正文只有要求訪客確認真人身份的驗證提示。頁面另提示 vimeo.com 需要先檢查連線安全,沒有提供 SDK 的功能或技術細節。
OpenAI 的 Realtime API 入門指南説明如何經 WebRTC 或 WebSocket 建立有狀態的語音對話,並以事件管理會話。指南涵蓋文字和音訊生成、圖像輸入、function calling、VAD 設定、打斷處理及 push-to-talk;Realtime Session 最長為 60 分鐘。
OpenAI 提出提升 LLM 正確性與行為一致性的優化框架,建議先透過評估診斷失誤,再按問題選用提示詞、RAG 或微調。在冰島語校正測試中,GPT-4 零樣本的 BLEU 為 62,加入 3 個 few-shot examples 後為 70;以 1000 個例子微調 GPT-4 後為 87,再加入 RAG 則降至 83。
OpenAI Codex 編程概覽以使用 Codex 進行編程為主題,提供相關內容的整體介紹。原文未列出具體功能、操作步驟或技術細節。
OpenAI Developers 示範如何使用 4o 模型生成圖像。
OpenAI 的 Structured Outputs 示例倉庫收錄三個以 NextJS 構建的 sample apps,展示此 API 功能的實際用法。Structured Outputs 可令模型回應和工具調用遵循指定 JSON schema。
OpenAI Realtime Console 示例應用展示如何透過 WebRTC 使用 Realtime API,並在 WebRTC data channel 上收發事件及配置 client-side function calling。
DevDay 的分組討論聚焦有效進行模型知識蒸餾的策略。
「MCP intro」頁面只顯示人機驗證提示,要求訪客確認自己是人類而非垃圾訊息機械人,才能繼續。頁面指出 vimeo.com 需要先檢查連線安全,正文沒有提供 MCP 的介紹內容。
OpenAI DevDay 的專題環節探討了活動中分享的結構化輸出技術,內容聚焦 structured outputs、JSON 與 schema。
OpenAI 的 Computer Use API 指南説明,模型可透過瀏覽器或桌面介面填表、測試使用者流程或完成應用程式任務,應用程式負責提供環境並執行模型要求。
OpenAI 的 Predicted Outputs 指南説明,Chat Completions 可透過 `prediction` 參數提供預測文本,在輸出內容大致已知時加快 API 回應。
OpenAI Developers 提供結合 Realtime API 與 Twilio 電話通話能力的 starter app,用於構建 AI 電話助手。示例以 NextJS 前端和 Express WebSocket 後端串接 Twilio 雙向通話串流與 Realtime API,後端亦向前端轉發訊息。
OpenAI 的語音智能體指南比較 GPT-Live、Realtime API 與分階段語音管線,説明三種架構各自適用的場景。指南涵蓋 GPT-Live 的 Client delegation 和 Responses delegation,以及可逐階段檢視或轉換文字的管線設計。
OpenAI 的內建工具指南整理了可用工具,以及在 Responses API、Agents API 和 Agents SDK 中的接入方式。所列工具包括網頁搜尋、檔案搜尋、函數呼叫、遠端 MCP、Skills、Shell、電腦操作、圖像生成、tool search 和 Programmatic Tool Calling。
Manus 團隊分享構建 Manus 的 AI 智能體上下文工程經驗,提出管理上下文、工具選擇與記憶的設計原則。文章建議保持提示詞前綴穩定、避免在迭代中動態增刪工具,並把檔案系統作為可恢復的外部記憶;另指出應在上下文中保留失敗記錄,並持續重述待辦目標。文中提到 Manus 平均輸入與輸出 token 比例約為 100:1,典型任務平均約有 50 次工具呼叫。
OpenAI 示範如何在 Image API 和 Responses 圖像生成工具中設定 input_fidelity="high",以保留輸入圖片的關鍵細節。指南提供人像、標誌、局部物件編輯及多圖合成示例,並説明多圖輸入時首張圖片可保留更豐富的紋理細節。該設定會比預設值消耗更多 image input tokens。
OpenAI Developers 的 Building agents 學習專題介紹構建 AI 智能體的核心概念與實作流程,涵蓋模型選擇、工具使用、編排和最佳實踐。
OpenAI Developers 提供一套面向開發者的 AI 應用開發學習路線,按四階段涵蓋基礎概念、應用開發、測試與評估,以及規模化和維護。內容介紹如何透過 Responses API 或 Agents SDK 建置智能體,並説明 RAG 用於引入知識、微調用於調整模型行為,以及用 evals 和 guardrails 測試與約束應用。
Hugging Face 分享其官方 MCP Server 的建置經驗,説明 AI 助手如何透過 hf.co/mcp 存取 Hub 及 Spaces 上的 AI 應用。
推薦理由:文章拆解遠端 MCP Server 在傳輸模式、連線狀態與資源開銷上的取捨,並以 Hugging Face 的部署配置呈現決策脈絡。
Hugging Face Blog 示範如何透過 Gradio MCP 伺服器為 LLM 接入工具能力,並以 Flux.1 Kontext[dev] 展示按文字指令編輯圖片。
推薦理由:文章以 Flux.1 Kontext[dev] 示範將 Hugging Face Spaces 的 MCP 服務接入 Cursor,並交代圖片須使用公開 URL,呈現從選擇服務到設定客户端的實作流程。
Hugging Face Blog 示範如何使用 Sentence Transformers 訓練及微調稀疏嵌入模型,介紹 SPLADE、Inference-free SPLADE、CSR 架構,以及資料、損失函數、評估器和訓練器的配置。
推薦理由:文章按 SPLADE、Inference-free SPLADE 與 CSR 的適用情境梳理架構選擇,並以實作例子串連資料、損失函數和評估器配置。
TNG 指出,長提示詞的 prefill 會阻塞後續請求,並在與 decode 共用 GPU 時拖慢已開始生成的請求。vLLM 的並行 partial prefill 可降低短請求的 time-to-first-token;例如可設定最多並行 4 個請求,當中最多 1 個的 prompt 超過 10,000 tokens。
OpenAI Developers 的 Cookbook 以收據審核為例,示範如何以 evals 驅動 LLM 應用從原型逐步走向生產環境。指南從少量標註資料建立收據抽取與審核流程,設計分步及端到端評測,並把錯誤率連結至業務成本以安排改進優先次序。案例比較 o4-mini 與 gpt-4.1-mini,並介紹透過提示詞、示例、模型選擇及持續監測改善系統。
OpenAI Developers 的指南示範如何用 OpenAI Agents SDK 建立多智能體流程,將複雜投資研究任務拆分給多個專家智能體。
OpenAI 發佈 o3/o4-mini 函數呼叫指南,説明如何透過開發者提示詞、工具描述和 Responses API 改善函數呼叫表現。指南建議明確規定工具的使用邊界及呼叫次序、把參數構造規則置前,並盡可能將 `strict` 設為 `true`。
OpenAI 的指南示範如何為 o4-mini 設計模型評分器,並以臨牀對話結果預測任務進行強化微調(RFT)。實驗使用 100 個訓練樣本和 100 個驗證樣本,採用 gpt-4.1 模型評分器後,微調模型的驗證評分較基礎 o4-mini 提高約 5 個百分點。指南亦展示詞面評分可能誘發模型加入同義詞、劑量或治療方案來刷分,並建議以領域專家檢查評分器和資料品質。
Hugging Face Diffusers 文章比較五種量化後端在 FLUX.1-dev 上的記憶體佔用與推理時間。BF16 載入後約佔 31.447 GB,bitsandbytes 4-bit 為 12.584 GB、推理需 12 秒;torchao int4_weight_only 為 10.635 GB,但推理需 109 秒。
OpenAI 的指南介紹 Responses API 託管 MCP 工具,讓模型連接遠端 MCP 伺服器並直接調用工具。指南説明工具清單載入與快取、預設呼叫審批,並建議用 allowed_tools 限定可用工具,以降低 token 開銷和延遲。
OpenAI Developers 示範使用 Evals API 的 `responses` 數據源,從日誌比較 gpt-4o-mini 與 gpt-4.1-mini 對 OpenAI SDK 程式碼檔案的解釋品質。