Hugging Face ZeroGPU Spaces 如何透過 PyTorch AoT 編譯提升效能
Hugging Face 介紹如何在 ZeroGPU Spaces 使用 PyTorch AoT 編譯,將模型預先編譯後在不同程序中載入,以減少即時編譯造成的冷啟動開銷。
推薦理由:文章拆解 ZeroGPU Spaces 的 PyTorch AoT 編譯流程,並展示量化、動態形狀與區域編譯等可遷移的優化做法。
Hugging Face 介紹如何在 ZeroGPU Spaces 使用 PyTorch AoT 編譯,將模型預先編譯後在不同程序中載入,以減少即時編譯造成的冷啟動開銷。
推薦理由:文章拆解 ZeroGPU Spaces 的 PyTorch AoT 編譯流程,並展示量化、動態形狀與區域編譯等可遷移的優化做法。
MCP 讓 AI 智能體透過自然語言使用研究工具,跨 arXiv、GitHub 與 Hugging Face 搜尋論文、程式碼、模型及資料集並交叉查證。Hugging Face 的 Research Tracker MCP 可從 MCP Settings 加入,並按 Claude Desktop、Cursor、Claude Code 或 VS Code 的指引完成設定。
OpenAI 的速率限制指南説明 API 限額依組織、專案及模型而異,並整理常見限額指標與錯誤處理方式。限額指標包括 RPM、RPD、TPM、TPD、IPM,以及部分串流音訊模型的每分鐘音訊分鐘數;API 支出增加後會自動升至更高 usage tier,通常提高大部分模型的速率限制。
OpenAI 指南説明如何驗證 gpt-oss 推理服務的 API 實作、工具調用與模型表現。Responses API 的 reasoning 項目應以 reasoning_text 傳回原始 CoT;Chat Completions 則建議使用 reasoning 欄位,並在後續請求中一併傳回 CoT。
GPT-5 可協助創意寫作。
OpenAI Developers 提供使用 LM Studio 在本地設置並運行 gpt-oss-20b 或 gpt-oss-120b 的指南,涵蓋聊天、MCP 伺服器及 LM Studio 本地開發 API。
OpenAI Developers 示範用 Hugging Face TRL 和 LoRA 微調 openai/gpt-oss-20b,讓模型按指定語言生成鏈式推理。
OpenAI 介紹用 Ollama 在本地運行兩款 gpt-oss 模型,支援離線聊天、API 調用及接入 Agents SDK。gpt-oss-20b 建議至少 16GB VRAM 或 unified memory,gpt-oss-120b 至少 60GB;模型預設採用 MXFP4 量化,VRAM 不足時可用 CPU,但速度較慢。
推薦理由:指南比較兩個模型所需的硬件配置,並串起本地聊天、Chat Completions API 與 Agents SDK 接入步驟,便於評估本地部署路徑。
OpenAI 的 Reasoning guide 説明如何透過 Responses API 使用推理模型,並設定 reasoning.effort、reasoning.mode 及跨回合上下文。指南提醒各模型支援的設定與預設值不同,推理 tokens 會佔用上下文窗口並按輸出 tokens 計費,初期建議為推理及輸出至少預留 25,000 tokens;另涵蓋函數調用、保存推理狀態與提示詞建議。
OpenAI 的 Function calling 指南説明,如何透過 API 讓模型呼叫應用程式提供的函數與自訂工具,以存取外部資料或執行操作。內容涵蓋 Responses API 與 Chat Completions 的工具呼叫流程、JSON Schema 定義、strict mode、工具選擇和並行呼叫。
Mistral 以 Aerial Image Dataset 微調 Pixtral-12B,將衞星影像分類的整體準確率由 0.56 提升至 0.91,幻覺比例則由 5% 降至 0.1%。
文章示範如何以 Gradio 在 Python 中實作 MCP 伺服器,並建立可瀏覽服裝網站、呼叫 IDM-VTON 虛擬試穿的 AI 購物助手。Gradio 會把應用程式的 API endpoint 自動轉為具名稱、描述及輸入 schema 的 MCP 工具,並支援即時進度通知和自動檔案上傳。
推薦理由:示例將 Gradio MCP 伺服器、Playwright 網頁瀏覽與 IDM-VTON 虛擬試穿串成工作流程,並列出 VS Code 設定步驟。
Intercom 以 3 個關鍵經驗建立可擴展的 AI 平台,經驗涵蓋由評測到架構的做法。該平台旨在引領客户支援的未來。
OpenAI 的 Flex processing 可降低 Responses 或 Chat Completions 請求成本,但回應較慢,且偶爾會因資源不可用而無法處理。
OpenAI 的 File search 指南説明,Responses API 可透過語義與關鍵詞搜尋,從已上傳檔案的知識庫檢索資訊。指南示範先建立 vector store 並上傳檔案,再將 file_search 加入可用工具;此工具由 OpenAI 託管,模型決定調用時會自動搜尋檔案並返回結果。
OpenAI 的指南介紹透過 Responses API 管理多輪對話狀態的做法,包括手動傳遞上下文、Conversations API 和 previous_response_id。
OpenAI 的 Background mode 使用指南説明,開發者可透過 Responses API 非同步執行長時間任務,輪詢狀態或取消請求;建立時同時設置 background 和 stream 為 true,則可串流接收事件並在中斷後續接。
OpenAI 示範智能體如何透過工具呼叫完成任務。內容涉及 Responses API、function calling 和 Agents SDK,聚焦智能體工具呼叫。
OpenAI Developers 的 Responses API 使用指南概述 API 的使用方式,內容涵蓋工具(tools)和函數呼叫(function calling)。
OpenAI 示範 AI 智能體如何調用內置工具完成任務。內容涵蓋 Responses API、function calling、Agents SDK、agentic 與 tool calling。
OpenAI Agents SDK 快速入門示範如何建立並執行 Agent、加入工具,並以 handoffs 將問題交由不同專家 Agent 處理。指南亦介紹多輪對話可透過 result.to_input_list()、session=... 或 previous_response_id / conversation_id 延續,並附上 SDK 安裝和 API key 設定步驟。
OpenAI 語音應用指南介紹三種語音智能體架構:GPT-Live 搭配獨立後端、Realtime API 在單一會話中處理語音、推理與工具使用,以及可逐階段檢視或替換元件的串接式語音管線。指南列出任務與工具結果、對話時序、語音與語言、會話可靠性等評估面向,並建議以 Crawl、Walk、Run 逐步增加測試複雜度。
頁面目前只顯示人機驗證,要求訪客確認自己不是自動化程式;vimeo.com 亦提示須先檢查連線安全。頁面未提供「Launch apps with evaluations」的實際內容,因此無法確認其做法或細節。
OpenAI 指南按速度、成本、準確度及任務複雜度,説明如何選擇推理模型與 GPT 模型。指南建議由推理模型負責複雜規劃與決策、GPT 模型執行明確任務;提示詞保持簡潔直接,先試 zero-shot,必要時再加入 few-shot 範例。
OpenAI 的微調最佳實踐指南列出改善微調效果的數據與超參數調整方法,並指出其微調平台已不再向新用户開放。指南建議檢查訓練數據的品質、分佈、一致性及格式,建立測試集,並在訓練樣本中保留有效提示詞;數據品質和分佈合適後,再增加樣本量。
OpenAI 的 Python SDK 指南介紹多智能體編排的兩種方式,即由 LLM 規劃和決策,或由程式碼控制流程,兩者也可混合使用。SDK 常見模式包括由管理者 Agent 透過 `Agent.as_tool()` 調用專家,或由分流 Agent 透過 handoffs 將對話交給專家接手當前回合。
OpenAI Developers 歸納出七項 LLM 應用延遲優化原則,涵蓋 token 處理、減少請求、並行執行、改善用户等待體驗及避免不必要地使用 LLM。
OpenAI Developers 分享在品質、效能與開支之間取得合適取捨的策略,重點是平衡準確度、延遲與成本。
OpenAI 的音訊與語音指南按應用場景介紹 GPT-Live、Realtime API 及專用音訊 API 的選用方式。
OpenAI Realtime API 的即時轉錄指南説明如何建立即時音訊轉錄工作階段,接收隨語音到達的逐步文本,並在提交每個音訊回合後取得最終轉錄。指南建議使用 gpt-live-transcribe,伺服器端音訊管線可用 WebSocket,瀏覽器音訊可用 WebRTC。較高的 delay 會讓模型取得更多音訊上下文並可能改善詞錯誤率,設定應以具代表性的真實音訊測試。
OpenAI 的監督式微調(SFT)指南介紹以示例為特定用途訓練模型的流程,並指出微調平台正逐步停止服務。新用户已無法使用平台,現有用户在未來數月仍可建立訓練工作;所有微調模型可繼續推理,直至其基礎模型棄用。指南建議先建立 evals,從 50 個精心設計的示例開始,並以 JSONL 格式準備訓練資料。
OpenAI Developers 的 Agents SDK 頁面標題為「解鎖智能體能力」,但目前可見正文只有要求訪客確認真人身份的驗證提示。頁面另提示 vimeo.com 需要先檢查連線安全,沒有提供 SDK 的功能或技術細節。
OpenAI 的 Realtime API 入門指南説明如何經 WebRTC 或 WebSocket 建立有狀態的語音對話,並以事件管理會話。指南涵蓋文字和音訊生成、圖像輸入、function calling、VAD 設定、打斷處理及 push-to-talk;Realtime Session 最長為 60 分鐘。
OpenAI 提出提升 LLM 正確性與行為一致性的優化框架,建議先透過評估診斷失誤,再按問題選用提示詞、RAG 或微調。在冰島語校正測試中,GPT-4 零樣本的 BLEU 為 62,加入 3 個 few-shot examples 後為 70;以 1000 個例子微調 GPT-4 後為 87,再加入 RAG 則降至 83。
OpenAI Codex 編程概覽以使用 Codex 進行編程為主題,提供相關內容的整體介紹。原文未列出具體功能、操作步驟或技術細節。
OpenAI Developers 示範如何使用 4o 模型生成圖像。
OpenAI 的 Structured Outputs 示例倉庫收錄三個以 NextJS 構建的 sample apps,展示此 API 功能的實際用法。Structured Outputs 可令模型回應和工具調用遵循指定 JSON schema。
OpenAI Realtime Console 示例應用展示如何透過 WebRTC 使用 Realtime API,並在 WebRTC data channel 上收發事件及配置 client-side function calling。
DevDay 的分組討論聚焦有效進行模型知識蒸餾的策略。
「MCP intro」頁面只顯示人機驗證提示,要求訪客確認自己是人類而非垃圾訊息機械人,才能繼續。頁面指出 vimeo.com 需要先檢查連線安全,正文沒有提供 MCP 的介紹內容。