跳到正文

全部動態

今日 23 條
7月21日週一
  1. OpenAI Developers61

    OpenAI 語音應用入門:三種語音智能體架構的選擇與評估

    OpenAI 語音應用指南介紹三種語音智能體架構:GPT-Live 搭配獨立後端、Realtime API 在單一會話中處理語音、推理與工具使用,以及可逐階段檢視或替換元件的串接式語音管線。指南列出任務與工具結果、對話時序、語音與語言、會話可靠性等評估面向,並建議以 Crawl、Walk、Run 逐步增加測試複雜度。

  2. OpenAI Developers58

    OpenAI Python SDK 如何編排多個智能體

    OpenAI 的 Python SDK 指南介紹多智能體編排的兩種方式,即由 LLM 規劃和決策,或由程式碼控制流程,兩者也可混合使用。SDK 常見模式包括由管理者 Agent 透過 `Agent.as_tool()` 調用專家,或由分流 Agent 透過 handoffs 將對話交給專家接手當前回合。

  3. OpenAI Developers61

    OpenAI Realtime API 即時轉錄指南:工作階段設定與延遲調校

    OpenAI Realtime API 的即時轉錄指南説明如何建立即時音訊轉錄工作階段,接收隨語音到達的逐步文本,並在提交每個音訊回合後取得最終轉錄。指南建議使用 gpt-live-transcribe,伺服器端音訊管線可用 WebSocket,瀏覽器音訊可用 WebRTC。較高的 delay 會讓模型取得更多音訊上下文並可能改善詞錯誤率,設定應以具代表性的真實音訊測試。

  4. OpenAI Developers6

    Agents SDK:解鎖智能體能力

    OpenAI Developers 的 Agents SDK 頁面標題為「解鎖智能體能力」,但目前可見正文只有要求訪客確認真人身份的驗證提示。頁面另提示 vimeo.com 需要先檢查連線安全,沒有提供 SDK 的功能或技術細節。

  5. OpenAI Developers66

    如何提升 LLM 的正確性與一致性

    OpenAI 提出提升 LLM 正確性與行為一致性的優化框架,建議先透過評估診斷失誤,再按問題選用提示詞、RAG 或微調。在冰島語校正測試中,GPT-4 零樣本的 BLEU 為 62,加入 3 個 few-shot examples 後為 70;以 1000 個例子微調 GPT-4 後為 87,再加入 RAG 則降至 83。

7月18日週五
  1. OpenAI Developers3

    MCP 簡介

    「MCP intro」頁面只顯示人機驗證提示,要求訪客確認自己是人類而非垃圾訊息機械人,才能繼續。頁面指出 vimeo.com 需要先檢查連線安全,正文沒有提供 MCP 的介紹內容。

  2. Manus:Blog66

    AI 智能體的上下文工程:Manus 的構建經驗與教訓

    Manus 團隊分享構建 Manus 的 AI 智能體上下文工程經驗,提出管理上下文、工具選擇與記憶的設計原則。文章建議保持提示詞前綴穩定、避免在迭代中動態增刪工具,並把檔案系統作為可恢復的外部記憶;另指出應在上下文中保留失敗記錄,並持續重述待辦目標。文中提到 Manus 平均輸入與輸出 token 比例約為 100:1,典型任務平均約有 50 次工具呼叫。

7月17日週四
7月11日週五
  1. OpenAI Developers57

    OpenAI Developers 的 AI 應用開發學習路線:從概念到生產環境

    OpenAI Developers 提供一套面向開發者的 AI 應用開發學習路線,按四階段涵蓋基礎概念、應用開發、測試與評估,以及規模化和維護。內容介紹如何透過 Responses API 或 Agents SDK 建置智能體,並説明 RAG 用於引入知識、微調用於調整模型行為,以及用 evals 和 guardrails 測試與約束應用。

7月10日週四
7月9日週三
  1. Hugging Face Blog65

    Hugging Face 示範如何用 Gradio MCP Servers 為 LLM 增添工具能力

    Hugging Face Blog 示範如何透過 Gradio MCP 伺服器為 LLM 接入工具能力,並以 Flux.1 Kontext[dev] 展示按文字指令編輯圖片。

    推薦理由:文章以 Flux.1 Kontext[dev] 示範將 Hugging Face Spaces 的 MCP 服務接入 Cursor,並交代圖片須使用公開 URL,呈現從選擇服務到設定客户端的實作流程。

7月1日週二
  1. Hugging Face Blog64

    使用 Sentence Transformers 訓練及微調稀疏嵌入模型

    Hugging Face Blog 示範如何使用 Sentence Transformers 訓練及微調稀疏嵌入模型,介紹 SPLADE、Inference-free SPLADE、CSR 架構,以及資料、損失函數、評估器和訓練器的配置。

    推薦理由:文章按 SPLADE、Inference-free SPLADE 與 CSR 的適用情境梳理架構選擇,並以實作例子串連資料、損失函數和評估器配置。

6月12日週四
6月2日週一
  1. OpenAI Developers73

    OpenAI Cookbook 示範以 evals 驅動系統設計,從原型走向生產環境

    OpenAI Developers 的 Cookbook 以收據審核為例,示範如何以 evals 驅動 LLM 應用從原型逐步走向生產環境。指南從少量標註資料建立收據抽取與審核流程,設計分步及端到端評測,並把錯誤率連結至業務成本以安排改進優先次序。案例比較 o4-mini 與 gpt-4.1-mini,並介紹透過提示詞、示例、模型選擇及持續監測改善系統。

5月28日週三
5月26日週一
  1. OpenAI Developers62

    o3/o4-mini 函數呼叫指南

    OpenAI 發佈 o3/o4-mini 函數呼叫指南,説明如何透過開發者提示詞、工具描述和 Responses API 改善函數呼叫表現。指南建議明確規定工具的使用邊界及呼叫次序、把參數構造規則置前,並盡可能將 `strict` 設為 `true`。

5月23日週五
  1. OpenAI Developers60

    OpenAI 指南探討如何為強化微調設計模型評分器

    OpenAI 的指南示範如何為 o4-mini 設計模型評分器,並以臨牀對話結果預測任務進行強化微調(RFT)。實驗使用 100 個訓練樣本和 100 個驗證樣本,採用 gpt-4.1 模型評分器後,微調模型的驗證評分較基礎 o4-mini 提高約 5 個百分點。指南亦展示詞面評分可能誘發模型加入同義詞、劑量或治療方案來刷分,並建議以領域專家檢查評分器和資料品質。

5月21日週三
5月13日週二