OpenAI API 語音轉文字方法比較指南
OpenAI Developers 的筆記本比較透過 OpenAI API 與 Agents SDK 進行語音轉文字的多種方法,並提供由檔案上載至即時串流的示例。
OpenAI Developers 的筆記本比較透過 OpenAI API 與 Agents SDK 進行語音轉文字的多種方法,並提供由檔案上載至即時串流的示例。
Gradio 不只是另一個 UI 函式庫,而是透過介面與 API 連接機器學習模型的框架,並提供效能、安全及回應能力保障。它可從單一實作自動生成 REST API 端點及 API 文件,並提供 API Recorder(4.26 引入)、Gradio 5.0 的伺服器端渲染(SSR)、佇列管理和即時串流等功能。
OpenAI Developers 的 cookbook 示範以 Responses API 建立 RAG 多工具工作流程,按查詢將請求路由至內置工具或外部工具。示例結合內置網絡搜尋與 Pinecone 向量資料庫檢索,並展示先搜尋網頁、再查詢 Pinecone,將工具結果交回 API 生成答案。
OpenAI 的 Cookbook 示範以 Realtime API 和 WebSockets 搭建多語言單向語音翻譯流程,讓講者輸入音訊並把不同語言的譯音轉送至聽眾端。
Open R1 的指南示範如何在本機設定 OlympicCoder 7B,並將它接入 VS Code 作為編碼助手。流程使用 LM Studio 載入 LMStudio Community 的 4bit GGUF 版本,再透過 Continue.dev 連接至本機服務 http://localhost:1234/v1。
Hugging Face Blog 的教程示範以 React Native 建立手機應用,在裝置本地執行 LLM 聊天。應用從 Hugging Face Hub 下載 GGUF 模型,並以 llama.rn(llama.cpp 的 binding)載入,教程涵蓋 Android 和 iOS。文章亦介紹 GGUF 量化格式、手機選模取捨,以及逐 token 生成與推理速度追蹤等功能。
推薦理由:文章按模型選擇、GGUF 下載與載入、聊天介面逐步拆解 React Native 實作,並説明量化格式與設備能力的取捨,可作為端側 LLM 應用的開發參考。
Mistral AI 的 TranscriptToPRDTicket 智能體工作流程可將會議逐字稿自動轉成產品需求文件(PRD)及開發工單。其中 PRDAgent 與 TicketCreationAgent 均由 Mistral Large 2 驅動,並可在 Linear 或 Jira 建立工單。完整實作已提供於 Google Colab notebook,供使用者開始部署及按需自訂。
這項基準測試比較文字分類、文本嵌入及視覺嵌入的推理配置,估算處理 1B 筆輸入的成本與延遲。在 nvidia-L4($0.8/hr)上,三類任務每 1B 筆輸入的成本分別為 $253.82、$409.44 和 $44,496.51;測試程式碼見 https://github.com/datavistics/encoder-analysis。
推薦理由:三類實測呈現 GPU、batch size 與並行 VUs 對成本和延遲的影響,並提供可替換模型與硬件重跑的流程,供讀者估算自有配置處理 1B 筆輸入的開支。
Hugging Face Blog 的 hlky 和 Sayak 介紹一套建立影片生成模型微調資料集的三階段工具流程,讓社羣能自行製作小型資料集。流程以 yt-dlp 下載影片、用 Video to Scenes 切成短片,再以影格或全片指標篩選,並用 Florence-2 生成字幕、辨識物件及進行 OCR;也可用 Qwen2.5 為整段影片加字幕。
以 ChatGPT 打造自訂數學導師,聚焦 ChatGPT 與個人化輔導;正文未提供設計流程、具體功能或其他規格。
ChatGPT 可用於尋找美甲靈感。
ChatGPT 被用於捕捉大比目魚;原文未提供具體方法或捕捉結果。
Hugging Face Diffusers 團隊梳理多款開源影片生成模型的能力與限制,並介紹 Diffusers 對影片生成、推理優化及微調的支援。
推薦理由:文章整理多款開源影片模型的資源需求,並以 HunyuanVideo 不同優化設定的數據,呈現量化、卸載和 VAE tiling 對顯存與推理時間的實際取捨。
OpenAI 的範例 notebook 示範呼叫 Completions Usage API 和 Costs API,擷取用量及費用數據並製作監測圖表。程式以分頁方式讀取 API 回應,交由 pandas 整理,再用 matplotlib 繪製每日 token 用量與成本,並按模型、項目及 `line_item` 分組查看統計。
Hugging Face Blog 介紹 NVIDIA 的 LogitsProcessorZoo,示範如何透過 logits 處理器控制語言模型的生成結果。示例涵蓋調整輸出長度、依據提示詞引導內容、強制加入指定結尾短語,以及讓模型在選擇題中只輸出選項。
動畫師 Lyndon Barrois 以 Sora 創造新世界,並分享如何把 Sora 作為説故事工具;內容聚焦其作為創作工具的使用方式。
OpenAI 呼籲產品團隊把 AI 用於產品工作;現有內容只提出這項建議,未説明具體工具、功能或實施方式。
Hugging Face Blog 發佈 EU AI Act 開源開發者指南,梳理法規對 AI 系統及 GPAI 模型的適用範圍與分級義務。指南聚焦有限風險 AI 系統和非系統性風險開源 GPAI 模型,涵蓋披露 AI 互動、以機器可讀格式標記合成內容、提供訓練內容摘要及尊重版權 opt-out 等要求。
推薦理由:文章區分有限風險 AI 系統與非系統性風險開源 GPAI 模型,梳理透明標示、訓練內容摘要及版權 opt-out 等合規要求。
這篇教程逐步拆解 Transformer 位置編碼的設計,從整數、二進制及正弦方案推導至 RoPE。文章解釋 RoPE 如何對 query 和 key 向量的分量成對旋轉,令注意力點積帶入相對位置資訊,同時不改變向量範數。文中也介紹如何分開處理各維度的位置資訊,以延伸至多維資料。
推薦理由:文章從位置編碼的設計需求出發,逐步比較整數、二進制與正弦方案,並推導 RoPE 如何以旋轉在注意力計算中表達相對位置。
Stable Diffusion 3.5 Large(8B)及其 timestep 蒸餾版(8B)已在 Hugging Face Hub 提供,並可透過 Diffusers 進行推理與訓練。
推薦理由:文章把 Diffusers 中的量化推理與 LoRA 微調落到具體步驟,並提供在 24GB VRAM 消費級 GPU 上微調 SD3.5 Large 的參考路徑。
Hugging Face 示範以自訂 Docker 映像,將 Speech-to-Speech(S2S)流程部署至 Hugging Face Inference Endpoints。
推薦理由:文章把多模型語音流程拆解為自訂 Docker 映像、端點設定和 WebSocket 音訊服務等步驟,提供部署複雜推理管線時可參照的實作路徑。
Hugging Face Blog 示範以 Dask 和 Coiled 把 FineWeb-Edu 網頁分類流程,從 pandas 本機處理 100 行擴展至雲端多 GPU 處理 211 million 行。
推薦理由:FineWeb-Edu 分類案例呈現了由 pandas 本機小批次測試,擴展至 Dask 與 Coiled 雲端多 GPU 處理 211 million 行資料的完整流程,為大型資料集推理提供可參照的工程做法。
Hugging Face 介紹 Daily Papers 頁面的功能,包括認領論文、提交社羣推薦論文、與作者討論,以及查看相關模型、數據集和示範。過去一年,Daily Papers 收錄超過 3,700 篇論文,訂閲者超過 12k;只有已認領論文的用户可提交論文,留言支援多種語言並提供內置翻譯。用户可在評論區輸入 @librarian-bot 獲推薦相關論文,亦可訂閲每日更新(週末除外)。
Hugging Face Blog 示範如何用 Optimum-Intel 和 OpenVINO GenAI 優化 Transformers 模型,並部署至邊緣或客户端環境。
Hugging Face Blog 介紹 Hugging Face Hub 上 5 項常被忽略的工具,並以 Reddit 資料展示自動更新的視覺化語義搜尋流程。
推薦理由:文章以每日更新的 Reddit 資料為例,拆解 Hugging Face Hub 五項工具如何協作,從資料抓取、嵌入向量處理與事件觸發,直到視覺化語義搜尋。
Hugging Face Blog 提供了在 Google Cloud Vertex AI 部署 Meta Llama 3.1 405B Instruct FP8 的操作教程,並示範如何以 Text Generation Inference(TGI)執行線上推理。
Hugging Face Blog 的 ggml 入門指南介紹這個以 Transformer 推理為重點的 C/C++ 機器學習函式庫,並示範其基本用法。文章解釋 ggml_context、ggml_cgraph、ggml_backend 等概念,透過矩陣乘法展示張量建立、計算圖執行和 backend 記憶體配置流程。
Hugging Face Blog 介紹 TextImage Augmentation,這套與 Albumentations AI 合作開發的流程可同步增強文件圖像及其中的文字標註。它可隨機插入、刪除或交換文字,並搭配圖像變換生成多樣化訓練樣本。變更後文字及對應 bounding box 可提取,用於模型訓練。
Hugging Face 示範如何在 Diffusers 中使用 Quanto 量化 Transformer-based diffusion pipeline,以降低推理時的 GPU 記憶體佔用。
推薦理由:文章提供在 Diffusers 中以 Quanto 量化擴散 Transformer 與文字編碼器的操作步驟,並用記憶體和延遲數據呈現精度設定的取捨。
Hugging Face Blog 示範如何用 distilabel 為 Argilla 2.0 技術文件建立 RAG 聊天機械人。流程包括從文件建立切塊與合成查詢三元組、微調領域嵌入模型、建立向量資料庫,並將 Gradio 應用部署至 Hugging Face Spaces。聊天互動會記錄在 Argilla,供持續評估與改進。
推薦理由:文章串起文件切塊、合成查詢三元組、微調領域嵌入模型、向量檢索與對話評估,提供一套可複用的文件問答 RAG 實作流程。
Hugging Face《倫理與社會通訊》第 6 期闡述高質素數據如何支撐更好的 AI,並強調數據須切合具體用途,而非只看準確度或數量。文章列出相關性、全面性、時效性及偏見緩解等質素要素,並指出優質數據有助提升模型表現、穩健性、效率與包容性。數據整理、去重、內容篩選、人類回饋、參與式收集、治理框架及定期評估,都是改善數據質素的做法。
Hugging Face Blog 示範以 DocVQA 微調 Microsoft 的 Florence-2,使其適配視覺問答任務。訓練 7 個 epochs 後,驗證集 Levenshtein 相似度由 0 升至 57.0。文中提供凍結視覺編碼器、batch size 6 的低資源方案,並記錄以 8 張 H100、batch size 64 微調全模型需時 70 分鐘。
推薦理由:文章以 DocVQA 示範 Florence-2 微調,並列出驗證集表現及不同 GPU 配置,可供評估下游任務適配與訓練資源。
Hugging Face 介紹如何使用 TGI Benchmarking 工具,測量 Text Generation Inference(TGI)在不同 batch size 下的吞吐量與延遲,並據此調整部署設定。
OpenAI Developers 的 Notebook 示範以 GPT-4o 建立檢查客服智能體回覆是否出現幻覺的輸出防護欄。流程先生成客服政策與對話作為評測集,再按句檢查事實準確性、相關性、政策遵循及上下文連貫性。文中報告 precision 為 0.97、recall 為 1.00。
Sentence Transformers 指南示範如何微調嵌入模型以配合特定任務,並説明亦可從頭訓練新模型。內容講解資料集、損失函數、訓練參數、評估器與 Trainer,並示範從 Hugging Face Hub 或本機載入資料及多資料集訓練。文中 AllNLI 三元組範例以餘弦相似度計算,開發集及測試集準確率分別為 90.04% 和 91.5%;訓練前基礎模型的開發集準確率為 68.32%。
推薦理由:文章拆解資料集格式、損失函數、訓練參數、評估器與 Trainer 的配合,並展示多資料集搭配不同損失函數的訓練方式,方便轉用於不同嵌入任務。
Hugging Face Blog 示範以 Intel Xeon CPU 運行嵌入模型、以 Intel Gaudi 2 運行 LLM,並透過 LangChain、Redis 和 TGI 構建及部署企業級 RAG 應用。
Hugging Face 示範透過自訂 inference handler,在 Hugging Face Inference Endpoints 將 ASR、説話人分離與推測解碼整合至單一 API endpoint。
推薦理由:文章展示如何把 ASR、説話人分離與推測解碼組成單一端點,並以長短音訊基準説明推測解碼的效益會隨輸入長度改變。
Zama 團隊示範如何透過 Hugging Face Endpoints 部署 Concrete ML 預編譯模型,讓使用者在加密資料上執行推理。文章以垃圾郵件決策樹為例,説明 Endpoint 部署、客户端設定及自製預編譯模型的流程。文中指出,CPU Endpoint 當時最多提供 8 vCPU 和 16 GB RAM,FHE 評估密鑰存於 Endpoint 的 RAM,重啟後需要重新傳送。
Gradio reload mode 可在不重啟 Gradio server 的情況下載入來源檔案的最新變更,文章以此快速構建 AI 文件問答應用。
推薦理由:文章透過文件問答應用示範 Gradio reload mode,並説明如何用 gr.NO_RELOAD 保留客户端,減少開發迭代時重建資源的等待。
Hugging Face Blog 示範以 DuckDB-NSQL-7B 結合 Hugging Face Dataset Viewer API 和 DuckDB,將自然語言問題轉為 SQL 查詢資料集中的資料。