跳到正文

#部署/工程

今日 17 條
9月2日週三
  1. Cursor Blog55

    Nokia 藉助 Cursor 在兩週內分析超過 5000 萬行程式碼

    Nokia 核心網部門表示,兩名工程師藉助 Cursor 在兩週內分析某條產品線超過 5000 萬行程式碼,無需自訂工具。分析為拆解單體架構、轉向分散式服務架構提供規劃依據,並據 Nokia 估算,數月內釋放十多名專家投入其他項目。Cursor 亦協助 Nokia 將新功能部署工作流約 80% 自動化及可視化,並把根因分析由數週縮短至數天。

  2. Sierra:Blog58

    甚麼是 Voice AI?企業級 AI 語音智能體指南

    Sierra 的企業級 Voice AI 指南説明,AI 語音智能體可結合客戶背景及業務系統,在通話中處理要求並完成工作。企業準備程度須以整通電話作端到端評估,涵蓋延遲、輪流發言、語音辨識、上下文、操作、護欄及轉接七項測試,並納入噪音、打斷、模糊請求和整合失敗等情況。Sierra 的 tau-voice 基準以 278 項客戶服務任務,結合真實音訊及重疊發言,測試對話行為與資料庫狀態是否正確。

9月1日週二
8月31日週一
8月30日週日
8月25日週二
  1. Hugging Face Blog64

    Gradio gr.Workflow 如何編排、執行及部署 AI 工作流

    Gradio 內置的 gr.Workflow 可把 AI 工作流表示為由帶類型節點組成的圖,並提供可拖放、逐節點執行及查看中間結果的畫布。節點可執行 Python 函數、調用 Hugging Face Inference Providers 模型或其他 Gradio Space,也可處理 Hub 數據集資料。

    推薦理由:文章以多個可執行示例展示如何把模型、Python 函數與 Gradio Space 串成工作流,並讓節點輸出直接成為 API。

  2. Mistral AI55

    Mistral AI 與 HUMAIN 宣佈戰略合作,推進沙特阿拉伯及中東主權 AI

    Mistral AI 與 HUMAIN 宣佈戰略合作,將在沙特阿拉伯及區域內推進 AI 基礎設施、先進模型開發和 AI 解決方案部署。雙方將開發並本地化先進 AI 模型,初期聚焦網絡安全和語音,並計劃開發阿拉伯語表現出色的前沿模型;合作規模達數億歐元。Mistral AI 將探討使用 HUMAIN 的數據中心基礎設施,雙方亦計劃在沙特制定面向受監管行業的共同市場策略。

8月21日週五
  1. Hugging Face Blog63

    Hugging Face Inference Endpoints、Jobs 和 Buckets 如何支撐 Papers with Code 搜尋

    Hugging Face 以 Inference Endpoints、Jobs 和 Storage Buckets 建立 Papers with Code 混合搜尋系統,為來自 arXiv 和 Daily Papers 的超過 110,000 篇論文維護嵌入向量。

    推薦理由:文章拆解離線批次建向量與線上查詢的分工,並説明端點冷啟動時如何回退全文檢索,呈現混合搜尋進入生產環境的工程取捨。

8月18日週二
  1. Hugging Face Blog72

    Sentence Transformers v6.0 多向量(Late Interaction)嵌入模型使用指南

    Sentence Transformers v6.0 新增 MultiVectorEncoder,支援 ColBERT 式多向量檢索。文中示範載入 PyLate 與 Stanford-NLP ColBERT checkpoint、接入檢索索引,以及以同一 API 執行 ColPali 視覺文件檢索。

    推薦理由:文章對照 LateOn 與 DenseOn 在 NanoBEIR 13 個資料集的結果,並以索引體積數據呈現多向量檢索表現與儲存成本的取捨。

8月15日週六
  1. Ahead of AI38

    從零開始建構 AI 文字偵測器

    這個教學示範如何從零建構 AI 文字偵測器,並以微調 DistilBERT 分類器估算文字由 AI 生成的可能性。評分為 0-100,項目目標包括提供人類及智能體可用的 API,以及可顯示全文和個別文字區塊評分的本地瀏覽器介面。作者亦以此探討 AI 偵測器的限制,以及評分器或驗證器在 LLM 應用中的用途。

8月14日週五
  1. Epoch AI:Gradient Updates77

    融資會否成為 AI 算力擴張瓶頸?Anthropic 個案分析

    Epoch AI 以 Anthropic 基建融資為案例,指出近 $50 billion 債務融資顯示,至少短期內融資不太可能成為前沿算力擴張的瓶頸。其中,機構投資者承諾提供 $34.5 billion 債務,支持租賃超過 1 GW 的 Google TPU 系統;另有約 $15.2 billion 貸款支持五個數據中心建設,涉及 1.43 GW 的關鍵 IT 容量。

    推薦理由:Anthropic 個案拆解供應商信用支持租賃融資的結構,呈現未來租金如何轉化為機構資金,以及融資成本如何受風險分擔安排影響。

8月13日週四
  1. Cursor Blog66

    Cursor 推出「構建」功能,雲端智能體啟動速度最快提升至 3 倍

    Cursor 推出「構建」功能,透過預先準備好的開發環境,讓雲端智能體啟動速度最快提升至 3 倍,且不額外收費。預設每小時建立新構建,成功版本會成為後續智能體的啟動環境;新構建失敗時,智能體仍使用上一次成功版本。從 8 月 17 日起,所有新建及現有環境將預設啟用構建。

8月12日週三
  1. Hamel Husain 長文9

    AI 產品工程筆記

    Hamel Husain 列出其 AI 產品工程長文選集,題材包括 AI 評測、產品開發、LLM 評估及工程工具。他與人共同教授的 AI Evals for Engineers and PMs 已有逾 5,000 名學生,來自 500 多間公司,包括 OpenAI、Anthropic 和 Google。

8月10日週一
8月7日週五
7月30日週四
  1. Cursor Blog69

    Cursor 如何搭建雲端智能體環境

    Cursor 分享了為雲端智能體搭建開發環境的方法,讓雲端 VM 貼近本地開發,並支援智能體測試程式碼及維護環境。團隊以 Dockerfile 配置依賴,以 anydev 簡化服務啟動,並透過 Cursor Cloud MCP 和 Cloud Doctor 診斷、修復環境及改善工作流。去年 12 月,合併到 Cursor 單體倉庫的 PR 中約十分之一由雲端智能體編寫,如今已超過一半。

7月29日週三
7月24日週五
7月23日週四
7月22日週三
  1. Google DeepMind64

    Google 承諾提供 $40M 的 AI tokens 與雲端額度,支持 Genesis Mission

    Google 在 DOE Genesis Mission Summit 2026 宣佈,將提供 $40 million 的 AI tokens 和雲端額度,支持 Genesis Mission 研究人員。

    推薦理由:承諾同時涵蓋科學 AI 工具與 Gemini for Government 一年使用權,並附有顯微鏡校準時間及手動步驟的前後數據,可見資源投入如何落到實驗室工作流程。

7月10日週五
7月8日週三
  1. Hugging Face Blog75

    Hugging Face 更新 vLLM Transformers 建模後端,多種相容 LLM 架構推理吞吐量達原生實作水平

    Hugging Face 更新 vLLM 的 Transformers 建模後端,令多種相容 LLM 架構的推理吞吐量達到或超過 vLLM 手寫原生實作。測試涵蓋 Qwen3-4B 單 GPU、Qwen3-32B 張量並行,以及 Qwen3-235B-A22B-FP8 MoE 在同一 8×H100 節點上的數據並行與專家並行,三者均達到或超越原生實作吞吐量。

    推薦理由:文章以三種不同規模及並行配置的 Qwen3 模型對照 vLLM 手寫實作,並説明 torch.fx 分析與運行時融合如何使相容模型達到原生推理速度。

7月7日週二
  1. Hugging Face Blog63

    Hugging Face 精選模型目錄登陸 Microsoft Foundry Managed Compute,開放預覽

    Hugging Face 與 Microsoft 將每週更新的精選開放權重模型目錄加入 Microsoft Foundry Model Catalog,並可一鍵部署至 Foundry Managed Compute。

    推薦理由:文章梳理模型篩選、權重預置和執行環境掃描的上架流程,説明企業如何在私有網絡內部署而毋須連出 Hugging Face Hub。

7月6日週一
7月1日週三
6月27日週六
  1. Google Research61

    Google Research 為凍結權重的 Gemini Nano v3 加入 Multi-Token Prediction,加速 Pixel 端生成

    Google Research 已將 Multi-Token Prediction(MTP)架構部署至 Pixel 9 和 10 系列的 Gemini Nano v3,透過凍結主模型權重加快裝置端文字生成。

    推薦理由:文章對照整合式 MTP head 與獨立草稿模型,説明直接利用主模型狀態如何提升候選 token 準確度,並改善 Pixel 端的速度與記憶體效率。

6月26日週五
  1. Hugging Face Blog68

    用一條命令在 HF Jobs 上執行 vLLM 伺服器

    Hugging Face Blog 示範用一條命令在 HF Jobs 上以 vLLM 啟動私有、OpenAI-compatible 的 LLM 端點。內容提供 curl 和 Python OpenAI client 呼叫範例,並示範以 SSH、Gradio 及 Pi 延伸使用;每次請求須附上具該 Job 讀取權限的 HF token。

    推薦理由:文章把 HF Jobs、vLLM 與 OpenAI-compatible API 的部署、驗證和停止流程串成可複用命令,並説明私有端點的 token 權限與成本控制。

6月25日週四
  1. Google Research47

    以線性彈性快取優化雲端經濟效益

    Google Research 提出線性彈性快取,將頁面淘汰建模為 ski rental 問題,按即時工作負載動態調整快取容量,以降低快取管理的總擁有成本。在 Spanner 生產環境測試中,記憶體用量減少 15.5%,快取未命中僅增加 5.5%,總擁有成本約降低 5%,實際 I/O 成本影響僅 0.5%。

6月24日週三