跳到正文

#部署/工程

今日 5 條
7月22日週三
7月10日週五
7月8日週三
  1. Hugging Face Blog75

    Hugging Face 更新 vLLM Transformers 建模後端,多種相容 LLM 架構推理吞吐量達原生實作水平

    Hugging Face 更新 vLLM 的 Transformers 建模後端,令多種相容 LLM 架構的推理吞吐量達到或超過 vLLM 手寫原生實作。測試涵蓋 Qwen3-4B 單 GPU、Qwen3-32B 張量並行,以及 Qwen3-235B-A22B-FP8 MoE 在同一 8×H100 節點上的數據並行與專家並行,三者均達到或超越原生實作吞吐量。

    推薦理由:文章以三種不同規模及並行配置的 Qwen3 模型對照 vLLM 手寫實作,並説明 torch.fx 分析與運行時融合如何使相容模型達到原生推理速度。

7月7日週二
  1. Hugging Face Blog63

    Hugging Face 精選模型目錄登陸 Microsoft Foundry Managed Compute,開放預覽

    Hugging Face 與 Microsoft 將每週更新的精選開放權重模型目錄加入 Microsoft Foundry Model Catalog,並可一鍵部署至 Foundry Managed Compute。

    推薦理由:文章梳理模型篩選、權重預置和執行環境掃描的上架流程,説明企業如何在私有網絡內部署而毋須連出 Hugging Face Hub。

7月6日週一
7月1日週三
6月27日週六
  1. Google Research61

    Google Research 為凍結權重的 Gemini Nano v3 加入 Multi-Token Prediction,加速 Pixel 端生成

    Google Research 已將 Multi-Token Prediction(MTP)架構部署至 Pixel 9 和 10 系列的 Gemini Nano v3,透過凍結主模型權重加快裝置端文字生成。

    推薦理由:文章對照整合式 MTP head 與獨立草稿模型,説明直接利用主模型狀態如何提升候選 token 準確度,並改善 Pixel 端的速度與記憶體效率。

6月26日週五
  1. Hugging Face Blog68

    用一條命令在 HF Jobs 上執行 vLLM 伺服器

    Hugging Face Blog 示範用一條命令在 HF Jobs 上以 vLLM 啟動私有、OpenAI-compatible 的 LLM 端點。內容提供 curl 和 Python OpenAI client 呼叫範例,並示範以 SSH、Gradio 及 Pi 延伸使用;每次請求須附上具該 Job 讀取權限的 HF token。

    推薦理由:文章把 HF Jobs、vLLM 與 OpenAI-compatible API 的部署、驗證和停止流程串成可複用命令,並説明私有端點的 token 權限與成本控制。

6月25日週四
  1. Google Research47

    以線性彈性快取優化雲端經濟效益

    Google Research 提出線性彈性快取,將頁面淘汰建模為 ski rental 問題,按即時工作負載動態調整快取容量,以降低快取管理的總擁有成本。在 Spanner 生產環境測試中,記憶體用量減少 15.5%,快取未命中僅增加 5.5%,總擁有成本約降低 5%,實際 I/O 成本影響僅 0.5%。

6月24日週三
6月23日週二
  1. Mistral AI60

    Mistral OCR 4 發佈,新增文件區塊定位、分類與信心分數

    Mistral AI 發佈文件解析模型 Mistral OCR 4,除提取文字外亦輸出邊界框、區塊類型和信心分數,並支援 170 種語言、10 個語言組別。獨立人工偏好評估的平均勝率為 72%,模型在 OlmOCRBench 得分 85.20;官方提醒自動基準存在評分侷限,建議以自有文件評估。

    推薦理由:文章列明 OCR 4 的結構化輸出和自動基準評分侷限,為企業按自身文件評估解析、檢索及資料管線提供具體參照。

6月19日週五
6月15日週一
6月11日週四
6月10日週三
6月9日週二
6月5日週五
  1. Hugging Face Blog62

    NVIDIA 發佈 Nemotron 3.5 Content Safety,整合多模態安全判定與自訂政策

    NVIDIA 發佈 Nemotron 3.5 Content Safety,將多模態輸入、多語言覆蓋、自訂企業政策與可審計推理整合至單一 4B 模型。模型基於 Google Gemma 3 4B IT,明確訓練覆蓋 12 種語言,並承接其約 140 種語言的 zero-shot 泛化;可選 THINK mode 會輸出推理軌跡。

    推薦理由:Nemotron 3.5 將多模態判定、自訂政策和可審計推理整合於 4B 模型,並附訓練資料集,提供企業安全審核的部署參考。

6月2日週二
  1. Hugging Face Blog63

    Holo3.1 系列發佈,擴展電腦操作至手機並提供本地量化權重

    H Company 發佈 Holo3.1 電腦操作模型系列,擴展至網頁、桌面及手機環境,並提供本地推理量化權重。AndroidWorld 上,35B-A3B 模型的分數由 67% 升至 79.3%,4B 和 9B 版本由 58% 升至 72%。

    推薦理由:文章同時列出不同尺寸、量化格式,以及 AndroidWorld 和 DGX Spark 數據,讀者可據此比較本地部署的性能與速度取捨。

6月1日週一
  1. OpenAI News68

    OpenAI 前沿模型與 Codex 現已在 AWS 正式提供

    OpenAI 宣佈,其前沿模型與 Codex 現已在 AWS 正式提供,為企業提供透過既有 AWS 環境使用 OpenAI 的途徑。企業可沿用熟悉的 AWS 控制措施及採購流程,並加快由評估走向生產。

    推薦理由:這項可用性變化讓企業沿用既有 AWS 環境、控制措施及採購流程接入 OpenAI,並加快由評估推進至生產。

5月29日週五
5月28日週四
  1. Google Research46

    Google 透過零信任聚合實現私隱分析

    Google將新型密碼學聚合協定與可信執行環境(TEE)結合,為私隱分析建立零信任防護,確保Google只能取得匿名化的羣體彙總洞察。新協定讓裝置以單一訊息提交資料,免須在多輪互動期間持續在線;密碼學層確保個人原始資料不會在任何伺服器記憶體中暴露或重建。

5月25日週一
  1. Hugging Face Blog60

    AI 智能體中的 Harness、Scaffold 等術語解析

    Hugging Face 梳理 AI 智能體常見術語,解釋 Model、Scaffolding、Harness、Agent 等概念及其區別。文中將 Harness 定義為調用模型、處理工具調用及決定何時停止的執行層,Scaffolding 則涵蓋系統提示詞、工具描述、回應解析和上下文管理等行為定義層。

    推薦理由:文章以模型、Scaffolding、Harness 與 Agent 的分工建立實用心智模型,並把這套脈絡延伸至訓練術語,便於理解智能體系統的組成與相關討論。

5月18日週一
5月13日週三
5月11日週一
5月8日週五
5月5日週二
5月4日週一
4月29日週三
4月27日週一