跳到正文

#推理

今日 0 條
12月23日週一
12月20日週五
12月18日週三
  1. Hugging Face Blog67

    Bamba-9B 混合 Mamba2 模型發佈,vLLM 測試吞吐量最高達 Meta Llama 3.1 8B 的 2.5 倍

    IBM、Princeton、CMU 和 UIUC 合作訓練並推出 Bamba-9B 混合 Mamba2 模型,使用完全開放數據。該模型以 2.2T tokens 訓練;在 vLLM 測試中,相較 Meta Llama 3.1 8B,吞吐量最高提升 2.5 倍,延遲改善 2 倍。

    推薦理由:文中對照 Bamba-9B 與 Meta Llama 3.1 8B 的 vLLM 推理數據,並列出數學及 MMLU 評測差距,兼顧效率與基準表現。

12月17日週二
11月20日週三
  1. Hugging Face Blog41

    BAAI FlagEval Debate:首個多語言 LLM 辯論賽讓大型模型同場辯論

    BAAI 的 FlagEval Debate 平台讓大型模型透過多語言辯論賽互相比試,以評估其推理與語言能力。平台支援中文、英文、韓文和阿拉伯文,讓模型直接交鋒,供評估者比較觀點、邏輯推理及論證策略。評估結合辯論專家評審和用户投票,並允許模型團隊調整參數、策略與對話風格。

10月16日週三
  1. Mistral AI65

    Mistral AI 發佈 Ministral 3B 和 Ministral 8B 邊緣模型

    Mistral AI 發佈 Ministral 3B 和 Ministral 8B,面向裝置端運算及邊緣場景。兩款模型支援最高 128k 上下文長度(vLLM 目前為 32k),Ministral 8B 採用交錯式滑動窗口注意力模式。

    推薦理由:文章以多個評測類別對照 Ministral 3B、8B 與 Gemma 2、Llama 3.2、Llama 3.1、Mistral 7B 等模型,涵蓋預訓練及 Instruct 版本,便於參照各模型表現。

10月9日週三
  1. Hugging Face Blog60

    Hugging Face + Dask 如何擴展 AI 資料處理

    Hugging Face Blog 示範以 Dask 和 Coiled 把 FineWeb-Edu 網頁分類流程,從 pandas 本機處理 100 行擴展至雲端多 GPU 處理 211 million 行。

    推薦理由:FineWeb-Edu 分類案例呈現了由 pandas 本機小批次測試,擴展至 Dask 與 Coiled 雲端多 GPU 處理 211 million 行資料的完整流程,為大型資料集推理提供可參照的工程做法。

9月17日週二
  1. Mistral AI70

    Mistral AI 發佈 Pixtral 12B 多模態模型

    Mistral AI 發佈 Pixtral 12B,這款多模態模型採用基於 Mistral Nemo 的 12B 參數解碼器,以及從零訓練的 400M 參數視覺編碼器。它支援不同尺寸與長寬比的圖像,並可在 128K tokens 上下文窗口中處理多張圖片;在 MMMU 推理基準上取得 52.5%。模型採用 Apache 2.0 授權,可透過 Le Chat 或 La Plateforme 試用。

    推薦理由:Mistral AI 以相同評測流程比較 Pixtral 12B 與多個開源及閉源模型,並列出 MMMU 52.5% 等基準結果,便於理解其多模態表現。

8月13日週二
8月12日週一
  1. Hugging Face Blog68

    TII 發佈 Falcon Mamba 7B 純 Mamba 模型

    阿布扎比的 Technology Innovation Institute(TII)發佈 Falcon Mamba 7B,這是一款採用純 Mamba 架構、以 TII Falcon Mamba 7B License 1.0 開放存取的模型。

    推薦理由:文章並列 Falcon Mamba 的基準表現與長序列生成結果,也説明 sequential prefill 對可處理提示長度的影響。

7月24日週三
  1. Mistral AI78

    Mistral Large 2 發佈,支援 128k 上下文窗口及單節點推理

    Mistral AI 發佈 Mistral Large 2,提供 128k 上下文窗口、支援 80+ 種程式語言,並面向單節點推理及長上下文應用。模型有 123 billion parameters,預訓練版本在 MMLU 的準確率為 84.0%,並加強指令遵循、推理與函數調用能力。

    推薦理由:Mistral Large 2 披露參數規模、上下文窗口與多項基準表現,並交代研究授權和商用自部署條件,方便比較其能力及部署門檻。

7月23日週二
  1. Hugging Face Blog87

    Meta 發佈 Llama 3.1,推出 8B、70B、405B 模型並支援多語言與 128K tokens 上下文

    Meta 發佈 Llama 3.1,提供 8B、70B、405B 三種規模的 base 與 instruct 模型,均支援 128K tokens 上下文和 8 種語言。Instruct 版本加入工具調用能力,並支援自訂 JSON 函數;授權亦允許以模型輸出改進其他 LLM。Hugging Face 同時列出 Transformers、TGI 等整合,以及各型號在推理和微調時的記憶體需求。

    推薦理由:文章將 8B、70B、405B 的部署定位、128K tokens 上下文及記憶體需求一併列出,可比較不同規模模型的使用取捨。

7月18日週四
  1. Mistral AI70

    Mistral AI 與 NVIDIA 合作發佈 Mistral NeMo 12B 模型,支援 128k tokens 上下文窗口

    Mistral AI 與 NVIDIA 合作發佈 12B 模型 Mistral NeMo,支援最高 128k tokens 上下文窗口。其預訓練基礎版與指令微調版 checkpoints 採 Apache 2.0 授權;標準架構可替換採用 Mistral 7B 的系統,並支援無性能損失的 FP8 推理。

    推薦理由:文章將 Mistral NeMo 與 Mistral 7B 的替換相容性、FP8 推理支援及 Tekken 多語壓縮數據放在一起,呈現模型部署適配與語言處理效率的比較脈絡。

7月17日週三
7月16日週二
  1. Mistral AI69

    Mistral AI 發佈 Codestral Mamba 指令模型

    Mistral AI 發佈 Codestral Mamba,這是一款採 Mamba 架構、擁有 7,285,403,648 個參數的指令模型。Mistral AI 表示,Mamba 模型提供線性時間推理,Codestral Mamba 的程式與推理能力可媲美 SOTA Transformer 模型,且上下文檢索測試至 256k tokens。

    推薦理由:Codestral Mamba 以 Mamba 架構切入程式助手場景,並列出線性時間推理特點及至 256k tokens 的上下文檢索測試,呈現其技術定位。

6月27日週四
  1. Hugging Face Blog79

    Google 發佈開放式大語言模型 Gemma 2

    Google 發佈 Gemma 2,提供 9B 和 27B 兩種參數規模的基礎版與指令微調版,合共四個開放權重模型。Gemma 2 每隔一層採用滑動窗口注意力,其餘層使用全局注意力;9B 模型採用知識蒸餾預訓練。Hugging Face Hub 已提供四個模型,並介紹 Transformers 整合、Inference Endpoints 部署及 TRL 微調示例。

    推薦理由:文章並列 Gemma 2 9B 與 Mistral 7B、Llama 3 8B 等模型在 MMLU、GSM8K 等基準的成績,提供小型開放模型效能比較的具體參照。

5月16日週四
5月3日週五
4月23日週二
4月17日週三
  1. Mistral AI77

    Mistral AI 發佈 Mixtral 8x22B 開放模型

    Mistral AI 發佈 Mixtral 8x22B 開放模型,採用稀疏混合專家(SMoE)架構,141B 參數中有 39B 為活躍參數,並以 Apache 2.0 授權發布。

    推薦理由:Mixtral 8x22B 公開了參數規模、授權條款與多項基準結果,讓讀者可比較其開放使用條件及數學、編碼表現。

4月16日週二
  1. Hugging Face Blog59

    Zama 示範如何透過 Hugging Face Endpoints 對加密資料執行推理

    Zama 團隊示範如何透過 Hugging Face Endpoints 部署 Concrete ML 預編譯模型,讓使用者在加密資料上執行推理。文章以垃圾郵件決策樹為例,説明 Endpoint 部署、客户端設定及自製預編譯模型的流程。文中指出,CPU Endpoint 當時最多提供 8 vCPU 和 16 GB RAM,FHE 評估密鑰存於 Endpoint 的 RAM,重啟後需要重新傳送。

2月26日週一
  1. Mistral AI79

    Mistral AI 發佈 Mistral Large、Mistral Small,並將 Mistral Large 接入 Azure

    Mistral AI 發佈 Mistral Large 與 Mistral Small,並透過 Azure 提供 Mistral Large。Mistral Large 支援英語、法語、西班牙語、德語和意大利語,具備 32K tokens 上下文窗口及原生 function calling,並可用於文本理解、轉換和程式碼生成。

    推薦理由:這次發佈同時涵蓋旗艦與低延遲型號,並以基準比較和多種接入渠道呈現兩款模型的能力定位及成本、延遲取向。

12月11日週一
9月27日週三
  1. Mistral AI84

    Mistral AI 發佈 7.3B 參數模型 Mistral 7B

    Mistral AI 發佈 7.3B 參數的 Mistral 7B,稱其在多項基準測試中勝過或追平 Llama 2 13B。模型以 Apache 2.0 授權發佈,團隊亦提供使用公開指令數據微調的 Mistral 7B Instruct 聊天版。

    推薦理由:文章以重跑評測比較 Mistral 7B 與 Llama 系列,並説明 SWA 如何降低長序列的推理計算與快取成本。

8月23日週三
  1. Hugging Face Blog76

    Hugging Face 將 AutoGPTQ 整合至 Transformers,支援大語言模型 GPTQ 量化

    Hugging Face 將 AutoGPTQ 整合至 Transformers,支援以 GPTQ 將大語言模型量化至 8、4、3 或 2-bit。4-bit 量化的精度下降可忽略,小批次推理速度與 fp16 基準相若;整合支援 NVIDIA GPU 和 ROCm 驅動的 AMD GPU。

    推薦理由:文章列出 4-bit 量化的精度變化與小批次推理速度,並説明 GPU 支援範圍及 TGI 大批次下的速度限制,呈現 GPTQ 的部署取捨。

5月31日週三
1月24日週二
  1. Hugging Face Blog60

    甚麼令對話智能體有用?

    Hugging Face Blog 梳理對話智能體的訓練方法,涵蓋 IFT、SFT、RLHF 和 CoT。文中指出,IFT 所需指令數據僅為數百例量級,SFT 以人工標註改善有用性和安全性,RLHF 則根據人類偏好訓練獎勵模型,再用強化學習訓練對話智能體。

    推薦理由:文章把 IFT、SFT、RLHF 與 CoT 放在對話智能體訓練脈絡中梳理,並比較多個系統的訓練資料和評估方向,呈現各方法的分工。

11月17日週四
10月12日週三
  1. Hugging Face Blog63

    BLOOM 推理優化實錄:延遲降低 5x、吞吐量提升 50x

    Hugging Face 團隊記錄了為 BLOOM 建置推理伺服器的優化過程,稱數週內將延遲降低 5x、吞吐量提升 50x。改用 Tensor Parallelism 後,延遲由 300ms/token 降至 91ms/token,吞吐量升至 10RPS;其後透過 torch.jit.script 和自訂 kernel 將延遲再降至 71ms/token。

    推薦理由:文章以 BLOOM 的實測串連並行策略、算子融合和批次服務的取捨,呈現大型模型推理優化中如何平衡延遲與吞吐量。

8月17日週三
  1. Hugging Face Blog84

    Hugging Face Transformers、Accelerate 與 bitsandbytes 的大規模 8-bit 矩陣乘法入門

    Hugging Face 將 LLM.int8() 整合至 Transformers 與 Accelerate,透過混合 INT8/FP16 矩陣乘法降低大型語言模型推理所需的記憶體。

    推薦理由:文章串連 LLM.int8() 的離羣特徵處理、效能比較與 Transformers 整合細節,呈現 8-bit 量化降低大型模型記憶體需求的實作脈絡。

1月26日週二