ggml 入門指南:核心概念、矩陣運算與後端使用
Hugging Face Blog 的 ggml 入門指南介紹這個以 Transformer 推理為重點的 C/C++ 機器學習函式庫,並示範其基本用法。文章解釋 ggml_context、ggml_cgraph、ggml_backend 等概念,透過矩陣乘法展示張量建立、計算圖執行和 backend 記憶體配置流程。
Hugging Face Blog 的 ggml 入門指南介紹這個以 Transformer 推理為重點的 C/C++ 機器學習函式庫,並示範其基本用法。文章解釋 ggml_context、ggml_cgraph、ggml_backend 等概念,透過矩陣乘法展示張量建立、計算圖執行和 backend 記憶體配置流程。
Mistral AI 發佈 Mistral Large 2,提供 128k 上下文窗口、支援 80+ 種程式語言,並面向單節點推理及長上下文應用。模型有 123 billion parameters,預訓練版本在 MMLU 的準確率為 84.0%,並加強指令遵循、推理與函數調用能力。
推薦理由:Mistral Large 2 披露參數規模、上下文窗口與多項基準表現,並交代研究授權和商用自部署條件,方便比較其能力及部署門檻。
Mistral AI 與 NVIDIA 合作發佈 12B 模型 Mistral NeMo,支援最高 128k tokens 上下文窗口。其預訓練基礎版與指令微調版 checkpoints 採 Apache 2.0 授權;標準架構可替換採用 Mistral 7B 的系統,並支援無性能損失的 FP8 推理。
推薦理由:文章將 Mistral NeMo 與 Mistral 7B 的替換相容性、FP8 推理支援及 Tekken 多語壓縮數據放在一起,呈現模型部署適配與語言處理效率的比較脈絡。
Mistral AI 發佈 Codestral Mamba,這是一款採 Mamba 架構、擁有 7,285,403,648 個參數的指令模型。Mistral AI 表示,Mamba 模型提供線性時間推理,Codestral Mamba 的程式與推理能力可媲美 SOTA Transformer 模型,且上下文檢索測試至 256k tokens。
推薦理由:Codestral Mamba 以 Mamba 架構切入程式助手場景,並列出線性時間推理特點及至 256k tokens 的上下文檢索測試,呈現其技術定位。
Paf 在全公司採用 ChatGPT Enterprise,工程師每日使用自訂 GPT 加快例行開發工作。Paf 亦將 ChatGPT Enterprise 整合至 grit:lab 編碼學院,從第一天起以 AI 輔助的系統架構思維培訓新一代軟件開發者。Paf 員工中有 70% 積極使用 ChatGPT Enterprise,涵蓋財務、人力資源、市場營銷及客户支援等業務團隊。
BigCodeBench 團隊發布 BigCodeBench 程式碼生成基準,收錄1,140項函式級任務,涵蓋139個程式庫。基準分為 BigCodeBench-Complete 和 BigCodeBench-Instruct;GPT-4o 的 calibrated Pass@1 分別為61.1%和51.1%。團隊開源任務、測試案例、評測框架及排行榜,並提供 PyPI 安裝方式。
Mistral AI 發佈 22B 開放權重程式碼生成模型 Codestral,支援 80+ 種程式語言,並提供 32k 上下文窗口。其評測圖表稱,Codestral 在 RepoBench 長距離程式碼生成評測中超越其他模型;模型亦可補全程式碼、編寫測試及以 fill-in-the-middle 機制補完片段。
推薦理由:文章列明 Codestral 的研究與測試授權、商業授權申請方式,以及專用 endpoint 的免費 beta 和候補名單,呈現不同使用入口的條件。
Hugging Face Spaces 推出 Dev Mode,讓用户可透過 VS Code 或 SSH 直接連接 Space 並編輯程式碼。功能目前處於 beta,供 PRO 訂閲者使用;修改後可在 Space 點擊「Refresh」測試,無需先推送變更或重建容器。確認修改後,可透過 commit and merge 保存。
StarCoder2-15B-Instruct-v0.1 採用全透明、寬鬆授權的自對齊流程訓練,未使用人工標註或大型專有 LLM 的蒸餾數據。流程以 StarCoder2-15B 從 The Stack V1 的種子函數生成指令,並透過沙箱執行測試篩選回答,最終形成包含 50k 組指令與回答的 SFT 數據集。
推薦理由:文章梳理了從 The Stack V1 種子函數生成指令,再以執行測試篩選回答的自對齊流程,説明程式碼模型如何利用自身生成數據進行微調。
Mistral AI 發佈 Mixtral 8x22B 開放模型,採用稀疏混合專家(SMoE)架構,141B 參數中有 39B 為活躍參數,並以 Apache 2.0 授權發布。
推薦理由:Mixtral 8x22B 公開了參數規模、授權條款與多項基準結果,讓讀者可比較其開放使用條件及數學、編碼表現。
LiveCodeBench Leaderboard 推出,基於 UC Berkeley、MIT 和 Cornell 研究人員開發的 LiveCodeBench 基準評估程式碼大語言模型。
Google 發佈面向程式碼的大語言模型家族 CodeGemma,推出 2B base、7B base 和 7B instruct 三種版本。模型以 Gemma checkpoint 為基礎,額外訓練 500 billion tokens,三款模型均採用 8K token 上下文窗口。
推薦理由:文章交代 CodeGemma 三種版本的用途,並列出 HumanEval 表現及 Hugging Face 的部署與量化整合,方便比較版本定位、基準表現和使用路徑。
Hugging Face Blog 示範以 DuckDB-NSQL-7B 結合 Hugging Face Dataset Viewer API 和 DuckDB,將自然語言問題轉為 SQL 查詢資料集中的資料。
JetBrains 使用 OpenAI API 將 AI 融入開發者軟件,打造出其有史以來增長最快的產品。
BigCode 發佈 StarCoder2 開放程式碼大語言模型系列,提供 3B、7B 和 15B 三種規模。其中,StarCoder2-15B 使用 The Stack v2 的 4+ trillion tokens 訓練,涵蓋 600+ 程式語言。
推薦理由:StarCoder2 同步公開模型、The Stack v2 數據集及訓練程式碼,並按倉庫組織訓練資料,呈現程式碼模型與數據建設的完整鏈路。
Mistral AI 發佈 Mistral Large 與 Mistral Small,並透過 Azure 提供 Mistral Large。Mistral Large 支援英語、法語、西班牙語、德語和意大利語,具備 32K tokens 上下文窗口及原生 function calling,並可用於文本理解、轉換和程式碼生成。
推薦理由:這次發佈同時涵蓋旗艦與低延遲型號,並以基準比較和多種接入渠道呈現兩款模型的能力定位及成本、延遲取向。
Hugging Face 示範以其 GitHub 組織內按 stargazers 排名前 10 的公開程式碼庫,微調 StarCoder 製作個人化程式碼助手 HugCoder。
推薦理由:文章示範以 Hugging Face 公開程式碼庫微調個人化程式碼助手,並對照 QLoRA 與全量微調的成本和 HumanEval 結果,呈現訓練資源與表現的取捨。
Mistral AI 發佈 7.3B 參數的 Mistral 7B,稱其在多項基準測試中勝過或追平 Llama 2 13B。模型以 Apache 2.0 授權發佈,團隊亦提供使用公開指令數據微調的 Mistral 7B Instruct 聊天版。
推薦理由:文章以重跑評測比較 Mistral 7B 與 Llama 系列,並説明 SWA 如何降低長序列的推理計算與快取成本。
Code Llama 推出 7B、13B 和 34B 參數版本,是以 Llama 2 為基礎、專攻編碼任務的模型家族。基礎模型以 500 billion tokens 的程式碼資料訓練,另有 Python 專用版和指令微調版;模型採用與 Llama 2 相同的社羣授權,可商用。
推薦理由:文章並列 7B、13B、34B 參數規模、Python 與指令微調變體,以及 Hugging Face 接入方式,便於比較模型選擇和部署路徑。
Hugging Face 推出 SafeCoder 企業程式碼助手方案,讓客户在自家基礎設施訓練及部署,程式碼於訓練和推理期間不離開 VPC。SafeCoder 初始版本以 StarCoder 為基礎,可按客户私有程式碼庫微調;程式碼補全建議會對照 The Stack,顯示其是否匹配資料集中的程式碼及相關授權。SafeCoder 與 VMware 合作推出,現向 VMware 企業客户提供。
Hugging Face 示範如何使用離線強化學習資料,從零訓練 Decision Transformer,使其學習 Gym HalfCheetah 環境中的奔跑行為。
Hugging Face 深度強化學習課程第 8 單元講解 PPO(近端策略優化),説明其透過裁剪策略概率比限制更新幅度,以提升訓練穩定性。文章介紹裁剪替代目標函數,並以 PyTorch 從零實作 PPO,在 CartPole-v1 和 LunarLander-v2 測試;示例裁剪範圍為 [0.8,1.2](ϵ=0.2)。
作者以 Sentence Transformers 和 Gradio 構建歌單生成器,透過對歌詞嵌入向量進行語義搜索,按文字提示找出相關歌曲。由於所選模型的最大序列長度為 512 word pieces,歌曲歌詞先按 verse 切分並逐段嵌入;設置 top_k=20 時,作者實測幾乎總能得到至少 9 首不同歌曲。
OpenAI Codex 現正透過 OpenAI API,為涵蓋多種使用場景的 70 款不同應用程式提供支援。
Hugging Face 的 Deep Reinforcement Learning Class 第二部分講解 Q-Learning,並帶領學員從零實作強化學習智能體。
文章示範以 amazon_reviews_multi 的英文資料微調 microsoft/deberta-v3-base,建立五類情感分類模型以篩選最不滿意的客户訊息。測試中,模型識別出約 95% 的極度不滿意訊息,並把約 12% 的中立或滿意訊息誤判為需要回覆。按每日 10,000 則訊息的假設估算,人工工作量可減少約 83%;文章指出,實際應用需要貼近業務情境的高質素訓練數據。
推薦理由:文章由任務界定、資料集篩選延伸至微調與業務指標設計,展示如何把模型評估對準客服實際處理目標。
OpenAI 發佈改進版 Codex,這套 AI 系統可將自然語言轉換為程式碼,並自今日起透過 API 開放私人測試。
推薦理由:公告同時交代 Codex 的自然語言轉程式碼定位和 API 私人測試安排,讀者可掌握其用途與當時的接入範圍。
OpenAI 發佈 Triton 1.0,這是一種用於神經網絡 GPU 程式設計的類 Python 開源語言。它讓沒有 CUDA 經驗的研究人員也能編寫高效 GPU 程式碼;OpenAI 稱,多數情況下這些程式碼可媲美專家所能產出。
推薦理由:Triton 1.0 以類 Python 語言降低神經網絡 GPU 程式設計門檻,讓沒有 CUDA 經驗的研究人員也能編寫高效程式碼,OpenAI 稱多數情況下可媲美專家產出。
Hugging Face 的 Transformers 教程以 GPT2 示範如何實作多種文字生成解碼方法。文章介紹貪心搜尋、束搜尋、temperature、Top-K 及 Top-p 採樣,説明各方法對重複、流暢度與隨機性的影響,並指出沒有一種方法適用所有開放式生成場景。
推薦理由:文章以 GPT2 和 Transformers 範例比較貪心搜尋、Beam search 與 Top-K、Top-p 採樣,呈現各方法在生成重複、流暢度與隨機性上的取捨。