Mistral AI 公佈模型自訂、Agents 早期版本及 mistralai 1.0 SDK
Mistral AI 宣佈在 La Plateforme 開放旗下旗艦及專用模型自訂,並推出 Agents 早期版本及 mistralai 1.0 客户端 SDK。
推薦理由:這次發布把模型自訂、Agents 工作流程與客户端 SDK 更新並列,呈現 Mistral AI 如何涵蓋應用構建中的模型調整、流程編排和程式接入環節。
Mistral AI 宣佈在 La Plateforme 開放旗下旗艦及專用模型自訂,並推出 Agents 早期版本及 mistralai 1.0 客户端 SDK。
推薦理由:這次發布把模型自訂、Agents 工作流程與客户端 SDK 更新並列,呈現 Mistral AI 如何涵蓋應用構建中的模型調整、流程編排和程式接入環節。
OpenAI 在 API 中推出 Structured Outputs,模型輸出現在可可靠遵循開發者提供的 JSON Schema。
推薦理由:這項 API 更新説明 Structured Outputs 的核心作用,讓模型輸出可靠遵循開發者提供的 JSON Schema。
Hugging Face Blog 介紹 TextImage Augmentation,這套與 Albumentations AI 合作開發的流程可同步增強文件圖像及其中的文字標註。它可隨機插入、刪除或交換文字,並搭配圖像變換生成多樣化訓練樣本。變更後文字及對應 bounding box 可提取,用於模型訓練。
Google 發佈 Gemma 2 2B、ShieldGemma 安全分類模型及 Gemma Scope 稀疏自編碼器套件。Gemma 2 2B 有 2.6B 參數,補充既有 9B、27B 版本,並可作 Gemma 2 27B 的輔助模型,最高提速 3x 且不損失品質。
推薦理由:這次更新同時涵蓋小型模型部署、安全內容分類與模型內部分析,讀者可據此比較 Gemma 系列在推理、安全防護及可解釋性研究中的用途。
Hugging Face 示範如何在 Diffusers 中使用 Quanto 量化 Transformer-based diffusion pipeline,以降低推理時的 GPU 記憶體佔用。
推薦理由:文章提供在 Diffusers 中以 Quanto 量化擴散 Transformer 與文字編碼器的操作步驟,並用記憶體和延遲數據呈現精度設定的取捨。
OpenAI 正測試 SearchGPT,作為全新 AI 搜尋功能的臨時原型。它提供快速、即時的答案,並附上清晰且相關的來源。
Mistral AI 發佈 Mistral Large 2,提供 128k 上下文窗口、支援 80+ 種程式語言,並面向單節點推理及長上下文應用。模型有 123 billion parameters,預訓練版本在 MMLU 的準確率為 84.0%,並加強指令遵循、推理與函數調用能力。
推薦理由:Mistral Large 2 披露參數規模、上下文窗口與多項基準表現,並交代研究授權和商用自部署條件,方便比較其能力及部署門檻。
OpenAI 開發並應用一種利用 Rule-Based Rewards(RBRs)的新方法,讓模型無須大量收集人工數據,便能對齊至安全行為。
Meta 發佈 Llama 3.1,提供 8B、70B、405B 三種規模的 base 與 instruct 模型,均支援 128K tokens 上下文和 8 種語言。Instruct 版本加入工具調用能力,並支援自訂 JSON 函數;授權亦允許以模型輸出改進其他 LLM。Hugging Face 同時列出 Transformers、TGI 等整合,以及各型號在推理和微調時的記憶體需求。
推薦理由:文章將 8B、70B、405B 的部署定位、128K tokens 上下文及記憶體需求一併列出,可比較不同規模模型的使用取捨。
GPT-4o mini 旨在推動更具成本效益的智能。
Mistral AI 與 NVIDIA 合作發佈 12B 模型 Mistral NeMo,支援最高 128k tokens 上下文窗口。其預訓練基礎版與指令微調版 checkpoints 採 Apache 2.0 授權;標準架構可替換採用 Mistral 7B 的系統,並支援無性能損失的 FP8 推理。
推薦理由:文章將 Mistral NeMo 與 Mistral 7B 的替換相容性、FP8 推理支援及 Tekken 多語壓縮數據放在一起,呈現模型部署適配與語言處理效率的比較脈絡。
Hugging Face 的 TGI 推出 Multi-LoRA serving,讓單一基礎模型可按請求動態選用不同 LoRA adapter,以一個部署服務多個微調模型。文中以 mistralai/Mistral-7B-v0.1 示範,載入 30 個 adapter 時 VRAM 增幅為 3%;實際可載入數量取決於 GPU 資源和所部署模型。
推薦理由:文章以 TGI 的部署及調用示例,展示單一基礎模型按請求選用不同 LoRA adapter 的做法,並比較多模型部署的成本與擴展管理。
OpenAI 為 ChatGPT Enterprise 新增合規與管理工具,支援大規模合規計劃、資料安全及使用者存取管理。工具包括 Compliance API 整合、SCIM 及 GPT 控制項。
Hugging Face 發佈 Docmatix 文件視覺問答數據集,包含 2.4 million 張圖片及 9.5 million 組問答,規模較先前數據集增加 240X。
Prover-Verifier Games 可提升語言模型輸出的可讀性,令 AI 解答更清晰、易於驗證,並讓人類和機器更信任這些結果。
Mistral AI 發佈 Codestral Mamba,這是一款採 Mamba 架構、擁有 7,285,403,648 個參數的指令模型。Mistral AI 表示,Mamba 模型提供線性時間推理,Codestral Mamba 的程式與推理能力可媲美 SOTA Transformer 模型,且上下文檢索測試至 256k tokens。
推薦理由:Codestral Mamba 以 Mamba 架構切入程式助手場景,並列出線性時間推理特點及至 256k tokens 的上下文檢索測試,呈現其技術定位。
Mistral AI 發佈 Mathstral,這款以 Mistral 7B 為基礎、專攻 STEM 的模型面向複雜數學推理。Mathstral 7B 在 MATH 得分 56.6%、MMLU 得分 63.47%;加入多數投票後,MATH 得分為 68.37%,使用強力獎勵模型並在 64 個候選項中評選時為 74.59%。
Hugging Face 發佈 135M、360M 和 1.7B 三種 SmolLM 模型,並公開訓練語料 SmolLM-Corpus。語料包括 28B tokens 的 Cosmopedia v2、4B tokens 的 Python-Edu,以及 220B tokens 的 FineWeb-Edu;三款模型分別以 600B、600B 和 1T tokens 訓練。
推薦理由:文章梳理 SmolLM 的資料集整理流程、訓練配置與各參數級別的基準結果,並列出三種模型規模及本地運行選項,便於比較小型模型的訓練和部署取捨。
Hugging Face Blog 示範如何用 distilabel 為 Argilla 2.0 技術文件建立 RAG 聊天機械人。流程包括從文件建立切塊與合成查詢三元組、微調領域嵌入模型、建立向量資料庫,並將 Gradio 應用部署至 Hugging Face Spaces。聊天互動會記錄在 Argilla,供持續評估與改進。
推薦理由:文章串起文件切塊、合成查詢三元組、微調領域嵌入模型、向量檢索與對話評估,提供一套可複用的文件問答 RAG 實作流程。
OpenAI 與洛斯阿拉莫斯國家實驗室宣佈研究合作,正共同開發安全評估方法。評估旨在衡量前沿模型的生物能力及相關風險。
Hugging Face 與 KerasHub 宣佈共用模型保存格式,讓 Hugging Face Hub 上部分 Transformers 模型可直接載入 KerasHub。首批涵蓋 Gemma 1、Gemma 2、Llama 3 和 PaliGemma;KerasHub 可透過 TensorFlow、JAX 或 PyTorch 後端運行這些模型。
推薦理由:共享模型保存格式讓受支援架構的 Transformers 模型可直接載入 KerasHub,並透過 TensorFlow、JAX 或 PyTorch 後端運行,呈現跨框架使用的實際路徑。
Hugging Face 正在 Dataset Hub 試驗 Presidio 報告功能,估算資料集內個人識別資訊(PII)的存在情況。Presidio 是開源 PII 偵測工具,透過偵測模式和機器學習模型識別 PII;報告可供使用者在訓練前評估資料集,也讓擁有者檢查 PII 過濾流程。示例報告在預訓練資料集中偵測到少量電郵地址及敏感 PII。
Hugging Face 宣佈,Google Cloud TPU v5e 現已支援 Inference Endpoints 和 Spaces,可用於部署生成式 AI 模型及運行 AI 示範應用。
Banque des Territoires、Polyconseil 與 Hugging Face 完成 EduRénov 首階段合作,開發主權數據 RAG 工具以支援地方政府。EduRénov 旨在協助 10,000 項公立學校設施翻新工程,並在 5 年內實現 40% 能源節省。項目要求確保所用運算服務與模型的主權。
Hugging Face 宣佈為 Dataset Search 加入四項功能,支援按資料模態、行數、格式及相容 library 篩選資料集。行數可設定最低和最高值;對於 metadata 未列出行數的超大型資料集,系統會根據前 5GB 內容估算總行數。新篩選條件可與 Language、Tasks、Licenses 及文字搜尋組合使用。
CriticGPT 是一個基於 GPT-4 的模型,會撰寫對 ChatGPT 回應的評析,協助人類訓練員在 RLHF 過程中找出錯誤。
OpenAI 與 TIME 建立戰略內容合作,利用 TIME 101 年的檔案內容提升回覆。回覆亦會提供 Time.com 相關報道的連結。
Google 發佈 Gemma 2,提供 9B 和 27B 兩種參數規模的基礎版與指令微調版,合共四個開放權重模型。Gemma 2 每隔一層採用滑動窗口注意力,其餘層使用全局注意力;9B 模型採用知識蒸餾預訓練。Hugging Face Hub 已提供四個模型,並介紹 Transformers 整合、Inference Endpoints 部署及 TRL 微調示例。
推薦理由:文章並列 Gemma 2 9B 與 Mistral 7B、Llama 3 8B 等模型在 MMLU、GSM8K 等基準的成績,提供小型開放模型效能比較的具體參照。
Hugging Face《倫理與社會通訊》第 6 期闡述高質素數據如何支撐更好的 AI,並強調數據須切合具體用途,而非只看準確度或數量。文章列出相關性、全面性、時效性及偏見緩解等質素要素,並指出優質數據有助提升模型表現、穩健性、效率與包容性。數據整理、去重、內容篩選、人類回饋、參與式收集、治理框架及定期評估,都是改善數據質素的做法。
Hugging Face Blog 示範以 DocVQA 微調 Microsoft 的 Florence-2,使其適配視覺問答任務。訓練 7 個 epochs 後,驗證集 Levenshtein 相似度由 0 升至 57.0。文中提供凍結視覺編碼器、batch size 6 的低資源方案,並記錄以 8 張 H100、batch size 64 微調全模型需時 70 分鐘。
推薦理由:文章以 DocVQA 示範 Florence-2 微調,並列出驗證集表現及不同 GPU 配置,可供評估下游任務適配與訓練資源。
OpenAI 收購了 Rockset。
OpenAI 透過網絡安全資助計劃助力防禦者,並聚焦網絡安全領域的創新研究與 AI 整合。
擴散模型大幅推進圖像、音訊和影片生成,但依賴反覆採樣流程,令生成速度較慢。
OpenAI 改進一致性模型的訓練技術。一致性模型是一類新興生成模型,無需對抗式訓練即可一步生成高質素數據。
OpenAI 提出一套面向真實世界內容審核的整體方法,旨在建立穩健且實用的自然語言分類系統,用於偵測不當內容。
Paf 在全公司採用 ChatGPT Enterprise,工程師每日使用自訂 GPT 加快例行開發工作。Paf 亦將 ChatGPT Enterprise 整合至 grit:lab 編碼學院,從第一天起以 AI 輔助的系統架構思維培訓新一代軟件開發者。Paf 員工中有 70% 積極使用 ChatGPT Enterprise,涵蓋財務、人力資源、市場營銷及客户支援等業務團隊。
BigCodeBench 團隊發布 BigCodeBench 程式碼生成基準,收錄1,140項函式級任務,涵蓋139個程式庫。基準分為 BigCodeBench-Complete 和 BigCodeBench-Instruct;GPT-4o 的 calibrated Pass@1 分別為61.1%和51.1%。團隊開源任務、測試案例、評測框架及排行榜,並提供 PyPI 安裝方式。
Color Health 正與 OpenAI 合作,探索運用 GPT-4o 加快癌症患者獲得治療的新方式。其 Cancer Copilot 應用程式可識別缺失的診斷項目並制定個人化檢查方案,協助醫療提供者就癌症篩查與治療作出循證決策。
OpenAI 任命退役美國陸軍將領 Paul M. Nakasone 加入董事會。他具備網絡安全經驗,並將加入董事會安全與保安委員會。
推薦理由:這項任命把網絡安全經驗帶入 OpenAI 董事會,並安排 Nakasone 加入安全與保安委員會,呈現董事會安全職責的配置。
Hugging Face 宣佈 Stable Diffusion 3 Medium(2B parameters)已在 Hugging Face Hub 上提供,並可透過 Diffusers 使用。
推薦理由:文章比較 offloading、移除 T5 與 8-bit T5 的顯存和耗時,並提供 torch.compile 加速與 LoRA 微調腳本,可作為 SD3 推理部署與微調的實作參考,並呈現節省顯存方案的耗時取捨。