跳到正文

#端側

今日 0 條
9月22日週二
  1. Hugging Face Blog51

    oMLX 創作者兼維護者 Jun Kim 加入 Hugging Face 支援 MLX 社羣

    Hugging Face 宣佈,oMLX 創作者兼維護者 Jun Kim 加入團隊,並會繼續領導 oMLX。oMLX 維持 Apache 2.0 授權,項目將轉為獲資助並持續維護;Hugging Face 預期這有助提升穩定性,並希望加快開發。Hugging Face 亦希望以 oMLX 作為新想法的試驗場,並加快將 transformers 模型定義轉成不同引擎可使用的 MLX 參考實作。

6月27日週六
  1. Google Research61

    Google Research 為凍結權重的 Gemini Nano v3 加入 Multi-Token Prediction,加速 Pixel 端生成

    Google Research 已將 Multi-Token Prediction(MTP)架構部署至 Pixel 9 和 10 系列的 Gemini Nano v3,透過凍結主模型權重加快裝置端文字生成。

    推薦理由:文章對照整合式 MTP head 與獨立草稿模型,説明直接利用主模型狀態如何提升候選 token 準確度,並改善 Pixel 端的速度與記憶體效率。

6月5日週五
  1. Google Research65

    Google Research 發表 PHRM 研究,探索智能手機被動監測心率與靜息心率

    Google Research 在 Nature 發表 PHRM 研究系統,透過智能手機前置鏡頭在面部解鎖後擷取 8 秒影片,於日常使用中被動估算心率(HR)及每日靜息心率(RHR)。

    推薦理由:研究結合實驗室測試與八日自由生活驗證,按膚色報告 HR 誤差,並呈現 RHR 估算覆蓋率及穿戴裝置對照,讓讀者掌握日常使用中的證據範圍。

4月3日週五
2月5日週四
1月23日週五
  1. Google Research44

    小模型,大成果:Google Research 以分解方法提升意圖提取效果

    Google Research提出分解式流程,令小型多模態 LLM 從網頁及手機互動軌跡提取意圖,表現勝過 CoT 提示和端到端微調。流程先逐屏摘要,再從摘要序列抽取整體意圖;測試涵蓋手機、網頁軌跡及 Gemini、Qwen2 基礎模型。Gemini 1.5 Flash 8B 配合此法,效果可媲美 Gemini 1.5 Pro,展示裝置端意圖理解的應用潛力。

9月26日週五
  1. Hugging Face Blog48

    swift-transformers 升至 1.0,並展望未來

    Hugging Face 的 Swift 函式庫 swift-transformers 發佈 1.0,標誌套件進入穩定階段,並為後續功能迭代奠定基礎。Tokenizers 和 Hub 現已成為頂層模組,套件亦採用支援有狀態模型的 Modern Core ML API,並完整支援 Swift 6。團隊表示,後續將聚焦 MLX 與智能體應用。

6月26日週四
  1. Hugging Face Blog74

    Gemma 3n 全面接入主流開源工具庫,推出 E2B、E4B 尺寸模型

    Gemma 3n 已接入多個主流開源工具庫,並推出 E2B、E4B 兩種尺寸的 base 與 instruct 版本。支援工具包括 Transformers、timm、MLX、llama.cpp、Transformers.js 和 Ollama;兩款模型實際參數量為 5B 和 8B,GPU 記憶體佔用約相當於 2B 和 4B 模型。

    推薦理由:文章並列模型的實際參數量、GPU 記憶體需求和多個工具庫的接入方式,方便衡量 Gemma 3n 本地多模態部署時的硬件門檻與工具選擇。

3月7日週五
  1. Hugging Face Blog61

    用 React Native 在手機上本地執行 LLM 的入門指南

    Hugging Face Blog 的教程示範以 React Native 建立手機應用,在裝置本地執行 LLM 聊天。應用從 Hugging Face Hub 下載 GGUF 模型,並以 llama.rn(llama.cpp 的 binding)載入,教程涵蓋 Android 和 iOS。文章亦介紹 GGUF 量化格式、手機選模取捨,以及逐 token 生成與推理速度追蹤等功能。

    推薦理由:文章按模型選擇、GGUF 下載與載入、聊天介面逐步拆解 React Native 實作,並説明量化格式與設備能力的取捨,可作為端側 LLM 應用的開發參考。

10月16日週三
  1. Mistral AI65

    Mistral AI 發佈 Ministral 3B 和 Ministral 8B 邊緣模型

    Mistral AI 發佈 Ministral 3B 和 Ministral 8B,面向裝置端運算及邊緣場景。兩款模型支援最高 128k 上下文長度(vLLM 目前為 32k),Ministral 8B 採用交錯式滑動窗口注意力模式。

    推薦理由:文章以多個評測類別對照 Ministral 3B、8B 與 Gemma 2、Llama 3.2、Llama 3.1、Mistral 7B 等模型,涵蓋預訓練及 Instruct 版本,便於參照各模型表現。

9月25日週三
  1. Hugging Face Blog79

    Meta 發佈 Llama 3.2,涵蓋視覺模型與裝置端小型模型

    Meta 發佈 Llama 3.2,共有 10 個開放權重模型,包括 5 個多模態模型和 5 個純文字模型,涵蓋 11B、90B 視覺模型及面向裝置端的 1B、3B 純文字模型。

    推薦理由:Llama 3.2 涵蓋 11B、90B 視覺模型與 1B、3B 裝置端純文字模型,並列出 Transformers、llama.cpp 等運行示例,可作為選擇部署路徑的參考。