Speak 正以 AI 個人化語言學習
Speak 正以 AI 個人化語言學習。文章以對談形式訪問 Speak 行政總裁兼共同創辦人 Connor Zwick。
Speak 正以 AI 個人化語言學習。文章以對談形式訪問 Speak 行政總裁兼共同創辦人 Connor Zwick。
《華盛頓郵報》與 OpenAI 合作,將新聞內容整合至 ChatGPT。用户可在 ChatGPT 中獲得相關內容的摘要、引文,以及指向原始報道的直接連結。
OpenAI 發佈 o3 和 o4-mini,稱兩者是其迄今最智能、能力最強的模型,並提供完整工具存取權限。
Gradio 不只是另一個 UI 函式庫,而是透過介面與 API 連接機器學習模型的框架,並提供效能、安全及回應能力保障。它可從單一實作自動生成 REST API 端點及 API 文件,並提供 API Recorder(4.26 引入)、Gradio 5.0 的伺服器端渲染(SSR)、佇列管理和即時串流等功能。
OpenAI 分享更新版 Preparedness Framework,用於衡量並防範前沿 AI 能力造成的嚴重危害。
OpenAI 將 GPT-4.1 新模型系列引入 API,並同步推出首款 nano 模型。OpenAI 表示,該系列整體有所改進,尤其在編碼、指令遵循和長上下文理解方面提升顯著,並即日起向全球開發者開放。
推薦理由:公告列出 API 開放時間、改進方向及 nano 型號,讓開發者掌握此次 GPT-4.1 更新的發布範圍。
Hugging Face 收購 Pollen Robotics,並開始銷售其開源人形機械人 Reachy 2。Reachy 2 可透過 sales@pollen-robotics.com 電郵訂購,價格為 $70,000,適用於研究、教育和具身 AI 實驗,並兼容 VR。
推薦理由:這宗收購把 Hugging Face 的 LeRobot 開源機械人項目與 Pollen Robotics 的硬件團隊納入同一組織,呈現其軟硬件佈局。
Language Technologies Lab 發佈 Visual Salamandra,將 7B 參數的 Salamandra 模型擴展至圖像與影片理解。
BrowseComp 是一項面向瀏覽智能體的基準測試。
Hugging Face 與 Cloudflare 合作,讓 FastRTC 開發者可透過 Hugging Face token 使用 Cloudflare 的企業級 WebRTC 基礎設施。
OpenAI 分享《歐盟經濟藍圖》,提出協助歐洲把握人工智能機遇、推動區內可持續經濟增長的建議。藍圖旨在確保 AI 由歐洲開發、在歐洲部署,並為歐洲服務。
Canva 以 AI 助力創意表達。內容是一場與 Canva 共同創辦人兼首席產品官 Cameron Adams 的對談。
Hugging Face 將 Llama 4 Maverick (~400B) 與 Scout (~109B) 的權重上架 Hub,並宣佈 Transformers 與 TGI 支援。
推薦理由:文章整理了長上下文所用的 NoPE、分塊注意力與 temperature tuning 設計,讓讀者瞭解 Llama 4 延伸上下文窗口的架構取捨。
OpenAI 推出 PaperBench,這項 benchmark 用於評估 AI 智能體複現前沿 AI 研究的能力。
OpenAI 就英國版權諮詢作出回應,提出有利創新的政策建議,盼協助英國成為歐洲的 AI 之都。
OpenAI 宣佈獲得 $40B 新融資,投後估值為 $300B,資金將用於推進 AI 研究、擴大算力基礎設施並提供更強大的工具。OpenAI 表示,ChatGPT 每週有 500 million 人使用。
推薦理由:這筆融資的規模與投後估值,連同 OpenAI 提及的研究、算力基建及 ChatGPT 工具用途,呈現其資金投入方向。
Hugging Face 將 Intel Gaudi 硬件支援原生整合至 Text Generation Inference(TGI)主線程式碼,令大語言模型推理服務可直接部署於 Gaudi。整合支援 Gaudi1、Gaudi2、Gaudi3、多卡推理、視覺語言模型及 FP8 量化,並提供版本為 3.2.1-gaudi 的官方 Docker 映像。
DeepSeek-V3 0324 已登上 Hugging Face Hub,沿用原版架構並採用 MIT 授權,重點改善指令遵循、編碼和數學能力。DeepSeek 團隊列出的 MMLU-Pro、GPQA、AIME 和 LiveCodeBench 分數,分別由 75.9、59.1、39.6、39.2 升至 81.2、68.4、59.4、49.2。
推薦理由:文中提供 MMLU-Pro、GPQA、AIME 和 LiveCodeBench 的更新前後分數,讓讀者可按多項基準逐一比較 DeepSeek-V3 0324 相對原版的提升幅度。
OpenAI 表示,正主動調整,並將全面安全措施直接建置於其基礎設施與模型,作為通往 AGI 之路上的安全保障。
OpenAI 在 GPT‑4o 中推出原生圖像生成,並提升文字渲染與指令遵循能力。原文亦提及 ChatGPT Images 2.5。
推薦理由:原生圖像生成之外,文字渲染與指令遵循是明確列出的改進點,讀者可據此掌握 GPT‑4o 圖像功能此次更新的着力處。
OpenAI 表示,公司規模已大幅擴展,但核心方向不變,仍致力於推進能加速人類進步的前沿 AI 研究。OpenAI 現亦提供供數以億計的人使用的產品。
OpenAI 與 MIT Media Lab 合作,聚焦研究 ChatGPT 情感化使用與情緒健康的早期方法。現有簡介未列出具體方法或研究結果。
Hugging Face 更新 Inference Endpoints 分析儀錶板,加入即時指標、自訂時間範圍、自動重新整理及副本生命週期檢視。儀錶板會即時顯示請求延遲、回應時間及錯誤率,後端亦經重新設計以加快載入,尤其是高流量端點。副本檢視可追蹤副本由初始化至終止的狀態轉換。
Booking.com 整合自身數據系統與 OpenAI 的大語言模型,提供更智能的搜尋、更快捷的支援,以及以意圖為導向的旅遊體驗。
OpenAI 介紹 API 新一代音訊模型,文字轉語音模型可按開發者指示採用特定説話方式。例如,開發者可要求模型「像富有同理心的客服智能體那樣説話」,為語音智能體提供更多自訂空間。
推薦理由:開發者可用指示控制文字轉語音模型的説話方式,例如採用富有同理心的客服智能體語氣,讓語音智能體的表達方式有更多自訂空間。
Open R1 的指南示範如何在本機設定 OlympicCoder 7B,並將它接入 VS Code 作為編碼助手。流程使用 LM Studio 載入 LMStudio Community 的 4bit GGUF 版本,再透過 Continue.dev 連接至本機服務 http://localhost:1234/v1。
EliseAI 以 AI 提升住房及醫療保健效率。內容是一段與 EliseAI 行政總裁兼聯合創辦人 Minna Song 的對談。
OpenAI 分享 ChatGPT for Business 2025 年 3 月的最新發布。內容指出,ChatGPT 正變得更具互動性,可按團隊工作方式度身訂製,並更具智能體特性。
NVIDIA 在 GTC 2025 發佈 Cosmos Transfer、Physical AI Dataset 和 NVIDIA Isaac GR00T N1 三項 Physical AI 開源資源。
推薦理由:三項資源分別涵蓋可控合成場景、機械人訓練數據與人形機械人推理及技能,呈現 Physical AI 開發中生成、訓練和執行能力的不同分工。
Hugging Face 已將首批模型與數據集倉庫由 LFS 遷移至 Xet 儲存,總量 4.5 TB,並把 Hub 約 6% 的下載流量切至 Xet 基礎設施。
推薦理由:文章以首批倉庫遷移為例,交代下載開銷與節點負載失衡如何在真實流量下浮現,以及分階段遷移如何避免服務中斷。
Mistral AI 發佈 Mistral Small 3.1,改進文本表現與多模態理解,並將上下文窗口擴展至最高 128k tokens。官方稱模型推理速度為 150 tokens per second,表現超越 Gemma 3、GPT-4o Mini 等可比模型,並以 Apache 2.0 授權釋出。
推薦理由:文中將 Mistral Small 3.1 的文本、多模態、長上下文與多語言表現放入同級比較,並列出本地運行條件及下載、API 等使用入口。
OpenAI表示,法院於 2025 年 3 月 4 日作出決定,駁回 Elon Musk 最新一次試圖拖慢 OpenAI 的行動。OpenAI稱,Musk 此舉是為其個人利益。
LY Corporation 藉助 OpenAI 推動增長,並創造「WOW」時刻。
Google 發佈 Gemma 3 開放權重模型系列,提供 1B、4B、12B、27B 四種規模及預訓練、指令微調版本。4B、12B、27B 版本支援圖像和文字、140+ 種語言及 128k tokens 上下文;1B 版本僅支援文字和英文,提供 32k 上下文。
推薦理由:文章整理 Gemma 3 各版本的上下文、圖像與語言支援差異,並列出 Transformers、MLX 和 llama.cpp 的推理入口,方便比較使用路徑。
OpenAI 表示,利用 LLM 監測前沿推理模型的思維鏈,可偵測模型利用漏洞的不當行為。懲罰模型的「不良思維」無法阻止大多數不當行為,反而會令它們隱藏意圖。
推薦理由:材料對照監測與懲罰的結果,指出思維鏈監測能偵測漏洞利用,而懲罰不良思維未能阻止大多數不當行為,並會令模型隱藏意圖。
Nubank 藉助 OpenAI 提升客户體驗。
Hugging Face Blog 的教程示範以 React Native 建立手機應用,在裝置本地執行 LLM 聊天。應用從 Hugging Face Hub 下載 GGUF 模型,並以 llama.rn(llama.cpp 的 binding)載入,教程涵蓋 Android 和 iOS。文章亦介紹 GGUF 量化格式、手機選模取捨,以及逐 token 生成與推理速度追蹤等功能。
推薦理由:文章按模型選擇、GGUF 下載與載入、聊天介面逐步拆解 React Native 實作,並説明量化格式與設備能力的取捨,可作為端側 LLM 應用的開發參考。
Mistral AI 推出 Mistral OCR 文件理解 API,可解析圖片與 PDF,並抽取文字、圖像、表格及公式。API mistral-ocr-latest 已在 la Plateforme 開放,每美元可處理 1000 頁,批次推理下每美元可處理頁數約增至兩倍;Mistral OCR 亦可在 le Chat 免費試用。
推薦理由:Mistral OCR 可解析 PDF、圖片中的表格與公式,並支援 JSON 輸出,展示文件接入 RAG 與 Agent 工作流的實際做法。
透過 OpenAI,工程週期加快 20%。
Mistral AI 的 TranscriptToPRDTicket 智能體工作流程可將會議逐字稿自動轉成產品需求文件(PRD)及開發工單。其中 PRDAgent 與 TicketCreationAgent 均由 Mistral Large 2 驅動,並可在 Linear 或 Jira 建立工單。完整實作已提供於 Google Colab notebook,供使用者開始部署及按需自訂。