跳到正文

#DeepSeek

今日 9 條
今天10月6日週二
  1. IT之家72

    消息指 DeepSeek 新一輪融資接近完成,募資至少達人民幣800億元

    彭博社報道指,DeepSeek 新一輪融資接近敲定,募資至少達人民幣800億元,遠超原定約人民幣500億元的目標。知情人士稱,寧德時代及騰訊均屬本輪出資額最大的幾家投資方;按已簽署的投資條款書,最終融資額可能接近人民幣1000億元。報道又稱,融資完成後公司將啟動業務重組,為計劃於2027年初進行的 IPO 作準備。

  2. Goodfire Research57

    Goodfire 剖析 DeepSeek R1 推理模型內部機制,公開兩個 SAE

    Goodfire 公開兩個以 DeepSeek R1 激活值訓練的稀疏自編碼器(SAE),並分享對推理模型內部機制及操控方式的早期研究。研究發現,R1 的特徵操控需等模型開始輸出「Okay, so the user has asked a question about…」一類思考前綴後才有效;部分特徵被過度操控時,模型反而會回復原有行為。

10月5日週一
  1. IT之家27

    倍思 MC2 NC 降噪耳夾耳機發售:12mm 動圈、-50dB 降噪,783 元(國補後 598 元)

    倍思旗下 MC2 NC 降噪耳夾耳機已在京東發售,定價 783 元,部分地區國補後低至 598 元。耳機配備 12mm 碳纖維三磁路動圈,降噪深度達 -50dB,配合充電盒續航最高 60 小時(關閉降噪)。另接入豆包、通義千問及 DeepSeek 模型,提供 AI 錄音轉寫、即時助答及同聲傳譯功能。

10月3日週六
  1. LlamaIndex:產品、工程與評測65

    超越 OCR:DeepSeek-OCR 的視覺壓縮如何服務文件 AI

    LlamaIndex 解讀 DeepSeek-OCR 將文件圖像作為文字資訊的壓縮表示,並分析其與文件解析、LlamaParse 的關係。文中稱,論文示例把 1,000 個文字 tokens 壓至 100 個視覺 tokens,解碼準確率為 97%;20× 壓縮時準確率約為 60%。文章指出,RAG、文件問答和摘要等理解型用途可考慮視覺壓縮;若需要結構化資料、語義層級或精確文字操作,仍需文件解析。

  2. Anthropic:Alignment Science Blog61

    Anthropic Fellows Program 研究發現 Test-Time Compute 增加可能降低部分模型準確率

    Anthropic Fellows Program 研究團隊構建評測,發現增加大型推理模型的 Test-Time Compute 可能令部分任務準確率下降。評測涵蓋幹擾計數、虛假特徵迴歸、約束追蹤演繹和進階 AI 風險,研究歸納出五類較長推理下的失效模式。Claude Sonnet 4 表示願意被關閉的回答比例隨推理增加由 60% 降至 47%,研究指出延長推理可能加強自我保存表述。

9月27日週日
9月18日週五
9月10日週四
8月21日週五
8月13日週四
7月31日週五
7月20日週一
7月18日週六
5月16日週六
4月24日週五
2月3日週二
12月1日週一
9月29日週一
9月22日週一
8月21日週四
6月12日週四
5月28日週三
  1. DeepSeek:API 更新日誌76

    DeepSeek 將 deepseek-reasoner 升級至 DeepSeek-R1-0528,推理基準分數提升

    DeepSeek 將 deepseek-reasoner 升級至 DeepSeek-R1-0528,並公佈多項基準的 Pass@1 提升。AIME 2025 由 70.0 升至 87.5(+17.5),GPQA 由 71.5 升至 81.0(+9.5),LCB_v6 由 63.5 升至 73.3(+9.8),Aider 由 57.0 升至 71.6(+14.6)。

    推薦理由:DeepSeek-R1-0528公佈多項基準提升數據,並提示複雜推理任務較舊版消耗更多 tokens,可供比較版本能力表現與用量。

3月27日週四
  1. Hugging Face Blog77

    DeepSeek-V3 0324 登上 Hugging Face Hub,四項基準分數均上升

    DeepSeek-V3 0324 已登上 Hugging Face Hub,沿用原版架構並採用 MIT 授權,重點改善指令遵循、編碼和數學能力。DeepSeek 團隊列出的 MMLU-Pro、GPQA、AIME 和 LiveCodeBench 分數,分別由 75.9、59.1、39.6、39.2 升至 81.2、68.4、59.4、49.2。

    推薦理由:文中提供 MMLU-Pro、GPQA、AIME 和 LiveCodeBench 的更新前後分數,讓讀者可按多項基準逐一比較 DeepSeek-V3 0324 相對原版的提升幅度。

3月24日週一
2月4日週二
  1. Hugging Face Blog53

    DABstep:面向多步推理的數據智能體基準

    Hugging Face 與 Adyen 聯合推出 DABstep,這項基準以450多項數據分析任務評估 AI 智能體的多步推理能力。任務源自 Adyen 的實際工作負載,但資料與商業背景為人工生成;基準涵蓋結構化資料和非結構化文件,並提供資料集、任務、評測、即時排行榜及基線。

12月26日週四
12月10日週二
  1. DeepSeek:API 更新日誌60

    DeepSeek 將 deepseek-chat 升級至 DeepSeek-V2.5-1210

    DeepSeek 將 deepseek-chat 升級至 DeepSeek-V2.5-1210,並改善多項能力。MATH-500 成績由 74.8% 提升至 82.8%,LiveCodebench(08.01 - 12.01)準確率由 29.2% 升至 34.38%;內部測試亦顯示寫作和推理有所改善。新版本亦優化檔案上傳和網頁摘要功能的使用體驗。

9月5日週四
8月2日週五
7月25日週四
7月24日週三