跳到正文

#部署/工程

今日 15 條
今天10月7日週三
  1. Hacker News 熱門(buzzing.cc 中文翻譯)63

    OpenSSH 10.6 發佈,新增後量子簽名演算法並修補安全問題

    OpenSSH 團隊於 2026-10-06 發佈 OpenSSH 10.6,並表示暫時會更頻密地發佈版本,讓錯誤修正更快交付用戶。版本停用 LZ77 字典壓縮,以緩解共享壓縮字典造成的 SSH 多通道側信道洩漏,並指出此舉會降低 Compression 選項的效果。版本亦新增混合後量子簽名演算法 ssh-mldsa44-ed25519,並加強命令列用戶名稱檢查,拒絕含反斜線或美元符號的名稱。

  2. IT之家67

    SpaceX 計劃集資 400 億美元採購 NVIDIA AI 晶片

    SpaceX 計劃集資 400 億美元採購 NVIDIA AI 晶片,《金融時報》稱融資將由阿波羅全球管理牽頭,交易預計於 2027 年完成。融資方案包括約 100 億美元銀行貸款及 300 億美元投資級債券,Pimco 亦正洽談參與出資。SpaceX 先前發行的債券曾因市場憂慮其債務和資本開支而遭拋售;2056 年到期債券目前價格約為面值的 85 美分,收益率較美國國債高約 2.27 個百分點。

10月6日週二
  1. HuggingFace Daily Papers(社區熱門論文)48

    SoK:網絡控制迴路中的語義決策引擎

    這項 SoK 研究整理 139 個語義決策引擎論文系列,評估其用於網絡控制迴路的證據。50 個系列聲稱符合控制迴路或時間預算要求,只有 4 個有配對測量支持;全部系列中也只有 4 個報告達成期限。缺乏確定性計算步驟的 72 個系列提出 22 項聲稱,均無支持,只有 2 個指定覆蓋責任人。

  2. Tessl:產品與工程博客57

    規格驅動開發在以系統用例作規格時奏效

    AI Unified Process 以系統用例和領域模型作核心規格,讓 Agent 直接根據系統用例生成業務軟件,省略規劃與任務拆分階段。現代化項目先從舊系統逆向整理用例、實體模型、測試和文件,再交由業務人員審核,按行為生成新實作,而非直接轉換舊程式碼。生成流程配合技能、防護規則、架構指引、MCP 伺服器和測試,並按風險安排審查。

  3. 英國 AI Security Institute:Blog60

    RepliBench:評估 AI 系統自主複製能力的基準

    UK AI Security Institute 的研究提出 RepliBench,透過 20 項 LLM 智能體評測衡量 AI 系統的自主複製能力。研究測試 7 個前沿模型,最佳模型在 15/20 個任務系列取得 >50% pass@10,在最難變體的 9/20 個任務系列達到此水平;沒有模型能完成自主複製所需的全部組成任務。

  4. 英國 AI Security Institute:Blog60

    SandboxEscapeBench:安全評估 AI 智能體容器逃逸能力的基準測試

    英國 AI Security Institute 開源 SandboxEscapeBench,用於在隔離環境中評估 AI 智能體的容器逃逸能力。基準涵蓋18種橫跨編排、執行階段及核心層的情境,每個容器均在加固虛擬機內運行。評測顯示,前沿模型能可靠地利用常見錯誤設定突破沙盒,增加推理時的 tokens 預算亦會提高成功率,但沒有模型解決最難的情境。

  5. 英國 AI Security Institute:Blog58

    英國 AI Security Institute 發佈 AISI Engineering Playbook,整理前沿 AI 評估方法與實踐

    英國 AI Security Institute 發佈 AISI Engineering Playbook,整理其評估前沿 AI 系統時建立的方法與實踐。手冊將評估所需基建分為 Evaluate、Isolate、Connect、Run 和 Scale 五層,並提供技術介紹及現有開源程式碼連結。研究人員可採用個別組件,機構亦可參照五層架構建立自己的評估平台。

  6. Cerebras:Blog76

    OpenAI 與 Cerebras 簽訂多年協議,部署總容量達 750 megawatts 的晶圓級系統

    OpenAI 與 Cerebras 簽訂多年協議,將分階段部署 750 megawatts 的 Cerebras 晶圓級系統,為 OpenAI 客戶提供服務。部署將於 2026 年開始;Cerebras 稱這將成為全球最大高速 AI 推理部署。Cerebras 表示,其系統上的大語言模型在編碼智能體或語音聊天場景中,回應速度較基於 GPU 的系統快達 15×。

    推薦理由:文章列出 750 megawatts 的部署規模,並引述 Cerebras 稱其推理回應較 GPU 系統快達 15×,呈現合作的規模與方案定位。

  7. Cerebras:Blog43

    Cerebras Inference 推出 Multi-LoRA 多適配器支援

    Cerebras 在 Cerebras Inference 推出 Multi-LoRA,支援團隊以單一共享基礎模型搭配多個 LoRA 適配器,並按每次請求切換適配器。該功能支援以 HF PEFT 格式部署 LoRA,現正向 Cerebras Inference 專用端點用戶提供私人預覽,毋須額外付費。團隊可按領域、任務、客戶及工作流程專門調整模型行為。

  8. Eugene Yan:Writing71

    產品評測的三個簡單步驟

    Eugene Yan 提出產品評測的三步流程:標註小型數據集、校準 LLM 評估器,並在每次配置變更後執行實驗與評測。他建議採用二元標籤,在 200 個以上樣本中準備 50–100 個失敗案例,並以 75% 樣本校準、25% 留作測試;不同評測維度應使用獨立評估器。

  9. ElevenLabs:Blog52

    ElevenLabs 與烏克蘭合作建設全球首個智能體政府

    ElevenLabs 與烏克蘭政府簽署諒解備忘錄,合作推動 AI 公共服務由概念走向部署。教育部團隊正開發 Mriia 個人化 AI 導師應用程式,經濟部則把智能體整合至 Obriy,醫療領域運用語音技術減少行政工作。烏克蘭數碼轉型部計劃於 2030 年前成為 AI 公共服務應用的領先者,並以 Diia.AI 踏出第一步;該平台是全球首個公共服務智能體應用程式及平台。

  10. Zyphra Research41

    Tree Attention:面向 GPU 叢集長上下文注意力的拓撲感知解碼

    Zyphra 提出 Tree Attention,以樹狀歸約平行化多 GPU Transformer 解碼,實測可提升長上下文注意力的解碼速度並降低記憶體開銷。Zyphra 估算,在 1M 序列長度下,Tree Attention 的解碼速度較 Ring Attention 快逾 8x,通訊量則減至一半或更低。其跨裝置複雜度為對數級,而 Ring Attention 為線性級。

  11. Prime Intellect53

    Prime Intellect 預覽面向公共互聯網的分散式推理堆疊,並開源三個研究程式碼庫

    Prime Intellect 預覽面向消費級 GPU、為公共互聯網 100ms 延遲設計的分散式推理堆疊,並開源三個研究程式碼庫。PRIME-IROH 是管線並行通訊後端,PRIME-VLLM 是可在公共網絡運行的 vLLM 管線並行整合,PRIME-PIPELINE 是快速驗證研究構想的精簡研究沙盒;用戶現已可連接私人硬件,透過公共網絡執行推理。

  12. Prime Intellect74

    Prime Intellect 推出 Lab 全棧模型訓練平台

    Prime Intellect 推出 Lab,將 Environments Hub、Hosted Training 和 Hosted Evaluations 整合為模型後訓練研究的全棧平台。平台現支援基於 prime-rl、使用 LoRA 的智能體強化學習訓練,並可在自建環境中執行。私測期間已完成逾 3,000 次 RL runs,現已向所有人開放。