跳到正文

全部動態

今日 453 條
9月2日週三
  1. Cursor Blog55

    Nokia 藉助 Cursor 在兩週內分析超過 5000 萬行程式碼

    Nokia 核心網部門表示,兩名工程師藉助 Cursor 在兩週內分析某條產品線超過 5000 萬行程式碼,無需自訂工具。分析為拆解單體架構、轉向分散式服務架構提供規劃依據,並據 Nokia 估算,數月內釋放十多名專家投入其他項目。Cursor 亦協助 Nokia 將新功能部署工作流約 80% 自動化及可視化,並把根因分析由數週縮短至數天。

  2. Hugging Face Blog50

    BenchMIRT:LLM 基準測試實際衡量甚麼?

    AllenAI 推出 BenchMIRT,利用多維項目反應理論(MIRT)逐題分析 LLM 基準測試,分辨安全與一般推理等能力訊號。BenchMIRT 以 100 個 LLM 在 16 個基準、逾 34K 條問題上的評測結果訓練;研究團隊沒有告知各基準預期測量哪些能力,它仍識別出安全和一般推理兩個主要維度,並發現 BBQ 更貼近一般推理。

  3. Sierra:Blog58

    甚麼是 Voice AI?企業級 AI 語音智能體指南

    Sierra 的企業級 Voice AI 指南説明,AI 語音智能體可結合客戶背景及業務系統,在通話中處理要求並完成工作。企業準備程度須以整通電話作端到端評估,涵蓋延遲、輪流發言、語音辨識、上下文、操作、護欄及轉接七項測試,並納入噪音、打斷、模糊請求和整合失敗等情況。Sierra 的 tau-voice 基準以 278 項客戶服務任務,結合真實音訊及重疊發言,測試對話行為與資料庫狀態是否正確。

9月1日週二
  1. Timothy B. Lee:Understanding AI61

    人形機械人為何短期內仍難追上人類工作者

    人形機械人雖在舞蹈和跑步等示範中取得進展,但物件操作、任務泛化、長時間工作及安全部署仍有多重障礙,短期內難以追上人類工作者。Physical Intelligence 示範完成 15 項操作挑戰中的 10 項,但機械人完成大部分任務所需時間是人類的 4 至 10 倍,成功率為 52%。

  2. Ai2 / Allen Institute for AI54

    BenchMIRT:LLM 基準測試實際測量甚麼?

    Ai2 介紹 BenchMIRT,一種逐題分析 LLM 基準測試的方法,並從模型作答中辨識出安全與一般推理兩個主要能力維度。BenchMIRT 以 100 個 LLM、16 個基準及逾 34K 道題目的評測結果訓練;分析發現 BBQ 和 WMDP 的分數與一般推理的關聯強於安全。

  3. Google Research51

    Google Research 發佈 TimesFM-3 零樣本多變量時間序列預測基礎模型

    Google Research 發佈 TimesFM-3,一款原生支援多變量零樣本預測的時間序列基礎模型,可在單次前向傳播中預測多條相關序列。它有 330 million parameters,使用超過 1 trillion time points 的真實及合成時間序列資料預訓練,並能結合多個目標、歷史協變量和已知未來協變量,無需任務專用微調。

  4. Manus:Blog59

    Manus 恢復獨立營運

    Manus 宣佈已正式恢復獨立營運,創始團隊將繼續領導公司,並表示會持續推進通用 AI Agent 的發展。過渡期間,部分用户需要備份和恢復資料,並應對暫時的存取中斷。Manus 表示未來將加深與日常工作流程的整合,並更主動地代表用户採取行動。

8月31日週一
  1. OpenAI News66

    ChatGPT Ads 年化收入運行率達 $1 billion,並擴展至全球

    OpenAI 宣佈,ChatGPT Ads 的年化收入運行率達 $1 billion,並擴展至全球。這項業務透過免費及平價選項,支持擴大 AI 的使用機會。

    推薦理由:材料將 ChatGPT Ads 的收入規模與全球擴展,連同免費及平價選項支持 AI 普及的方向一併交代,呈現其商業進展與使用入口之間的關聯。

8月30日週日
8月29日週六
8月28日週五
  1. Hugging Face Blog68

    Open ASR Leaderboard 新增 Hindi、Indian English 評測集,首度納入全球南方語言

    Voice Arena 與 Hugging Face 為 Open ASR Leaderboard 加入 Monsoon en-IN 和 Monsoon hi-IN 評測集,涵蓋 Indian English 與 Hindi,令 Hindi 成為其多語言分頁首個 Indic language。

    推薦理由:這批評測集把説話者背景與可接受的拼寫變體納入 ASR 評估,讓總體 WER 之外的區域差異和 Hindi 正字法誤差更容易被辨識。

  2. Epoch AI:Gradient Updates64

    OpenAI 與 Anthropic 合計年化收入升至 $105B,前沿 AI 增長維持高速

    OpenAI 與 Anthropic 的合計年化收入在 2026 年已由 $30B 增至 $105B,約為原來的 3.5 倍。作者提出,這輪增長可能是編碼智能體達到關鍵門檻後帶來的短期加速,並與 ChatGPT 推出後的收入激增作比較。文章認為,收入增長能否延續,取決於新能力是否各自帶來新的普及曲線,還是前沿 AI 整體逐漸飽和。

  3. MIT News38

    PottsMPNN:超越天然蛋白質序列的蛋白質設計

    研究人員開發機器學習框架 PottsMPNN,將蛋白質結構與穩定性的物理原理納入設計,提升序列生成及預測突變對穩定性影響的能力。它以成對分佈捕捉氨基酸間相互作用,並用演化相關序列訓練,更準確地建模序列—能量景觀,支援設計序列不同於天然蛋白質、但結構上可行的蛋白質。

8月27日週四
  1. Ai2 / Allen Institute for AI67

    Ai2 與 Providence Swedish Cancer Institute 合作,將 AutoDiscovery 用於癌症研究數據集

    Ai2 宣佈與 Providence Swedish Cancer Institute 合作,將 AutoDiscovery 用於癌症研究數據集。團隊以 The Cancer Genome Atlas(TCGA)進行分析,發現浸潤性小葉癌(ILC)的免疫特徵較以往認知更強,並透過獨立患者數據集及實驗室分析驗證。研究指出,這類癌症約佔美國每年確診乳癌的 15%,患者或可受惠於免疫療法。

  2. Google DeepMind69

    Google DeepMind 發佈 Gemini 3.5 Transcribe 語音轉文字模型

    Google DeepMind 發佈 Gemini 3.5 Transcribe,這是一款面向智能語音互動的語音轉文字模型。它可透過 Live API 以低於一秒的延遲進行即時串流,亦可經 Interactions API 處理預錄音訊,提供説話者歸屬及逐字時間戳。

    推薦理由:材料同時提供串流與非串流 WER,以及相較 Chirp 3 的最終轉錄時間改善幅度,讓準確度與延遲兩項表現有具體數據可供對照。

8月26日週三
  1. MIT News49

    AI 助力設計可在現實世界應用的新材料

    MIT 研究人員開發 CrysVCD,在材料生成前以價電子層化學規則約束設計,提升材料穩定性。該方法在近 70% 的計算生成中達到高晶格動力學穩定性;依穩定性指標微調後,生成材料的機械穩定性達 68%、亞穩定性達 85%。相較生成後再篩選,CrysVCD 生成更穩定材料的效率提高一個數量級。