跳到正文

全部動態

今日 448 條
8月25日週二
  1. Hugging Face Blog64

    Gradio gr.Workflow 如何編排、執行及部署 AI 工作流

    Gradio 內置的 gr.Workflow 可把 AI 工作流表示為由帶類型節點組成的圖,並提供可拖放、逐節點執行及查看中間結果的畫布。節點可執行 Python 函數、調用 Hugging Face Inference Providers 模型或其他 Gradio Space,也可處理 Hub 數據集資料。

    推薦理由:文章以多個可執行示例展示如何把模型、Python 函數與 Gradio Space 串成工作流,並讓節點輸出直接成為 API。

  2. Mistral AI55

    Mistral AI 與 HUMAIN 宣佈戰略合作,推進沙特阿拉伯及中東主權 AI

    Mistral AI 與 HUMAIN 宣佈戰略合作,將在沙特阿拉伯及區域內推進 AI 基礎設施、先進模型開發和 AI 解決方案部署。雙方將開發並本地化先進 AI 模型,初期聚焦網絡安全和語音,並計劃開發阿拉伯語表現出色的前沿模型;合作規模達數億歐元。Mistral AI 將探討使用 HUMAIN 的數據中心基礎設施,雙方亦計劃在沙特制定面向受監管行業的共同市場策略。

8月24日週一
8月22日週六
  1. Ahead of AI60

    Claude 如何為 AI 生成文字加入浮水印

    Anthropic 計劃為 Claude 模型生成的文字加入浮水印,Sebastian Raschka 詳解其文字生成與抽樣機制。浮水印在抽樣階段使用秘密金鑰和前四個詞語控制 token 選擇,毋須重新訓練模型;tournament sampling 讓系統可用金鑰和浮水印函數為文字評分,毋須重新執行 LLM。由於浮水印位置不公開,作者指出需改動多處文字才可能移除標記。

8月21日週五
  1. Amazon Science64

    Amazon 發佈 SOP-Bench 基準,評估 AI 智能體執行真實業務程序的能力

    Amazon 推出 SOP-Bench,這套開放基準以真實業務標準作業程序評估 AI 智能體的執行能力。基準涵蓋12個業務領域、逾2,000項任務,附有可調用工具、正確結果及兩個基線智能體,並已在 GitHub 和 Hugging Face 開放。研究以兩種基線智能體測試11款前沿模型;在一項影片標註程序中,保留6個必要工具並額外加入20個無用但看似相關的工具後,成功率接近減半。

  2. Hugging Face Blog54

    研究測量語音辨識模型的基準優化現象

    Hugging Face 的研究提出三項測試衡量語音辨識中的基準優化,並評估 11 個常用開源 ASR 模型,發現多個模型會重現與音訊不符的基準文本。研究在所分析的 VoxPopuli 測試片段中標記出 40% 的潛在參考文本錯誤,涉及約 3% 的參考詞;呈現基準優化行為的模型在相關測試中有 18–30% 的情況會重現錯誤參考文本。

  3. Hugging Face Blog63

    Hugging Face Inference Endpoints、Jobs 和 Buckets 如何支撐 Papers with Code 搜尋

    Hugging Face 以 Inference Endpoints、Jobs 和 Storage Buckets 建立 Papers with Code 混合搜尋系統,為來自 arXiv 和 Daily Papers 的超過 110,000 篇論文維護嵌入向量。

    推薦理由:文章拆解離線批次建向量與線上查詢的分工,並説明端點冷啟動時如何回退全文檢索,呈現混合搜尋進入生產環境的工程取捨。

  4. MIT News37

    MIT 研究為更環保的氨生產鋪路

    MIT 研究人員開發出一種預測方法,篩選電化學製氨最有前景的催化材料,為低排放製氨提供研究方向。這套方法找出推動氮還原催化活性的關鍵物理性質,可大幅加快對數以百萬計合金組合的搜尋。研究成果於 8 月 11 日發表於開放取用期刊 EES Catalysis。

8月20日週四
  1. Mistral AI68

    Mistral 推出 Agentic Search,以多步檢索提升準確率並降低延遲和 token 使用量

    Mistral 推出 Agentic Search,讓模型透過多步檢索搜尋、查看、導覽及核實複雜文件中的資料。在 FinanceBench 金融文件測試中,正確率由 26.7% 升至 86%;OfficeQA Pro 表格密集的多文件問題則由 6.3% 升至 51.9%。

    推薦理由:FinanceBench 和 OfficeQA Pro 的基準數據呈現 Agentic Search 相較單次 RAG 的準確率提升,也量化延遲與 token 使用量變化。

8月19日週三
8月18日週二
  1. Hugging Face Blog72

    Sentence Transformers v6.0 多向量(Late Interaction)嵌入模型使用指南

    Sentence Transformers v6.0 新增 MultiVectorEncoder,支援 ColBERT 式多向量檢索。文中示範載入 PyLate 與 Stanford-NLP ColBERT checkpoint、接入檢索索引,以及以同一 API 執行 ColPali 視覺文件檢索。

    推薦理由:文章對照 LateOn 與 DenseOn 在 NanoBEIR 13 個資料集的結果,並以索引體積數據呈現多向量檢索表現與儲存成本的取捨。

8月17日週一
8月15日週六
  1. Ahead of AI38

    從零開始建構 AI 文字偵測器

    這個教學示範如何從零建構 AI 文字偵測器,並以微調 DistilBERT 分類器估算文字由 AI 生成的可能性。評分為 0-100,項目目標包括提供人類及智能體可用的 API,以及可顯示全文和個別文字區塊評分的本地瀏覽器介面。作者亦以此探討 AI 偵測器的限制,以及評分器或驗證器在 LLM 應用中的用途。

8月14日週五
  1. Cursor Blog82

    SpaceX 正式完成對 Cursor 的收購

    SpaceX 已正式完成對 Cursor 的收購,結束始於 4 月的收購流程。雙方當時宣佈合作以加速模型訓練;Cursor 表示,與 SpaceX 攜手後可使用全球最大的 GPU 集羣,打造更強且運行成本更低的模型。Cursor 稱,星期三發布的 Grok 4.6 初步展示雙方共同打造的成果,並表示 Cursor 將成為讓這類智能發揮實用價值的場域之一。

    推薦理由:這則消息把 Cursor 的收購與模型建設所需算力、降低成本的計劃放在同一脈絡中,Grok 4.6 被列作初步成果。

  2. elsewhere:文章29

    Vol.006|對話孟醒:我很怕和別人一樣

    elsewhere 訪問五源資本合夥人孟醒,他表示人生的驅動力是體驗與不同,也坦言很怕和別人一樣。孟醒曾做投行、兩度創業,之後從事科技投資並加入滴滴負責自動駕駛,2024年重返投資行業;他在順為投資的 Momenta 其後上市。

  3. Epoch AI:Gradient Updates77

    融資會否成為 AI 算力擴張瓶頸?Anthropic 個案分析

    Epoch AI 以 Anthropic 基建融資為案例,指出近 $50 billion 債務融資顯示,至少短期內融資不太可能成為前沿算力擴張的瓶頸。其中,機構投資者承諾提供 $34.5 billion 債務,支持租賃超過 1 GW 的 Google TPU 系統;另有約 $15.2 billion 貸款支持五個數據中心建設,涉及 1.43 GW 的關鍵 IT 容量。

    推薦理由:Anthropic 個案拆解供應商信用支持租賃融資的結構,呈現未來租金如何轉化為機構資金,以及融資成本如何受風險分擔安排影響。

  4. Cursor Blog55

    Firetiger 團隊加入 Cursor,推進編碼智能體與上線後監控協同

    Firetiger 團隊將加入 Cursor,其智能體可監控軟件發布、發現回歸、調查事件,並把發現反饋給編程智能體。Cursor 表示,雙方會讓這些系統更緊密協同,使智能體能交付變更、觀察其表現,並在問題出現時響應。相關工作還包括為智能體時代打造的 Git forge Cursor Origin,以及即將推出、會監控已部署變更並在問題出現時標記的 Change Monitors。

8月13日週四
  1. Cursor Blog66

    Cursor 推出「構建」功能,雲端智能體啟動速度最快提升至 3 倍

    Cursor 推出「構建」功能,透過預先準備好的開發環境,讓雲端智能體啟動速度最快提升至 3 倍,且不額外收費。預設每小時建立新構建,成功版本會成為後續智能體的啟動環境;新構建失敗時,智能體仍使用上一次成功版本。從 8 月 17 日起,所有新建及現有環境將預設啟用構建。