跳到正文

全部動態

今日 458 條
10月3日週六
  1. LlamaIndex:產品、工程與評測55

    LlamaIndex 解釋 VLM 為何難以解析表格

    LlamaIndex 指出,通用 VLM 難以可靠解析表格,因其並非為文件及表格處理最佳化;LlamaParse 則以專用方案取得更佳結果並降低成本。LlamaParse 以巢狀 JSON 保留欄位與分區關係,並處理勾選狀態、邊界框定位和欄位歸屬。

  2. LlamaIndex:產品、工程與評測30

    LlamaParse 應付帳款 OCR:效益、挑戰與最佳實踐

    LlamaParse 將應付帳款 OCR 與 VLM 文件解析、機器學習及結構化解析整合,把非結構化發票轉成可驗證、可供企業系統使用的財務資料。系統可擷取發票欄位及明細,並在資料進入 ERP 前核對小計、明細與總額是否符合財務規則。結構化索引和檢索亦可加快查找發票記錄及財務屬性,強化審計準備。

  3. LlamaIndex:產品、工程與評測27

    甚麼是 Agentic OCR?智能文件自動化的下一階段

    Agentic OCR 將推理、規劃與自我修正納入文件處理流程,並按文件元素選用合適模型,不再只做一次性文字擷取。多模態語言模型與自動文件類型識別可理解版面、表格及圖表;視覺定位則將擷取欄位連回來源頁面供核查。Agentic loop 透過一致性檢查驗證結果,並在輸出前修正總額與明細不符等錯誤。

  4. LlamaIndex:產品、工程與評測31

    LlamaParse 表格 OCR:如何從文件提取結構化資料

    表格 OCR 透過表格偵測、結構辨識與資料擷取,將文件中的表格轉為 JSON、CSV 或 Excel 等機器可讀格式。LlamaParse 的發票示例會重建行列及欄位關係,並把數值映射至指定 schema。算術、資料類型及跨欄位一致性檢查,有助避免結構錯配流入企業工作流程。

  5. IT之家48

    特斯拉持續推進 FSD 監管版輔助駕駛系統在中國台灣地區落地,進一步優化道路測試計劃

    特斯拉正持續推進 FSD 監管版輔助駕駛系統在中國台灣地區落地的申請,並按首輪技術審查意見進一步優化道路測試計劃架構。測試路線除涵蓋法規要求場景,亦將納入由城市至鄉村的多種交通環境,以驗證系統對當地機動車與摩托車混行及交通規則的適應能力。公司將完善路線與場景規劃,推進系統取得相關審核認可。

  6. IT之家64

    Black Forest Labs 發佈 FLUX 3 Image,支援最高 4K 生成及精確排布畫面元素

    Black Forest Labs 發佈圖像生成模型 FLUX 3 Image,最高支援生成 4K 解像度圖片,並可用座標網格和邊界框精確安排畫面元素。模型單次最多可融入 10 張參考圖像並指定物件位置,也可修改指定區域而保持其他像素不變;官方稱其能在像素級別維持原圖內容,以支援精確多輪編輯。

  7. IT之家51

    湖北擴大智能家居國補範圍,機械人、數碼相機等可補貼 15%

    湖北省自 2026 年 10 月 1 日起擴大智能家居及相關消費品補貼範圍,新增機械人、數碼相機、無人機、血壓儀等品類。個人消費者在參與商家購買補貼範圍內產品,可按扣除各環節優惠後的最終售價獲 15% 補貼,每類產品限 1 件、每件不超過 1500 元。數碼及智能產品、家電仍參與國補。

  8. IT之家52

    上海市委網信辦要求平台防範七類涉未成年人心理健康風險,嗶哩嗶哩、小紅書、拼多多等 17 家平台參會

    上海市委網信辦於9月30日召開未成年人網絡保護專題指導會,17家重點平台參會,會議要求平台防範七類涉未成年人心理健康風險。風險包括網絡沉迷成癮、網絡欺凌、容貌身材焦慮、自殘自殺類消極有害信息傳播、線上社交擠佔現實交往、AI 換臉及虛擬人設帶來的情感操控,以及不良價值觀傳播。

  9. OpenAI Developers:Blog30

    Hello, world! OpenAI 推出開發者網誌

    OpenAI 推出面向開發者的新網誌,將刊載技術深入文章、版本更新説明及最佳實踐,並由工程師直接分享工具與功能資訊。首批兩篇文章包括 Realtime API 開發者備忘,聚焦整合 GA Realtime API 及新即時模型時涉及的重要技術變更。

  10. OpenAI Developers:Blog76

    OpenAI Realtime API 開發者筆記:GA 後語音對語音更新要點

    OpenAI 整理 Realtime API 與 gpt-realtime 語音對語音模型進入 GA 後的介面變更、新功能及整合注意事項。文章建議客户遷移至 GA 介面,並説明 beta 與 GA 在功能支援、temperature 和非同步函式呼叫上的差異。

    推薦理由:文章對照 beta 與 GA 的功能支援差異,並説明介面遷移、temperature 設定及長對話截斷的處理方式,方便開發者按整合環節核對需要調整的設定。

  11. OpenAI Developers:Blog52

    Dagster Labs 如何用 Codex 加速文件撰寫、跨媒介改編與完整度評估

    Dagster Labs 團隊運用 OpenAI Codex 加快技術教育文件撰寫、跨媒介內容改編,並評估文件完整度。他們透過完善 CONTRIBUTING.md,並把程式碼、文件與示例放在同一個程式碼庫,讓 Codex 協助解讀 PR、起草文件及製作影片講稿。此外,團隊讓 Codex 根據文件生成程式碼,再執行測試,並以程式能否按預期運作作為文件完整度的間接指標。

  12. OpenAI Developers:Blog63

    如何打造優質 ChatGPT app,讓產品能力在對話中發揮價值

    OpenAI 提供 ChatGPT app 設計指南,説明如何選擇使用場景,並將產品優勢拆成模型可在對話中調用的明確能力。文章以 Know、Do、Show 概括 app 的增值方式,建議聚焦少量操作,而非移植整個產品。指南亦涵蓋模糊與明確意圖下的互動、清晰的工具參數與結構化輸出、資料最小化及跨 app 協作。

  13. OpenAI Developers:Blog67

    Codex Agent 技能的 Evals 系統化測試實踐指南

    OpenAI Developers 提供一套以 Evals 系統化測試、評分並改進 Codex Agent 技能的實踐流程。指南建議先定義可量度的成功條件,並以 10–20 條提示詞涵蓋技能應否觸發等情境。再用 codex exec --json 記錄 JSONL trace,對命令與檔案執行確定性檢查,並以 --output-schema 輸出結構化 rubric 評分風格要求。

  14. OpenAI Developers:Blog76

    OpenAI 分享以 Skills、託管 shell 與服務端 compaction 建構長時間運行智能體的實作技巧

    OpenAI 分享以 Skills、託管 shell 和服務端 compaction 構建長時間運行智能體的實作模式,涵蓋技能路由、容器復用與網絡配置。Glean 面向 Salesforce 的 skill 將評測準確率由 73% 提升至 85%,並令 time-to-first-token 縮短 18.1%。

    推薦理由:文章將 Skills、shell 與服務端 compaction 的分工整理成長流程建構方法,並涵蓋技能路由、產物交接及網絡隔離等可複用設計。

  15. OpenAI Developers:Blog21

    OpenAI Codex 部落格文章一覽

    OpenAI Developer Blog 彙列多篇 Codex 文章,涵蓋以 Codex 建立遊戲、進行建築視覺化、製作前端介面,以及自動化重複工程工作的案例。其他內容包括 Skills 與提示詞、Codex Security、遠端工程工作、程式碼審查規則、JetBrains MCP 整合,以及用 Evals 系統測試 Agent Skills 的指南。

  16. Hacker News:AI 熱帖30

    消費者對 AI 的疲勞感令人難以招架,本地商户應重新考慮使用 AI

    消費者對 AI 內容的疲勞感已令人難以招架,討論主張本地商户重新考慮使用 AI。支持者認為,專業運用 AI 可製作媲美甚至勝過人工作品的內容,速度更快、成本更低。批評者稱,AI 產出有 99% 一眼可見地粗劣;他們所見的做法是未用過 AI 的人只輸入「a poster」,便採用首個結果。

  17. Hacker News:AI 熱帖18

    評測智能體在雜亂真實公司知識中的檢索能力

    這場討論聚焦如何評測智能體在雜亂真實公司知識中的檢索能力,並詢問 BEAM、MemEval、MemoryArena 等基準的參考價值。提問者亦詢問 Karpathy 的 Episodic/Procedural/Semantic 分類(Doxa/Koine/Gnosis)是否有用、與設計哪些部分相符,並追問能否公開資料抽取流程,讓其他公司自行比較,以推進可重現性。

  18. Hacker News:AI 熱帖27

    Jev 等決策模型未能勝過 LLM-as-a-judge 或傳統分類器

    Jev 等決策模型未能勝過 LLM-as-a-judge 或傳統分類器;用於智能體堆疊的條件分支決策時,模型須兼具良好校準與資訊性。神經網絡輸出 logits 對可約減的認知不確定性屬高度有損壓縮,令校準在實務上難以落實;高概率區域的估計亦會在輕微協變量偏移下不穩,令多步搜尋圖可能走向模型訓練或校準時未見的分支,甚至落在分佈外。