LiteParse 2026 年 9 月更新加快 PDF 解析、改善表格準確度並新增視覺定位
LlamaIndex 更新 LiteParse,PDFium 優化令文字抽取耗時減少 20-25%,並改善 Markdown 解析表現,新增視覺定位及 is-complex API。
LlamaIndex 更新 LiteParse,PDFium 優化令文字抽取耗時減少 20-25%,並改善 Markdown 解析表現,新增視覺定位及 is-complex API。
LlamaIndex 指出,通用 VLM 難以可靠解析表格,因其並非為文件及表格處理最佳化;LlamaParse 則以專用方案取得更佳結果並降低成本。LlamaParse 以巢狀 JSON 保留欄位與分區關係,並處理勾選狀態、邊界框定位和欄位歸屬。
LlamaIndex 發佈文件抽取智能體 Extract v2.5,提升所有檔位的準確度,且每頁收費不變。ExtractBench 上,Cost Effective 的整體 value F1 由 87.1 升至 93.9,Agentic 由 89.8 升至 95.8,Agentic Plus 由 95.1 升至 96.4。
LlamaParse 將應付帳款 OCR 與 VLM 文件解析、機器學習及結構化解析整合,把非結構化發票轉成可驗證、可供企業系統使用的財務資料。系統可擷取發票欄位及明細,並在資料進入 ERP 前核對小計、明細與總額是否符合財務規則。結構化索引和檢索亦可加快查找發票記錄及財務屬性,強化審計準備。
Agentic OCR 將推理、規劃與自我修正納入文件處理流程,並按文件元素選用合適模型,不再只做一次性文字擷取。多模態語言模型與自動文件類型識別可理解版面、表格及圖表;視覺定位則將擷取欄位連回來源頁面供核查。Agentic loop 透過一致性檢查驗證結果,並在輸出前修正總額與明細不符等錯誤。
表格 OCR 透過表格偵測、結構辨識與資料擷取,將文件中的表格轉為 JSON、CSV 或 Excel 等機器可讀格式。LlamaParse 的發票示例會重建行列及欄位關係,並把數值映射至指定 schema。算術、資料類型及跨欄位一致性檢查,有助避免結構錯配流入企業工作流程。
現代非結構化資料抽取結合 NLP、NER 與 LLM,從文件擷取可查詢的結構化資訊,供下游系統處理。實際流程包括文件匯入、OCR 與分塊等預處理、提示詞抽取、資料驗證及輸出整合。LLM 的 zero-shot 能力無需領域專用訓練例子,可降低新增文件類型的成本。
特斯拉正持續推進 FSD 監管版輔助駕駛系統在中國台灣地區落地的申請,並按首輪技術審查意見進一步優化道路測試計劃架構。測試路線除涵蓋法規要求場景,亦將納入由城市至鄉村的多種交通環境,以驗證系統對當地機動車與摩托車混行及交通規則的適應能力。公司將完善路線與場景規劃,推進系統取得相關審核認可。
MemoMind One 將於明日進駐全國 56 家線下門店及 INNO100 全球創新旗艦店,並開放定金預訂。10 月 3 日至 10 月 14 日到店預付 100 元定金,可獲贈價值 199 元墨鏡夾片 1 副。官方稱眼鏡具備 AI 記憶、導航和提詞功能,結合極米顯示、蔡司光學與哈曼聲學,目前尚未公佈配置資訊。
東京法院在津田健次郎起訴 TikTok 案中,首次確認人的聲音受法律保護,並認定未經許可使用其聲音侵犯形象權。案件涉及匿名帳號用 AI 克隆其聲音為影片旁白;因帳號已註銷,法院未支持津田要求 TikTok 下架影片的請求。
大眾安徽與眾 09 夏測實車亮相,並已開啟預售,售價 19.99 萬元起。新車搭載端到端智能輔助駕駛模型,可實現高速/城區 NOA 和車位到車位 AI 代駕,並標配圖靈 AI 晶片,總算力 750TOPS。
Black Forest Labs 發佈圖像生成模型 FLUX 3 Image,最高支援生成 4K 解像度圖片,並可用座標網格和邊界框精確安排畫面元素。模型單次最多可融入 10 張參考圖像並指定物件位置,也可修改指定區域而保持其他像素不變;官方稱其能在像素級別維持原圖內容,以支援精確多輪編輯。
小鵬汽車表示,MONA L03 9 月交付超 14,000 台,年輕用户佔比過半。一線、新一線及二線城市佔七成,超九成訂單選擇 Max / Ultra SE,輔助駕駛里程累積超 7 億公里。
Anthropic 在 IPO 招股書中警告,美國政府對公司及其技術的態度可能影響政府業務,並延伸至商業客户和合作夥伴,甚至波及人類文明。
湖北省自 2026 年 10 月 1 日起擴大智能家居及相關消費品補貼範圍,新增機械人、數碼相機、無人機、血壓儀等品類。個人消費者在參與商家購買補貼範圍內產品,可按扣除各環節優惠後的最終售價獲 15% 補貼,每類產品限 1 件、每件不超過 1500 元。數碼及智能產品、家電仍參與國補。
鈦度推出輕鸞 2 頭戴式耳機,售價 159.9 元,主打輕量化機身。耳機重約 230g,搭載 50mm 發聲單元,支援 7.1 遊戲音效與音樂雙模式,並提供 2.4G、藍牙 6.0 及有線 USB 連接。產品內置 1000mAh 電池,配備可插拔全指向 AI 降噪麥克風。
上海市委網信辦於9月30日召開未成年人網絡保護專題指導會,17家重點平台參會,會議要求平台防範七類涉未成年人心理健康風險。風險包括網絡沉迷成癮、網絡欺凌、容貌身材焦慮、自殘自殺類消極有害信息傳播、線上社交擠佔現實交往、AI 換臉及虛擬人設帶來的情感操控,以及不良價值觀傳播。
NVIDIA 推出 DGX Spark 64GB 版本,起售價 4,999 美元,並將於 10 月 23 日發售。產品基於 GB10 Grace-Blackwell,約 56GB 記憶體可供模型權重與 KV cache 使用,並最多支援 4 台設備組成集羣。官方實測兩台設備組成集羣運行 Qwen3.8-27B,相比單台設備性能最高提升 1.7 倍。
Meta 宣佈,旗下 AI 智能體 Muse 將於近期登陸智能眼鏡,用户可透過語音指令讓它在後台代辦任務。Muse 基於 Muse Spark AI 模型運行,使用持續運作的雲端 Linux 虛擬機,並可自行編寫、執行程式碼或把工作分派給多個子智能體。
極氪汽車為煥新極氪 007GT 推出「河谷綠」外飾色與「墨綠」內飾。2026 年 10 月 1 日至 10 月 31 日下定該車,可享更多限時權益;煥新極氪 007/007GT 均採用 900V 高壓架構,匹配麒麟電池,最高續航達 905 公里,百公里加速最快 2.73 秒。
Meta 公佈 Ray-Ban Display 眼鏡 2026 年下半年大型更新詳情,涵蓋導航、通知管理、Hologram 虛擬化身及 Explore 應用推薦。
OpenAI 推出面向開發者的新網誌,將刊載技術深入文章、版本更新説明及最佳實踐,並由工程師直接分享工具與功能資訊。首批兩篇文章包括 Realtime API 開發者備忘,聚焦整合 GA Realtime API 及新即時模型時涉及的重要技術變更。
OpenAI 整理 Realtime API 與 gpt-realtime 語音對語音模型進入 GA 後的介面變更、新功能及整合注意事項。文章建議客户遷移至 GA 介面,並説明 beta 與 GA 在功能支援、temperature 和非同步函式呼叫上的差異。
推薦理由:文章對照 beta 與 GA 的功能支援差異,並説明介面遷移、temperature 設定及長對話截斷的處理方式,方便開發者按整合環節核對需要調整的設定。
Dagster Labs 團隊運用 OpenAI Codex 加快技術教育文件撰寫、跨媒介內容改編,並評估文件完整度。他們透過完善 CONTRIBUTING.md,並把程式碼、文件與示例放在同一個程式碼庫,讓 Codex 協助解讀 PR、起草文件及製作影片講稿。此外,團隊讓 Codex 根據文件生成程式碼,再執行測試,並以程式能否按預期運作作為文件完整度的間接指標。
OpenAI 提供 ChatGPT app 設計指南,説明如何選擇使用場景,並將產品優勢拆成模型可在對話中調用的明確能力。文章以 Know、Do、Show 概括 app 的增值方式,建議聚焦少量操作,而非移植整個產品。指南亦涵蓋模糊與明確意圖下的互動、清晰的工具參數與結構化輸出、資料最小化及跨 app 協作。
OpenAI 發佈 gpt-4o-mini-transcribe-2025-12-15、gpt-4o-mini-tts-2025-12-15、gpt-realtime-mini-2025-12-15 及 gpt-audio-mini-2025-12-15 四款語音模型快照,並擴大 Custom Voices 開放範圍。
Skyscanner 的開發者將 OpenAI Codex CLI 透過 JetBrains 的 MCP server 接入 JetBrains IDE,讓 Codex 查詢 IDE 檢查結果及執行預設 run configurations,以縮短除錯、測試與開發工作流程。
OpenAI Developers 提供一套以 Evals 系統化測試、評分並改進 Codex Agent 技能的實踐流程。指南建議先定義可量度的成功條件,並以 10–20 條提示詞涵蓋技能應否觸發等情境。再用 codex exec --json 記錄 JSONL trace,對命令與檔案執行確定性檢查,並以 --output-schema 輸出結構化 rubric 評分風格要求。
Alpic 分享 ChatGPT Apps 開發的 15 項經驗,並將部分做法納入開源 Skybridge 框架及 chatgpt-apps-builder Codex 技能。
OpenAI 分享以 Skills、託管 shell 和服務端 compaction 構建長時間運行智能體的實作模式,涵蓋技能路由、容器復用與網絡配置。Glean 面向 Salesforce 的 skill 將評測準確率由 73% 提升至 85%,並令 time-to-first-token 縮短 18.1%。
推薦理由:文章將 Skills、shell 與服務端 compaction 的分工整理成長流程建構方法,並涵蓋技能路由、產物交接及網絡隔離等可複用設計。
OpenAI 宣佈即日起,Codex 可透過 Figma MCP server 在 Figma 與程式碼間雙向協作,並將運行中的介面轉成可編輯的 Figma frames。
OpenAI 為 Codex Code Review 加入自訂倉庫規則支援,讓它可按 AGENTS.md 中的指引檢查改動,並在審查發現中引用相關規則。在包含已知違規和安全反例的主要評測套件中,規則引導版本識別出 98% 的必要自訂問題,基線對照組為 58.3%。
OpenAI 介紹 Rosalind Workbench,讓每位科學家都能成為自己的研究團隊。它透過引導式任務、科學檢視器及定序分析,協助研究人員循研究問題從數據追尋證據。
OpenAI Developer Blog 彙列多篇 Codex 文章,涵蓋以 Codex 建立遊戲、進行建築視覺化、製作前端介面,以及自動化重複工程工作的案例。其他內容包括 Skills 與提示詞、Codex Security、遠端工程工作、程式碼審查規則、JetBrains MCP 整合,以及用 Evals 系統測試 Agent Skills 的指南。
OpenAI API 的 Audio & voice 文件聚焦於建立語音及即時語音體驗,並列於 API 開發文件導覽中。頁面其餘內容為開發者文件與資源入口,沒有提供音訊功能細節。
Hacker News 分享了 openid.net 上一份題為《面向 AI 智能體的身份管理》的 PDF,標示年份為 2025 年。頁面未提供文件內容細節。
消費者對 AI 內容的疲勞感已令人難以招架,討論主張本地商户重新考慮使用 AI。支持者認為,專業運用 AI 可製作媲美甚至勝過人工作品的內容,速度更快、成本更低。批評者稱,AI 產出有 99% 一眼可見地粗劣;他們所見的做法是未用過 AI 的人只輸入「a poster」,便採用首個結果。
Justin 推出 Breadcrumb,一款為 Mac 設計的本機工具,可記錄螢幕、會議及 AI 對話與操作,並整理為 AI 可搜尋的記憶和上下文規則。作者舉例,Claude 讀取會議記錄、調取螢幕時間線並檢查程式碼後,建立 14 張 JIRA 工單、附上 12 張截圖,並草擬 Slack 訊息。
這場討論聚焦如何評測智能體在雜亂真實公司知識中的檢索能力,並詢問 BEAM、MemEval、MemoryArena 等基準的參考價值。提問者亦詢問 Karpathy 的 Episodic/Procedural/Semantic 分類(Doxa/Koine/Gnosis)是否有用、與設計哪些部分相符,並追問能否公開資料抽取流程,讓其他公司自行比較,以推進可重現性。
Jev 等決策模型未能勝過 LLM-as-a-judge 或傳統分類器;用於智能體堆疊的條件分支決策時,模型須兼具良好校準與資訊性。神經網絡輸出 logits 對可約減的認知不確定性屬高度有損壓縮,令校準在實務上難以落實;高概率區域的估計亦會在輕微協變量偏移下不穩,令多步搜尋圖可能走向模型訓練或校準時未見的分支,甚至落在分佈外。