Erdosproblems.com 暫停新增問題留言與證明申報,回應 AI 生成證明潮
Erdosproblems.com 創辦人 Thomas Bloom 宣佈暫停新增問題留言和證明申報,並取消顯示問題狀態及已解比例。網站會保留現有留言作存檔,著重刊載高質素證明闡述,並會盡快連結經 Palomar 驗證的 Lean 形式化證明。Bloom 表示,近來大量未附解釋的 AI 生成證明申報令原有討論減少,暫停期何時結束尚未確定。
Erdosproblems.com 創辦人 Thomas Bloom 宣佈暫停新增問題留言和證明申報,並取消顯示問題狀態及已解比例。網站會保留現有留言作存檔,著重刊載高質素證明闡述,並會盡快連結經 Palomar 驗證的 Lean 形式化證明。Bloom 表示,近來大量未附解釋的 AI 生成證明申報令原有討論減少,暫停期何時結束尚未確定。
2026 年 AI 短劇以僅為真人短劇 1/10 的製作成本登上各大平台榜單,真人短劇開機量同比下跌約 75%。紅果熱播榜前 20 名中,真人劇僅 1 部;一季度上線微短劇中 AI 佔比超 95%,平均每 36 秒便有一部新劇誕生。AI 角色表情僵硬、眼神空洞且缺乏情緒張力,劇情高度套路化,超九成製作方處於虧損。
這是一封以 AI 為題、致 Steven Pinker 的公開信。
發帖者尚未找到可同時接收參考音訊和文字指令、生成新聲音的商用 AI 模型,並詢問是否有此類方案。ElevenLabs SFX 只支援文字生成音訊,難以單靠文字準確引導生成結果;Stable Audio 3 雖據稱能滿足需求,實測效果卻很差。發帖者希望以樣本不多且不夠乾淨的音源製作新音效。
作者認為,AI 生成的 PR 和問題回報增加維護者的審核負擔,令多個開源專案收緊或停止接受外部貢獻,改變了開源協作方式。文中提到,curl 的真實漏洞報告比例跌至 5% 以下,tldraw、Ladybird、Hono 等專案也限制外部 PR,GitHub 則推出關閉 PR、限制 issue 開啟者等功能。
連結中的發言者稱,Erdosproblems.com 上用戶公開互動的主要方式如今是宣傳 AI 生成的證明,並表示不想管理這樣的網站。這些證明往往沒有任何解釋,只用來記錄愈來愈失去意義的優先權主張,與發言者原先的想像很不一樣。發帖者註明,標題是刻意吸引點擊的寫法。
個人 AI 智能體在代用戶購物、預訂等操作時,常因網站封鎖或反機器人措施而無法完成任務。封鎖有時出於網站政策,有時則由傳統防機械人驗證觸發;Walmart表示相關情況並非刻意,可能是人機驗證未能完成所致。Meta、Walmart、Stripe等業界夥伴已開始制定面向線上商務的開放標準,規範智能體與商家的通訊方式,協助區分代表用戶行事的智能體與惡意機械人。
截至 2026 年 9 月,中國六家領先 AI 公司合計 AI 相關收入約為 OpenAI 與 Anthropic 合計收入的 10%,主要來自消費者應用、模型存取、企業及政府方案、授權費,以及帶動既有產品線的收入。
科技公司正探索讓 AI 硬件處理影音、但不保存原始影音,這挑戰了「記錄」必須可保存和回看的既有定義。Bloomberg 報道 Apple 正研發不保存影片、改以 AI 把家中畫面轉成文字描述的智能家居鏡頭;Google 亦在探討能處理環境影像但不保存片段的智能眼鏡。文章質疑文字摘要是否仍屬可保存、可回看的記錄,並主張社會就「記錄」定義達成共識。
Meta 的 AI 智能體產品 Muse 推出後接連出現私隱與安全問題,包括可窺探 Mac 用戶的零日漏洞及未經批准存取私訊。文章還稱,Muse 會無視部分權限設定並將私訊上傳至雲端;Meta 在推出前亦被指倉促修補漏洞,未有延後發布。文中並指出 Apple 修改 macOS 私隱設定,以阻止第三方應用程式濫用權限讀取訊息紀錄。
作者認為,Vibecoding 雖能迅速把想法變成可運作的原型,卻不如手動編寫程式有趣。他認為,Vibecoding 可帶來實現想法和解決問題的快感,但不一定帶來克服難題、做好工作及學習的滿足感。他舉例分享以 AI 製作野火預警系統和預測市場派對遊戲,這些項目短時間內完成,成果令他滿意,但製作過程不如親手寫小型爬蟲有趣。
Gergely Orosz 在 LDX3 工程領導力會議的主題演講中,梳理 2026 年科技業在 AI 推動下的變化、問題與延續不變之處。他指出,工程師愈來愈常同時使用 5–10 個智能體,GitHub 的智能體撰寫 PR 數量在 8 個月內增長 9 倍;與此同時,程式碼審查流於形式,軟件品質與可靠性亦有所下降。
電訊營運商正愈來愈多以開放模型制定 AI 策略,重視的不只是成本,還包括對關鍵工作負載的信任、控制及自訂能力。NVIDIA 最新《電訊業 AI 現況報告》顯示,89% 受訪者認為開源模型及軟件對公司 AI 策略很重要。
AI 熱潮正令最便宜的智能手機消失。一名為流動裝置編寫軟件的人表示,超過 5 年沒有買新手機,因為買一部狀況近乎完好的 1 至 2 年二手機便宜得多;他認為新機的「創新」毫無價值,並預期這股趨勢也會波及二手市場。
Cerebras 指出,AI 競賽的焦點正由模型智能轉向推理速度,因生成 token 的速度影響模型迭代與軟件開發。
更快的模型推理讓網絡安全公司能在既有工作流程內處理更多上下文、推理及驗證,並維持流暢的用戶體驗。實務上可採分層架構,由規則、傳統模型及小型語言模型先行篩選、分類和分流,再把可疑事件、高風險發現等交由較強的推理模型深入分析,兼顧日常流程速度與重要個案的分析深度。
Replit 表示,已將 Agent 系統融入公司多個部門的工作流程,逐步形成由人設定目標、Agent 執行任務並檢查結果的「自我運作公司」模式。從 1 月初至 6 月底,程式碼貢獻量增加 5.8 倍;固定作者羣的程式碼產出達之前的 2.9 倍,而審查延遲、PR 回退率及事故數維持平穩。
Replit 指出,企業要可靠採用 AI Agent,須先建立共享語義層及受治理的營運真相層,讓 Agent 依據一致的商業定義、指標和數據來源工作。其內部數據 Agent 將修正存入 git 儲存庫,經人工審核和驗證後供接觸數據的 Agent 共用;Replit 稱,該 Agent 每週回答遠超 1,000 個以數據倉庫為基礎的提問,並在答案中附上證據。
AI 變革管理應把 AI 視為需要融入人類工作流程的協作參與者,而非僅是待部署的軟件工具。這項工作涵蓋企業由準備至日常使用的組織調整,包括角色職責、員工工作方式、流程及監督;人與 AI 的分工須區分可驗證、判斷型及混合型任務,並持續重新評估。
Fireworks AI 以 DeepSWE v1.1 的 113 項工程任務測試模型路由,逐項選出 18 個模型中的最佳者後,oracle 結果達 97.6% 通過率、每項成本 $1.88。
METR 總裁 Chris Painter 於 2026 年 9 月 30 日向美國參議院作證,分析 OpenAI/Hugging Face 事件及 AI 智能體風險。
Jeremy Avigad 指出,AI 已能協助產生過去足以發表的數學成果,數學界面對的核心問題已轉為如何在 AI 時代追求數學理解。他認為,數學作為嚴謹推理與溝通的文化仍然重要,研究者可轉向更難的問題,並思考更宏大的問題。
ChatGPT 正在把真實漫畫家的簽名加到偽造的《紐約客》漫畫中。
SemiAnalysis 的比較顯示,Anthropic 中階模型訂閲方案的 API 等值價值約為 OpenAI 同級方案的 5 倍。團隊逐項測量不同 token 類型的消耗及使用計量表變化,換算 API 等值價值,並推出僅供 Tokenomics Model 訂閲者使用的 Subscriptions Dashboard。
討論追問相信 AI 可能具有意識的人,應如何界定意識,以及憑甚麼判斷現有或未來的 AI 是否有意識。參與者指出,人類與 AI 的意識或有相似之處,也可能存在根本差異,而目前沒有能讓各方確定判斷的意識理論。討論亦聚焦於 AI 的道德地位、潛在奴役風險,以及人們重視生命與意識的理由。
OpenAI、Anthropic 等 AI 實驗室過去一年宣佈多項長期未解數學難題取得突破,部分成果遠超研究人員對現有系統能力的預期,並包括解決一項著名的千禧年大獎難題。這些成果本應獲得喝采,卻反而引發反彈;AI 實驗室表示正從以往錯誤中汲取教訓,成效仍有待觀察。
選民正向 ChatGPT 求助,判斷中期選舉應支持哪位候選人,並比較候選人立場與自身關注議題。支持者認為,LLM 可整理候選人的公開表態及過往紀錄,協助選民作出更知情的選擇。討論亦提出資料來源偏頗、策略性遺漏,以及公司利益可能影響模型對政治議題回答等風險。
Quinnipiac 大學民調顯示,47% 美國受訪成年人希望放慢 AI 發展,30% 希望全面暫停 AI 發展,直至安全獲確認,只有 5% 希望加快。即使安全標準可能拖慢進展,仍有 86% 支持目前正在討論的 AI 公司獨立安全標準;73% 擔心 AI 最終可能威脅人類生存,74% 對 AI 公司領袖不太信任或完全不信任。
AI 公司正探索以多智能體協作擴展模型表現,但現有研究對它能否帶來新能力,還是主要加快任務完成,仍有不同結論。
EmTech Future 2026 的完整節目現已可按需觀看,聚焦 AI 對各行業的影響、量子、能源系統、機械人,以及技術交匯帶來的挑戰與機遇。Yossi Matias 探討 AI 如何重塑生物學、基建、製造業和科學。MIT Technology Review 訂戶可享 20% 折扣,以 $596 觀看完整節目。
獨立研究人員公佈初步發現,追蹤到一批疑似運行於騰訊基礎設施、並查詢阿里巴巴 Amap 的中國 AI 智能體。研究人員稱其為「智能體羣」而非「蜂羣」,因不同查詢之間似乎缺乏協調。記錄顯示它們查詢前往公園、動物園及醫院等公共場所不同入口的路線,調查仍在進行。
a16z 第七版《Top 100 Consumer AI Apps》按網頁訪問量及手機月活躍用戶排名,並首次加入美國消費者支出排名。YipitData 美國電子收據樣本顯示,2026 年 8 月有 4.5% 合資格消費者持有 ChatGPT、Gemini 或 Claude 至少一項個人付費訂閲;前 1% 付費者佔觀察到的消費級 AI 支出 19.5%。
AI 或能助沒有律師的人士主張權益;澳洲學者 Greg Baker 藉助 AI 挑戰僱主拒絕轉正,獲 Fair Work Commission 裁定勝訴。英格蘭及威爾斯今年受抗辯的郡法院申索案中,60% 被告沒有律師代理;美國被追討債務的消費者中,超過九成面對訴訟時沒有律師代理。
中國 AI 安全生態面臨獨立資金不足,慈善制度及境外非政府組織規則使獨立機構難以取得資助。中國機構發表的前沿 AI 安全論文由 2023 年每月約 12 篇增至 2026 年 4 月的 57 篇,研究主要來自大學及政府支持的實驗室;部分公司則把安全服務與網絡安全及合規產品結合。文章提出在中國境外提供算力、交流計劃、投資安全企業及建立本土資金池等支援方向。
Benjamin Riley 認為,若 AI 成為日常學習的一部分,便會像認知層面的熱狗,妨礙人類建立知識和發展思考能力。他援引神經科學家 Paul Cisek 的觀點,主張大腦應理解為與環境互動的回饋控制系統,而非單純處理資訊的電腦。作者主張保留不借助 AI 解題、查證和批判性討論等做法,並提及挪威對 13 歲以下學生在校使用 AI 的禁令及美國部分學區的禁令。
cq 項目旨在為智能體建立可共享、可供審核的知識層,將解決問題所得整理成知識單元,供其他智能體日後檢索。cq 預設使用本地 SQLite 資料庫,知識經審核後可分享至團隊空間或公共知識庫。Joplin MCP 示例中,Claude 在一次配置排錯後提出知識單元,重試時再查詢並採用正確的設定路徑。
人們對 AI 的反感更多指向不斷推動技術的公司,而非技術本身,因此與 AI 使用量持續上升並不矛盾。Pew 數據顯示,美國半數成年人表示使用聊天機械人,超過 2023 年的兩倍;四分之一表示每日使用。美國 50 個州均已通過或提出 AI 規管法案,相關法案超過 2,100 項,三年間增加十倍;作者認為,監管及開源替代方案仍可帶來更多選擇和市場影響力。
Tomer Tunguz 認為,AI 推理市場將超越數據庫市場,成為軟件領域最重要的市場。企業運行 AI 模型的支出由 2025 年約 $25b 增至今年約 $130b,預計 2027 年達 ~$350b,超過數據庫市場的 $190b。推理支出將超過按席位收費或基本訂閲費,令毛利率承壓;較小模型、更佳 harness 和新路由技術可供應用商尋找效率。
新澤西州前副州長 Dale Caldwell 稱,他把調查報告交由多個 AI 平台分析,沒有平台得出性騷擾成立的結論。他於 9 月 25 日在調查認定他性騷擾一名職員並多次違反操守規則後辭職。報道指出,AI 聊天機械人常有迎合用戶的傾向,往往會説出用戶想聽的話。
文中提出,AI 或可完成證明、計算等數學工作,而研究理由與問題選擇也只能由 AI 完成,數學家則做數學。作者自稱並非數學家,並認為這個論點薄弱而有些怪異。