跳到正文
OpenAI News·· 16 小時前精選AI 評分60

Asana 以 GPT-6.1 Sol 將瀏覽器智能體測試成本降低 76 倍

Asana cuts model costs 76x in browser tests with GPT-6.1 Sol

AI 導讀

Asana 以 GPT-6 Astra 在 Codex 中進行實驗,優化 GPT-6.1 Sol 上的瀏覽器智能體工作流,較原有 Model B 生產配置成本低 76 倍、速度快 5 倍。團隊測試了延長瀏覽歷史快取、提高可保留文字量,以及分批移除截圖等改動。優化後的工作流平均每次估算成本為 $0.47,約需 4 分鐘;較大的歷史容量下,18 次測試均產生正確答案。

推薦理由

144 次測試對照了瀏覽歷史、文字保留量和截圖清理策略,呈現這些設定對智能體成本、速度與作答完成率的影響。

正文 · 繁體中文

Asana 使用 GPT‑6.1 Sol 進行瀏覽器測試,將模型成本降低 76 倍

Asana 使用 Codex 中的 GPT‑6 Astra 進行測試,令其瀏覽器 Agent 的成本降低 76 倍、速度提升 5 倍,從而能為客戶提供能力更強的模型。

聯絡銷售團隊

Image 1: White Asana logo over a blue layered-paper texture.

公司規模:大型企業

地區:北美

行業:科技

產品:Codex

76x

使用優化後的 GPT-6.1 Sol 工作流程,預計模型成本降低

5x

使用優化後的 GPT-6.1 Sol 工作流程,瀏覽器執行速度提升

$0.47

使用優化後的 GPT-6.1 Sol 工作流程,平均預計模型成本

分享

Asana 使用 Codex 中的 GPT‑6 Astra 進行實驗,優化了瀏覽器 Agent 使用 GPT‑6.1 Sol 的工作流程,令成本降低 76 倍、速度提升 5 倍。

Asana 透過 StackAI⁠(在新視窗中開啟) 協助客戶自動化跨商業應用程式的工作;StackAI 是其收購⁠(在新視窗中開啟)的平台。使用 StackAI,客戶無需編寫程式碼,便可建立能瀏覽網站、填寫表格及收集資訊的工作流程。在 Asana 的規模下,這些工作流程中的細微低效率累積起來,影響甚大。

Asana 的 StackAI 技術總監 Frank Hidalgo 博士,致力讓瀏覽器 Agent 執行得更快、成本更低。他指示 Codex 中的 GPT‑6 Astra 調查 Agent、測試改進方案並比較結果。他估計原本手動需時一至兩個月的工作,現在約一週便可完成。

Asana 的 144 次執行研究⁠(在新視窗開啟)測試了 GPT‑6.1 Sol 及另外三個前沿模型,本文分別稱為 Model A、B 和 C。最終在 GPT‑6.1 Sol 上採用的優化工作流程,平均每次執行的預計模型成本為 $0.47,耗時約四分鐘;與原本在 Model B 上使用的正式環境配置相比,成本降低 76 倍,速度提升 5 倍。

「這就是人類與 Agent 團隊在實際工作中的樣子。工程師制定方向,GPT-6 Astra 進行實驗,結果再經由 Command 部署至正式環境。這展示了 Asana 如何讓人類與 Agent 團隊協同工作。」

—Arnab Bose,Asana 首席產品總監

使用 GPT‑6 Astra 找出瀏覽器 Agent 的效率問題

為了加快進度,Hidalgo 先使用 Codex 中的 GPT‑6 Astra 梳理程式碼庫,並説明 Agent 如何建立每個模型請求。GPT‑6 Astra 發現,Agent 會快取固定指示和工具定義,卻不會快取逐漸累積的頁面文字及螢幕截圖紀錄,因此每次請求都會重新傳送整段紀錄,並按全額計費。

此外,Agent 幾乎每一步都會移除較舊的螢幕截圖並縮減文字內容。每次編輯都會改變紀錄,因此單是快取紀錄並無幫助;而失去這些資料,可能會令 Agent 需要重新瀏覽已讀取的頁面。

使用 GPT‑6 Astra,將原估計兩個月的研究時間縮短至一週

Hidalgo 檢視 GPT‑6 Astra 提出的改進方案後,選出三項進行測試:

  • 延長快取涵蓋範圍,將 Agent 的瀏覽紀錄也納入其中

  • 增加可保留的文字量

  • 改為分批移除螢幕截圖,而非每一步都移除

GPT‑6 Astra 先進行快速測試,找出哪些變數會影響結果。由於程式碼原本並非為受控實驗而設計,之後便重構程式碼,讓同一個前端和後端可同時支援多個工作流程,每個流程均可使用自己的設定。

Astra 完成了整項研究:測試 120,000 和 480,000 字元的歷史記錄容量,以及六種快取和截圖策略;四個模型各自使用每種策略測試三次(見下表)。表現最佳的策略會先累積最多 20 張截圖,然後縮減至只保留最新一張。這樣一來,每次移除內容前,較早的歷史記錄都能維持較長時間不變。配合較大的歷史記錄容量,這便成為最佳化工作流程。每種設定都執行相同任務:從公開示範目錄中,為 32 本書各收集六個欄位的資料;這項任務代表部分 Asana 客戶在 StackAI 上執行的工作。

模型 説明 價格
Model A 另一家前沿實驗室推出的較小型、價格較低的模型,於 2025 年秋季推出 價格是 GPT‑6.1 Sol 的一半
Model B 原先在正式環境中使用的模型,與 Model A 來自同一實驗室,於 2026 年夏季推出 價格與 GPT‑6.1 Sol 相同
Model C Model B 的更新版本,於 2026 年秋季推出 價格與 GPT‑6.1 Sol 相同
GPT‑6.1 Sol OpenAI 的模型

GPT‑6 Astra 執行工作流程,並檢視請求、用量記錄及輸出;另有獨立的模型工作階段審查工作成果。每個工作階段的請求、數據軌跡及結果都記錄在 Asana 的軟件交付平台 Command⁠(在新視窗開啟),讓團隊之後可以檢視整項研究。團隊在 Command 將研究結果整理成工單,再建立拉取請求,並將變更部署至正式環境。

「如果由我手動處理,這需要一至兩個月。使用 Codex 中的 GPT-6 Astra,大約一星期便完成:我會在睡前設定 /goal,早上再檢視結果。」

—Frank Hidalgo, PhD,Asana 的 StackAI 技術總監

每次執行的模型成本降至 $0.50 以下

對 Model B 而言,最佳化將模型成本估算值由每次至少 $36.21(部分原始測試在完成前已達到步驟上限)降至 $1.24,成本降低 29 倍。以 GPT‑6.1 Sol 執行的最佳化工作流程,成本再低 2.6 倍,每次只需 $0.47。最佳化工作流程的每次執行都完成了任務,並返回正確答案。

3 次執行的平均值。≥:基準測試包含達到上限的執行,因此其平均值是下限。

最右側兩個圖表區塊以最佳化後的 Model B 作比較。Model B 在同一項研究的第 1 階段執行,Model C 和 Sol 6.1 則在第 2 階段執行(虛線)。

只看 GPT‑6.1 Sol,並使用較大的歷史記錄容量時,新的快取和截圖策略將每次執行的成本降低了 4 倍,由 $1.97 降至 $0.47。每次呼叫的成本也低約 3 倍,因為 89% 的輸入來自快取,價格只有未快取內容的 5%。執行速度亦有所提升:Model B 的原始設定至少需時 22.5 分鐘,而 GPT‑6.1 Sol 的最佳化工作流程約需四分鐘。

3 次執行的平均值,誤差線表示標準差。≥:平均值包含達到上限或未完成的執行,因此實際值至少有這麼高。

長條圖採用藍色主題。比較快取效果時,請以 480k 的較大容量長條為準。

執行標記和標準差誤差線是根據來源圖片近似重建;未有原始執行數值及標準差資料。

3 次執行的平均值,誤差線表示標準差。≥:平均值包含達到上限或未完成的執行,因此實際值至少有這麼高。

長條圖採用藍色主題。比較快取效果時,請以 480k 的較大容量長條為準。

執行標記和標準差誤差線是根據來源圖片近似重建;未有原始執行數值及標準差資料。

調查亦顯示,歷史記錄管理會如何影響 Agent 能否產生答案。為 GPT‑6.1 Sol 提供更多空間保留瀏覽歷史記錄後,能產生答案的執行次數由較小歷史記錄預算下 18 次中有 3 次,增至較大預算下 18 次全部成功,而且每次答案都正確。對 Hidalgo 而言,這項工作的商業價值,在於讓客戶使用速度更快、能力更強的模型,同時維持可持續的營運成本。

「成本過去一直限制我們能為客戶提供哪些模型來處理這些工作負載。透過提升 Agent 的效率,我們可以為客戶提供更好、速度更快的模型,同時降低營運成本。」

—Frank Hidalgo, PhD,Asana 的 StackAI 技術總監

擴大實驗及產品測試規模

Asana 已在 StackAI 推出瀏覽器導覽方面的改動,並正開發工具,讓類似實驗更容易重複進行。團隊計劃日後將這類測試納入平台評估,讓客戶和內部團隊在設定 Agent 時,比較成本、執行時間和答案質素。

「發布速度已不再是瓶頸;人的注意力才是。我們正接近這樣的時代:每位工程師都是產品經理,帶領一整隊 Agent。」

—Frank Hidalgo, PhD,Asana 的 StackAI 技術總監

Asana 現正使用 Codex 中的 GPT‑6 Astra,在產品功能發布前進行測試:Astra 會在平台中瀏覽、嘗試不同輸入,並向人工 QA 審核人員報告錯誤。Hidalgo 認為,這是新一代軟件開發生命週期的基礎,屆時多個雲端 Agent 工作階段會並行測試功能。

完整研究報告可在 Asana⁠(在新視窗開啟)和 StackAI⁠(在新視窗開啟)的網誌閲讀。

加入工作的新時代

全球有超過 100 萬家企業正透過 OpenAI 取得實質成果。

聯絡銷售團隊

繼續閲讀

Image 2: Oracle — Cover

Oracle 如何透過 ChatGPT 和 Codex 將數天工作縮短至數分鐘 Oct 8, 2026

Image 3: 1Password > Card image > Fiber ridge close-up

1Password 如何透過 Codex 將工程生產力提升 21% Sep 8, 2026

Image 4: loveholidays customer story art card v4

loveholidays 如何透過 Codex 讓每個人都成為建構者 Aug 26, 2026

研究

最新進展

安全

產品

API 平台

商業

開發者

公司

支援

更多

條款 & 政策

(在新視窗開啟)(在新視窗開啟)(在新視窗開啟)(在新視窗開啟)(在新視窗開啟)(在新視窗開啟)(在新視窗開啟)

OpenAI © 2015–2026 你的私隱選擇

英文 美國

來源:OpenAI News · openai.com