Asana 以 GPT-6.1 Sol 將瀏覽器智能體測試成本降低 76 倍
Asana cuts model costs 76x in browser tests with GPT-6.1 Sol
Asana 以 GPT-6 Astra 在 Codex 中進行實驗,優化 GPT-6.1 Sol 上的瀏覽器智能體工作流,較原有 Model B 生產配置成本低 76 倍、速度快 5 倍。團隊測試了延長瀏覽歷史快取、提高可保留文字量,以及分批移除截圖等改動。優化後的工作流平均每次估算成本為 $0.47,約需 4 分鐘;較大的歷史容量下,18 次測試均產生正確答案。
144 次測試對照了瀏覽歷史、文字保留量和截圖清理策略,呈現這些設定對智能體成本、速度與作答完成率的影響。
Asana 使用 GPT‑6.1 Sol 進行瀏覽器測試,將模型成本降低 76 倍
Asana 使用 Codex 中的 GPT‑6 Astra 進行測試,令其瀏覽器 Agent 的成本降低 76 倍、速度提升 5 倍,從而能為客戶提供能力更強的模型。

公司規模:大型企業
地區:北美
行業:科技
產品:Codex
76x
使用優化後的 GPT-6.1 Sol 工作流程,預計模型成本降低
5x
使用優化後的 GPT-6.1 Sol 工作流程,瀏覽器執行速度提升
$0.47
使用優化後的 GPT-6.1 Sol 工作流程,平均預計模型成本
分享
Asana 使用 Codex 中的 GPT‑6 Astra 進行實驗,優化了瀏覽器 Agent 使用 GPT‑6.1 Sol 的工作流程,令成本降低 76 倍、速度提升 5 倍。
Asana 透過 StackAI(在新視窗中開啟) 協助客戶自動化跨商業應用程式的工作;StackAI 是其收購(在新視窗中開啟)的平台。使用 StackAI,客戶無需編寫程式碼,便可建立能瀏覽網站、填寫表格及收集資訊的工作流程。在 Asana 的規模下,這些工作流程中的細微低效率累積起來,影響甚大。
Asana 的 StackAI 技術總監 Frank Hidalgo 博士,致力讓瀏覽器 Agent 執行得更快、成本更低。他指示 Codex 中的 GPT‑6 Astra 調查 Agent、測試改進方案並比較結果。他估計原本手動需時一至兩個月的工作,現在約一週便可完成。
Asana 的 144 次執行研究(在新視窗開啟)測試了 GPT‑6.1 Sol 及另外三個前沿模型,本文分別稱為 Model A、B 和 C。最終在 GPT‑6.1 Sol 上採用的優化工作流程,平均每次執行的預計模型成本為 $0.47,耗時約四分鐘;與原本在 Model B 上使用的正式環境配置相比,成本降低 76 倍,速度提升 5 倍。
「這就是人類與 Agent 團隊在實際工作中的樣子。工程師制定方向,GPT-6 Astra 進行實驗,結果再經由 Command 部署至正式環境。這展示了 Asana 如何讓人類與 Agent 團隊協同工作。」
—Arnab Bose,Asana 首席產品總監
使用 GPT‑6 Astra 找出瀏覽器 Agent 的效率問題
為了加快進度,Hidalgo 先使用 Codex 中的 GPT‑6 Astra 梳理程式碼庫,並説明 Agent 如何建立每個模型請求。GPT‑6 Astra 發現,Agent 會快取固定指示和工具定義,卻不會快取逐漸累積的頁面文字及螢幕截圖紀錄,因此每次請求都會重新傳送整段紀錄,並按全額計費。
此外,Agent 幾乎每一步都會移除較舊的螢幕截圖並縮減文字內容。每次編輯都會改變紀錄,因此單是快取紀錄並無幫助;而失去這些資料,可能會令 Agent 需要重新瀏覽已讀取的頁面。
使用 GPT‑6 Astra,將原估計兩個月的研究時間縮短至一週
Hidalgo 檢視 GPT‑6 Astra 提出的改進方案後,選出三項進行測試:
延長快取涵蓋範圍,將 Agent 的瀏覽紀錄也納入其中
增加可保留的文字量
改為分批移除螢幕截圖,而非每一步都移除
GPT‑6 Astra 先進行快速測試,找出哪些變數會影響結果。由於程式碼原本並非為受控實驗而設計,之後便重構程式碼,讓同一個前端和後端可同時支援多個工作流程,每個流程均可使用自己的設定。
Astra 完成了整項研究:測試 120,000 和 480,000 字元的歷史記錄容量,以及六種快取和截圖策略;四個模型各自使用每種策略測試三次(見下表)。表現最佳的策略會先累積最多 20 張截圖,然後縮減至只保留最新一張。這樣一來,每次移除內容前,較早的歷史記錄都能維持較長時間不變。配合較大的歷史記錄容量,這便成為最佳化工作流程。每種設定都執行相同任務:從公開示範目錄中,為 32 本書各收集六個欄位的資料;這項任務代表部分 Asana 客戶在 StackAI 上執行的工作。
| 模型 | 説明 | 價格 |
|---|---|---|
| Model A | 另一家前沿實驗室推出的較小型、價格較低的模型,於 2025 年秋季推出 | 價格是 GPT‑6.1 Sol 的一半 |
| Model B | 原先在正式環境中使用的模型,與 Model A 來自同一實驗室,於 2026 年夏季推出 | 價格與 GPT‑6.1 Sol 相同 |
| Model C | Model B 的更新版本,於 2026 年秋季推出 | 價格與 GPT‑6.1 Sol 相同 |
| GPT‑6.1 Sol | OpenAI 的模型 |
GPT‑6 Astra 執行工作流程,並檢視請求、用量記錄及輸出;另有獨立的模型工作階段審查工作成果。每個工作階段的請求、數據軌跡及結果都記錄在 Asana 的軟件交付平台 Command(在新視窗開啟),讓團隊之後可以檢視整項研究。團隊在 Command 將研究結果整理成工單,再建立拉取請求,並將變更部署至正式環境。
「如果由我手動處理,這需要一至兩個月。使用 Codex 中的 GPT-6 Astra,大約一星期便完成:我會在睡前設定 /goal,早上再檢視結果。」
—Frank Hidalgo, PhD,Asana 的 StackAI 技術總監
每次執行的模型成本降至 $0.50 以下
對 Model B 而言,最佳化將模型成本估算值由每次至少 $36.21(部分原始測試在完成前已達到步驟上限)降至 $1.24,成本降低 29 倍。以 GPT‑6.1 Sol 執行的最佳化工作流程,成本再低 2.6 倍,每次只需 $0.47。最佳化工作流程的每次執行都完成了任務,並返回正確答案。
3 次執行的平均值。≥:基準測試包含達到上限的執行,因此其平均值是下限。
最右側兩個圖表區塊以最佳化後的 Model B 作比較。Model B 在同一項研究的第 1 階段執行,Model C 和 Sol 6.1 則在第 2 階段執行(虛線)。
只看 GPT‑6.1 Sol,並使用較大的歷史記錄容量時,新的快取和截圖策略將每次執行的成本降低了 4 倍,由 $1.97 降至 $0.47。每次呼叫的成本也低約 3 倍,因為 89% 的輸入來自快取,價格只有未快取內容的 5%。執行速度亦有所提升:Model B 的原始設定至少需時 22.5 分鐘,而 GPT‑6.1 Sol 的最佳化工作流程約需四分鐘。
3 次執行的平均值,誤差線表示標準差。≥:平均值包含達到上限或未完成的執行,因此實際值至少有這麼高。
長條圖採用藍色主題。比較快取效果時,請以 480k 的較大容量長條為準。
執行標記和標準差誤差線是根據來源圖片近似重建;未有原始執行數值及標準差資料。
3 次執行的平均值,誤差線表示標準差。≥:平均值包含達到上限或未完成的執行,因此實際值至少有這麼高。
長條圖採用藍色主題。比較快取效果時,請以 480k 的較大容量長條為準。
執行標記和標準差誤差線是根據來源圖片近似重建;未有原始執行數值及標準差資料。
調查亦顯示,歷史記錄管理會如何影響 Agent 能否產生答案。為 GPT‑6.1 Sol 提供更多空間保留瀏覽歷史記錄後,能產生答案的執行次數由較小歷史記錄預算下 18 次中有 3 次,增至較大預算下 18 次全部成功,而且每次答案都正確。對 Hidalgo 而言,這項工作的商業價值,在於讓客戶使用速度更快、能力更強的模型,同時維持可持續的營運成本。
「成本過去一直限制我們能為客戶提供哪些模型來處理這些工作負載。透過提升 Agent 的效率,我們可以為客戶提供更好、速度更快的模型,同時降低營運成本。」
—Frank Hidalgo, PhD,Asana 的 StackAI 技術總監
擴大實驗及產品測試規模
Asana 已在 StackAI 推出瀏覽器導覽方面的改動,並正開發工具,讓類似實驗更容易重複進行。團隊計劃日後將這類測試納入平台評估,讓客戶和內部團隊在設定 Agent 時,比較成本、執行時間和答案質素。
「發布速度已不再是瓶頸;人的注意力才是。我們正接近這樣的時代:每位工程師都是產品經理,帶領一整隊 Agent。」
—Frank Hidalgo, PhD,Asana 的 StackAI 技術總監
Asana 現正使用 Codex 中的 GPT‑6 Astra,在產品功能發布前進行測試:Astra 會在平台中瀏覽、嘗試不同輸入,並向人工 QA 審核人員報告錯誤。Hidalgo 認為,這是新一代軟件開發生命週期的基礎,屆時多個雲端 Agent 工作階段會並行測試功能。
完整研究報告可在 Asana(在新視窗開啟)和 StackAI(在新視窗開啟)的網誌閲讀。
加入工作的新時代
全球有超過 100 萬家企業正透過 OpenAI 取得實質成果。
繼續閲讀

Oracle 如何透過 ChatGPT 和 Codex 將數天工作縮短至數分鐘 Oct 8, 2026

1Password 如何透過 Codex 將工程生產力提升 21% Sep 8, 2026

loveholidays 如何透過 Codex 讓每個人都成為建構者 Aug 26, 2026
研究
最新進展
安全
產品
- ChatGPT(在新視窗開啟)
- ChatGPT Business(在新視窗開啟)
- ChatGPT Enterprise(在新視窗開啟)
- ChatGPT for Education(在新視窗開啟)
- Codex
- Dots(在新視窗開啟)
- 版本更新
API 平台
商業
開發者
公司
支援
更多
條款 & 政策
(在新視窗開啟)(在新視窗開啟)(在新視窗開啟)(在新視窗開啟)(在新視窗開啟)(在新視窗開啟)(在新視窗開啟)
OpenAI © 2015–2026 你的私隱選擇
英文 美國
來源:OpenAI News · openai.com