协作办公软件巨头Asana借助Codex中的GPT-6 Astra对浏览器AI智能体展开架构优化,在GPT-6.1 Sol上实现了运行成本降低76倍、速度提升5倍的突破。原本需人工耗时两月的实验周期被压缩至一周。

通过旗下收购的无代码自动化平台 StackAI,企业协作软件巨头 Asana 允许用户跨业务应用构建自动化工作流,无需编写代码即可自动浏览网页、填写表单及采集信息。但在庞大的企业调用规模下,自动化流程中的细微低效都会迅速放大为高昂的算力成本。
为了打破这一瓶颈,Asana 旗下 StackAI 首席技术官 Frank Hidalgo 博士借助 Codex 环境下的 GPT-6 Astra 对浏览器 AI 智能体进行了全面排查与优化。原本人工需要耗费一至两个月的调优测试,在 AI 的协助下仅用一周便告完成。
在包含 144 次对比运行的实验中,团队测试了 GPT-6.1 Sol 与另外三款业界前沿模型。最终,迁移至 GPT-6.1 Sol 架构下的优化工作流将单次任务的模型推理成本压低至 0.47 美元,运行耗时缩短至约 4 分钟,相比此前线上部署的基线模型,实现了成本降低 76 倍、速度提升 5 倍的显著飞跃。
为了快速定位瓶颈,Hidalgo 首先让 Codex 中的 GPT-6 Astra 梳理代码库,解析智能体向模型发起请求的底层机制。分析很快发现了两处核心缺陷:
针对上述问题,GPT-6 Astra 提出了对应的重构方案,Hidalgo 选定了三项关键调整进行验证:将缓存机制扩展到浏览历史、扩充智能体单次保留的文本上限、以及将屏幕截图由每步丢弃改为批量清理。
为了支撑可控变量对比,GPT-6 Astra 自主重构了测试代码,使一套前后端系统能同时并发评测不同参数的多条工作流。随后,Astra 执行了完整的控制变量实验,在四款模型上横跨两种历史上限(12 万与 48 万字符)及六种截屏与缓存策略展开交叉评测。基准任务统一设定为从公开图书目录中抓取 32 本书的 6 项关键字段。
测试发现,最优策略是允许截图累积至 20 张后再统一裁剪保留最新一张。这种做法既保证了请求历史在长周期内稳定不发生变动(充分命中缓存),又避免了超长上下文溢出。测试期间所有的调用链路、Token 消耗均沉淀在 Asana 的研发平台 Command 中,随后自动生成工单和 Pull Request,直接合并部署到生产环境。
优化成效立竿见影:对于原生产环境使用的 Model B,单次预估模型成本从基线状态的超 36.21 美元降至 1.24 美元,降幅达 29 倍;而在 GPT-6.1 Sol 上,成本进一步缩减至 0.47 美元,任务达成率达到 100%。
在 GPT-6.1 Sol 单项测试中,更大的上下文预算结合新缓存机制使运行成本下降了 4 倍。其中 89% 的 Prompt 输入直接命中上下文缓存,缓存命中的 Token 价格仅为原价的 5%。耗时也从最初的 22.5 分钟以上锐减至 4 分钟左右。
此外,上下文历史管理直接决定了智能体的任务成败。在小容量历史设定下,GPT-6.1 Sol 在 18 次测试中仅有 3 次能正常输出有效结论;而在扩大上下文并合理缓存后,18 次测试全部成功完成并给出了准确答案。
目前,该项浏览器导航优化已正式上线 StackAI,Asana 还在构建标准化评测套件,以便客户与内部团队在配置智能体时能够直观权衡成本、时延和回答质量。
不仅如此,Asana 已经开始利用 Codex 中的 GPT-6 Astra 开展上线前的日常功能测试:AI 智能体自主在平台界面中操作、输入各种边界用例并向人工 QA 团队提交 Bug 报告。Hidalgo 认为,这标志着软件开发生命周期正在迎来全新范式——产品交付的瓶颈已不再是研发速度,而是人类的专注力,未来的工程师将更像统领一群 Agent 舰队的产品经理。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断