一个任务,几乎耗光一周额度:Codex 不是 Skill 越多越好

AI 路口

一个任务,几乎耗光一周额度:Codex 不是 Skill 越多越好

Agent 的成本不仅取决于任务,还取决于它启动了多少流程。Skill 应按任务调用,而不是越多越好。

Dan JIN  ·  2026 年 7 月 15 日  ·  约 5 分钟阅读

一个任务,几乎耗光一周额度:Codex 不是 Skill 越多越好

一次并不复杂的 Codex 任务连续运行了一两个小时,几乎耗尽当周可用额度,最重要的功能却还没有完成。

执行记录里有大量规划、文件读取、任务拆分、测试和审查。每一步单独看都有理由,合在一起却没有形成与消耗相匹配的交付。

这次经历让我重新判断 Agent 的效率:不能只看它执行了多少步骤,还要看这些步骤是否必要。

使用量不只由输入长度决定

OpenAI 当前文档说明,ChatGPT Work 与 Codex 共享使用量。实际消耗会受到模型、任务规模、上下文、推理、工具调用、检索和缓存影响;相似任务也可能产生不同消耗。

因此,这次经历不能简单归因于某一个 Skill,也不能证明所有账号都会出现相同情况。可以确认的是:长时间运行、较大的上下文和更复杂的执行流程会增加使用量。

Skill 的价值,也是它的成本

Skill 是一套可复用的工作方法。它可以规定先读哪些材料、怎样修改、需要什么测试,以及最后如何验收。

对数据迁移、权限、安全、支付或大型重构来说,完整流程能减少遗漏。对于改一句文案、修一个明确问题或整理少量文件,同样的流程可能显得过重。

问题不在于 Skill 本身,而在于任务和流程没有匹配。

小任务不需要大型项目的完整待遇

可以把任务分成三档:

  • 小任务:直接修改,运行相关检查,汇报结果;
  • 中等任务:先写简短计划,完成实施和一次复核;
  • 高风险任务:使用完整计划、分工、测试、审查和回滚方案。

给 Agent 的要求也应说明停止条件:运行多久必须汇报、哪些文件不能动、什么结果算完成、遇到什么情况必须暂停询问。

评价 Agent,要看有效产出

一次任务是否高效,可以用四个问题检查:

  1. 交付了多少可以直接使用的结果?
  2. 减少了多少人工工作?
  3. 消耗了多少额度与运行时间?
  4. 还需要多少检查和返工?

如果输出了大量计划和审查记录,却没有完成核心功能,就不能把过程长度当成质量。

我后来减少了默认加载的复杂流程,需要时再调用。这个选择不是反对规范,而是把规范用在真正需要它的地方。

AI Agent 的能力会继续增加。更重要的使用能力,是知道什么时候增加工具,什么时候减少流程,以及什么时候让系统停下来汇报。


资料来源

图片说明: ACMFC 编辑部使用生成式 AI 辅助制作。独立编辑示意图,非相关品牌或机构官方视觉。图中额度、流程与数据为视觉示意。


原载:微信公众号文章