用 Claude Code 这类编程智能体的人大多有同一种体验:感觉才干了没多久,「已达使用上限,请稍后再来」的提示就弹了出来。编程智能体在翻代码库、推理、调用工具的过程中能烧掉惊人的 token 量,有时候一件并不复杂的活,它在后台想的时间比动手的时间还长。

XDA 撰稿人 Mahnoor Faisal 分享,她只改了一个设置,五项任务合计的输出 token 就少了 45%,而结果质量看不出明显下降。
一、这个设置到底在管什么
Claude Code 里控制这件事的是 effort(努力程度)。新一代模型采用自适应推理,模型会自行判断某一步值不值得深想;effort 则决定它能动用多大的推理空间。想得越多,等待越久、额度掉得越快——难题上这笔账划算,日常小活上就不一定了。
在受支持的新模型上共有五个档位:
- low:范围明确的短任务,速度优先于最高智能。
- medium:为成本敏感的工作降低 token 消耗,可能牺牲一部分能力。
- high:平衡档,多数模型的默认值,Sonnet 5 在 Claude Code 上就默认这一档。
- xhigh:留出更深的推理空间,token 成本明显更高。
- max:推得更远,但 Anthropic 自己也提示存在边际递减、容易过度思考。
同一个菜单里还有 Ultracode,严格说它不是档位,而是把 xhigh 级推理和 Claude Code 的动态工作流编排组合起来,用于处理更重的任务。
二、改的具体位置
- 在 Claude Code 会话里直接输入
/effort,从弹出的列表里选档,随时可切。 - 也可以在
/model菜单中拖动 effort 滑块调整。 - 想长期固定,设置环境变量
CLAUDE_CODE_EFFORT_LEVEL,取值为 low、medium、high、xhigh、max。
三、实测降幅
该撰稿人先让 Sonnet 5 保持默认的 high 档,跑五项任务并记录每次的用量报告;随后把代码库重置回同一个未改动的版本,切到 medium 用完全相同的提示词重跑一遍,确保唯一变量就是这个设置。
- 修复 bug:high 约 2000 个输出 token,medium 约 1500,减少 25%
- 新增搜索功能:14400 降到约 7500,减少近 48%
- 重构代码:减少约 54%
- 提升测试覆盖率:减少 40%
- 定位并修复性能瓶颈:减少 39%
五项加总,high 用掉约 26000 个输出 token,medium 约 14300,降幅 45%。质量方面 medium 五项全部完成:让它找测试覆盖不足的逻辑时,两个档位各自独立选中了同一个任务完成函数、发现同一个 bug、给出同样的一行修复,12 项测试全部通过;让它排查性能问题时,两档也指向同一处。
注意事项
这不等于建议永久锁死在 medium。复杂的调试会话、架构层面的取舍,把档位调回 high 甚至 xhigh 更划算。更实际的做法是默认从 medium 起步,等任务真的给出理由再往上加。max 会更快吃掉用量额度,按会话临时启用即可。
来源:XDA Developers







