8月23日,有开发者报告称 Anthropic 正在 Claude Code 中 A/B 测试动态推理努力级别与 token 预算机制:简单任务自动降级为轻量响应,复杂重构则维持高深度链条。这一调整直接针对代理日常运行中的 token 消耗与延迟痛点。
代理经济正从“能跑”转向“能省”。此前前沿模型普遍追求最大推理深度,OpenAI 与 Google 的代理方案多依赖固定高努力配置,导致企业知识检索或长会话场景成本居高不下。Anthropic 此举通过服务器端配置动态映射努力值,早期反馈显示常规编码会话延迟显著降低,同时保留关键任务的推理强度。
对比 Pinecone 等检索层在企业基准上击败纯模型代理的案例可见,未来胜负手已不止模型参数,而是端到端资源调度能力。Anthropic 这一实验若规模化,将迫使 OpenAI 等对手加速类似自适应机制,否则在代理编排与成本敏感场景中将面临劣势。
悬念在于:动态努力级别能否成为新常态,还是仅限 CLI 工具的临时优化?若 Anthropic 后续将其推广至 API 层,代理经济的分水岭或将提前到来。
信源:https://blogs.techbytes.app/tech-pulse-daily/2026/august/23/
https://blogs.techbytes.app/posts/anthropic-claude-code-ab-tests-reduced-effort-levels-2026/










