Claude的“努力值”罗生门:当推理变成一种昂贵的消耗品
【Claude的“努力值”罗生门:当推理变成一种昂贵的消耗品】近期大量开发者发现Anthropic在Claude Code中进行秘密A/B测试:用户选择了“高强度”推理,模型却在后台显示为“低强度”或表现得极其低效。最典型的案例是,原本两分钟能修好的配置文件,Opus 5却花了43分钟去拉取容器、跑沙盒,甚至在无关代码上反复横跳。Anthropic官方回应称这只是显示数值的映射变化,不影响性能,但用户感知的却是模型变得话痨、傲慢且难以沟通。这件事揭示了当前AI服务的一个尴尬现状:当模型厂商按Token计费时,他们天然缺乏“让模型保持简洁”的动力。为了在榜单上刷出高分,模型被训练得过度思考,产生大量冗余的思维链,而这些成本最终都由用户买单。这不再单纯是技术迭代,而是一场关于算力成本与用户信任的博弈。当“推理能力”变成一种黑盒式的订阅服务,用户就像在租用一个随时可能被调低智商的虚拟大脑。如果闭源模型继续在透明度上玩捉迷藏,开发者转向DeepSeek或开放权重模型将不是因为它们更强,而是因为它们更可控。