你用不好 Agent,不是提示词写得差。 是你还在当监工。

你用不好 Agent,不是提示词写得差。

是你还在当监工。

前两天我又把《AI炼金术》余一那期翻出来听。节目在小宇宙,栏目是徐文浩、任鑫做的。她把自己管的那一堆 Agent,说成一家百人公司。

她的原话,表里记的是:
「一个人调度100个agent的产出,可能超过1000个不用AI的人。」
(这条我没对上音频原文,先当她的主张,不写成我核实过的事实。)

我第一反应:夸张。
后来听明白了。她说的不是你真雇了一千人。是你还在用管十个人的办法,去管一百个。十个人你可以盯。一百个你再盯,公司会死,你也会死。

说白了,瓶颈不是模型。瓶颈是你。

节目里有个画面。余一站在台下,打开一份自己没看过的 PPT,按播放。屏幕上用她的声音讲四十来分钟。选题、资料、排版、配音、短视频,她给的指令就一句话:启动全自动模式。节目录了六分钟快进,机器实际干了四十分钟,中间零确认。
试错成本她算过:翻车大概五十块 token。她要是全程盯着,时薪可比这贵。
这些数字来自节目页和表内摘要,不是我现场看过她的后台。

我自己吃过这个亏。
做 Token.Step 的时候,我抱着电脑盯了三天,手动循环,人先累死。后来改 Goal 模式:晚上睡觉前让它开始运行,早上起来验收就行了。那一刻我才承认——这不是提示词问题,是管理问题。

好的 Goal,我后来就管五件事:目标、证据、边界、迭代、停止。中间那一长串「先做这个再做那个」,别再贴在对话框里。

余一比我说得更狠。她给 Agent 画红绿灯。
绿灯:材料齐、流程清、没大风险,自己干,别汇报。
黄灯:可逆的,先做再告诉她,事后可以骂。
红灯:涉及钱、改底层、不可逆,写进异步文档,等她批。

她还故意不管。有次短视频标题叫「棉手套」,她当时就觉得这词太抽象,观众看不懂。她没改。发出去,把播放、完播、点赞丢回去,让它自己复盘。机器后来自己说出一句人话:棉手套引发的是困惑,不是好奇。困惑是完全不知道在说啥。好奇才是大概知道、想看细节。

这事我不敢写成「标题实验数据」——表内有复盘原话,我没拿到那条视频的后台数字。能用的只有方法:你不把一手反馈交给它,它学到的就只是「怎么让老板满意」。

第二点更损。很多人所谓复利,就是让 AI 写 lessons.md。写了两万字,下次还犯同样的错。
余一骂过这种做法。她要的不是日记。是改执行路径:更新 Skill、加 Hook、写检查脚本。一句话下次不能改变行为,就不配进系统。

「我不希望他的复利给我积累的是一堆细节的经验,而是希望他压缩到说这个问题背后到底是哪一类问题。」

这句是表内金句,C 级,是她的,不是我的。

我这边能对上的亲历,是另一件事。招聘卡住半年,小四百人来,见一个不对一个。后来让两个 AI 吵了二十来分钟,才发现我问错了:我以为缺一个做内容的人,其实缺的是能让我专心做内容的人。运营消耗是失血,内容产能是造血。造血再快,失血止不住也是白搭。
管理问题,经常不是执行问题。是你把决策权握死了,还把问题定义错了。

所以你明天别再优化那条 Prompt。做三件能下手的:

第一,选本周最影响交付的一件事,让 Agent 先跑第一轮。不是你做完再让它润色。Agent First 是这个意思。24 小时启动,48 小时看见第一版。这是我 2026 年 8 月才定名的口径,别听成我十年前就会。

第二,把目标、验收、红黄绿灯写进一份异步文档。关掉窗口。它要问你,让它把问题写回去,做完再叫你。你盯着它的四十分钟,通常比它浪费的那点 token 更贵。

第三,复盘只收三类结果:改了哪条 Skill、加了哪个检查、下次哪条路被堵住了。出现「下次注意」「提高警觉」,直接打回去。

余一还有一句,我同意:
「环境、激励、反馈,这三个是我比较可控的地方,中间的过程不重要,交给他就好了。」

AI 替代的是手,不是脑子。手交给它。脑子留在你这:什么值得做,什么叫做好,谁承担后果。

董事长的活,就这三件。

你现在管的,是一个对话框,还是一家还没命名的小公司?


分类