真正的优势在哪里?它从三个方面着手:
1️⃣ 整个训练过程都只针对技能文档进行优化,任何调整都必须在验证集上带来实际的分数提升才能生效——容不得半点猜测。
2️⃣ 实际部署后,模型调用次数?零增长。它仍然运行着你原来的模型,一切都像什么都没发生过一样流畅。
3️⃣ 在 52 个测试网格中,它要么独占鳌头,要么并列第一——横扫所有榜单。在 GPT-5.5 上,它直接提升了 23.5 分;Codex 提升了 24.8 分;Claude Code 提升了 19.1 分。
经过一番调整后,最终得到的只是一个包含几百到两千个标记的轻量级文件——轻如鸿毛,可以轻松移植到各种模型和工具中。如果这种模式能够保持稳定,那么手动编写提示符的方式或许将彻底改变。