Hugging Face 官方频道出品的一期技术科普视频,由Alejandro AO主讲,主题是提示词缓存(prompt caching)——一个能帮你在 AI 编码智能体上大幅省钱的机制。#微博视频号续航计划#
他先澄清一个常见误解:提示词缓存不是缓存 LLM 的"输出"(那没有意义),而是缓存"输入"——因为编码智能体每轮对话都要把整段对话记录(比如 5 万、5 万 1 千、5 万 5 千词元)反复重发给 LLM,如果不缓存,费用会指数级上涨。
他对比了 OpenAI、Anthropic、Gemini、Kimi K3、Grok、DeepSeek 等提供商的定价(一个 20 万词元的会话,Opus 和 GPT-5.6 Sol 不开缓存要 41 美元,而 DeepSeek 便宜到几乎免费),并演示自己用 DeepSeek V4 Flash 跑出 1090 万词元交换只花了 6 美分。
视频还给出最佳实践:注意各提供商缓存过期时间(OpenAI 一小时、Anthropic 五分钟)、确认提供商是否自动缓存(OpenAI/HF 自动、Anthropic/Gemini 不自动)、绝不要在系统提示词里放动态内容(时间戳、当前工作目录等),否则会让整个缓存失效,以及上下文压缩会重置缓存;最后建议用一个能监控缓存命中率的Harness。 http://t.cn/AXp4MwpM