Prompt Caching 实战全解:Anthropic vs OpenAI vs Gemini 缓存机制深度对比(2026)
分析日期:2026-08-14
涉及产品:Anthropic Claude、OpenAI GPT 系列、Google Gemini 2.5+
核心问题:如何让同样的 prompt 重复调用时少付 90% 的输入 token 费?
一、为什么要认真看待 Prompt Caching?
LLM API 计费的核心公式很简单:输入 token 价格 × 输入 token 数 + 输出 token 价格 × 输出 token 数。当你的 system prompt 有 3000 token、RAG 上下文有 5 万 token、工具定义又占 2000 token,每次请求都在为这些”几乎不变的内容”重复付费。
Prompt Caching 的本质:把每次请求的”共享前缀”缓存起来,重复调用时只对新增部分做完整前向传播(prefill)。三家大厂 2026 年都已落地,但机制、计费、最低门槛差别很大。





