长对话上下文工程与记忆管理实战指南
2026 年,Agent 领域的瓶颈已经从「如何让模型答对」转移到了「如何让模型持续答对」。
多轮对话中,每一次工具调用、每一次检索结果、每一段用户追问都在累积消耗上下文窗口。当对话进入第 10 轮、第 20 轮,Token 预算耗尽、有效信息被噪声淹没、关键上下文消失在长序列中间——这些不是边缘情况,而是生产环境中每天都会遇到的现实问题。
Andrej Karpathy 在 2025 年 6 月给出了一个精辟的类比:LLM 是 CPU,上下文窗口是 RAM,工程师的工作就是操作系统,负责在每一步加载正确的信息。 当任务从单轮问答变成多轮 Agent 工作流时,真正决定成败的不再是提示词写得有多巧,而是整个上下文管道设计得有多好。







