导语:很多人都经历过——第一次让AI干活很顺,对话一长它就开始丢三落四、前后矛盾,于是拼命补资料、加规则,结果Prompt越来越长,AI却越来越不可靠。Anthropic的观点是:问题不在Prompt写得好不好,而在每一刻你让它「看见什么」。
很多人第一次用AI处理复杂任务时,体验都相当好。要求讲清楚,再丢几份资料过去,它很快就能抓住重点。可随着对话越滚越长,事情就开始走样:前面反复强调的要求,它转头就忘;已经否掉的方案,隔了几十轮又端回来;你怕它犯错,继续补背景、加规则、塞案例,窗口越堆越满,它却没有变得更靠谱。
最让人想不通的是,资料明明都在对话里,它并不是「没看过」——更像是那个桌上堆满文件、连轴转了十几个小时的人:东西都在眼皮底下,却越来越难准确找到此刻真正需要的那一页。
你以为在写Prompt,其实是在布置「工作台」
Anthropic先划了一条界线:Prompt工程关心的是怎么把指令写清楚;上下文工程管的范围大得多——模型一次推理时能看到的全部Token,包括系统指令、工具说明、外部检索数据、历史消息,还有Agent前几轮干活留下的中间结果。
改一封邮件,这两者区别不大:你提要求,它给结果,完事。可要是让AI做一份行业研究,它得先搜资料、再读论文、比公司数据、按你的反馈改框架,每一步都会有新结果、旧对话、临时判断涌进来。到这一步,真正决定成败的已经不是开头那句话,而是模型此刻的「工作台」上到底摆着什么。Anthropic把这种思路概括成一句话:什么样的上下文配置,最可能产生我们想要的行为?下次AI答偏,别急着补一句「请认真一点」,先看看这个对话里是不是已经混进了太多旧任务、无关资料和互相打架的要求。
打个比方:Prompt是你交给AI的任务单;Context是任务单加参考资料、历史记录、工具和中间结果组成的整个工作环境。活儿干得好不好,越来越取决于后者。
最反直觉的一点:装得下,不等于用得好
大厂们如今拼命宣传更长的上下文窗口,容易让人产生一个直觉——既然能塞几十万Token,那就把所有可能沾边的资料都扔进去,宁可多给也别漏给。Anthropic恰恰提醒大家别这么想,还引了一个词:context rot,上下文腐化。窗口里Token越多,模型准确召回其中信息的能力就越差。信息并没有消失,消失的是它可靠调用这些信息的能力。
他们把模型可用的注意力称作一份「注意力预算」。每塞进一条信息,就占掉预算的一部分。所以该问的不是「这条资料有没有一点关系」,而是「它值不值得占用模型的注意力」。比如让AI改一篇三千字的文章,最有效的上下文通常就是原稿、明确的修改目标、少量风格参考和必须核对的来源;你要是把过去十篇稿子、几十轮聊天、各种临时想法和边缘案例全倒进去,信息量是上去了,真正决定这次改得好不好的信号反而被稀释了。
这种退化往往是「温水煮青蛙」。模型不会在某个Token之后突然失灵,它照样行文流畅、语气自信,但事实召回和长距离推理的精度已经悄悄下滑。这正是长对话最阴险的地方:语言质量看不出问题,你就容易误以为它还牢牢握着前面所有内容。
正解不是「越短越好」,而是「最小充分」
既然上下文是稀缺资源,是不是Prompt越短越好?Anthropic同样否了这种简单化答案,给的原则是:找到一组能最大化目标结果概率的、最小的「高信号」Token。
这里的「最小」最容易被人误解。他们专门强调,minimal并不等于short——复杂任务当然要有足够的背景、约束和资料,真正该删的是那些既不能提高成功率、又一直在耗注意力的东西。对普通人来说,不妨理解成「最小充分」:少一条就可能影响判断,多十条答案并不会更好。做公司研究,与其一次砸进50篇报道,不如先给研究目标、公司名、要回答的关键问题和几份核心材料,再让它按需去搜。
这也解释了很多「万能Prompt」为什么越用越笨重——为了覆盖所有可能,规则、例外、示例、禁止事项一路叠加,最后攒出几千上万字的指令。Anthropic建议反过来:先给最小版本,用当前最强的模型跑真实任务,观察它到底在哪一步翻车,再针对真实失败补一条清晰的指令或例子。每条新增的规则都有现实原因,而不是为了买一份「写得越细越安心」的心里安慰。
规则少堆点,例子挑好点
Anthropic仍然推荐few-shot,也就是给模型喂示例,但反对把边缘案例像洗衣清单一样一锅端进Prompt。原因很直接:例子太多会吃掉上下文、稀释真正重要的行为模式,还可能让模型困在表面的差异里。
更好的做法是挑少量、多样、有代表性的典型样例。他们有一句话很形象:对模型来说,例子就是「一图胜千言」的那张图。一个真正好的样例,能同时传达结构、语气、判断标准和信息密度,往往比十条抽象规则管用得多。写作尤其明显——与其反复叮嘱「别AI味、别小短句、像成熟编辑、逻辑自然」,不如直接给它一篇你真正满意的文章,再明确说学的是段落组织、信息密度和节奏,而不是照抄内容。
但这里也要克制,参考不是越多越好,你需要的是几篇能清楚表达目标风格的「代表作」。
别把整个资料库塞给它,让它需要时自己去找
另一个重要变化叫just-in-time context,即时上下文。过去很多AI系统习惯在任务开头就把可能相关的资料全部检索出来一次塞进去;Agent能力变强之后,Anthropic越来越倾向让模型只保留轻量引用,真需要时再动态加载。
Claude Code就是现成的例子:面对一个大型代码库,它不会先把所有文件都装进上下文,而是靠文件路径和查询,一步步翻出真正需要的那部分。这种做法的底层逻辑其实接近人的认知习惯——我们不会背下整个硬盘、邮箱或书架,而是依赖文件夹、书签和搜索,需要时再取回来。做长期研究也一样:与其把几十份PDF全倒进一个对话,不如先给任务框架和资料目录,让它判断该看什么,再逐步读取。Anthropic管这个过程叫progressive disclosure,渐进式披露——Agent一层层往里探,每次拿到的信息都决定下一步去哪儿找,工作记忆里只留当下最要紧的,其余放外面,需要时再调。
换句话说,未来真正好用的Agent,不一定是「什么都记得」的那个,更可能是「知道什么时候该去哪儿找」的那个。
对话太长?最有效的动作可能是重新开一个
这是普通人立刻能用上的一点。很多人习惯在一个ChatGPT或Claude窗口里连轴干上几天甚至几周,怕新对话「丢上下文」。但Anthropic给出的思路恰恰相反:当上下文越来越臃肿,保留关键状态、压缩历史、开一个干净的新窗口,往往比拖着全部历史继续走更可靠。
官方管这个动作叫Compaction——把接近窗口上限的对话压成一份高保真摘要,留下架构决策、未解决的问题和关键实现细节,扔掉重复的工具输出这类已经没价值的信息,然后带着摘要重新开始。个人完全可以手动做:一篇文章来回改了30轮越来越乱,就让AI先整理一份「当前版本工作摘要」——目标是什么、哪些事实已确认、哪些观点已删掉、还剩什么问题、风格有什么硬要求——然后带着这份摘要和最新稿件开新对话。
关键不是把旧对话整个搬过去,而是把真正影响下一步的状态搬过去。这正是上下文工程最核心的一句话:保留信息,不等于保留所有原始记录。
长任务,让AI学会「写笔记」
除了压缩,Anthropic还提出了Structured note-taking,结构化笔记,也叫Agentic Memory。Agent会把重要状态写到上下文窗口之外,比如维护一个To-do List或NOTES.md,需要时再读。
他们用Claude玩《宝可梦》的实验来演示:Agent跨越数千个游戏步骤,记录目标、训练进度、探索的地图和战斗策略;上下文重置之后,它读回自己的笔记,接着往下玩。这里重要的不是AI会不会打游戏,而是它展示了一种长期任务的工作方式——持续干活,不必依赖一个永远不清空的聊天窗口,关键状态完全可以外置。
对普通人来说,长期用AI做项目时,可以主动建一份「项目记忆」,里面只放长期有效的东西:目标、已完成事项、重要决策、关键人物、固定的写作标准、不能改变的事实、下一步计划。每次开新对话,把真正需要的部分带回来。这比指望AI从几百轮历史里自动翻出所有重点,更可控也更可靠。
真正该学的,是管理它的注意力
把Anthropic这篇长文拉回个人场景,方法论其实很朴素:把AI的上下文当成工作记忆,而不是硬盘。你不需要让它时刻看到所有东西,只需要在当下这一步,让它看到最有价值的信息。
写作,只放当前稿件、核心材料和明确标准;研究,先立问题再按需查资料;对话乱了,及时总结、压缩、换窗口;长期项目,把状态写进外部笔记;学风格,给少量真正好的范例,而不是几十篇参考。
这套打法没有「一个Prompt让AI能力翻倍」那么抓人,但它可能更接近AI真正稳定工作的方式。过去我们比的是谁更会「问」,接下来可能要比的是谁更会「组织信息」。一个熟练的AI用户,不一定拥有最长的Prompt,也不一定塞给模型最多资料,他更像一个好编辑、好研究员、好项目经理:知道目标是什么、此刻需要什么、什么该先放一边、什么时候该总结、什么时候该重开,也知道什么时候该让AI自己去查。
所以,这篇文章真正值得记住的,不是「上下文工程」这个新名词,而是一个朴素判断:AI的注意力也是有限的。把世界一股脑塞进它脑子里,不如在每个当下,只让它看到最值得看到的那部分。
给个人用户的几条简化原则:复杂任务开始前,先想清楚目标、交付物和硬约束,别一上来就堆资料;参考资料优先选少量高质量、直接相关的,能按需调用的不必全部预加载;AI开始重复、遗忘或前后矛盾时,先怀疑上下文是不是过载了,而不是继续往上叠Prompt;长对话定期生成「项目状态摘要」,必要时带着摘要和最新材料开新窗口;长期项目维护一份外部项目记忆,记下关键事实、已做决定、未完成事项和固定标准;给示例追求典型和多样,不追求数量,边缘案例留给测试;时刻问自己,这一条信息真的会提高这次做对的概率吗——不会,就别占上下文。
免责声明:本文基于公开报道的事实信息整理,仅供参考,不构成任何投资或技术选型建议。
发表评论 取消回复