← 返回博客

Context Window 科普:AI 的桌面有多大,为什么它会忘记你说过的话

Context Window 科普:AI 的桌面有多大,为什么它会忘记你说过的话

你和 AI 谈了一个小时,把一份计划书的来龙去脉交代得清清楚楚。谈到最后一步,你说「照我们一开始定的三个原则写」,它写出来的东西,一条原则都没对上。

你再提醒一次,它道歉,然后又写错另一条。

它不是敷衍你。那三个原则,此刻已经不在它眼前了。

一张放不下所有东西的桌子

大模型没有记忆。它不像人脑那样把事情存起来、需要时再取出。它每一次回答,都是把「当下能看见的全部文字」读一遍,然后预测下一个字。

这个「当下能看见的全部文字」,就是 context window。

用一张办公桌来想象:你和 AI 的每一句对话、你贴给它的每一份文件、它自己写出来的每一段回应,全部摊开在这张桌面上。它回答之前,会把整张桌子从左到右扫一遍。桌上有的,它看得见;桌上没有的,对它而言等于不存在。

桌子有边界。新的东西不断放上来,旧的东西就会被推下桌。你一小时前定的三个原则,已经掉在地上——它不是忘记,是看不见。

茶餐厅的比喻更贴切一点:context window 是那张卡座的桌面,能同时放多少碟菜是有限的。侍应收走前菜,才腾得出位置上主菜。AI 也一样,只是它收走旧菜的时候不会问你。

Token:桌面的量度单位

桌面大小不用字数计算,用 token 计算。

Token 是模型切割文字的最小单位。英文一个 token 大约等于四个字母,或四分之三个英文字;中文则普遍是一个字占一个 token 或以上。同样一段内容,中文换算成 token 通常比英文多——这也是为什么同一个问题用中文问,成本往往比英文高。

重点是,桌面上的每一样东西都占位置,包括:

占用 context 的东西

常被忽略的地方

你的每一句话

连客套句都算

AI 的每一段回应

它的长篇大论占得最多

你贴上的文件与截图

一份长合约可以占掉大半张桌

系统指示与工具说明

你看不见,但一开场就已占了位置

工具执行的结果

搜索结果、文件内容,一次可以很大

所以对话越长,桌面越挤,越接近边界。这解释了三个常见现象:谈久了它开始重复问已答过的问题;回应速度变慢;按用量计费的话,账单越走越快——因为它每答一句,都要把整张桌子重读一遍。

窗口越大,就记得越牢吗

不是。这是 2026 年最需要澄清的一个误解。

各家旗舰模型的窗口这两年大幅扩张,百万 token 级别已经不稀奇。厂商乐于宣传这个数字,因为它好懂又好比。但「放得下」与「看得清」是两件事。

研究界很早就记录了一个现象,叫 lost in the middle:把关键信息放在一段超长内容的正中间,模型抓取它的准确度,明显低于放在开头或结尾。表现曲线呈 U 形——两端好,中间塌。近年的模型在简单的「大海捞针」测试上已有明显改善,但一旦任务需要跨多段内容综合推理,中段信息被忽略的倾向依然存在。

换成桌面的说法:桌子加长了三倍,但人的视线始终偏向自己面前与最远处那一叠。放在中间那几张纸,最容易被略过。

实务上的结论很直接:不要把窗口大小当成可以无限堆料的许可证。一份塞了八十页杂项的 context,效果往往不如一份整理过的三页摘要。

五个立刻用得上的做法

一、重要的指示,放在开头或结尾

既然中段最容易被略过,就不要把关键要求埋在长文中间。标准做法是:贴原文之前先讲清楚任务,贴完之后再重申一次要求。

【任务】以下是会议录音的逐字稿,请按四个栏位整理成记录:决定、负责人、限期、待跟进事项。

(贴上逐字稿全文)

【重申】只输出四栏表格,不要加入逐字稿以外的推测。

一头一尾各说一次,看似啰嗦,实测差别明显。

二、一件事一个对话

不要在同一个对话里先谈报价、再谈请假安排、然后回头谈报价。中间那段无关内容会一直占着桌面,并且成为干扰——模型分不清哪些是这一刻的重点。

判准很简单:换了题目,就换一个对话。

三、长文件先摘要,再深挖

要处理一份长报告,与其整份贴上去反复追问,不如分两步:第一步请它输出结构化摘要(章节、关键数字、结论),第二步只针对你关心的章节贴原文细问。

第一步的产出很小,第二步的桌面很干净,两步的总成本通常低于一步到底,准确度反而更高。

四、摘要接力:长任务的续命方法

任务做到一半,桌面快满了,但事情还没完。这时不要硬撑,也不要直接开新对话从头讲一次。做法是请它先自我结算:

请把目前为止的进度整理成交接摘要,包含:已确定的决定、尚未解决的问题、下一步该做什么。用条列式,不要加入新内容。

拿到这段摘要,开一个新对话,把摘要贴进去作为起点。等于把整桌散乱的纸张,收成一页备忘录再重新开工。

用 Claude Code 一类 CLI 工具的读者会发现,这正是 /compact 指令在做的事——把过程折叠成结论,腾出桌面继续。原理相同,只是它帮你自动做了。

五、定期看一眼桌面还剩多少

若你用的工具能显示 context 用量(Claude Code 的 /context、部分网页界面的进度条),养成习惯看一眼。用量过半就该考虑收拾,而不是等它开始失忆才处理。

没有这类显示的工具,用一个粗略的体感判断也可以:对话超过二三十来回、或者贴过超过一份长文件,就当作已经过半。

三个常见误解

  1. 以为它记得上一次对话。 除非产品明确提供跨对话记忆功能,否则每开一个新对话,桌面都是空的。上星期告诉过它的事,这星期它一无所知。

  2. 以为说「请记住」它就会记住。 这句话本身也只是桌上的一张纸,同样会被推下去。真正可靠的做法是把长期偏好写进系统层设置(system prompt、项目指示、CLAUDE.md 一类的规则文件),而不是在对话中口头叮嘱。

  3. 以为清空对话是浪费。 恰恰相反。一张干净的桌子,通常比一张堆到满溢的桌子做出更好的成果,而且更便宜。

桌面大小是能力,收拾桌面是技巧

Context window 是这一代 AI 的硬边界,也是最少人真正理解、却最影响日常体验的一个概念。明白它之后,很多「AI 好像变笨了」的时刻都有了解释,而且都有对策。

模型会越出越强,桌子会越造越大。但只要它还是「看得见才算数」,收拾桌面就永远是一项划算的技巧。

顺带一提,若你在香港或中国,想稳定使用 Claude、GPT 这类长窗口模型,门槛往往不在技术而在接入——官方不接受本地注册、外币卡付不了款。Essevin 做的正是这一段:一个账户直连多个官方模型,本地支付方式即可增值,用量按实际使用计算。

延伸阅读:《Claude Code 越用越贵?三个指令看住你的 context》 https://essevin.com/blog/claude-code-context-compact-clear-cn?inv=zd9km4gn&lang=zh 讲的是同一套原理在 CLI 工具上的具体操作,/context/compact/clear 三个指令对应本文的第五、第四、第二点。


*本文资料截至发稿日(2026 年 7 月 24 日),仅供一般参考,不构成任何建议;第三方产品之功能、价格与政策,以其官方最新公布为准;Essevin 服务详情以官网与 console 实际显示为准。