
两年前的大模型一次只能处理几千字,现在随便一个国产模型都能一口气读完一本书。这个能力叫长上下文。理解它,你才知道该不该把整份合同、整本操作手册一次性丢给AI,也才知道丢了之后它到底靠不靠谱。
先说上下文是什么。每次对话你发给AI的所有内容,问题、历史记录、粘贴的文档,加起来就是它的工作记忆,模型只在这个范围内理解并回答。超出范围的东西,它看不到,更记不住。你聊到第五十句,它还记得第一句,靠的就是把整段对话都装进上下文里。
从几千涨到百万Token,靠两招。一是注意力机制稀疏化,以前每个字都要和所有字比较,现在分块处理,只挑相关部分重点看,计算量降下来了;二是位置编码升级,让模型清楚内容的前后顺序,不会读着读着把顺序搞乱。通俗讲,以前是逐字对照,现在是先扫一遍,挑重点精读。
但窗口长了不代表变聪明了。长上下文解决的是能读进去,不是都理解。实测里有个经典现象叫大海捞针:关键信息埋在长文档中间段时,模型经常读到后面忘了前面,答不上来。所以真要用,把最重要的结论放开头和结尾,中间放补充材料,模型抓到的概率高得多。
站长和企业最实用的场景:把客户的全套资料、历史对话、产品手册一次性喂进去做深度问答,或者让AI基于整份合同列风险清单。但别把所有文本无脑塞进去,费钱不说,重点还被淹没了。先想清楚哪些是必须让AI看到的,再决定塞多少。
上手前先做个测试:扔一篇长文档进去,问一个藏在中间段的细节,看它答得对不对。答错别急着骂模型笨,这是长上下文的固有短板。学会把关键信息往前放,比换更贵的模型管用。
还木有评论哦,快来抢沙发吧~