大语言模型是怎么记住知识的?通俗解释

王尘宇 AI百科 4

很多人觉得AI知道很多事情,像一个超级百科全书。但实际上,大语言模型的知识和我们理解的知识完全不是一回事。

先说一个基本事实:ChatGPT没有数据库。它不像维基百科那样把知识存在某个地方,需要的时候去查。它的知识分布在几十亿甚至上万亿个参数里,这些参数就是一堆数字。

那它是怎么知道法国的首都是巴黎的?

训练的时候,模型读了海量的文本。在这些文本里,法国首都和巴黎经常一起出现。模型通过统计规律学到了:当输入包含法国和首都的时候,输出巴黎的概率最高。

注意,这不是记忆,是模式匹配。模型不知道法国是一个国家,不知道巴黎在哪里,不知道塞纳河流过巴黎。它只知道在训练数据里,这几个词的共现模式。

这就解释了为什么大语言模型会一本正经地胡说八道。它在输出的时候,选择的是概率最高的下一个词。如果某个错误答案在训练数据里出现得足够多,它也会自信地输出错误答案。

模型的知识存储在哪里?

主要在两种结构里:前馈神经网络层和注意力层。

前馈层有点像一个巨大的查找表。输入一个概念,它输出相关的概念。法国到巴黎这种知识主要存在前馈层里。

注意力层负责理解上下文。苹果这个词在吃苹果和苹果公司里的含义不同,注意力层会根据上下文选择正确的理解方式。

那为什么模型参数越多,能力越强?

因为参数越多,能存储的模式越多。这就像人脑的神经元——神经元越多,能建立的连接越多,能处理的信息越复杂。GPT-4据说有1.8万亿参数,所以它能处理的知识范围远超GPT-3(1750亿参数)。

但参数多不等于聪明。一个模型如果训练数据质量差,参数再多也只会输出垃圾。数据质量和训练方法同样重要。

了解这些有什么用?

理解了模型的原理,你就知道它的边界在哪里。它擅长的是模式匹配和文本生成,不擅长精确计算和事实核查。让它写文章、翻译、总结信息很靠谱,但让它算数学题或者查最新的新闻,就不那么可靠了。

所以正确的用法是:把AI当助手,不当权威。它给的答案,重要的要自己验证。

标签: ai 大语言模型 机器学习

发布评论 0条评论)

  • Refresh code

还木有评论哦,快来抢沙发吧~