大模型是怎么"学会"说话的?一文看懂AI的训练过程

王尘宇 AI百科 13

你跟豆包聊天的时候,有没有想过一个问题:它怎么知道怎么回答你的?

很多人觉得AI就是"背答案",跟搜索引擎差不多。其实完全不是一回事。搜索引擎是帮你找别人写好的内容,大模型是自己"编"出来的——只不过它编得很靠谱,因为训练过了。

今天用大白话讲清楚大模型到底是怎么训练出来的。

第一步:吃进去海量文字

训练大模型的第一步是"喂数据"。有多海量呢?GPT-4的训练数据大概有13万亿个token(你可以理解为词),相当于把几百万本书全读了一遍。

这些数据来源五花八门:网页内容、维基百科、新闻、论坛帖子、代码、论文、电子书……基本上互联网上公开的文字都扫了一遍。

这里有个关键点:数据质量比数量重要。如果喂进去的全是垃圾信息,训练出来的模型也会说胡话。所以各家公司在数据清洗上花的功夫,比收集数据还多。

第二步:学"接话"的本事

大模型的训练核心其实就一件事:给它前半句话,让它猜下一个词是什么。

比如给它"今天天气真",它可能猜"好"。猜对了就强化,猜错了就调整。重复几十亿次之后,它就掌握了语言的规律。

这个过程叫"自监督学习"。不需要人工标注答案,模型自己从数据里学。就像小孩听大人说话听多了,自然就会说了——虽然他不懂语法,但能说出通顺的句子。

光会接话还不够。这个阶段训练出来的模型就像一个什么都知道但说话没重点的人,你问它问题,它可能给你扯到天南海北去。

第三步:教它"好好说话"

接下来要做的叫SFT(监督微调),通俗说就是"教它怎么当一个有用的助手"。

这个阶段,公司会请人写大量的"对话样本"——一问一答的标准格式。教它:用户问这种问题,应该这样回答;要分点说清楚,不要废话;不确定的事要说"我不确定",不要瞎编。

这一步特别烧钱。OpenAI雇了几千人专门写这些训练数据,人工标注的成本占了整个训练成本的相当大比例。

第四步:让它"对齐"人类偏好

最后一步叫RLHF(基于人类反馈的强化学习),这个名字很拗口,但原理不复杂。

方法是这样:让模型针对同一个问题生成好几个回答,然后请人来排序——哪个回答最好,哪个最差。模型根据这些排序来调整自己,学会什么样的回答是人类喜欢的。

比如用户问"西安有什么好吃的?",模型生成了三个回答:

回答A:详细列了10家店,每家说了招牌菜和人均消费。

回答B:说"西安美食很多,欢迎来品尝"。

回答C:扯了一大段西安的饮食文化历史。

人类标注员会把A排第一。模型就学到了:回答要具体、有信息量,不要空洞。

这四步走完,一个大模型就基本训练好了。当然实际操作中还有很多技术细节——学习率怎么调、数据怎么配比、算力怎么分配——但核心逻辑就是这些。

理解了这个过程,你就能明白为什么AI有时候会"一本正经地胡说八道"。它本质上是在"接话",不是在"查资料"。训练数据里有的内容它答得好,没有的就可能编出一个看起来很像回事的答案。这也是为什么用AI查事实性信息时,最好自己再核实一遍。

标签: AI百科 大模型 GPT AI训练 机器学习

发布评论 0条评论)

  • Refresh code

还木有评论哦,快来抢沙发吧~