大模型是怎么读懂文字的?先弄明白Embedding这件事

王尘宇 AI百科 5

很多人以为大模型真的在「理解」语言,其实底层干的事特别机械:它先把每个词、每句话变成一串数字。这串数字就叫向量,或者Embedding。

打个比方。你给「苹果」这个词编一个1500位的数字列表,「香蕉」编另一个,「汽车」再编一个。神奇的地方在于,训练完之后,「苹果」和「香蕉」这两串数字会靠得比较近,跟「汽车」离得远。这就让机器能用「距离」来判断意思相近不相近。

怎么做到的呢?靠海量文本硬喂。模型在读书的时候,会尽量让经常一起出现的词数字靠近。「苹果」旁边老跟着「吃」「水果」「甜」,慢慢它的数字就被推到了那一坨附近。它根本不知道苹果长啥样、啥味道,只是在数字空间里站对了位置。

为什么这事重要?因为AI回答你问题的时候,不是去翻字典,而是在数字空间里找「离你问题最近的那堆内容」。你问「怎么挑甜的苹果」,它就去向量里找跟「甜」「挑选」「苹果」近的句子,再把它们拼成回答。RAG、语义搜索、推荐系统,底层全是这套。

说个实际的坑。早年Embedding模型对中文支持很烂,中英文混排经常把意思搞反。现在好多了,但我们做知识库的时候还是发现,同一句话换个说法,向量能差挺远。所以检索效果好坏,一半在模型,一半在你怎么切分和写问题。

一句话总结:大模型不认识字,它只认识数字。Embedding就是那本把文字翻译成数字的字典。

标签: Embedding 大模型原理 向量 语义搜索 RAG

发布评论 0条评论)

  • Refresh code

还木有评论哦,快来抢沙发吧~