多模态大模型到底是啥?我用一个外卖订单给你讲明白

王尘宇 AI百科 7

多模态大模型到底是啥?我用一个外卖订单给你讲明白-第1张图片-王尘宇

经常有人问我:多模态大模型是啥?跟普通的大模型有啥区别?今天我不甩专业术语,用一个外卖订单把这个概念讲清楚。

先说你手机里现在能用的AI。ChatGPT、Kimi、DeepSeek——如果你只打字提问,那你用的是纯文本大模型。它能读文字、写文字,仅此而已。

但如果你给DeepSeek发一张外卖小票的照片,问它「我这周点了几次奶茶,花了多少钱」,它能识别图片里的文字和数字,给你一个准确的回答——这时候它用的就是多模态能力。

所谓「多模态」,说白了就是AI能同时处理多种类型的信息。

文字是一种模态。图片是第二种。语音是第三种。视频是第四种。甚至传感器数据、3D模型、医疗影像——这些都算不同的模态。

纯文本模型就像一个只能读书的人。多模态模型就像一个能看、能听、能读、能说的人。

那它是怎么做到的?

原理不复杂。以图片为例:多模态模型里有一个叫「视觉编码器」的组件,它把图片切成很多小块,每一块转成一组数字。文字也被转成数字。然后训练的时候,模型学会了在这两种数字之间建立关联——看到猫的图片,对应到「猫」这个词。

训练的数据量非常恐怖。GPT-4V据传用了上亿对图文数据。这也是为什么多模态模型只有大厂和头部创业公司能做——普通团队根本拿不出这么多高质量的多模态数据。

现在有哪些多模态模型可以用?

先说明一点:不是所有叫多模态的都名副其实。有些模型只能图生文(看图说话),但不能文生图(根据文字生成图片)。真正意义上的多模态应该支持输入和输出的多种组合。

目前国内比较能打的有几个:通义千问VL,阿里的,图文理解能力很强,尤其是中文场景——我用来识别合同扫描件里的关键条款,准确率比人工还高一点。DeepSeek-V3支持图文混合输入,上传一张图表它能帮你分析趋势,但输出还是纯文字。智谱GLM-4V在学术基准上表现不错,实际用起来对模糊图片的识别不太稳定。Kimi的多模态主要是文件解析方向,PDF、PPT、Excel这些格式处理得特别好。

有什么用?不是画饼

医疗:把CT片子喂给多模态模型,它能标出疑似病灶区域。不是替代医生,是帮医生快速过片。某三甲医院放射科用这个方案,阅片时间缩短了将近一半。

教育:学生拍一道数学题,模型不光给答案,还能一步步讲解。

电商:用户拍一张穿搭照片,模型识别出衣服款式,在商品库里匹配相似款。淘宝的拍立淘底层就是多模态技术。

局限也很明显

目前的模型对视频的理解还比较弱。一个10分钟的视频喂进去,它最多能记住几个关键帧的内容,做不到真正理解时间线上的因果逻辑。另外幻觉问题在多模态场景下更严重——你给模型看一张模糊的图片,它可能脑补出不存在的内容,这在医疗和法律场景下尤其危险。

总的来说,多模态是大模型的必然方向。纯文本的天花板摆在那里。但要让它真正好用、可靠,还有很长的路要走。

小编点评

我买过十几款手机了,从诺基亚功能机到现在的折叠屏,发现最实用的永远是续航长+系统流畅的那一款,参数都是虚的。

买路由器别光看天线数量,信道质量和芯片方案才是关键,推荐大家多看看真实评测。

有没有哪款软件是你换了无数个最终留下来的?评论区交换一波。

标签: 多模态 大模型 AI科普 AIGC 人工智能

发布评论 0条评论)

  • Refresh code

还木有评论哦,快来抢沙发吧~