
DeepSeek-V3发布的时候,有个数字让很多人懵了一下:总参数六千七百多亿,但每回答一个问题,实际只激活三百七十亿参数。总参数和激活参数差着快二十倍,还能正常工作。它靠的就是MoE架构,全称混合专家模型。
MoE的原理,用大白话讲就是一家公司不会让所有员工处理所有事。前台接待、法务审合同、工程师写代码,各干各的。MoE给模型内置了一堆「专家」,每个专家擅长处理某一类输入,外面加一个路由网络当「调度员」,每次来一个问题,调度员先判断该叫哪几个专家干活。
具体到数字上,总参数就是所有专家参数加在一起的总和,激活参数是这次回答实际参与计算的专家参数。DeepSeek-V3一共部署了几百个专家,每次回答只挑其中少数几个,这就是所谓的稀疏激活。早年有个叫Mixtral的开源模型也是这个路子,八个专家每次激活两个,效果在当时相当能打。
MoE最大的好处是省钱。训练和推理的时候,算力只花在激活的那部分参数上。DeepSeek-V3的训练成本大约五百五十万美元,放在同等规模的传统模型面前低了一个量级,当时整个行业都震惊了。推理也一样,同样的硬件能服务的用户更多,这也是现在大厂模型普遍转向MoE的原因。
但MoE不是没有代价。第一,所有专家都得加载进显存,哪怕这次没用上,所以MoE模型的总显存占用还是按总参数算,本地部署依旧困难,这也是为什么你电脑上跑不动DeepSeek-V3。第二,调度员如果判断失误,叫错了专家,回答质量就会打折扣。第三,专家之间的负载可能不均衡,有的专家被频繁调用,有的常年闲着,影响整体效率。
到2026年,市面上主流的大模型基本都用了MoE架构,区别只是专家数量、激活比例这些细节。对普通用户来说,不需要搞懂路由算法,记住一件事就行:看模型参数表的时候,别只看总参数,激活参数才是决定实际能力和成本的关键。
还木有评论哦,快来抢沙发吧~