上周给客户做产品图,我让AI生成了一张不锈钢阀门的场景图,客户盯着看了半天,问了一句:这图到底是咋画出来的?是真拍的吗?
不是拍的。它背后的技术叫扩散模型,2026年你手机上用的所有AI绘画软件,即梦、可灵、美图,底层都是它。原理不复杂,我拿一锅汤给你讲。
想象一碗清水,你滴进去一滴墨水。墨水会慢慢散开,直到整碗水都变成淡淡的灰色。这个过程就是扩散。AI画画的过程,就是把这个过程倒着放:它学习的是怎么从一碗均匀的灰色,一步步把墨水「捞」回原来的形状。
具体到训练:工程师拿几亿张图片,每张都做加噪处理,往清晰图上撒噪点,撒一遍、两遍,直到完全看不清。AI看的是这个「从清晰到模糊」的完整过程,它要学的,是每一步反着走该怎么走。训练完了,生成的时候就简单了:给它一碗纯噪点,让它按学到的规律一步步去噪,去完50步,一张清晰图就出来了。
所以AI画画不是从图库里拼贴,它是真的学会了「一张图长什么样」的概率规律。这也是为什么它能画出世界上不存在的场景,因为它是从规律里推出来的,不是找出来的。
扩散模型有俩搭档你得认识。一个是CLIP,它相当于文字和图片之间的翻译官。你说「红色的猫在沙发上」,CLIP把它翻译成模型听得懂的方向,画出来的图才跟你的话对得上。另一个是潜空间,Stable Diffusion这类模型把图片压缩到一个很小的空间里再做扩散,显存要求低了一大截,普通人家的显卡也能跑。
还有一个词你八成见过:采样步数。去噪不是一步到位的,一般20到50步,步数越多细节越精细,但超过一定步数就没什么变化了,纯浪费电。现在的模型出图速度,从2022年的几分钟一张,降到了几秒一张,手机上都跑得动。
它也有翻车的时候。复杂场景里的手、招牌上的文字,还是容易画崩,2026年比前两年好多了,但没到完美。另外版权问题一直吵,训练数据里用了谁的图,至今没个定论。
想弄明白扩散模型,看十篇科普不如自己跑二十张图。用即梦或者SD WebUI,同一个提示词分别用10步、30步、50步生成,对比一下细节差别,比什么教程都直观。
还木有评论哦,快来抢沙发吧~