
先说结论:大部分小网站做的A/B测试,数据都是废的。
我在2025年初开始在自己运营的一个工具站上跑A/B测试。工具站月访问量大概8万UV,付费转化率2.3%。老板说"优化一下注册页,看能不能提到3%"。听起来很简单对吧——改个按钮颜色、换个文案,跑一周,看哪个好。结果我跑了三个月才搞明白自己在干什么。
坑1:样本量不够就开始下结论
第一周我拿了两个按钮文案做测试——"免费试用"vs"开始使用"。跑了四天,"免费试用"转化率3.1%,原版2.3%。我兴奋地汇报了,把全站按钮都改了。两周后数据回落到2.2%——比原来还差。
问题出在哪?四天只有1400个访客进入测试,两组各700人。在这个样本量下,3.1%和2.3%的差异p值是0.27——统计上完全不显著。说人话就是:这个"提升"大概率是运气。后来我用 Evan Miller 的样本量计算器一算,要从2.3%提到3%(检测到30%的提升),每组至少需要2800人。小网站没有这个流量,就别测太小的改动。
坑2:不控制时间段偏差
第二个月,我同时跑了一个定价页的布局测试——A组看原版,B组看新设计。跑了十天,B组转化率高15%。正要庆祝的时候发现一个大问题:A组和B组是按访问时间分配的,但B组刚好横跨了两个周末,而那段时间有个竞品宕机了。说白了不是我的设计好,是竞品"助攻"了。
修这个坑的办法是:用服务端随机分流,确保两组访客在时间分布上是均匀的。Google Optimize已经关了,现在我用的是 PostHog 自部署版(免费,支持100万月事件),配合他们的 Feature Flag 做分流。
坑3:只测一个变量但忽略了交互效应
这是我犯过最隐蔽的错。我把注册页的表单从5个字段砍成3个,转化率确实上了——从2.3%到了3.5%。但我没注意到的是,砍掉的"公司名称"字段让后续的销售demo预约率下降了40%。因为销售团队靠这个字段做前期背调,没了它,预约质量变差,成交率跌了。单体A/B测试赢了局部,搞砸了全局。
一套小网站能用的方法
经过这些教训,我现在的做法是:
1. 只测"大改动"——按钮颜色、文案微调这些,量不够就别玩。测整个页面的信息架构重设计、定价策略调整,效果差别大到你不需要统计学也能看出来。
2. 用 Bayesian 而不是 Frequentist 方法——贝叶斯在小样本下更诚实,至少它会告诉你"还没结论,继续跑"而不是给你一个假的p值。VWO和PostHog都内置了。
3. 至少跑满两个完整周期——如果网站有周末效应,就跑14天。如果B2B网站周末没流量,至少跑10个工作日。
4. 看辅助指标——转化率上去了但客单价掉了,或者注册多了但7日留存崩了,这种"胜利"没有意义。
最后说一句:如果月UV低于2万,建议别做A/B测试。不是不能做,是做了也得不到可靠结论。不如直接看行业最佳实践、抄竞品、或者直接问用户。工具站有不少免费的定性调研手段——Hotjar录屏、Clarity用户行为回放,这些东西不需要量,但给你的洞察可能比一个不靠谱的A/B测试值钱得多。
还木有评论哦,快来抢沙发吧~