什么是 A/B 测试? — 免费工具
A/B 测试把两个仅有一处不同的版本放在一起比较结果。为什么那一个变量就是这门功课的全部,一个赢家需要多少结果才算数,以及那些让人自信地得出错误结论的常见做法。
投放两个只在单一要素上不同的版本——标题、图片或行动号召——然后比较结果。同时改动多个变量,就无法解释为什么某个版本胜出。
这是什么
A/B 测试,也叫分组测试,是把同一条内容或同一个广告的两个版本放在一起比较结果。版本 A 通常就是你本来会发的那条;版本 B 只改动一处。目的不是找到一条更好的内容,而是弄清楚是哪个要素让数字动了,这样这次学到的东西才不会随着这条内容一起过去。
如何衡量
指标要在开始前定好,不是事后再挑:带链接的内容看点击率,广告看转化率,视频看完播率。然后需要足够多的结果,差异才有意义。把真实差异和噪声分开的是显著性计算,而两个版本越接近,需要的结果就越多才能看出差别。
常见误解
最常见的错误不是改了两个变量,而是停得太早。测试初期两个版本会不断互相超过,所以如果你盯着看、一有版本领先就收手,几乎每次都能"找到"赢家,哪怕两个版本完全相同。第二个错误是测的东西太小:换一个表情符号在任何你能收集到的样本量下都盖不过噪声,于是这个测试花掉一周却什么也没带回来。先测报价、开头钩子或者形式,再去测标点。
什么时候重要
最有意义的是在花钱的地方,因为两个百分点的差异在那里会累积。在自然流量上,诚实的用法要窄得多:你没法把受众和时段固定住,所以把自然流量的比较当作提出假设的来源,真正的裁决交给付费测试。
功能
- 清楚的定义,把单一变量的规则讲透
- 为什么数字上的差异不等于版本之间的差异
- 测试该跑多久,以及为什么在第一次领先时收手是经典错误
- 自然流量能诚实测出什么、测不出什么,与付费的对比
- 附显著性计算工具的链接,用来核对结果而不是凭眼估
常见问题
一次能改几个变量?
一个。这不是风格偏好,而是让结果可解释的前提:如果获胜版本既换了标题又换了图片,测试只告诉你这一对赢了,完全说不出是哪一半起了作用。
一个测试该跑多久?
久到样本不会因为几条结果就翻转,并且至少覆盖你正常一周的完整节奏。周二到周四的测试测的是周二到周四,不是你的受众。
什么时候可以宣布赢家?
当差异大于噪声时,而这正是显著性计算告诉你的。一有版本领先就收手,是得到自信而错误答案最常见的方式,因为早期的领先会不断反转。
自然内容能做 A/B 测试吗?
只能做个大概。你没办法在相同条件下把两个版本给同一批人看,所以自然流量的比较会连带把时段、星期几和算法都算进去。把它当线索,把真正的测试留给付费。
如果没有差异呢?
那也是结果,而且有用。说明你改的那个要素不是限制这条内容的地方,所以下一次测试应该换个方向,而不是在同一件事上做更小的变化。