glossaryadvertising

什么是 A/B 测试? — 免费工具

A/B 测试把两个仅有一处不同的版本放在一起比较结果。为什么那一个变量就是这门功课的全部,一个赢家需要多少结果才算数,以及那些让人自信地得出错误结论的常见做法。

投放两个只在单一要素上不同的版本——标题、图片或行动号召——然后比较结果。同时改动多个变量,就无法解释为什么某个版本胜出。

这是什么

A/B 测试,也叫分组测试,是把同一条内容或同一个广告的两个版本放在一起比较结果。版本 A 通常就是你本来会发的那条;版本 B 只改动一处。目的不是找到一条更好的内容,而是弄清楚是哪个要素让数字动了,这样这次学到的东西才不会随着这条内容一起过去。

如何衡量

指标要在开始前定好,不是事后再挑:带链接的内容看点击率,广告看转化率,视频看完播率。然后需要足够多的结果,差异才有意义。把真实差异和噪声分开的是显著性计算,而两个版本越接近,需要的结果就越多才能看出差别。

常见误解

最常见的错误不是改了两个变量,而是停得太早。测试初期两个版本会不断互相超过,所以如果你盯着看、一有版本领先就收手,几乎每次都能"找到"赢家,哪怕两个版本完全相同。第二个错误是测的东西太小:换一个表情符号在任何你能收集到的样本量下都盖不过噪声,于是这个测试花掉一周却什么也没带回来。先测报价、开头钩子或者形式,再去测标点。

什么时候重要

最有意义的是在花钱的地方,因为两个百分点的差异在那里会累积。在自然流量上,诚实的用法要窄得多:你没法把受众和时段固定住,所以把自然流量的比较当作提出假设的来源,真正的裁决交给付费测试。

功能

  • 清楚的定义,把单一变量的规则讲透
  • 为什么数字上的差异不等于版本之间的差异
  • 测试该跑多久,以及为什么在第一次领先时收手是经典错误
  • 自然流量能诚实测出什么、测不出什么,与付费的对比
  • 附显著性计算工具的链接,用来核对结果而不是凭眼估

常见问题

一次能改几个变量?

一个。这不是风格偏好,而是让结果可解释的前提:如果获胜版本既换了标题又换了图片,测试只告诉你这一对赢了,完全说不出是哪一半起了作用。

一个测试该跑多久?

久到样本不会因为几条结果就翻转,并且至少覆盖你正常一周的完整节奏。周二到周四的测试测的是周二到周四,不是你的受众。

什么时候可以宣布赢家?

当差异大于噪声时,而这正是显著性计算告诉你的。一有版本领先就收手,是得到自信而错误答案最常见的方式,因为早期的领先会不断反转。

自然内容能做 A/B 测试吗?

只能做个大概。你没办法在相同条件下把两个版本给同一批人看,所以自然流量的比较会连带把时段、星期几和算法都算进去。把它当线索,把真正的测试留给付费。

如果没有差异呢?

那也是结果,而且有用。说明你改的那个要素不是限制这条内容的地方,所以下一次测试应该换个方向,而不是在同一件事上做更小的变化。