ab-testcalculatoranalyticsstatistics

A/B 测试显著性计算器 — 免费工具

检查 A/B 测试的胜出版本是否可信。输入两个版本的展示量和转化数,即可查看各自的转化率、相对提升、p 值以及一句人话结论。

版本 A(对照组)

版本 B(挑战组)

转化率 A
转化数 ÷ 展示量
--
转化率 B
转化数 ÷ 展示量
--
相对提升
B 相对 A 高出多少
--
p 值
双比例 z 检验(双尾)
--
结论
每组至少需要 100 次展示和 5 次转化
--
输入数据即可查看结果

功能

  • 两个版本的转化率并排显示
  • 相对提升 — 挑战组比对照组高出多少
  • 基于双比例 z 检验的双尾 p 值
  • 任一组低于 100 次展示或 5 次转化时拒绝判定胜负
  • 完全在浏览器中运行 — 不上传任何数据

常见问题

统计显著性到底能说明什么?

它只说明一件很窄的事:如果两个版本表现完全相同,出现这么大差异的概率有多低。p 值小于 0.05 意味着这样的差异仅靠随机很难出现。它并不能说明差异在商业上足够重要、下个月依然成立、是版本 B 造成了差异,或者你可以停止测试 — 这些判断仍然要由你来做。

为什么有时显示「数据不足」而不给结论?

因为用寥寥几次事件算出的 p 值只是披着结果外衣的噪声。如果任一组的展示量不足 100 次或转化不足 5 次,检验功效太低,说明不了任何问题,所以计算器会直说,而不是给出一个会被拿去做决策的数字。

使用的是哪种检验?

基于合并比例的双尾双比例 z 检验,这是比较两个转化率的标准做法。p 值来自正态分布近似,在本工具允许给出结论的样本量下足够精确。

95% 置信度是合适的门槛吗?

这是惯例,不是定律。95% 意味着你接受大约二十分之一的概率把非胜出版本判为胜出。如果改动成本低且可回退,用更弱的证据行动也可以;如果代价很大,就等更多数据或采用更严格的门槛。

我的数据会被发送到别处吗?

不会。所有计算都在你的浏览器中完成,不上传、不存储、不记录,也无需注册账号。