A/B 测试显著性计算器 — 免费工具
检查 A/B 测试的胜出版本是否可信。输入两个版本的展示量和转化数,即可查看各自的转化率、相对提升、p 值以及一句人话结论。
版本 A(对照组)
版本 B(挑战组)
转化率 A
转化数 ÷ 展示量
--
转化率 B
转化数 ÷ 展示量
--
相对提升
B 相对 A 高出多少
--
p 值
双比例 z 检验(双尾)
--
结论
每组至少需要 100 次展示和 5 次转化
--
输入数据即可查看结果
功能
- 两个版本的转化率并排显示
- 相对提升 — 挑战组比对照组高出多少
- 基于双比例 z 检验的双尾 p 值
- 任一组低于 100 次展示或 5 次转化时拒绝判定胜负
- 完全在浏览器中运行 — 不上传任何数据
常见问题
统计显著性到底能说明什么?
它只说明一件很窄的事:如果两个版本表现完全相同,出现这么大差异的概率有多低。p 值小于 0.05 意味着这样的差异仅靠随机很难出现。它并不能说明差异在商业上足够重要、下个月依然成立、是版本 B 造成了差异,或者你可以停止测试 — 这些判断仍然要由你来做。
为什么有时显示「数据不足」而不给结论?
因为用寥寥几次事件算出的 p 值只是披着结果外衣的噪声。如果任一组的展示量不足 100 次或转化不足 5 次,检验功效太低,说明不了任何问题,所以计算器会直说,而不是给出一个会被拿去做决策的数字。
使用的是哪种检验?
基于合并比例的双尾双比例 z 检验,这是比较两个转化率的标准做法。p 值来自正态分布近似,在本工具允许给出结论的样本量下足够精确。
95% 置信度是合适的门槛吗?
这是惯例,不是定律。95% 意味着你接受大约二十分之一的概率把非胜出版本判为胜出。如果改动成本低且可回退,用更弱的证据行动也可以;如果代价很大,就等更多数据或采用更严格的门槛。
我的数据会被发送到别处吗?
不会。所有计算都在你的浏览器中完成,不上传、不存储、不记录,也无需注册账号。