A/B 测试怎么看:样本量与显著性
实操教程 · ContactFinder 博客 · 文中他家工具的价格与功能以其官网为准
要点速览
- 样本太小就是骗自己:每组只发二三十封,A 版比 B 版多两个回复,那是运气不是胜负,别急着全量铺开。
- 一次只改一个变量:同一轮把主题行、开头、发送时间一起改,就算赢了也不知道赢在哪,等于白测。
- 回复和成交才是北极星:开信率早被邮箱的隐私保护搅浑,真正该盯的是回复率、正向回复率和约到会的比例。
先说清楚:多数人跑 A/B 测试,是在拿噪声当结论
A/B 测试本身不难,难的是「看」。我见过太多业务员两版开发信各发三十封,A 版回了 3 个、B 版回了 1 个,就宣布「A 版完胜」,第二天把 A 版几千封铺出去,结果回复率跌回原样。问题不在文案,在于他把随机波动当成了真本事。
外贸冷邮件的 A/B 测试比电商、广告的测试更容易骗人,有三个天生的坑。第一,回复率基数低,通常是个位数百分比,分母一小,分子差一两封,比例就能翻着跟头跳,30 封里 3 个和 1 个的差距看着吓人,其实全在噪声范围内。第二,样本攒得慢,一个小团队一个月也发不出几千封,等你凑够能下结论的量,季节、名单、行情早变了。第三,指标选错,盯着最容易看、也最不靠谱的开信率沾沾自喜。
这篇不重复「A/B 怎么设计、怎么跑」的基础流程,只讲一件事:测完之后,凭什么相信这个结论、什么时候根本不该下结论。
第一步:先估最小样本量,别用二三十封信定生死
下结论之前,先问自己一句:这个量,够看出差别吗?统计上有个朴素的直觉——你想分辨的差异越小、基础回复率越低,需要的样本就越大。冷邮件回复率本来就低,所以要的量比很多人以为的多得多。想稳当分辨「回复率从 3% 提到 6%」这种翻倍级的差异,每组往往需要几百封的量级;想看出更细的差别,量还要往上翻好几倍。
不用你去背公式,记住下面这张按低回复率(个位数百分比)冷邮件总结的经验档位就够用:
| 每组样本量(发信数) | 差异要多大才别当噪声 | 结论可信度 | 该怎么用 |
|---|---|---|---|
| 每组 < 50 | 几乎任何差异都是噪声 | 极低 | 别下任何结论,继续攒量或先合并看总体 |
| 每组 50 – 200 | 只有翻倍级的大差异才值得留意 | 低到中 | 当方向性参考,别据此改流程 |
| 每组 200 – 500 | 能看出中等差异(如回复率相对提升过半) | 中 | 可作决策,但盯住会不会翻盘 |
| 每组 ≥ 500 – 1000 | 能较稳地分辨较小差异 | 较高 | 差异稳定就固化赢家 |
这张表是量级参考,不是精确门槛:回复率越低,同一档位需要的量越大;开信率那种基数四五成的指标,反而小样本就能看出差别——可惜开信率本身不可信,后面会讲。核心是先有「够不够」这根弦,别拿三十封信当判决书。
小团队的变通:发信量小、单轮凑不够,就把同一版本连续几轮的数据累加起来看,或者拉长观察周期。宁可慢一点得出靠谱结论,也别用小样本快速误判、然后把整个名单发废。
一次只改一个变量,否则赢了也白赢
第二个高频错误:一轮里同时改主题行、开头第一句、正文长度和发送时间,四处一起动。结果 B 版赢了,你却说不清是主题行的功劳,还是换了时间的功劳,下一轮想复现都无从下手。这不叫 A/B 测试,叫瞎撞运气。
正确做法是控制变量:一轮只动一个地方,其余全部锁死。这一轮测主题行,两版的正文、CTA、发送时间、名单来源必须一模一样;下一轮再测开头。听起来慢,但每一轮都能沉淀出一条能复用的结论,长期反而快。
变量还要挑值得测的。主题行、第一句、CTA 这类高杠杆、高频复用的环节,值得认真 A/B;而落款字体、问候语这种边角料,测出花来对回复率也没多少影响,别浪费宝贵的样本量。把测试火力集中在真正能撬动回复的地方。
盯回复和成交,别被开信率带偏
开信率是最爱骗人的指标。现在主流邮箱和邮件客户端普遍会预取图片、屏蔽跟踪像素,跟踪像素被批量触发,你看到的「打开」里混着大量机器行为,数字虚高且时准时不准。更要命的是,开信率高不等于回复多——标题党能骗到打开,却换不来生意。
真正的北极星指标,应该顺着漏斗往下走,越靠近成交越可信:
- 回复率:比开信率实在得多,但也要看回的是什么。
- 正向回复率:剔掉「不感兴趣」「退订」「已有供应商」这类拒信,只算真正表达了兴趣、愿意往下聊的。这才是判优劣的主力指标。
- 约到会 / 拿到询盘率:再往下一层,能约到通话、拿到具体询盘的比例,最贴近钱。
判断哪个版本更好,优先比正向回复率,其次看约会与询盘。到底该建立哪些指标、怎么定义,可以看外贸触达该盯的核心指标;心里没底、不知道自己的回复率算高算低,先对照回复率的参考基准再判断,别用一个连基准都没有的数字去比来比去。
显著性到底怎么看:不算 p 值也能判
「显著」不是「A 的数字比 B 大」这么简单——大一点点很可能只是运气。一个差异要能站住脚,得同时满足三个条件:
- 差异幅度够大:不是一两个百分点的绝对值,而是相对提升明显,比如正向回复率相对涨了大半,而不是从 3.1% 挪到 3.4%。
- 样本量够:对着上面那张表核一下,两组都进了「中」及以上的档位。
- 没中途偷看提前喊停:别每天盯着,一见 A 领先就叫停宣布获胜——这叫偷看,几乎必然把短暂波动误判成胜负。
如果你想更严谨,网上有免费的 A/B 显著性计算器,填入两组的发送数和回复数,它会算出一个 p 值。p 值回答的是:假如两版其实一样好,纯靠运气也能拉开这么大差距的概率;这个概率足够小(习惯上取 5% 以下)才敢说「大概率不是运气」。但对样本本就不大的外贸场景,别把 p 值当圣旨——一个能连着几轮复现的方向,比一次勉强压线的 p 值可靠得多。
把常见的误判摆一块儿看,一眼就能对号入座:
| 症状 | 错在哪 | 正确做法 |
|---|---|---|
| 各发 30 封,A 版赢就全量上 A | 样本太小,3 比 1 只是随机波动 | 每组攒到几百封、差异稳定不翻盘再定 |
| 同一轮改了主题行加开头加时间 | 变量混在一起,赢了不知赢在哪 | 一轮只改一个变量,其余全部锁死 |
| A 版开信率高就判 A 赢 | 开信率被隐私保护搅浑,且与成交弱相关 | 以正向回复率、约会 / 询盘率为准 |
| 每天盯着,一见 A 领先就停测 | 中途偷看提前叫停,把波动当胜负 | 事先定好样本量或周期,到点再看 |
| 回复率高就等于版本更好 | 招来一堆无效回复也被算成战绩 | 只数愿意往下聊的正向回复 |
换个思路:小团队别硬凑统计显著
说句可能反直觉的话:如果你是 SOHO 或几个人的小团队,一个月发信量本就有限,追求教科书式的「统计显著」多半是自我折磨——等样本凑够,黄花菜都凉了。这种情况下,把力气全花在抠 A/B 上,性价比很低。
更聪明的打法是分三层。第一,先修杠杆更大的事:名单精不精准、邮件能不能进收件箱、基础文案是不是像群发模板,这几样只要有一样不及格,提升空间远比你从两版文案里抠出来的大,先把它们做到及格再谈优化细节。第二,把 A/B 降级成「方向性下注」:小样本只看方向、不较真显著,某个写法连续两三轮都占优,就先信它、用它,之后再验证。第三,只对高频环节较真:主题行几乎每封信都用、影响又大,值得长期滚动测;一次性的边角内容就别测了。
说白了,统计显著是给「有足够流量」的场景准备的奢侈品。量不够时,方向感 + 复现,比一个孤零零的 p 值更值得信。
一个正反例:同样的数据,两种读法
反例(样本不足就下结论):小李测两版开发信,各发 30 封。A 版收到 3 个回复(10%),B 版 1 个(3.3%)。他兴奋地宣布「A 版回复率是 B 版三倍」,第二天把 A 版发给名单里剩下的 2000 个联系人。一周后 A 版的整体回复率只有 4% 出头。他百思不得其解——其实 3 比 1 从一开始就是随机波动,30 封的样本什么都证明不了。
正例(攒够量、控住变量、看对指标):老王测同一件事,规矩得多。这一轮只改主题行,正文和发送时间完全不动;每版累积发到 400 多封才看数据。A 版正向回复率 5.1%,B 版 3.2%,差异连续两周不翻盘。他这才把 A 版主题行固化下来,接着开下一轮,只测开头第一句。慢是慢,但每一步都踩实了,结论能复用、能叠加。
两个人数据来源差不多,结局天差地别,差就差在「怎么看」——样本够不够、变量纯不纯、指标对不对。
把话说拢
A/B 测试的价值不在「跑」,在「读」。读之前先过三关:样本量够不够下结论、这一轮是不是只改了一个变量、比的是不是回复和成交这类真指标。三关有一关没过,得出的「赢家」很可能是运气伪装的,照着它改反而越改越差。
落到执行:想先补齐 A/B 的设计与跑法,可以看冷邮件 A/B 测试的完整跑法;想搭一套能持续追踪的指标体系,参考外贸触达该盯的核心指标;不确定自己现在的回复率是好是坏、值不值得优化,先用回复率的参考基准校准预期,再决定把 A/B 火力压在哪里。
换个思路:查不到,就不扣费
ContactFinder 按找到的结果计费,不按月白扣。输入公司或姓名,拿到决策人的邮箱、手机和 WhatsApp;只有公司名单,也能 AI 直接找出关键人。中文界面,微信人工客服,免费试用额度加微信即可开通。
常见问题
发信量小,凑不够样本量,A/B 还测不测?
测,但换个方式测。别追求统计显著,改用「方向性下注」:小样本只看方向,同一个写法连续两三轮都占优就先信它、先用它。同时把同一版本跨轮次的数据累加起来看,慢慢逼近能下结论的量。更要紧的是,量不够时先别死磕文案 A/B,先把名单精准度和送达率这类杠杆更大的事做好,回报高得多。
开信率高、回复率没涨的版本,算赢吗?
不算。开信率现在被邮箱的隐私保护和图片预取搅得虚高,还混着机器触发,本就不可信;就算是真打开,能骗到打开的标题党也换不来生意。判断版本优劣,一律以正向回复率为主、约会与询盘率为辅——这些越靠近成交,越不会骗你。开信率最多当个辅助观察,绝不能当判决依据。
没学过统计,怎么快速判断一个 A/B 结果可不可信?
记住三句话就够用。一,两组样本都到几百封了吗?没到就先别下结论。二,这一轮是不是只改了一个变量?改了好几处,赢了也说明不了问题。三,差异是明显拉开、还是只差零点几个百分点?只有大差异才值得当真。想更保险,就把两组的发送数和回复数丢进免费的显著性计算器看看 p 值,但小样本下别迷信这个数,能连着几轮复现的方向才最靠谱。