← 工具测评与教程

A/B 测试怎么看:样本量与显著性

实操教程 · ContactFinder 博客 · 文中他家工具的价格与功能以其官网为准

要点速览

先说清楚:多数人跑 A/B 测试,是在拿噪声当结论

A/B 测试本身不难,难的是「看」。我见过太多业务员两版开发信各发三十封,A 版回了 3 个、B 版回了 1 个,就宣布「A 版完胜」,第二天把 A 版几千封铺出去,结果回复率跌回原样。问题不在文案,在于他把随机波动当成了真本事。

外贸冷邮件的 A/B 测试比电商、广告的测试更容易骗人,有三个天生的坑。第一,回复率基数低,通常是个位数百分比,分母一小,分子差一两封,比例就能翻着跟头跳,30 封里 3 个和 1 个的差距看着吓人,其实全在噪声范围内。第二,样本攒得慢,一个小团队一个月也发不出几千封,等你凑够能下结论的量,季节、名单、行情早变了。第三,指标选错,盯着最容易看、也最不靠谱的开信率沾沾自喜。

这篇不重复「A/B 怎么设计、怎么跑」的基础流程,只讲一件事:测完之后,凭什么相信这个结论、什么时候根本不该下结论。

第一步:先估最小样本量,别用二三十封信定生死

下结论之前,先问自己一句:这个量,够看出差别吗?统计上有个朴素的直觉——你想分辨的差异越小、基础回复率越低,需要的样本就越大。冷邮件回复率本来就低,所以要的量比很多人以为的多得多。想稳当分辨「回复率从 3% 提到 6%」这种翻倍级的差异,每组往往需要几百封的量级;想看出更细的差别,量还要往上翻好几倍。

不用你去背公式,记住下面这张按低回复率(个位数百分比)冷邮件总结的经验档位就够用:

每组样本量(发信数)差异要多大才别当噪声结论可信度该怎么用
每组 < 50几乎任何差异都是噪声极低别下任何结论,继续攒量或先合并看总体
每组 50 – 200只有翻倍级的大差异才值得留意低到中当方向性参考,别据此改流程
每组 200 – 500能看出中等差异(如回复率相对提升过半)可作决策,但盯住会不会翻盘
每组 ≥ 500 – 1000能较稳地分辨较小差异较高差异稳定就固化赢家

这张表是量级参考,不是精确门槛:回复率越低,同一档位需要的量越大;开信率那种基数四五成的指标,反而小样本就能看出差别——可惜开信率本身不可信,后面会讲。核心是先有「够不够」这根弦,别拿三十封信当判决书。

小团队的变通:发信量小、单轮凑不够,就把同一版本连续几轮的数据累加起来看,或者拉长观察周期。宁可慢一点得出靠谱结论,也别用小样本快速误判、然后把整个名单发废。

一次只改一个变量,否则赢了也白赢

第二个高频错误:一轮里同时改主题行、开头第一句、正文长度和发送时间,四处一起动。结果 B 版赢了,你却说不清是主题行的功劳,还是换了时间的功劳,下一轮想复现都无从下手。这不叫 A/B 测试,叫瞎撞运气。

正确做法是控制变量:一轮只动一个地方,其余全部锁死。这一轮测主题行,两版的正文、CTA、发送时间、名单来源必须一模一样;下一轮再测开头。听起来慢,但每一轮都能沉淀出一条能复用的结论,长期反而快。

变量还要挑值得测的。主题行、第一句、CTA 这类高杠杆、高频复用的环节,值得认真 A/B;而落款字体、问候语这种边角料,测出花来对回复率也没多少影响,别浪费宝贵的样本量。把测试火力集中在真正能撬动回复的地方。

盯回复和成交,别被开信率带偏

开信率是最爱骗人的指标。现在主流邮箱和邮件客户端普遍会预取图片、屏蔽跟踪像素,跟踪像素被批量触发,你看到的「打开」里混着大量机器行为,数字虚高且时准时不准。更要命的是,开信率高不等于回复多——标题党能骗到打开,却换不来生意。

真正的北极星指标,应该顺着漏斗往下走,越靠近成交越可信:

判断哪个版本更好,优先比正向回复率,其次看约会与询盘。到底该建立哪些指标、怎么定义,可以看外贸触达该盯的核心指标;心里没底、不知道自己的回复率算高算低,先对照回复率的参考基准再判断,别用一个连基准都没有的数字去比来比去。

显著性到底怎么看:不算 p 值也能判

「显著」不是「A 的数字比 B 大」这么简单——大一点点很可能只是运气。一个差异要能站住脚,得同时满足三个条件:

如果你想更严谨,网上有免费的 A/B 显著性计算器,填入两组的发送数和回复数,它会算出一个 p 值。p 值回答的是:假如两版其实一样好,纯靠运气也能拉开这么大差距的概率;这个概率足够小(习惯上取 5% 以下)才敢说「大概率不是运气」。但对样本本就不大的外贸场景,别把 p 值当圣旨——一个能连着几轮复现的方向,比一次勉强压线的 p 值可靠得多。

把常见的误判摆一块儿看,一眼就能对号入座:

症状错在哪正确做法
各发 30 封,A 版赢就全量上 A样本太小,3 比 1 只是随机波动每组攒到几百封、差异稳定不翻盘再定
同一轮改了主题行加开头加时间变量混在一起,赢了不知赢在哪一轮只改一个变量,其余全部锁死
A 版开信率高就判 A 赢开信率被隐私保护搅浑,且与成交弱相关以正向回复率、约会 / 询盘率为准
每天盯着,一见 A 领先就停测中途偷看提前叫停,把波动当胜负事先定好样本量或周期,到点再看
回复率高就等于版本更好招来一堆无效回复也被算成战绩只数愿意往下聊的正向回复

换个思路:小团队别硬凑统计显著

说句可能反直觉的话:如果你是 SOHO 或几个人的小团队,一个月发信量本就有限,追求教科书式的「统计显著」多半是自我折磨——等样本凑够,黄花菜都凉了。这种情况下,把力气全花在抠 A/B 上,性价比很低。

更聪明的打法是分三层。第一,先修杠杆更大的事:名单精不精准、邮件能不能进收件箱、基础文案是不是像群发模板,这几样只要有一样不及格,提升空间远比你从两版文案里抠出来的大,先把它们做到及格再谈优化细节。第二,把 A/B 降级成「方向性下注」:小样本只看方向、不较真显著,某个写法连续两三轮都占优,就先信它、用它,之后再验证。第三,只对高频环节较真:主题行几乎每封信都用、影响又大,值得长期滚动测;一次性的边角内容就别测了。

说白了,统计显著是给「有足够流量」的场景准备的奢侈品。量不够时,方向感 + 复现,比一个孤零零的 p 值更值得信。

一个正反例:同样的数据,两种读法

反例(样本不足就下结论):小李测两版开发信,各发 30 封。A 版收到 3 个回复(10%),B 版 1 个(3.3%)。他兴奋地宣布「A 版回复率是 B 版三倍」,第二天把 A 版发给名单里剩下的 2000 个联系人。一周后 A 版的整体回复率只有 4% 出头。他百思不得其解——其实 3 比 1 从一开始就是随机波动,30 封的样本什么都证明不了。

正例(攒够量、控住变量、看对指标):老王测同一件事,规矩得多。这一轮只改主题行,正文和发送时间完全不动;每版累积发到 400 多封才看数据。A 版正向回复率 5.1%,B 版 3.2%,差异连续两周不翻盘。他这才把 A 版主题行固化下来,接着开下一轮,只测开头第一句。慢是慢,但每一步都踩实了,结论能复用、能叠加。

两个人数据来源差不多,结局天差地别,差就差在「怎么看」——样本够不够、变量纯不纯、指标对不对。

把话说拢

A/B 测试的价值不在「跑」,在「读」。读之前先过三关:样本量够不够下结论、这一轮是不是只改了一个变量、比的是不是回复和成交这类真指标。三关有一关没过,得出的「赢家」很可能是运气伪装的,照着它改反而越改越差。

落到执行:想先补齐 A/B 的设计与跑法,可以看冷邮件 A/B 测试的完整跑法;想搭一套能持续追踪的指标体系,参考外贸触达该盯的核心指标;不确定自己现在的回复率是好是坏、值不值得优化,先用回复率的参考基准校准预期,再决定把 A/B 火力压在哪里。

换个思路:查不到,就不扣费

ContactFinder 按找到的结果计费,不按月白扣。输入公司或姓名,拿到决策人的邮箱、手机和 WhatsApp;只有公司名单,也能 AI 直接找出关键人。中文界面,微信人工客服,免费试用额度加微信即可开通。

常见问题

发信量小,凑不够样本量,A/B 还测不测?

测,但换个方式测。别追求统计显著,改用「方向性下注」:小样本只看方向,同一个写法连续两三轮都占优就先信它、先用它。同时把同一版本跨轮次的数据累加起来看,慢慢逼近能下结论的量。更要紧的是,量不够时先别死磕文案 A/B,先把名单精准度和送达率这类杠杆更大的事做好,回报高得多。

开信率高、回复率没涨的版本,算赢吗?

不算。开信率现在被邮箱的隐私保护和图片预取搅得虚高,还混着机器触发,本就不可信;就算是真打开,能骗到打开的标题党也换不来生意。判断版本优劣,一律以正向回复率为主、约会与询盘率为辅——这些越靠近成交,越不会骗你。开信率最多当个辅助观察,绝不能当判决依据。

没学过统计,怎么快速判断一个 A/B 结果可不可信?

记住三句话就够用。一,两组样本都到几百封了吗?没到就先别下结论。二,这一轮是不是只改了一个变量?改了好几处,赢了也说明不了问题。三,差异是明显拉开、还是只差零点几个百分点?只有大差异才值得当真。想更保险,就把两组的发送数和回复数丢进免费的显著性计算器看看 p 值,但小样本下别迷信这个数,能连着几轮复现的方向才最靠谱。