← 工具测评与教程

开发信怎么做 A/B 测试

实操教程 · 更新于 2026-06-27 · ContactFinder 博客 · 文中他家工具的价格与功能以其官网为准

要点速览

A/B 测试到底在测什么

A/B 测试的思路很简单:准备两个版本(A 和 B),只有一个地方不同,发给条件相近的两组人,看哪个版本效果更好,然后留下赢家、淘汰输家,下次再拿赢家去挑战新版本。它的价值在于用数据代替「我觉得这句更好」的主观拍脑袋——你觉得好的开头,客户不一定买账。

但要先泼盆冷水:开发信的 A/B 测试,和大公司做落地页、做邮件营销的 A/B 测试不是一回事。后者一次能发几万封,样本充足,能算出统计显著;而外贸业务员一周可能就发几十上百封,样本天生小。所以本文讲的是「适合小样本的务实测法」,而不是照搬教科书里那套严格的统计流程。先摆正预期,再往下看。

铁律:一次只改一个变量

整个 A/B 测试里最重要、也最容易被违反的一条:一次只改一个地方。如果你的 A 版本和 B 版本既换了主题行、又改了开头、还调了 CTA,那就算 B 明显赢了,你也完全不知道是这三处里的哪一处(还是它们的组合)起了作用,下次根本没法复用这个经验。

正确的做法是:这一轮只测主题行,正文和 CTA 两个版本保持一模一样;测出赢的主题行后固定下来,下一轮再只测开头。听起来慢,但每一轮你都能得到一条能沉淀下来的确定结论,积累几轮之后,你手里就有一套被验证过的「主题行 + 开头 + CTA」组合,而不是一堆说不清道不明的模糊感觉。

该测哪些东西

不是所有地方都值得测,按「影响哪个漏斗环节 + 改动成本」来排优先级。下面这张表列了开发信里最值得测的几项:

测什么主要影响怎么设计对比优先级
主题行打开率A:痛点式;B:提问式 / 好奇式。别的全一样最高,先测这个
开头第一句是否读下去A:提对方一个具体事实;B:直接说来意。正文其余不变
CTA(结尾诉求)回复率A:约十五分钟通话;B:只问一句「是否感兴趣」
正文长度回复率A:三段完整版;B:精简到五句以内
发送时间打开 / 回复A:对方周二上午;B:对方周四下午。按客户时区中低

先从主题行测起,因为它是漏斗最上游——主题行没人点开,后面写得再好也白搭。主题行的具体写法和更多可测的角度,见开发信主题行怎么写。CTA 那一栏的两种诉求,对应的其实是「要求高 vs 要求低」的取舍,值得单独多试几轮。

样本要多大、怎么判断赢家

这是小样本 A/B 最尴尬的地方:你很难达到严格意义上的「统计显著」。举个直观的例子,A 版发 20 封回 2 封(10%),B 版发 20 封回 3 封(15%),看起来 B 赢了一半,但其实只差一封回复——换个人当天心情好不好都可能翻盘,这种差距毫无说服力。

务实的判断标准是:第一,每个版本至少积累到几十上百封、几十个可比的结果再看,别发一二十封就急着下结论;第二,看的是「明显的、持续的」差距,比如 A 稳定在 5% 而 B 稳定在 15%,连着两三轮都是 B 赢,那才敢信;第三,差距很小(比如 8% 对 9%)就判平局,别硬选,平局说明这个变量没那么重要,换个更值得测的地方。想知道回复率本身大概到多少算正常、好为自己的结果找个参照,见开发信回复率大概多少算正常

土办法与「别过度测」

既然严格 A/B 对小样本不友好,那更实际的是几种「土办法」:一是轮换法,准备两三个版本轮着用,发够一批后统计各自的回复情况,趋势明显就换掉最差的;二是分批法,这周全用 A、下周全用 B(注意控制两批客户质量相近),对比两周结果;三是定性观察,不光看数字,还看回复的内容——哪个版本引来的回复更认真、更接近真实意向,有时比回复率高低更有价值。

还有个常被忽略的前提:想让测试结果可信,两组联系人的质量必须相近——都得是真实、能送达、找对人的邮箱,否则赢的可能只是「那批邮箱更准」而不是「那个版本更好」。ContactFinder 输入公司名或姓名就能拿到决策人的邮箱、电话和 WhatsApp,按找到的结果计费、查不到不扣费,帮你先把「名单质量」这个变量控住,A/B 测的才是话术本身。

最后一句忠告:别过度测。开发信的产出大头是「找对人 + 说对话 + 持续跟进」,A/B 测试是锦上添花的优化,不是救命稻草。如果你把大量时间耗在纠结「这个逗号要不要改」上,却疏于扩大触达量和维护跟进,那是本末倒置。测那几个高杠杆的大项(主题行、CTA)就够了,细枝末节交给感觉。除了回复率还该盯哪些数据来判断优化方向,见开发获客该盯哪些数据

换个思路:查不到,就不扣费

ContactFinder 按找到的结果计费,不按月白扣。输入公司或姓名,拿到决策人的邮箱、手机和 WhatsApp;只有公司名单,也能 AI 直接找出关键人。中文界面,微信人工客服,免费试用额度加微信即可开通。

常见问题

我一周只发几十封,还有必要做 A/B 测试吗?

有必要,但要降低期待。这个量级做不出统计显著,别指望测出精确的「B 比 A 高 3.2%」。你能做的是用轮换法和定性观察,抓那些「一眼可见的大差距」——比如某个主题行明显更多人点开、某种 CTA 明显更多人愿意聊。把测试当成「持续微调的习惯」,而不是「一锤定音的科学实验」,就有意义。

两个版本要同时发,还是先发完 A 再发 B?

理想是同时发给随机分成两组、质量相近的人,这样能排除时间、市场情绪等干扰。但小团队做不到严格随机也没关系,退而求其次用分批法:这周 A、下周 B,只要两批客户的来源和质量尽量一致就行。最忌讳的是拿「上个月发给老客户的 A」去比「这周发给冷名单的 B」,两组人根本不可比,结论必然是错的。

测出赢家之后就一劳永逸了吗?

不会。市场、季节、客户群都在变,今天赢的版本过几个月可能就钝了。正确的心态是「赢家守擂」:留下当前最好的版本作为基准,每隔一段时间用一个新想法去挑战它,赢了就换、输了就守。A/B 测试是个持续循环,不是一次性任务。