LTV 存在一个盲点

我们针对 35,512 个真实客户群组对 LTV 进行了压力测试。预测误差呈现出清晰、可重复的规律。

执行摘要

LTV 可以说是 SaaS 领域最重要的单一指标,因为它预测的是未来:一个客户或一个群组将产生的总收入。但现实是否与这个预测相符?如果不符,那么此刻就有成千上万家公司正在基于错误的判断做出战略决策。

LTV 是一个简单的公式:ARPA 除以流失率。输入两个数字,就能得到一个数字,用来估算一段客户关系的总价值。它是 SaaS 领域的基础指标之一,影响着获客预算、回本周期预期、融资谈判和产品战略。

但当你把这个预测拿去和现实比对时,它究竟有多准?

为了回答这个问题,我们用来自 3,331 个 ChartMogul 公司账户、共 35,512 个客户群组的真实数据,对 LTV 进行了压力测试。具体来说,我们提出的问题是:如果你在一个群组形成时计算出 LTV,那么这个预测与 12 个月、24 个月和 36 个月后的实际情况,究竟有多接近?

核心结论有点反直觉:LTV 预测误差并非随机,而是系统性的,这使得该指标在某些情况下可靠,而在另一些情况下则始终具有误导性。

主要发现

  • 预测误差是系统性的,而非随机的。 电商类企业一直在高估客户价值,而企业级客户占比高的公司则往往低估客户价值,原因在于客户规模、留存和扩张之间的相互作用方式不同。
  • 许多群组的预测严重失准。 28.3% 的群组与实际情况的偏差超过 50%。
  • 中位数误差之所以看起来很小,只是因为方向相反的误差常常相互抵消。 LTV 经常以相近的幅度偏高又偏低,这让整体中位数显得很准确。
  • 大部分预测误差都来自同一个假设:用公司整体 ARPA 来估算新客户的收入。
  • 付费较低的客户反直觉地往往比付费较高的客户留存更久,但幸存客户的后续扩张最终会让 LTV 从高估收入转为低估收入。
  • LTV 最适合用作方向性指标,而非精确预测。 群组收入曲线和净 MRR 变动能补上这部分缺失的背景信息。

与其问 LTV 是否"准确",我们更想弄清楚它究竟在哪里出错。是什么导致了这些误差?它们如何叠加?又会如何随时间变化?这些又意味着你该如何使用 LTV?

作者:Thomas Anastaselos,研究指导与编辑意见来自 Jason Cohen。

Thomas Anastaselos

Thomas Anastaselos 是 ChartMogul 的营收运营与数据分析总监。他统筹营收运营、市场进入策略、产品驱动增长和产品分析等多个方向的工作,致力于把复杂的数据转化为切实可行的洞察,从而推动更好的业务决策。

Jason Cohen

Jason Cohen 是 WP Engine 的创始人,WP Engine 是全球最大的 WordPress 托管公司之一;他也是《Hidden Multipliers》一书的作者,并在 asmartbear.com 上撰写关于 SaaS 指标、增长和定价的文章。

LTV 公式假设了什么

LTV = ARPA ÷ 流失率,这是一个双变量模型。它的简单性也带来了局限。

要理解它在哪里出错,得先看看这个公式做了哪些假设:

每个新客户的付费水平都和公司平均值一样。 ARPA 是一个混合数字。它代表了你账户上此刻所有的订阅客户——大的、小的,新的、老的,正在扩张的、正在缩减的。当你用它来预测一个新群组将产生的收入时,你其实是在假设,刚刚注册的客户和你现有的整个客户群体长得一样,包括那些已经合作三年、并多次扩大开支的客户。

流失率保持不变。 过去六个月的平均客户数流失率,会被统一套用到每一个新群组上,无论这些客户是谁、是通过什么渠道获取的、与产品的契合度如何,也不管其中一些客户其实已经流失。

每位客户的收入保持不变。 公式并不会专门考虑扩张或缩减,只是通过混合 ARPA 间接体现。客户刚加入时付多少钱,就假设他们会一直付这么多钱;提前取消的客户,平均付费水平也被假设成和已经合作五年的客户一样。

这些都是已知的取舍。更简单的模型更容易理解,也更难被操纵。问题在于,这些取舍在实践中是否真的重要。我们来看数据。

我们如何测试

对数据集中的每个 ChartMogul 账户,我们都定义了群组:即在同一个自然季度注册的所有客户,以他们首次成为付费客户的时间点来划分。我们分析了 2020 年第一季度到 2024 年第四季度共 20 个季度群组,覆盖全部 3,331 个账户,最终得到 35,512 个(账户,群组季度)配对。

在每个群组形成的那一刻,我们记录下该账户的 ARPA 和过去六个月的流失率,做法与 LTV 公式完全一致。然后我们据此计算出 LTV 公式对这些客户在 12 个月、24 个月和 36 个月内的收入预测。

接下来,我们衡量这些客户实际产生了多少收入。对每位客户,我们逐月追踪其 MRR,并按每个时间窗口累加实际 MRR。为避免截尾偏差,我们排除了观察窗口超出数据截止日期(2026 年 6 月)的群组。

这样一来,我们就能在相同的时间段内,针对同一批客户,直接比较预测收入与实际收入,且只使用他们首次成为付费客户时就已经掌握的信息。

这个公式看起来相当准确

典型的群组在 12 个月内产生的收入,比 LTV 的预测少 2.4%。这听起来让人安心。

然而,28.3% 的所有群组的预测误差超过 50%,无论方向是高估还是低估。

一张标题为“12 个月 LTV 预测误差分布”的箱线图。箱体从第 25 百分位的 -28% 延伸到第 75 百分位的 +28%,中位数为 -2.4%。两端的阴影区域标出了预测误差超过正负 50% 的 28.3% 群组。

这个公式使用的是混合 ARPA,其中包含了现有客户多年来的扩张。这些客户可能已经增加席位、升级方案、提高支出好几个月甚至好几年。新客户还没有做过这些事。公式却假设他们已经和平均客户一样,尽管他们根本还没有时间变成那样的客户。

两个输入变量,两种出错方式

这个公式有两个输入变量,因此也就有两个可能出错的地方:分子中的 ARPA,或分母中的流失率。这两者都会出错,但出错的方向不同、幅度不同、原因也不同。

失效模式一:新客户并不是平均客户。

这个公式使用的是公司层面的混合平均客户收入。新客户几乎总是付费低于这个平均值——他们刚刚注册,还没有席位扩张,没有方案升级,也没有经历多年的增长,而混合平均值把这些全都算了进去。于是公式就假设新客户已经赚到了他们其实还没赚到的收入。

从中位数来看,这种 ARPA 错配对预测准确性的影响并不算大:-4.9%。但中位数掩盖了这种错配在不同群组之间的差异有多大。当我们把每个群组的预测误差拆解为 ARPA 和留存两个组成部分时,发现 ARPA 错配能解释预测准确性差异中的 84.9%。换句话说:典型的 ARPA 影响很小,但 ARPA 错配程度的差异,正是某些群组的 LTV 预测比其他群组更准确的主要原因之一。

失效模式二:群组的流失率并不等于平均流失率。

这个公式使用公司过去六个月的流失率,来预测每个月会有多少客户存活下来。但某个特定群组的流失率可能与之相差很大。新签的企业客户、由中小企业转化而来的客户,以及从试用转正式付费的客户,即便都在同一个季度加入,也不会有相同的存活曲线。公司层面的平均值,对你眼前这个具体群组的参考价值其实很有限。

从中位数来看,ARPA 和流失率这两种误差恰好部分相互抵消,这就是为什么 -2.4% 看起来很小的原因。

存活悖论

最令人意外的发现之一,是究竟哪些客户实际上留存时间最长。

传统的 SaaS 经验认为,付费更高的客户会留存更久。企业客户有锁定效应、多年期合同和专属客户经理;付费较低的客户则有更多替代选择、更低的转换成本,组织层面的黏性也更弱。以 WP Engine 为例,这个规律确实成立:规模更大的公司黏性更强。

ChartMogul 的数据集则偏向中小企业,且包含相当大比例的 B2C 群体。在这个数据集里,规律反了过来。我们按注册时的 MRR 把客户分成四组,衡量各组在 12 个月后仍然活跃的比例。结果令人意外:随着相对价格上升,12 个月留存率反而在下降。最便宜的四分位客户存活率为 74%,最贵的四分位客户存活率只有 45%。

一项二次检验也讲述了相同的故事:仍然活跃的客户,其注册时 MRR 的中位数会随时间下降,而不是上升。在一个群组内部,付费更高的客户往往会先流失。这可能部分反映了我们此前研究中提到的"会变成自己猎捕的样子"这一规律:许多 SaaS 公司会先成功获取中小企业客户,然后再向上层市场推进,而这时留住更大的客户会变得更具挑战性。

一张标题为“按注册 MRR 四分位划分的 12 个月存活率”的条形图。存活率随注册 MRR 上升而下降:最便宜的四分位客户在 12 个月后的存活率为 74%,而最贵的四分位客户存活率只有 45%。

拉高 ARPA 的是扩张,而非存活

乍看之下,这似乎和 ARPA 的故事相矛盾。如果付费更低的客户存活更久,群组 ARPA 不是应该随时间下降,而不是上升吗?一种可能的解释是:在以中小企业为主的市场里,付费较低的订阅客户没什么理由离开。软件已经嵌入他们的工作流程,成本也低到不足以触发一次刻意的取消决定。

付费更高的公司会更审慎地权衡投资回报率(ROI)。一旦价值不够清晰,他们就会换掉供应商。让大型 B2B 客户更具黏性的企业级锁定效应,并不适用于每月付 500 美元的中小企业买家,也不适用于每月付 29 美元的消费者。

这对 ARPA 意味着什么。 如果付费更低的客户存活更久,那么随着群组老化,其平均 MRR 应该下降,这和 ARPA 被拉高正好相反——而这似乎正是在客户层面实际发生的情况。

那么公司层面的 ARPA 又是被什么拉高的呢?答案是扩张。留下来的客户会升级方案。我们直接衡量了这一点:在从 2020 至 2021 年存活至今的客户中,当前 MRR 有 45.6% 来自注册之后的扩张,而不是他们最初的订阅。混合 ARPA 之所以被拉高,是因为存活下来的客户在不断扩张。

这对 LTV 又意味着什么?用来预测新群组收入的 ARPA,被你现有客户已经实现的扩张给拉高了,而新客户还根本没有时间实现这种扩张。

到目前为止,我们解释了为什么 LTV 一开始会高估新客户的价值。但这些误差来源并非一成不变。随着群组逐渐成熟,客户开始扩张,这会让最初的 ARPA 错配变得越来越不重要,而扩张的影响则越来越重要。当我们用更长的时间跨度比较同一批群组时,就能看到这种转变。

预测如何随时间变化

在早期,混合 ARPA 会让 LTV 显得过于乐观。但随着时间推移,客户扩张会逐渐超过这种最初的偏差。到 24 个月时,中位数预测误差为 +6.9%;到 36 个月时,则达到 +14.4%。到 24 个月的时候,LTV 已经从高估收入变成了低估收入。

原因就是扩张。在 12 个月时,ARPA 错配和扩张大致相互抵消。到 24 个月时,已经有足够多的客户升级了席位和方案,扩张的影响开始占上风。到 36 个月时,累积的扩张会把这个数字推得更远。

到 36 个月时,结果的离散程度也几乎翻了一倍,这让 LTV 的可靠性大打折扣。

一张标题为“LTV 预测误差随时间的变化”的图表。中位数预测误差从 12 个月时的 -2.4%,变为 24 个月时的 +6.9%,再到 36 个月时的 +14.4%;同时,第 25 至第 75 百分位的结果离散程度到 36 个月时几乎翻了一倍。

并非所有企业都遵循这个规律

总体规律——也就是付费更低的客户留存更久——是真实存在的,但并非放之四海而皆准。不是每家公司都遵循这个规律,我们来看看它在哪里成立,在哪里不成立。

对每家公司,我们衡量了客户注册 MRR 与 12 个月存活率之间的相关性。正相关意味着规模更大的客户留存更久,负相关意味着规模更大的客户流失得更快。

我们发现:

分组 企业占比 规律
负相关 37.2% 规模更大的客户流失更快
中性 48.9% 没有明显关系
正相关 13.9% 规模更大的客户留存更久

符合传统企业级预期的规律——也就是规模越大留存越久——只在 14% 的公司中成立。而对 37% 的公司来说,情况恰恰相反。

一张标题为“ARPA-留存相关性分组”的图表。37.2% 的公司呈负相关,规模更大的客户流失更快;48.9% 没有明显关系;13.9% 呈正相关,规模更大的客户留存更久。B2C 公司在负相关组中占 37.8%,但在正相关组中只占 6.6%。

B2C 公司在负相关组中占 37.8%,但在正相关组中只占 6.6%。这符合许多消费类企业的直觉:产品已经嵌入日常生活,成本低到不足以构成取消的理由。而付费更高的订阅者则更为谨慎,一旦价值不够清晰就更容易流失。小型 B2B 公司也呈现同样的规律:负相关组中有 77% 的公司 ARR 低于 50 万美元。

正相关组(规模更大的客户留存更久)中,93% 是 B2B 公司,且以规模较大的公司为主。这是典型的企业级规律:更高的 MRR 往往伴随着更深的系统集成、更高的转换成本,以及更深的组织依赖。

这些客户行为上的差异,直接体现为 LTV 准确性上的差异。

分组 LTV 误差中位数 不可靠群组占比
负相关——规模更大流失更快 +1.3% 15%
中性 -1.3% 25%
正相关——规模更大留存更久 -5.7% 45%
一张标题为“按 ARPA-留存相关性分组的 LTV 准确性”的图表。负相关组(规模更大的客户流失更快)的中位数误差最低,为 +1.3%,不可靠群组占比也最低,为 15%。正相关组(规模更大的客户留存更久)的中位数误差最高,为 -5.7%,不可靠群组占比也最高,为 45%。

当规模更大的客户流失更快时,LTV 最为准确;当他们留存更久时,LTV 最不准确。

当模型的两个误差相互抵消时,它最为准确:它高估了新客户的价值,但这些付费更高的客户也流失得更快,让实际收入更接近预测值。而当两个误差相互叠加时,它最不准确:付费更高的客户一开始就更有价值,还留存得更久,于是公式对他们的低估会出现两次——一次在他们注册时,另一次则随着他们不断扩张而再度出现。

LTV 在哪里最失灵

中位数误差的分布并不均匀。最大的差异出现在行业、公司规模和商业模式之间。

按行业划分:

一张标题为“按行业划分的 LTV 预测误差中位数”的条形图。条形图展示了各行业 12 个月预测误差的中位数,从电商行业的 -10.9% 到教育行业的 +0.7%,右侧标注了误差超过 50% 的群组占比,范围从 22.8% 到 31.3%。
行业 12 个月误差中位数 误差超过 50% 的群组占比 ARPA 比率 留存系数
电商 -10.9% 29.0% 0.88 1.02
办公与效率工具 -6.7% 29.8% 0.90 1.06
基础设施 / 开发者工具 -5.9% 31.3% 0.91 1.06
商业智能 -3.2% 24.5% 0.87 1.18
销售、营销与客户成功 -3.1% 28.4% 0.91 1.10
财务与运营 -2.2% 30.5% 0.91 1.10
会员制 -1.7% 22.8% 0.99 1.01
教育 +0.7% 23.1% 1.02 0.99

电商行业的高估幅度最大。新客户的付费水平远低于平均值,且几乎没有扩张,导致几乎没有什么能抵消最初的 ARPA 错配。

表格的另一端则是相反的故事。商业智能行业的扩张效应最强(1.18 倍),因为分析工具会随着时间推移变得越来越嵌入客户的工作流程,使用量增长也会带动客户升级方案。即便 ARPA 错配程度相近,注册后扩张强劲的行业,LTV 误差也始终更小。

这些差异反映的似乎更多是商业模式,而不是行业本身。当新客户与现有客户群体相似、且在注册后会继续扩张时,LTV 最为准确;当新客户一开始就远低于平均水平、而且始终无法缩小差距时,LTV 最不准确。

按公司规模划分:

MRR 区间 误差中位数 不可靠占比 ARPA 比率 留存系数
Over $30M ARR -19.1% 19.9% 0.69 1.21
$10M-$30M ARR -6.8% 25.1% 0.83 1.11
$500k-$10M ARR -4.3% 27.5% 0.90 1.09
Under $500k ARR +0.5% 29.5% 1.00 1.03

规模最大的公司(ARR 3,000 万美元以上)的高估幅度最大,但出现重大失误的比例却最低。它们的误差中位数达到 -19% 的水平,幅度很大,但相当一致。这些公司存在的时间已经足够长,老客户得以大幅扩张,把混合 ARPA 拉高到远超新群组实际付费水平的程度。但这些新客户在注册后往往也会大幅扩张,随着时间推移逐渐缩小差距。

小型公司(ARR 低于 50 万美元)则出现轻微的低估(误差中位数为 +0.5%),公式对这些最小规模公司的收入略有低估,可能是因为它们的扩张轨迹超出了平均水平所暗示的程度。但它们同时也拥有最多不可靠群组(29.5%)。它们的误差更多是噪声,而非系统性的。平均而言,公式大致准确,但单个群组的预测差异很大。

按商业模式划分:

目标市场 误差中位数 不可靠占比 ARPA 比率 留存
B2B -5.5% 30.2% 0.88 1.10
B2C +0.4% 20.2% 1.03 0.96

B2B 和 B2C 呈现出截然不同的准确性画像。

对 B2B 企业来说,最大的问题是 ARPA 错配。现有客户已经完成扩张,把平均值推高到远超新客户实际付费水平的程度。

B2C 公司在整体上基本处于中性(误差中位数 +0.4%),且严重失准的群组占比最低(20.2%)。B2C 的定价更简单、更统一,这意味着公式的核心假设更站得住脚。在消费市场中,这个公式的盲点更小。

光加一个警示标签是不够的

我们用群组形成之初就能获得的最强信号——ARPA 比率——来测试这一点。它衡量的是一个新群组的人均收入,与公式所用的公司整体平均值之间有多大差异。由于这个指标可以立即被观察到,因此在任何留存数据出现之前,就可以用它来预警。

背后的逻辑很简单。如果新客户的付费水平明显高于或低于平均值,那么公式的 ARPA 假设从一开始就是错的,仅凭这一点,就足以让最终得出的 LTV 估算变得不可靠。

我们测试了不同的标记阈值,来衡量精确率与召回率之间的取舍:这个标记有多大概率能正确识别出一个失准的估算,又能捕捉到多少失准的估算。

标记阈值 精确率 召回率 被标记公司比例
0.25 39.7% 66.7% 47.6%
0.35(最佳平衡点) 45.3% 57.6% 36.7%
0.50 54.8% 45.5% 23.6%
1.00 81.0% 9.6% 3.3%

在精确率与召回率的最佳平衡点上,要捕捉到 57% 的严重失准预测,你需要标记全部公司中的 37%。如果把阈值提高到只捕捉最极端的情况(阈值 1.00),精确率会提升到 81%,但只能捕捉到 10% 的失准预测。

这反映了一个底层现实:新客户很少和平均值完全一致,因此几乎每家公司的 ARPA 假设都或多或少存在偏差。一个警示标签最终会标记出相当大比例的公司,这样一来它既不具备可操作性,也谈不上特别可信。

这对你该如何使用 LTV 意味着什么

面对这些数据,你可以有三种应对方式:调整你解读当前数字的方式,修正公式本身,或者借助辅助指标。

调整你解读当前数字的方式。

把 LTV 当作方向性指标,而不是精确数字。中位数误差虽小,但围绕它的分布却很宽。对任何一个具体群组,实际结果都很可能比预测值高出或低出 25%-30%。如果你的 LTV:CAC 目标本身已经包含安全边际,请记住,这部分边际可能已经被 LTV 本身正常的不确定性所吸收。

基于数据,还有一些针对特定细分市场的调整建议:

  • 电商:这里的 ARPA 假设系统性地过于乐观(误差中位数为 -10.9%)。在用于获客决策之前,建议将 LTV 下调 10%-15%。
  • 大型公司(ARR 3,000 万美元以上):误差可预测且方向单一。LTV 往往会高估约 20%,这主要是因为混合 ARPA 中已经叠加了多年来现有客户的扩张。
  • 企业客户占比较高的季度:如果新客户明显比你现有的客户群体规模更大,就要预料到相反的问题——LTV 很可能会低估他们的价值。

有一点需要说明:以上描述的是每个细分市场中的典型公司,而非每一家公司。在应用任何调整之前,请先检查你自己历史上的 LTV 预测与实际情况的吻合程度。

修正公式本身。

影响最大的结构性修正,是用新群组在注册时的实际收入,取代公司层面的混合 ARPA。由于 ARPA 错配是误差方差中占比最大的因素,仅这一项调整就能显著提升准确性,而且所需的数据(注册时的 MRR)本来就已经存在。

扩张则更难用这种方式修正。它在注册时是无法预知的,而且占了剩余误差中很大一部分,所以即便修正了公式,也依然无法覆盖第二个、也是更大的一个偏差来源。这里还有一个实际成本:一个群组的实际 ARPA 要等到群组结束才能确定,这会延迟计算并增加复杂度。

使用辅助指标。

对于短期的单位经济效益,回本周期可能是一个更可靠的替代指标。它是有边界的(通常是 12-24 个月,而不是一个无限的时间跨度),并且对真正会变化的变量(利润率、早期流失、CAC)更敏感,不过一次高成本的获客投入也可能短暂地扭曲它。

对于更长的时间跨度,群组收入曲线展示的是过去群组实际产生的收入——这不是预测,而是历史记录。如果 24 到 36 个月的曲线呈上升趋势,说明留存和扩张健康;如果曲线过早趋平或下滑,就是一个清晰可见、可以定位到具体时间的问题。

净 MRR 变动则能同时补足这两者,解释这些曲线为什么会是这个样子,把扩张、缩减、流失和重新激活分别拆解开来,而 LTV 却把所有这些都压缩成了一个数字。

没有哪一个单独的视角是完整的。把它们放在一起看,能比单靠 LTV 更准确地描绘出客户价值的全貌。

最后的问题

LTV 之所以有局限,是因为它把两个并不稳定的假设压缩成了一个单一的数字。理解这些假设,比单纯相信这个数字本身更重要。

这个公式依然会继续有用,因为它足够简单,可以在董事会上三言两语说清楚,也便于长期跟踪,并且擅长用一个数字概括整个业务。只要把它当作方向性指标,并结合其他指标一起使用,LTV 仍然是一个有价值的工具。

方法论与数据

方法论说明

  • 数据集:来自 3,331 个公司账户的 ChartMogul 平台数据,覆盖 2020 年第一季度到 2024 年第四季度,共产生 35,512 个(账户,群组季度)配对。群组的定义是:首次新增业务变动发生在同一个自然季度内的所有客户。
  • 预测:在每个群组形成时,我们基于该账户的混合 ARPA 和过去六个月的客户流失率,用 ChartMogul 的公式计算出 LTV。然后据此计算出 LTV 隐含的、未来 12 个月、24 个月和 36 个月的收入预测。
  • 实际值:对每位客户,我们逐月追踪 MRR,并按每个时间窗口累加实际 MRR。观察窗口超出数据截止日期(2026 年 6 月)的群组被排除在外,以避免截尾偏差。
  • 误差指标:预测误差 = (实际值 − 预测值) / 预测值 × 100。负值表示公式高估,正值表示公式低估。不可靠群组是指绝对误差大于 50% 的群组。
  • 方差分解:我们把每个群组的预测误差拆分成两个组成部分:ARPA 错配和留存错配,然后衡量这两个部分各自能解释群组间预测准确性差异的多少。这两个组成部分加上它们之间的交互作用,共同解释了 100% 的误差。
  • ARPA-留存相关性:对每个账户,我们衡量了客户注册 MRR 与 12 个月存活率之间的关系。规模更大的客户往往留存更久的账户被归为正相关;流失更快的账户被归为负相关;其余的归为中性。我们设定了一个最低相关性阈值,以降低小样本带来的噪声。

关于数据的说明

本文反映的是截至 2026 年 6 月,基于 ChartMogul 实时平台数据所做的分析。此前版本的这项研究显示出略有不同的中位数误差和方差,但其中的核心观点,以及影响这些数字的因素保持不变。这些变化源于底层数据集的演变,以及公司账户在数据集中的增减。

订阅 The SaaS Roundup

加入其他 24,000 位读者,每周五在收件箱收到精选行业文章与最新洞察。