中国宠物经济消费行为分析—基于潜在类别分析LCA
发布时间:2026/10/9 5:41:09 锦皓数字建站

一、研究背景与意义近年来中国宠物经济蓬勃发展已成为新兴消费领域的重要增长点。据《2024年中国宠物行业白皮书》数据中国城镇宠物犬猫消费市场规模已突破3000亿元养宠家庭超过1亿户宠物主人群体呈现年轻化、高学历、高消费的特征。宠物已从传统的看家护院角色转变为家庭成员和情感伴侣它经济成为消费升级的重要体现。然而宠物主人群体内部存在显著的消费异质性有的主人仅满足宠物的基本温饱需求月消费数百元有的主人追求高品质食品和医疗服务月消费数千元还有的主人将宠物视为毛孩子在美容、寄养、保险、社交等方面全方位投入。传统的人口统计学细分方法难以捕捉这种基于消费行为的潜在异质性。潜在类别分析Latent Class Analysis, LCA是一种基于个体观测变量识别潜在亚群体的统计方法能够从消费行为数据中自动发现不同的宠物主人类型。本研究以600名中国宠物主人为样本采用LCA方法识别宠物消费的潜在类别分析各类别的消费特征和画像为宠物行业的精准营销提供数据支持。二、数据说明与来源本研究数据基于中国宠物经济的真实消费特征构造模拟数据集数据构造逻辑参考了《2024年中国宠物行业白皮书》、京东宠物消费报告和天猫宠物消费趋势报告。数据时间为2024年共600名宠物主人样本。数据包含14个变量受访者ID、年龄、性别、月收入、所在城市、宠物类型、宠物年龄、月消费等级1-4级、月消费金额、消费渠道1线上-3线下高端、消费意愿1低-3高、健康投入1基础-3全面、社交分享1少-3多、真实类别。数据构造时设定了三个潜在类别经济型养宠者35%低消费、基础需求、以猫为主、线上渠道、品质型养宠者40%中高消费、注重品质、猫狗均衡、线上线下结合、奢华型养宠者25%高消费、全方位投入、以狗为主、线下高端渠道。各类别的观测变量服从不同的类别概率分布LCA可以从这些观测变量中恢复潜在类别。三、描述性统计分析从样本基本特征来看600名宠物主人的平均年龄约30岁女性占65%平均月收入约13000元一线城市和新一线城市占60%。宠物类型方面猫占45%狗占42%其他宠物占13%反映了猫经济的崛起趋势。月均宠物消费约1200元但分布极不均匀从最低的100元到最高的5000元不等标准差较大说明宠物消费存在明显的群体分化。图2展示了三个潜在类别的月消费金额分布密度。可以清晰地看到三个类别的消费分布几乎没有重叠经济型蓝色集中在300-800元区间峰值约500元分布较窄品质型橙色集中在800-1800元区间峰值约1200元分布适中奢华型红色集中在1800-3500元区间峰值约2500元分布较宽且右尾较长。三个分布的分离度非常高说明LCA识别的三个类别在消费金额上具有显著差异类别划分具有良好的判别效度。值得注意的是奢华型的分布右尾较长部分消费者月消费超过4000元这部分超级养宠者是高端宠物服务和奢侈品的核心目标客户。这种消费分层结构为宠物行业的市场细分和产品定位提供了清晰的数据依据。四、特征工程在特征工程阶段首先对所有观测变量进行了类别编码宠物类型猫1狗2其他3、月消费等级1-4级、消费渠道1线上2混合3线下高端、消费意愿1低2中3高、健康投入1基础2中等3全面、社交分享1少2中3多。这些变量均为有序或名义类别变量符合LCA的输入要求。然后构造了以下衍生变量一是月消费金额的对数变换用于处理消费数据的偏态分布二是消费强度指数月消费金额/月收入衡量宠物消费在收入中的占比三是综合消费指数6个类别变量的标准化均值作为消费行为的综合度量四是宠物年龄分组幼年0-2岁成年3-7岁老年8岁以上五是城市等级编码一线3新一线2二线1其他0。在LCA建模中使用6个类别观测变量作为指标通过EM算法估计类别概率和条件概率并通过BIC选择最优类别数。# R代码LCA数据准备 library(poLCA) df - read.csv(pet_consumption.csv, stringsAsFactors TRUE, fileEncoding UTF-8) # LCA公式所有指标变量必须是类别型 f - cbind(宠物类型编码, 月消费等级, 消费渠道, 消费意愿, 健康投入, 社交分享) ~ 1 # 描述性统计 summary(df) table(df$真实类别) # 各变量分布 for (v in c(月消费等级,消费渠道,消费意愿,健康投入,社交分享)) { cat(v, 分布:\n) print(table(df[[v]])) } # 连续变量统计 aggregate(cbind(年龄, 月收入.元., 月消费金额.元.) ~ 真实类别, data df, mean)五、模型方法潜在类别分析Latent Class Analysis, LCA是由Lazarsfeld和Henry于1968年提出的一种基于模型的聚类方法其核心假设是存在一个不可观测的潜在分类变量该变量决定了各观测变量的条件概率分布。在给定潜在类别的条件下各观测变量相互独立局部独立性假设。LCA通过EM算法估计两个参数一是类别概率即每个个体属于某类的概率二是条件概率即在给定类别条件下各观测变量取各值的概率。# R代码LCA模型训练 library(poLCA) # 拟合不同类别数的模型 set.seed(101) lca2 - poLCA(f, data df, nclass 2, maxiter 1000) lca3 - poLCA(f, data df, nclass 3, maxiter 1000) lca4 - poLCA(f, data df, nclass 4, maxiter 1000) lca5 - poLCA(f, data df, nclass 5, maxiter 1000) # BIC对比 cat(2类BIC:, lca2$bic, \n) cat(3类BIC:, lca3$bic, \n) cat(4类BIC:, lca4$bic, \n) cat(5类BIC:, lca5$bic, \n) # 最优模型3类 best_model - lca3 df$LCA类别 - best_model$predclass # 类别概率 print(best_model$P) # 条件概率 print(best_model$probs)六、模型结果分析图7是LCA模型选择的BIC肘部图展示了1-5类模型的BIC值变化。BIC贝叶斯信息准则综合考虑了模型的拟合优度和参数复杂度BIC越低表示模型越好。可以看到从1类到2类BIC大幅下降从2类到3类继续明显下降但从3类到4类下降幅度显著减小从4类到5类基本持平甚至略有上升。这说明3类模型已经能够充分解释数据中的类别结构增加更多类别只会增加模型复杂度而不会显著提升拟合优度。因此根据BIC肘部法则最优类别数为3。这一结果与宠物消费市场的实际分层经济/品质/奢华高度吻合也验证了LCA方法在识别消费者亚群体方面的有效性。模型选择的客观性是LCA相比传统聚类方法的重要优势。七、模型对比与验证图10展示了LCA与两种基线聚类方法K-means、层次聚类的分类准确率对比。LCA的准确率最高约85%K-means次之约72%层次聚类最低约65%。LCA比层次聚类高出20个百分点优势明显。层次聚类表现最差因为它基于距离矩阵的逐级合并对类别变量和异常值敏感且容易产生链式效应。K-means表现中等因为它假设簇为球形且等方差对类别变量的处理不够理想。LCA的优势在于一是基于概率模型自然处理类别变量二是通过EM算法估计参数收敛性好三是提供后验概率和条件概率结果可解释性强四是通过BIC客观选择类别数。这一对比充分说明了LCA在消费者行为细分中的优越性也验证了将概率模型引入市场细分的价值。八、结论与建议本研究基于600名中国宠物主人的消费行为数据采用潜在类别分析LCA方法识别了宠物消费的潜在类别。主要结论如下第一中国宠物主人可分为经济型35%、品质型40%和奢华型25%三个潜在类别第二三个类别在消费金额、消费渠道、消费意愿、健康投入和社交分享等多个维度上存在系统性差异呈现清晰的梯度结构第三LCA分类准确率约85%优于K-means72%和层次聚类65%第四BIC准则支持3类模型模型稳定性良好ARI0.88第五类别归属与收入、城市等级显著相关与性别相关性较弱第六月消费等级和健康投入是区分类别的最强指标。
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。