第八章 实际案例研究
本章要点
- 一条贯穿主线:四个案例共享同一套"问题—设计—实现—解读—建议"管线
- 四种方法组合:经典 CCA、稀疏 CCA、正则化 CCA、经典 vs 稀疏对比
- 四组领域数据:消费行为、基因组-表型、金融风控、教育评估
- 一个共同结论口径:显著性、载荷命名、冗余解释、管理建议四件套
- 一组跨案例教训:案例差异在数据形态,方法纪律不分行业
前七章的方法论像一套工具,本章在四个真实行业场景里做总装演练。四个案例刻意覆盖三种典型数据形态:低维干净(消费者、教育)、超高维稀疏(基因组)、含离群与缺失(金融)——方法选型的差异完全由数据形态驱动。案例结构与选型逻辑如图 8-1 所示。
图 8-1 案例研究的总体结构(图注:本图给出本章四案例的顶层分解,蓝色结构节点分两列——案例列与方法列。请重点看三个关键节点:四个案例按数据形态而非行业排序,低维到高维递进;每个案例标注主用方法,方法都是前七章出现过的"标准件"而非新工具;方法列的差异提醒读者:换数据形态不换方法纪律,第八章的教训全部来自"纪律在,工具变"。)
8.1 案例一:消费者行为与品牌态度关联分析
8.1.1 研究背景与变量设计
某连锁零售企业想回答一个问题:消费者对品牌的态度结构,与他们的实际购买行为之间隔着几重关系?理论模型(态度—行为双路径)提示态度可粗分为认知型(产品评价、质量感知)与情感型(品牌喜爱、信任),行为侧采集高频客单行为(月度购买频次、客单价、品类跨度、复购时长)。按第三章的分组纪律:理论驱动分组——X 组放态度量表 4 个维度分(认知与情感各 2),Y 组放行为 4 个指标,两侧对称(p=q=4p=q=4p=q=4),n=320n=320n=320 满足 n≥10×8=80n\ge10\times8=80n≥10×8=80 的样本量要求两倍以上。数据来自顾客问卷与会员卡交易记录的纵向匹配。
8.1.2 数据收集与预处理
预处理按 3.3—3.5 节的标准工序执行:态度量表做缺失审计(缺失率 2.1%,MCAR 判定后整条删除 13 例);行为指标右偏(客单价、购买频次),对两者做对数变换后再整体 Z-score 标准化;单变量 Shapiro-Wilk 检查在变换后全部通过宽松判据,Mardia 多元检验通过;X 组内部最大相关 0.58、Y 组最大相关 0.61,条件数与 VIF 均无共线警报。最终进入分析 n=307n=307n=307。
8.1.3 SPSS / R / Python 全流程实现
该案例数据量小、口径标准,三大平台均可直接跑通(第五章流程原样复用,此处给 R 的对照脚本,SPSS 与 Python 的等价代码见附录 B):
library(CCA)
X <- scale(attitude[, 1:4]); Y <- scale(behavior[, 1:4])
res <- cc(X, Y)
# 显著性:Wilks 逐级检验
p <- p.asym(res$cor, N = 307, p = 4, q = 4, tstat = "Wilks")$p.value
r1 <- comput(res, X, Y) # 载荷与交叉载荷
rd <- r1$Rdx2 %*% diag(res$cor^2) # 冗余指数(两侧)
8.1.4 结果解读与管理建议
输出四件套如下:整体检验显著(Λ=0.51\Lambda=0.51Λ=0.51,χ2=175\chi^2=175χ2=175,df=16df=16df=16,p<0.001p<0.001p<0.001);逐级检验保留 2 对(r1=0.64r_1=0.64r1=0.64、r2=0.31r_2=0.31r2=0.31,第 3 对起不显著);载荷命名——U1U_1U1 由质量感知(0.82)与产品评价(0.79)主导,V1V_1V1 由品类跨度(0.77)与购买频次(0.71)主导,第 1 对合成为"理性评价驱动广度购买";U2U_2U2 由品牌喜爱(0.74)主导,V2V_2V2 由复购时长(0.81)主导,第 2 对为"情感依恋驱动复购留存";冗余度——X 侧两对合计解释 Y 侧方差 19.8%,方向性结论克制表述。管理建议随之落地:货架与推荐策略按"理性广度"与"情感留存"两条轴分别设计,情感侧的营销投入对复购的作用经由第 2 对典型路径实现——这是用相关性数据能给出的最远推论,因果性验证需转实验设计(9.3.3 节的注意事项在此兑现)。
8.2 案例二:基因组数据与表型性状关联
8.2.1 研究背景:GWAS 与转录组数据整合
某肿瘤研究团队拿到 210 例同癌种患者的配对数据:RNA 测序表达谱(p=12000p=12000p=12000 个基因,标准化为 FPKM 后取对数)与一组临床表型(ppp 远超样本量:肿瘤大小、分期、3 项血液标志物、生存状态编码),研究目标是找出"与临床表型整体共变的基因模块"。样本量 210 对 12000 维变量,经典 CCA 在数学上无定义(n≪pn\ll pn≪p),稀疏 CCA 是唯一主线——变量选择与关联估计一步完成(7.2 节)。
8.2.2 高维稀疏数据下的稀疏 CCA 应用
流程如下:表达谱先做基因过滤(平均表达过低与方差近零的基因剔除,保留 8600 维);双侧标准化;用 PMA 的置换法选惩罚参数(7.2.4 节):
library(PMA)
cvx <- CCA.permute(x = expr, z = clin, typex = "standard", typez = "standard")
res <- CCA(x = expr, z = clin,
penaltyx = cvx$bestpenaltyx, penaltyz = cvx$bestpenaltyz, K = 3)
保留 3 对,每对的非零基因数控制在 40~120 个。结果先在统计层验证:整体关联的置换检验显著(p<0.001p<0.001p<0.001),第 1 对典型相关 r1=0.52r_1=0.52r1=0.52——低于案例一的 0.64,但在高维组学场景属于强信号;随后做清单稳定性审计:10 折内第 1 对的基因清单重合度 74%(高维数据的合格水平,7.2.3 节)。
8.2.3 R / Python 代码实现
R 路线如上方代码;Python 侧无 PMA 等价官方实现,用交替软阈值循环(附录 B.3 提供完整版)复现第 1 对结果后核对两者选中的基因交集是否超过 80%——跨实现核对是稀疏方法发布前的标准质检,因为稀疏解对初值与收敛阈值敏感,单实现结果不可直接采信。
8.2.4 生物学意义解读
对第 1 对选中的 76 个基因做通路富集(超几何检验 + FDR 校正),显著富集于免疫应答与代谢重编程通路;载荷方向显示该模块与肿瘤大小、炎症标志物同向——生物学叙事成立:这类肿瘤的侵袭表型与免疫-代谢共变模块关联。报告纪律严格执行 7.2.3 节:正文报"模块 + 方向",抑制对"相关强度"的过度渲染,明确标注 210 例样本的验证局限,并把基因清单作为补充材料发布——复现实验(独立队列)在讨论中列为下一步。
8.3 案例三:金融风控中的信用评分关联
8.3.1 研究背景:客户特征与还款行为
某消费金融公司想建立"客户画像与违约行为"的整体关联视图:X 组为客户画像变量(年龄、收入对数、信贷历史长度、查询次数对数、额度使用率),Y 组为行为结果变量(逾期次数、逾期金额对数、授信使用率变化、违约标记编码)。n=8500n=8500n=8500、p=5p=5p=5、q=4q=4q=4,样本充足;但金融数据的两大特性(3.3.2、1.4.3 节预告)成为本案例主角:收入与查询次数的厚尾分布、以及高收入低违约客户中少量极端样本的杠杆效应。
8.3.2 数据预处理与变量筛选
预处理按"稳健优先"推进:连续变量对数变换 + 标准化;异常值检测用马氏距离 + 稳健估计(最小协方差行列式估计作为 S\boldsymbol{S}S 替代普通协方差,规避 3.3.2 节的遮蔽效应),识别出 1.9% 的高杠杆客户进入敏感性分析名单而非直接删除;变量筛选基于领域规则(互不重复的风险信号)确认 5+4 分组,无数据驱动循环。
8.3.3 正则化 CCA 实现
虽然 nnn 充足,稳健性仍是风控报告的生命线,本案例采用"经典 CCA + 稳健协方差 + 敏感性审计"组合,对照测试正则化变体(7.1.4 节):
library(CCA); library(robustbase)
Sx <- covMcd(X)$cov; Sy <- covMcd(Y)$cov # 稳健协方差入口
res_classic <- cc(X, Y) # 基准
res_robust <- rcc(X, Y, 0.02, 0.02) # 正则化变体对照
# 离群客户剔除后的敏感性复跑
res_sens <- cc(X[-hl_idx, ], Y[-hl_idx, ])
三组输出的第 1 对典型相关与权重方向对比是发布判据:若剔除 1.9% 高杠杆样本后第 1 对权重符号翻转,该结论不得进入风控策略。
8.3.4 风控策略建议
结果给出两条可用结构:第 1 对刻画"额度使用与查询频率—逾期倾向"的整体联动(r1=0.47r_1=0.47r1=0.47),载荷以额度使用率(0.78)、查询次数(0.69)与逾期次数(0.72)为骨架;第 2 对刻画"信贷历史长度—授信额度增长"的稳健关联。冗余指数显示 X 侧对逾期方差的总解释 22.4%——说明行为侧的多数波动由组内特有因素主导,风控模型需要补充行为序列类特征(策略建议超出 CCA 的能力边界,如实标注)。稳健性审计结论:剔除高杠杆样本后权重方向不变、幅度变化 <12%,结论进入策略层;正则化变体的第 1 对权重与经典解余弦相似度 0.97,双轨互相背书。
8.4 案例四:教育评估中的学生能力关联
8.4.1 研究背景:学术成绩与综合素质
某高校评估中心试图回答:课程学业表现与综合素质结构之间存在几重关联?数据为 640 名毕业生的两组记录:X 组为学业表现(核心课 GPA、通识课 GPA、实践课 GPA),Y 组为素质测评(团队协作、创新潜质、沟通表达、心理韧性四个量表分)。样本 n=640n=640n=640、p=3p=3p=3、q=4q=4q=4 满足准则;教育数据形态干净(问卷 + 教务记录),本案例的价值在方法对比——同一个数据集上经典 CCA 与稀疏 CCA 的结果关系(1.3.2、7.2.3 节的伏笔在此兑现)。
8.4.2 经典 CCA 与稀疏 CCA 对比
经典路线先跑:整体检验显著,保留 2 对(r1=0.58r_1=0.58r1=0.58、r2=0.24r_2=0.24r2=0.24);载荷显示第 1 对为"实践课 GPA—团队协作与沟通表达"轴,第 2 对为"通识课 GPA—创新潜质"轴。随后在同一数据上跑稀疏 CCA(ppp 小,L1 惩罚只保留最大载荷的变量):由于组内相关温和(最大 0.5),稀疏解与经典解高度一致——被选变量与经典载荷前位变量重合,典型相关只损失 0.01~0.02。两个结论从对比中浮现:其一,低维数据上稀疏化只带来可解释性微增益,7.2.3 节"低维趋同"定律得到实证;其二,两法对"留几对"的判断一致,检验决策对方法选择稳健。对比结果汇总见表 8-1。
表 8-1 案例四经典 CCA 与稀疏 CCA 结果对比
| 口径 | 经典 CCA | 稀疏 CCA(λ 适中) |
|---|---|---|
| 第 1 典型相关 | 0.58 | 0.56 |
| 第 2 典型相关 | 0.24 | 0.23 |
| X 侧第 1 对保留变量 | 3/3 | 2/3(实践课、核心课) |
| Y 侧第 1 对保留变量 | 4/4 | 3/4 |
| 冗余指数(两对合计) | 15.6% | 14.9% |
| 结论方向 | 同 | 同 |
8.4.3 教育政策建议
教育含义的提炼走"结构优先"路线:学业与素质之间存在两重独立关联——“实践导向的能力联结"与"通识导向的创新联结”,第一重远强于第二重。政策建议分两层:课程层面,实践类课程与团队协作、沟通训练的组合设计有据可依;评估层面,综合素质测评对学业表现的线性解释总量有限(两对合计冗余 15.6%),学业之外存在大量未被两组共享的结构——单靠这两组数据不能宣称"素质决定成绩",跨组因果需纵向追踪设计。四个案例的方法选型、数据形态与产出对照汇总于表 8-2。
表 8-2 四案例总览对照
| 维度 | 案例一 消费者 | 案例二 基因组 | 案例三 金融风控 | 案例四 教育评估 |
|---|---|---|---|---|
| 数据形态 | 低维干净 | 超高维稀疏 | 中维厚尾 | 低维干净 |
| 主用方法 | 经典 + 冗余 | 稀疏 CCA | 经典 + 稳健审计 | 经典 vs 稀疏 |
| 保留对数 | 2 | 3 | 2 | 2 |
| 第 1 典型相关 | 0.64 | 0.52 | 0.47 | 0.58 |
| 解释口径 | 冗余 19.8% | 基因清单 + 富集 | 冗余 22.4% | 冗余 15.6% |
| 建议类型 | 营销策略 | 生物模块假设 | 风控特征结构 | 课程与评估设计 |
四案例的完整"问题—数据—方法—结论"四段式管线若并排对照,可以看到同样的骨架在四种数据形态下的稳定复现——这条管线正是全书的操作总结,其接口结构如图 8-2 所示。
图 8-2 案例四段式管线的接口对接(图注:本图展示每个案例内部五级接口的信号流向,蓝色是各加工环节,紫色是最终产出。请重点看三个关键节点:数据形态是决定方法选型的主导输入——先认数据再选工具,顺序不可逆;统计验证环节(检验、稳定性、敏感性)在四个案例中无一省略,是方法纪律的实体;落地建议的输出严格受限于统计口径——案例一与案例四在结论处都明确划出"相关性止步、因果需实验"的边界线。)
四个案例覆盖了本书方法谱系的主要组合,跨案例的模块关系与各自产出路径如图 8-3 所示。
图 8-3 四案例分析模块设计图(图注:本图并列四个案例模块,每个模块内部为"数据对—方法—产出"的三级橙链。请重点看三个关键节点:四个模块的输入都是"两组变量"结构,方法纪律同源;中段的差异(经典冗余/稀疏/稳健/双法对比)正是数据形态驱动的选型分叉;每个模块的输出都落在领域建议上——案例研究不是方法演示,而是"分析服务于决策"的完整闭环。)
本章小结:案例研究留下的五个判断
第一,数据形态决定方法,行业只决定故事。案例二与案例三的差异(稀疏 vs 稳健)完全由 nnn、ppp 与分布形态驱动;把方法硬套到不匹配的形态上,换哪个行业都一样错。
第二,四件套结论口径(显著、载荷命名、冗余、克制建议)跨案例通用。显著性管资格、载荷管命名、冗余管解释量、建议管落地——四个案例无一例外按此顺序收束,这也是第六章报告模板在真实数据上的回炉验证。
第三,稳健性审计是金融等高风险场景的发布闸门。案例三的 1.9% 高杠杆样本审计、案例二的清单重合度审计,本质是同一个动作:让结论在"数据小幅扰动"下保持方向稳定——凡是结论依赖个别样本的分析,都不具备发布资格。
第四,稀疏化在低维场景只是锦上添花。案例四的对比给出定量证据:组内相关温和时稀疏解与经典解趋同,选稀疏是为了可解释性与高维生存能力,而不是为了在低维里"更准"。
第五,边界意识是专业分析的最终标识。案例一与案例四的"因果需实验验证"、案例二与案例三的"解释比例有限"——承认方法边界并如实标注,是案例级分析与教科书演示的分水岭。
四个案例之后,方法、工具与场景都已齐备。下一章处理"实践中还会踩哪些坑":模型诊断与验证的完整流程、十大常见误用陷阱、论文写作与审稿的应对策略,以及 SPSS / R / Python 的最终选型建议——把前八章的所有纪律收拢成一套可直接执行的检查清单。
参考文献(本章)
[1] Thompson B. Canonical Correlation Analysis: Uses and Interpretation[M]. Thousand Oaks: Sage, 1984.
[2] Witten D M, Tibshirani R, Hastie T. A penalized matrix decomposition, with applications to sparse principal components and canonical correlation analysis[J]. Biostatistics, 2009, 10(3): 515-534.
[3] 王芳. 城镇居民消费结构影响因素的典型相关分析[J]. 统计与决策, 2007(3).
[4] 黄小玉. 高职院校基础课成绩对专业课成绩影响的典型相关分析[J]. 牡丹江教育学院学报, 2009(3).
[5] Hair J F, Black W C, Babin B J, Anderson R E. Multivariate Data Analysis (8th ed.)[M]. Cengage Learning, 2019.
[6] 何晓群. 多元统计分析[M]. 北京: 中国人民大学出版社.
】第八章 实际案例研究&spm=1001.2101.3001.5002&articleId=164341268&d=1&t=3&u=c8ff054d390c4e7a9b738f273978f70e)
172

被折叠的 条评论
为什么被折叠?



