在心理测量、市场调研、社会科学等众多领域,因子分析是研究者们常用的统计工具,用以揭示观测变量背后的潜在结构。然而,传统探索性因子分析(EFA)在面对小样本、高维数据或多重共线性时,往往表现不稳定。近年来,正则化探索性因子分析(Regularized Exploratory Factor Analysis,简称正则化EFA)应运而生,它通过引入惩罚项,有效提升了模型的稳健性和泛化能力。但很多研究者完成正则化EFA后,面对“如何计算因子得分”这一关键问题,却常常感到困惑。本文将为您系统梳理正则化EFA后因子得分的计算方法及其应用场景。
什么是正则化EFA?
正则化EFA是传统EFA的延伸,它在估计因子载荷矩阵时加入L1(LASSO)或L2(岭回归)等惩罚项,以此约束参数大小,避免过拟合。例如,当样本量远少于变量数,或变量间存在严重共线性时,传统EFA的极大似然估计可能失效,而正则化方法通过收缩某些载荷至零(如LASSO),使模型更简洁、更易解释。常见的正则化EFA方法包括“稀疏因子分析”(SPCA)、“稳定因子分析”等,其中岭回归型正则化还能保留更多变量信息。
因子得分的作用
因子得分是将原始的多个观测变量浓缩为少数几个潜变量的数值表示。例如,在消费者满意度调查中,通过计算因子得分,可将几十个问题合并为“服务质量”“价格感知”等少数维度,以便进行后续的回归分析、聚类或可视化。正则化EFA后的因子得分同样服务于这一目的,但计算过程需考虑正则化带来的特殊性。
计算因子得分的核心方法
正则化EFA后,因子得分的计算通常沿用传统EFA的三种主流方法,但需要根据正则化模型的特点进行调整。
1. 回归法(Regression Method)
这是最常用的方法。假设正则化得到的因子载荷矩阵为 Λ(p×k,p为变量数,k为因子数),变量协方差矩阵为 Σ(可由数据估计)。传统回归法的因子得分公式为:F = X Λ (Λ' Σ Λ)^{-1} Λ',其中X为原始数据矩阵。但在正则化背景下,Λ 可能包含许多零元素(如LASSO的结果),此时直接套用公式需注意协方差矩阵 Σ 是否适用。实际做法是:先利用正则化后的载荷重构降秩协方差矩阵,再代入回归公式。多数统计软件(如R语言的psych包或regularizedEFA包)已内置该功能。
2. 巴特莱特法(Bartlett Method)
该方法通过加权最小二乘估计因子得分,公式为:F = (Λ' Σ^{-1} Λ)^{-1} Λ' Σ^{-1} X。巴特莱特法的优势在于得分无偏,但要求 Σ 可逆。正则化EFA中,如果惩罚项导致载荷矩阵非满秩,需先进行奇异值分解或添加极小正则项确保可逆。实践中,建议选择LASSO型正则化时使用巴特莱特法,因为它对稀疏载荷更稳定。
3. 安德森-鲁宾法(Anderson-Rubin Method)
此法旨在使因子得分正交且互不相关,适用于需要保留因子独立性的场景。其公式较复杂,本质上是在巴特莱特法基础上进行正交旋转。正则化EFA后,若因子间原本就通过惩罚项实现了近似正交,则安德森-鲁宾法效果更佳。但该方法计算量较大,一般仅用于结构方程建模前的预处理。
使用正则化后因子得分的注意事项
正则化EFA的因子得分并非传统得分的简单“正则化版本”,研究者需关注以下几点:
-
载荷稀疏性影响:LASSO型正则化可能将许多载荷压缩为0,导致某些变量完全不出现在因子得分中。这有助于降噪,但也可能丢失有用信息。建议结合交叉验证选择惩罚参数,平衡稀疏性和解释性。
-
得分尺度问题:正则化后因子得分的方差可能小于1,与传统EFA中标准化因子得分的方差为1不同。若需进行跨研究比较,建议将得分标准化为均值为0、方差为1的Z分数。
-
软件实现:目前只有少数专业软件(如R的
regfac、psych扩展包)直接支持正则化EFA的因子得分计算。Python的factor_analyzer库尚未完全集成。研究者也可手动计算:提取正则化后的载荷矩阵,将其视为已知参数,再用上述方法自行编程实现。
应用案例:心理量表开发
假设研究者开发了一份30题的焦虑量表,但样本仅有100人(变量数30,样本量不足)。传统EFA可能无法收敛。使用岭回归正则化EFA后,得到4个因子(躯体症状、认知担忧、社交回避、情绪波动)。此时,用回归法计算每位被试在4个因子上的得分,代替原始30个变量,再用于后续的焦虑诊断分类。正则化后的因子得分更稳定,且避免了小样本下的过度拟合。
未来展望
随着大数据时代高维数据的普及,正则化EFA及其因子得分计算将越来越重要。当前学术界正致力于开发更高效的算法,如基于交替方向乘子法(ADMM)的快速因子得分计算,以及结合贝叶斯方法的非参数正则化。对于一线研究者来说,理解正则化EFA因子得分的原理和计算选项,是在复杂数据环境中挖掘洞见的关键一步。
结语:正则化EFA后的因子得分计算并不神秘,其核心仍是回归、巴特莱特等经典方法,但需要结合正则化模型的特点谨慎实施。选择合适的计算方法、注意稀疏性和尺度问题,就能让正则化EFA真正成为数据分析的利器。无论您是刚接触因子分析的新手,还是寻求更稳健模型的资深学者,掌握正则化后因子得分的计算,都将为您的量化研究打开一扇新的大门。