*
主成分分析
主成分分析的基本原理
主成分分析的SPSS应用
*
主成分分析基本原理
每个人都会遇到有很多变量的数据。
比如全国或各个地区的带有许多经济和社会变量的数据;各个学校的研究、教学等各种变量的数据等等。
这些数据的共同特点是变量很多,在如此多的变量之中,有很多是相关的。人们希望能够找出它们的少数“代表”来对它们进行描述。
在引进主成分分析之前,先看下面的例子。
*
成绩数据()
100个学生的数学、物理、化学、语文、历史、英语的成绩如下表(部分)。
*
从本例可能提出的问题
目前的问题是,能不能把这个数据的6个变量用一两个综合变量来表示呢?
这一两个综合变量包含有多少原来的信息呢?
能不能利用找到的综合变量来对学生排序呢?这一类数据所涉及的问题可以推广到对企业,对学校进行分析、排序、判别和分类等问题。
*
主成分分析
例中的的数据点是六维的;也就是说,每个观测值是6维空间中的一个点。我们希望把6维空间用低维空间表示。
先假定只有二维,即只有两个变量,它们由横坐标和纵坐标所代表;因此每个观测值都有相应于这两个坐标轴的两个坐标值;如果这些数据形成一个椭圆形状的点阵(这在变量的二维正态的假定下是可能的)
那么这个椭圆有一个长轴和一个短轴。在短轴方向上,数据变化很少;在极端的情况,短轴如果退化成一点,那只有在长轴的方向才能够解释这些点的变化了;这样,由二维到一维的降维就自然完成了。
*
主成分分析
当坐标轴和椭圆的长短轴平行,那么代表长轴的变量就描述了数据的主要变化,而代表短轴的变量就描述了数据的次要变化。
但是,坐标轴通常并不和椭圆的长短轴平行。因此,需要寻找椭圆的长短轴,并进行变换,使得新变量和椭圆的长短轴平行。
如果长轴变量代表了数据包含的大部分信息,就用该变量代替原先的两个变量(舍去次要的一维),降维就完成了。
椭圆(球)的长短轴相差得越大,降维也越有道理。
*
*
主成分分析
对于多维变量的情况和二维类似,也有高维的椭球,只不过无法直观地看见罢了。
首先把高维椭球的主轴找出来,再用代表大多数数据信息的最长的几个轴作为新变量;这样,主成分分析就基本完成了。
注意,和二维情况类似,高维椭球的主轴也是互相垂直的。这些互相正交的新变量是原先变量的线性组合,叫做主成分(principal component)。
*
主成分分析是把各变量之间互相关联的复杂关系进行简化分析的方法。在社会经济的研究中,为了全面系统第分析和研究问题,必须考虑许多经济指标,这些指标能从不同的侧面反映我们所研究的对象的特征,但在某种程度上存在信息的重叠,具有一定的相关性。主成分分析试图在力保数据信息丢失最少的原则下,对这种多变量的截面数据表进行最佳综合简化,也就是说,对高维变量空间进行降维处理。
很显然,识辨系统在一个低维空间要比在一个高维空间容易得多。
*
(1) 基于相关系数矩阵还是基于协方差矩阵做主成分分析。当分析中所选择的经济变量具有不同的量纲,变量水平差异很大,应该选择基于相关系数矩阵的主成分分析。
(2) 选择几个主成分。主成分分析的目的是简化变量,一般情况下主成分的个数应该小于原始变量的个数。关于保留几个主成分,应该权衡主成分个数和保留的信息。
(3) 如何解释主成分所包含的经济意义。
在力求数据信息丢失最少的原则下,对高维的变量空间降维,即研究指标体系的少数几个线性组合,并且这几个线性组合所构成的综合指标将尽可能多地保留原来指标变异方面的信息。这些综合指标就称为主成分。要讨论的问题是:
*
主成分分析的数学模型
假设我们所讨论的实际问题中,有p个指标,我们把这p个指标看作p个随机变量,记为X1,X2,…,Xp,主成分分析就是要把这p个指标的问题,转变为讨论p个指标的线性组合的问题,而这些新的指标F1,F2,…,Fk(k≤p),按照保留主要信息量的原则充分反映原指标的信息,并且相互独立。这种由讨论多个指标降为少数几个综合指标的过程在数学上就叫做降维。主成分分析通常的做法是,寻求原指标的线性组合Fi。
*
*
满足如下的条件:
主成分之间相互无关,即无重叠的信息。即
主成分的方差依次递减,重要性依次递减,即
每个主成分的系数平方和为1。即
*
(1)对原变量的样本数据矩阵进行标准化变换
(2)求标准化数据矩阵的相关系数矩阵R
(3)求R的特征根及相应的特征向量和贡献率等
(4)确定主成分的个数
(5)解释主成分的实际意义和作用
详细的推导计算见《多元统计分析》p135
主成分分析的计算步骤
*
SPSS进行主成分分析
某市为了全面分析机械类各企业的经济效益,选择了8个不同的利润指标
*
净产值利润率(%)
x1
固定资产利润率(%)
x2
总产值利润率(%)
x3
销售收入利润率(%)
x4
产品成本利润率(%)
x5
物耗利润率(%)
x6
人均利润率
(千元/人)
x7
流动资金利润率(%)
x8
表1 8个不同的利润指标
*
表2 原始数据
变量
企业序号
净产值利润率(%)
xi1
固定资产利润率(%)
xi2
总产值利润率(%)
xi2
销售收入利润率(%)
xi3
产品成本利润率(%)
xi5
物耗利润率(%)
xi6
人均利润率
xi7(千元/人)
流动资金利润率(%)
xi8
1
2
3
4
5
6
7
8
9
10
11
12
13
14
*
SPSS操作步骤:
*
由于各个指标的单位不同,为消除单位不同所造成的影响,需对指标数据进行标准化,即数据的无量纲化。此步骤通过SPSS软件中的Analyze-Descriptive Statistics-Descriptives(分析-描述统计-描述)步骤,并在对话框中选择“Save standardized values as variables”。
*
*
*
数据的标准化
*
利用“Data Reduction-Factor”(分析-降维-因子分析),将标准化后的数据作为变量,并在对话框中的“Extraction”(抽取)选项中,选择“Principal components”(主成分分析),并选择“Correlation matrix”(相关矩阵);在“Descriptives”(描述)对话框中,选择“Coefficients”(系数)。
*
*
*
点击确认后,得到SPSS分析结果。
*
相关系数矩阵
*
方差分解主成分提取分析表
*
初始因子载荷矩阵
*
将两列因子载荷矩阵数据输入到SPSS软件数据编辑窗口,成为变量B1、B2。
主成分表达式:
*
(初始因子载荷矩阵)数据除以主成分相对应的特征根平方根,可得主成分表达式中各指标对应系数,即利用“Transform-compute”(转换-计算变量),输入C1=B1/SQRT(),C2=B2/SQRT()。
*
主成分相对应的特征根
*
*
*
可得主成分表达式:
F1=+++
+ 8X5+++
F2=
++
*
方差分解主成分提取分析表
F1=++++ 8X5+++
F2= ++
F=+-+ ++++
=(*+*)/
*
*
*
主成分1排序
主成分2排序
综合排序
9
1
9
6
5
6
2
8
1
8
13
8
1
11
2
13
2
13
14
4
5
5
14
14
7
3
10
10
12
7
4
10
4
11
6
11
3
9
3
12
7
12
*
F1,F2的累计贡献率达到%,是反映各企业总效应大小的综合指标。而F1各项系数大致相等,且均为正数,说明第一主成份对所有的信用评价指标都有近似的载荷,是对所有指标的一个综合测度,可以作为综合的信用等级指标。用F1得分值对各企业进行排序,能从整体上反映企业之间的效应差别。
从综合得分来看,
第9家企业的效益最好,
第12家企业的效益最差。
*
优点:
消除原始变量间存在的共线性,克服由此造成的运算不稳定、矩阵病态等问题,找到表现原始数据阵最重要的变量的组合。
压缩变量个数,剔除冗余信息,从最大的几个主成分的得分来近似反映原始的数据阵的信息,使模型更好地反映真实情况。
通过表示最大的方差,能有效地直观反映样本之间的关系。
*
缺点:
当主成分的因子负荷的符号有正有负时,综合评价函数意义就不明确;命名清晰性低。