第二章一元线性回归模型
商学院经贸系经济学研究室(12-209)
王俊娟
Tell:13193768331;Email:jay987666@
课程内容:
§2.1模型的建立及其假定条件
§2.2一元线性回归模型的参数估计
§2.3最小二乘估计量的统计性质
§2.4用样本可决系数检验回归方程的拟合优度
§2.5回归系数估计值的显著性检验与置信区间
§2.6一元线性回归方程的预测
§2.7小结
§2.8案例分析
§2.1模型的建立及其假设条件
1.相关关系与回归模型
①变量之间的关系:函数关系、非函数关系
相关关系:泛指变量间的非确定关系(不考虑因果)
回归关系:指变量间非确定性的因果关系(考虑因果)
相关关系的描述
最直观的描述方式——坐标图(散点图)
相关关系的类型
● 从涉及的变量数量看
简单相关
多重相关(复相关)
● 从变量相关关系的表现形式看
线性相关——散点图接近一条直线
非线性相关——散点图接近一条曲线
● 从变量相关关系变化的方向看
正相关——变量同方向变化,同增同减
负相关——变量反方向变化,一增一减
不相关——无规律可言
相关程度的度量—相关系数
总体线性相关系数:
其中: ——X 的方差; ——Y的方差
——X和Y的协方差
样本线性相关系数:
其中: 和 分别是变量 和 的样本观测值
和 分别是变量 和 样本值的平均值
注意:
● 和 都是相互对称的随机变量
● 线性相关系数只反映变量间线性相关程度,不能说明非 线性相关关系
● 样本相关系数是总体相关系数的样本估计值。由于抽样波动,样本相关系数是个随机变量,其统计显著性有待检验
● 相关系数只能反映线性相关程度,不能确定因果关系
计量经济学更关心:变量间的因果关系及隐藏在随机性后面的统计规律性,这有赖于回归分析方法。
②回归分析及回归模型:
回归分析
回归的古典意义:高尔顿遗传学的回归概念
回归的现代意义:一个因变量对若干自变量依存关系 的研究
回归的实质:由固定的自变量去估计因变量的平均值
补充:几个概念
● 的条件分布
当解释变量 取某固定值时(条件), 的值不确定, 的不同取值形成一定的分布,即 的条件分布。
● 的条件期望
对于 的每一个取值,
对 所形成的分布确
定其期望或均值,称
为 的条件期望或条
件均值
●回归线:
对于每一个 的取值,
都有 的条件期望
与之对应,
代表这些 的条件期
望的点的轨迹所形成
的直线或曲线,称为
回归线。
回归函数:因变量 的条件期望 随解释变量 的的变化而有规律的变化,如果把
的条件期望 表现为 的某种函数
这个函数称为回归函数。
分为:总体回归函数和样本回归函数
总体回归函数:
前提:假如已知所研究的经济现象的总体因变量 和解释变量 的每个观测值, 可以计算出总体应变量 的条件均值 ,并将其表现为解释变量 的某种函数
这个函数称为总体回归函数(PRF)
回归模型:若变量X、Y具有回归关系,则Y=f(X, μ)称为回归模型。
3150
2900
2650
2400
2150
1900
1650
1400
1150
900
2586
2589
2710
2487
2498
2012
2610
2453
2387
1900
Y
2567
2423
2316
1886
1702
出
3110
2538
2398
2298
1841
1600
支
3274
2934
2513
2313
2179
1778
1538
费
3142
2853
2487
2289
2078
1712
1489
消
3064
2789
2398
2210
2037
1650
1448
庭
3399
3021
2650
2365
2185
1943
1615
1400
1324
家
3288
2900
2587
2321
2066
1885
1520
1340
1259
月
3201
2856
2488
2319
1068
1835
1432
1310
1210
960
每
3150
2790
2426
2225
1906
1786
1410
1264
1121
932
3038
2589
2388
2110
1874
1726
1365
1201
1024
888
2824
2464
2275
2037
1842
1632
1329
1108
962
820
5500
5000
4500
4000
3500
3000
2500
2000
1500
1000
每 月 家 庭 可 支 配 收 入 X
例:假如已知100个家庭构成的总体。(单位:元)
条件均值表现形式
假如 的条件均值 是解
释变量 的线性函数,可表示为:
个别值表现形式
对于一定的 , 的各个别值 分布
在 的周围,若令各个 与条件
均值 的偏差为 , 显然 是随机变量,则有
或 ( )
③线性回归模型
“线性”的含义?
指变量之间按比例、成直线的关系,在数学上可以理解为一阶导数为常数的函数。
线性回归模型的普遍性 :
a.较容易研究,可以抓住问题实质 ;
b.现实中许多非线性问题可转化为线性模型;
c.线性模型是研究非线性模型的基础。
●实际的经济研究中总体回归函数通常是未知的,只能根据经济理论和实践经验去设定。“计量”的目的就是寻求PRF。
●总体回归函数中 与 的关系可是线性的,也可是非线性的。
对线性回归模型的“线性”有两种解释
就变量而言是线性的
—— 的条件均值是 的线性函数
就参数而言是线性的
—— 的条件均值是参数 的线性函数
变量、参数均为“线性”
参数“线性”,变量”非线性”
变量“线性”,参数”非线性”
计量经济学中:
线性回归模型主要指就参数而言是“线性”,因为只要对参数而言是线性的,都可以用类似的方法估计其参数。
对“线性”的判断
2.一元线性回归模型
例:为研究某市每年猪肉价格的需求量,考虑到消费者人均可支配收入对猪肉需求量的决定作用,建立如下计量经济学模型:
其中:
——表示某市全年对猪肉的需求量,即因变量;
——表示该市消费者人均可支配收入,即自变量;
——表示随机扰动项(随机误差项)
、 ——表示回归系数(待定系数)
式称为一元线性回归模型
为何要引入随机扰动项μ?
随机扰动项:
表示除X外,其他多种因素对Y的综合影响,又称误差项;是一随机变量,其值我们观察不到,可以取正值,也可以取负值。
(可以取0吗?)
引入原因:
①表示Yi的非确定性;
②实际经济定量分析过程中,计量经济学模型中不可能包含所有变量,次要变量不可避免地被忽略;
③确定模型数学形式时,没有确定的方法,而经济变量间关系极复杂,故确定数学形式有误差;
④建立模型时使用的样本数据会有测量误差;
⑤一些客观存在的随机因素无法列入模型。
μ项都包括哪些内容?
①代表了模型中省略的次要变量对变量Y的影响;
②代表了确定模型数学形式的误差;
③代表了一些随机因素(人们的随机行为、经济变量之间的合并误差);
④代表样本点的测量误差。
μ项的特征有哪些?
①众多因素对解释变量Y的影响代表的综合体;
②对Y的影响方向各异,有正有负;
③由于是次要因素的代表,对Y的总平均影响为可能零;
④对Y的影响是非趋势性的,是一个随机扰动。
3.随机误差项的条件及对解释变量性质的界定
说明:由于随机误差项μ的存在,使得模型中的参数的数值不可能严格算出,只能进行估计;而在计量经济学中,能否成功估计出 、 …等参数值,取决于随机项μ和解释变量X的性质。只有具备一定的假定条件,所作出的估计才具有较好的统计性质。因此,对于μ和X的统计假定及检验意义重大,被称为基本假定。
复习:随机变量的数字特征
数学期望:
定义:在实验次数很大时,随机变量X的观察值的算术平均数在一定意义下接近于随机变量X的数学期望或均值。
性质:①②③④
方差:
定义:表示随机变量与其均值的偏离程度。
性质:①②③④
协方差:
描述X与Y之间相互关系的数字特征。性质:①②
相关系数:
假定一:每个 ( i =1,2,3,…,n)均为随机变量,且
假定二: ,i =1,2,3,… ;
即任何特定条件下, 对应的 的期望值或平均值都为0。由此可知:
,
i=1,2,3,…
假定三: , i=1,2,3,…;
即在任何特定时期(或样本)条件下 对应的每个 的方差相同且均为同一常数 。
,
i=1,2,3,…
假定四: ,i=1,2,3,…
即在任何特定时期(或样本)解释变量 与 对应的随机项 与 之间是独立不相关的。
假定五:
即随机扰动项 与 不相关,进一步表示 是确定变量,保证 是非随机变量。
假定六: 服从正态分布 ;
假定七:
若模型中有两个或两个以上解释变量,则假定解释变量之间不是完全线性相关的。
违背假定三:异方差
违背假设四:自相关
§2.2一元线性回归模型的参数估计
——最小二乘估计
1.四种重要的关系式
A.总体回归模型:
B.总体回归方程:
(PRF)
C.样本回归模型:
( 、 是 和 的估计值和估计量。 = 为残差项、拟合误差,是 的估计值。)
D.样本回归线方程: ,
( 是样本观测值 的估计值或拟合值)
样本回归线与总体回归线的关系
SRF
PRF
A
为什么要估计参数?
由于实际经济分析中,不可能将变量 、 的所有值都取到,即参数的真实值 、 是求不到的,只能通过样本求得 、 ,用样本回归模型和样本回归线方程去推断总体回归模型的形式和总体回归线方程。
拟合原则不同,则参数估计方法不同。
2.最小二乘法:
最小二乘法原则:
一条好的拟合直线应该是使残差平方和最小,以此为准则,确定X与Y之间的线性关系。
即“普通最小二乘法”( Ordinary Least Squares ),简记OLS。
谁提出的OLS估计方法?为什么要取平方和?
(C F Gauss, 1777-1855)
C F Gauss 1809年提出OLS估计方法。
用OLS估计参数的过程:
求极值,使 达最小,对 、 求一阶偏导为零,即
也可以写作:
推出:
即:
此方程组叫正规方程组。
解正规方程组得:
2
用克莱姆法则求解得观测值形式的OLS估计式:
如果我们记: ,其中
则可根据正规方程组的解推出离差形式的最小二乘估计量:
注:不难看出,离差形式的最小二乘估计量表达式较前一种表达式简便且容易记忆。
残差项 的均值为零
因变量估计值 与残差项 不相关
解释变量 与残差项 不相关
3.几个常用的结果:
回归线通过样本均值
估计值 的均值等于实
际观测值 的均值
4.截距为零的一元线性回归模型的参数估计
若回归模型截距为零,则一元线性回归模型一般形式为:
若满足基本假设,则 的最小二乘估计量
练习:下表给出了某地区农村家庭人均可支配收入X,和家庭人均消费性支出Y的资料。请建立一元线性回归模型并利用OLS估计参数值。
12597109
1/n∑
∑
1954350
2706321
2007
1039295
1308575
2006
2005
2004
2003
2002
2001
1107574
2000
2178896
2754206
1999
2504061
3292685
1998
年份
§2.3最小二乘估计量的统计性质
抽样是随机的,不同的样本可得不同估计值。在最小二乘估计条件下,规定残差平方和最小是拟合好坏的标准,此时估计出来的参数均为随机变量,必定具有一定的概率分布。
估计出来的参数是否具有优良的统计性质?
三个优良统计性质:
A.线性性
B.无偏性
C.最小方差性(有效性)
拥有这类性质的估计量称为最佳线性无偏估计量(Best Linear Unbiased Estimator, BLUE)。
1.线性性,指的是参数估计量是被解释变量的线性函数。即估计量 、 是 的线性组合。
复习:偏度
偏度是统计数据分布偏斜方向和程度的度量,是统计数据分布非对称程度的数字特征。
总体偏度:对于单峰分布数据,总体偏度是
(其中,S表示偏度, 表示观测值, 表示 的均值,
表示 的总体标准差,N表示总体容量。)
偏度S是 的3阶矩。若分布式以 对称的,则偏度为零;若分布是右偏倚的,则偏度S>0;若分布是左偏倚的,则偏度S<0。
样本偏度:对于单峰分布数据,样本偏度是
(其中, 表示样本偏度。 表示观测值, 表示样本平均数, 表示样本标准差的估计值,n表示样本容量。
证:
易知
故
同样地,容易得出
(2)证明最小方差性
其中,ci=ki+di,di为不全为零的常数
则容易证明
§2.4用样本可决系数检验回归方程的拟合优度
参数估计→经济学检验→统计检验
(经济学意义的检验不做为本学科重点)
问题:由最小二乘法所得直线能对这些点之间的关系加以反映吗?对这些点之间的关系或趋势反映到了何种程度?(必须经某种检验或找某指标,在一定可靠程度下对拟合的优度进行评价。)
拟合优度检验:
衡量样本回归线与样本观测值之间拟合程度的检验。
(度量拟合程度的指标是可决系数R2)
§总离差平方和的分解
§样本可决系数
§样本可决系数与样本相关系数
§总离差平方和的分解
问题:采用普通最小二乘估计方法,已经保证了模型最好地拟合了样本观测值,为什么还要检验拟合程度?
Y的i个观测值与样本均值的离差
由回归直线解释的部分
回归直线不能解释的部分
离差分解为两部分之和
显然,由样本回归线解释的部分 越大,残差 解释的部分就越小,样本回归线的拟合优度就越好。
对于所有样本点而言,需考虑离差的平方和:
记
总体平方和(Total Sum of Squares)
回归平方和(Explained Sum of Squares)
残差平方和(Residual Sum of Squares )
即:总离差平方和=回归平方和+残差平方和
§样本可决系数
在给定样本中,TSS不变,
拟合优度:回归平方和ESS/Y的总离差TSS
如果实际观测点离样本回归线越近,则ESS在TSS中占的比重越大,说明样本回归线对样本值的拟合优度越好。
令:
可决系数的性质:
1. 是一个非负的统计量。取值范围:[0,1]
2. 越接近1,说明实际观测点离回归线越近,拟合优度越高。
不同的表达形式:
可决系数和相关系数有什么关系?
§样本可决系数与样本相关系数
样本相关系数:是变量X与Y之间线性相关程度的度量指标。定义为:
相关系数的性质:
1.取值范围:[-1,1];
2.当r=0时, =0,说明Y的变化与X无关,X与Y没有线性关系;
3.大多情况下,0<|r︱<1,即X与Y存在一定线性关系,r>0时, >0;反之,X与Y成负相关。
4.当r=1时,称为完全正相关;r=-1时,称完全负相关。
可决系数与相关系数概念不同,但密切相关:
可决系数可写为:
因此,从公式上看:
可决系数=相关系数的平方
相关系数可写为:
总之:
可决系数反映的是非随机变量X对随机变量Y的解释程度;
相关系数反映的是两个随机变量X与Y之间的线性相关关系。
样本相关系数的检验:
即对变量X与Y之间是否存在显著线性相关关系的检验。
在一元线性模型中,变量的显著性检验就是判断X是否对Y具有显著的线性影响。
变量的显著性检验所应用的方法是数理统计学中的假设检验。
通过检验对象真值是否为零来实现显著性检验。
复习:假设检验(Hypothesis Testing)
假设检验:就是事先对总体参数或总体分布形式作出一个假设,然后利用样本信息来判断原假设是否合理,即判断样本信息与原假设是否有显著差异,从而决定是接受或否定原假设。
假设检验采用的逻辑推理方法——反证法。先假定原假设正确,然后根据样本信息,观察由此假设而导致的结果是否合理,从而判断是否接受原假设。
判断结果合理与否,是基于“小概率事件不易发生”这一原理的。
假设检验原理:
样本相关系数检验过程:
原假设 : 备择假设 :
构造t统计量:
给出显著水平 ,查出自由度为n-2的t分布表,得到一个临界值 。
将样本相关系数带入t 统计量,求出︱t︱。
1.若︱t︱< , 则接受 : (总体相关系数为0,X与Y之间没有显著线性相关关系)
2.若︱t︱> ,则接受 : (X与Y间具有显著线性相关关系)
§2.5回归系数估计值的显著性检验与置信区间
§回归系数估计值的分布及 的方差
§回归系数估计值的显著性检验——t检验
§回归系数 、 的置信区间
§回归系数估计值的分布及 的方差
1. 、 的分布
已知 、 服从正太分布,回归系数估计值是被解释变量的线性组合,故也服从正太分布。即:
的概率分布图
2. 的方差
由于 、 的方差中都含 ,但在实际生活中 是观测不到的,必须用其估计值e的方差 作为其方差估计值:
可证明:
故, 、 的标准差估计值分别为 和
§回归系数估计值的显著性检验——t检验
回归系数估计值的显著性检验:是指对模型中被解释变量与某个解释变量之间的线性关系在总体上是否显著成立(即以多大的可能性成立)作出判断。
为什么要进行回归系数估计值的显著性检验?
回归方程是根据样本点经由估计方法求出的,我们并不知道参数的真值。如果很大可能性下参数值为零是成立的,则计量经济学模型中解释变量与别解释变量间的线性关系以统计学的观点看是不显著存在的,回归方程就没有意义了。
t检验步骤:
原假设 : ;备择假设 :
构建t统计量
计算
给出显著水平ɑ,查自由度为n-2的t分布表,找出临界值 。
如果︱t︱< ,则接受原假设;
如果︱t︱> ,则接受备择假设。
对 的t检验与此相似
§回归系数的置信区间
(n-2)
(n-2)
(n-2)
(n-2)
(n-2)
称为置信度
复习:
1.
2.
3.