博弈论-- 企业管理中的竞争问题
董志勇 博士 副教授
北京大学经济学院院长助理
市场竞争程度
(1)商品总量
(2)供大于求
(3)利润率
(4)企业寿命
(5)管理者思考时间
博弈论和策略行为
Game Theory & Strategic Behaviors
智猪博弈
石头、剪刀、布
田忌赛马
麻将
……
本讲计划( Lecture Plan):
博弈论(Game Theory )
策略&支付矩阵(Strategy & Payoff Matrix )
占优策略( Dominant Strategies )
纳什均衡(Nash Equilibrium)
最大最小策略& 混合策略(Maximin Strategy & Mixed Strategy )
策略行为(Strategic Behavior)
念出纸片上的数字,计算平均数的2/3
找出获胜者
猜数试验
猜数试验分析
每个参与人意识到其他参与人的存在
参与人的行为会相互影响
每个参与人推测其他参与人可能采取的行为,根据其推测决定自己的行为
这是一个典型的博弈
简单思路
每位同学随机提出0-100间的数,则平均数为50,2/3*50=33,可以提出33
但是,如果预料到其他同学也这样分析,则应该提出2/3*33=22
以此类推,则应该提出2/3*22=14,2/3*14=9,2/3*9=6,2/3*6=4。。。=0
如果是一群博弈专家作次试验,则答案为0,同学们知道彼此都不是博弈专家,所以多数没有提出0
博弈试验2—拍卖试验
规则
拍卖物品
每位同学在纸片上写下自己的出价,价格必须大于零,没有上限
出价最高者得这
无论得或不得,必须支付所出价:其余出价人的报价将收集起来作为活动经费(eg. 一起出去吃顿饭)
思考1分钟,写下出价
拍卖试验
公布各个同学的出价,找出获胜者
各位同学是否后悔自己的出价?
试验分析
知道其他同学出价后,一定有同学会后悔自己的出价,本博弈不存在简单的均衡
如果参与博弈的人越多,你的出价会变化吗?怎么变化?
人数越多,出价越低
博弈论的基本概念:
参与人( Players ): 参与人指的是一个博弈中的决策主体,他的目的是通过选择行动以最大化自己的支付水平。
行动( Action or Move): 行动是参与人在博弈的某个时点的决策变量。
信息( Information): 信息是参与人有关博弈的知识,特别是有关“自然”的选择、其他参与人的特征和行动的知识。
策略( Strategy): 战略是参与人在给定信息集情况下的行动规则,它规定参与人在什么时候选择什么行动。
支付( Payoffs ): 支付或者是指在一个特定的战略组合下参与人得到的确定效用水平,或者是指参与人得到的期望效用水平。
博弈与决策—一个例子
10位同学到餐厅用餐
A、如果分别点菜,分别付账,是博弈还是决策?
B、如果共同点菜,平均付账,是博弈还是决策?
A、决策, B、博弈
策略&支付(Strategy & Payoffs)
博弈论把人间一切竞争活动看成是玩策略游戏。这种策略游戏是在一定的游戏规则之下进行
它的两个最基本的概念是策略与支付矩阵
一种策略(Strategy)表示游戏参与人的一套运作计划和手段。如“降价15%”就是一种策略
收益矩阵(Payoff matrix)是表示游戏参与者在各种不同策略下的利润额的一套支付表格
寡头垄断,尤其是双寡头垄断竞争,特别适合使用博弈论研究
囚徒困境 (Prisoner’s Dilemma):
两个嫌犯被捕并受到指控,但除非至少一人招供犯罪,警方并无充分证据将其按罪判刑
警方将他们分开审讯(不能沟通),并对他们说明不同行动带来的后果。
如果二人都不坦白,只能判简单刑事罪,坐牢1个月
如果二人都坦白,两人都会定罪,判刑六个月;
如果其中一个坦白,另一个不坦白;那么坦白者马上释放(从宽)、不坦白者将会判刑九个月。
请问两个嫌犯该怎么办?
囚徒困境 (Prisoner’s Dilemma)
策略(Strategy): “沉默” & “招认”
支付矩阵(Payoff Matrix)如下:
囚犯1
招认
沉默
-6, -6
0, -9
招认
-9, 0
-1, -1
沉默
囚犯2
囚犯两难的问题在现实中常常出现。
比如两家企业的价格战。
国美
违约降价
遵守协议
70, 70
130, 30
违约降价
30, 130
100,100
遵守协议
苏宁
囚徒困境 (Prisoner’s Dilemma)
一个例子
失效的石油协定
两个OPEC成员国: 沙特 与 科威特
每个国家都有两种行动:增产 或 保持产量
保持产量可以获得稳定的利益;
一方增产一方保持,则增产的一方可以获得多一点的利益,而保持的一方利益受损;
双方都增产,供严重大于求,利益均损。
两国如何决策呢?
参与人
(局中人)
行动
结果和报酬
同时行动和纳什均衡
决策分析
假设:同时行动,不完全信息,各自追求自己的利益最大
保持
增产
保持
增产
沙特
科威特
科威特的策略:
不管沙特如何,我都增产;
不管沙特如何,我都保持;
沙特的策略:
不管科威特如何,我增产
不管科威特如何,我保持
(6, 6)
(7, 4)
(4, 7)
(5, 5)
结果:双方都增产……
同时行动和纳什均衡
决策分析
纳什均衡
(6, 6)
(7, 4)
保持
(4, 7)
(5, 5)
增产
保持
增产
沙特
科威特
一些结论
个人利益与集体利益的冲突
协议以及制度的安排,若要产生效力,需是纳什均衡
同时行动和纳什均衡
纳什均衡的关键:无人愿意打破僵局
给定一个状态,是否有人单独愿意去改变?
(6, 6)
(7, 4)
保持
(4, 7)
(5, 5)
增产
保持
增产
沙特
科威特
纳什均衡点
性别战博弈 (The Battle of Sex)
一男一女试图安排一个晚上的娱乐内容
策略:“歌剧”、“拳击”;不过男女有别
支付矩阵(Payoff Matrix)如下:
女 (The Lady)
拳击
歌剧
1,2
0,0
拳击
,
2, 1
歌剧
男 (The Man)
游戏:
规则:一群企业家,每一个人发给同样数目的货币例如1000元,告诉他们可以全部、部分或者零地对一个名为“团体交换”的项目投资。每一个人的投资额是保密的,并且每一个人都被告知在投资完成以后,所有人(不论投资与否)都将平均分配投资收益。投资收益是实际的投资额乘以一个大于1但是小于全体人数的倍数。
写出你的投资金额。
纳什均衡 (Nash Equilibrium)
纳什均衡问题:
不存在纳什均衡的例子:
猜谜游戏( Matching Pennies):
零和博弈,一方所得即另一方所失,没有纳什均衡!
A
反面
正面
1, -1
-1,1
反面
-1, 1
1, -1
正面
B
社会福利博弈:
政府
游荡
寻找工作
0, 0
-1,1
不救济
-1, 3
3, 2
救济
流浪汉
田忌赛马(左为田忌,上为齐王)
策略&支付(Strategy & Payoffs)
其他例子 :
协调博弈(Coordination games)
施密斯公司和琼公司分别决定生产何种大小的光盘和光驱。
当两家公司卖的光驱和光盘配套时他们都将卖出较多的电脑。
策略: “大” 或 “小” 。
支付矩阵如下。
策略&支付(Strategy & Payoffs)
合作博弈: 支付矩阵
施密斯公司
小光驱
大光驱
1, 1
-1,-1
小光盘
-1, -1
2, 2
大光盘
琼公司
纳什均衡 (Nash Equilibrium )
纳什均衡问题:
例子:Insensitive to extreme payoffs (risks)
施密斯公司
小光驱
大光驱
1, 1
-1,-1
小光盘
-1000, -1
2, 2
大光盘
琼公司
In Practice, it is almost sure that Smith wants to “play safe” and never try “large”!
支配策略 (Dominant Strategies )
如果某个参与人选择的最优策略不随其他参与人策略的变化而改变,这样的最优策略被称为“支配策略”。
第一步: 看参与人是否存在支配策略.
如何某个参与人存在支配策略,那么它必然会选择这个策略,而其他参与人将据此作出最优反应.
例子:
“囚徒困境”中是否存在“支配策略”?
“协调博弈”呢?
被支配策略 (Dominated Strategies )
不论其他参与人选择什么策略,某参与人选择某个策略的支付都低于其他的策略,这样的策略被称为“被支配策略”。
理性的参与人是不会选择被支配策略的。
如果存在支配策略,则其他策略都是被支配策略.
反之,如果存在被支配策略,则不一定存在支配策略。
应用: 重复剔除的支配策略均衡
例子:
纳什均衡 (Nash Equilibrium )
对于相当多的博弈,我们无法使用重复剔除被支配策略的办法找出均衡解.
因而,必须找到一种求解均衡的一般方法.
纳什均衡的概念:
纳什均衡是完全信息静态博弈解的一般概念,构成纳什均衡的策略一定是重复剔除被支配策略过程中不能被剔除的战略。
在那身均衡中,没有人愿意选择其他的策略。
纳什均衡 (Nash Equilibrium )
例子:
在下面的例子中,是否存在支配策略和被支配策略?
纳什均衡问题
多重解!
例子:
Battle of Sex
Coordination Game
女 (The Lady)
拳击
歌剧
1,2
0,0
拳击
0,0
2, 1
歌剧
男 (The Man)
Smith
Small
Large
1, 1
-1,-1
Small
-1, -1
2, 2
Large
Jones
纳什均衡 (Nash Equilibrium )
混合策略( Mixed Strategies )
混合策略是指参与人以一定的概率选择某种策略。比如说,参与人以的概率选择第一种策略,以以的概率选择第二种策略,以的概率选择第三种策略。
纳什均衡存在性定理:
每一个有限博弈至少存在一个纳什均衡(纯策略的或者混和策略的).
混合策略(Mixed Strategies )
例子:
Coordination Game
Jones 以 (p, 1-p)的概率选择 (大, 小)
Smith 的期望支付为:
“大”: 2p+(-1)(1-p) = US(L |(p, 1-p))
“小”: (-1)p+1(1-p) = US(S |(p, 1-p))
这两种选择对Smith来说应当是无差异的。
US(L |(p, 1-p)) = US(S |(p, 1-p)) p = 2/5
因此Jones的最优混合策略为 (, )
练习:找出Smith的最优混合策略.
猜谜游戏
找出混合策略的纳什均衡
纳什均衡 (Nash Equilibrium )
纳什均衡不一定有效率
蜈蚣虫游戏 (The Centipede Game ):
在蜈蚣虫游戏中,有两个参与人, 1 和2,假设信息是完全的。最初每个人的手中都只有1美元, 他们轮流进行决策,来决定游戏是“继续”还是“停止”,游戏从参与人1开始。 当某个参与人选择“继续”时,他将失去1美元,而另一个参与人将得到2美元。 一旦某个参与人选择“停止”,则游戏结束。否则,游戏将持续到两个参与人都获得100美元时结束。
Player 1
Player 2
Player 1
Player 2
Player 1
Player 2
S
C
C
C
C
C
C
S
S
S
S
S
1
1
03
2
2
97
100
99
99
98
101
100,100
最大最小策略 (Maxmin Strategies )
在博弈中参与人选择某种策略以最大化他可能得到的最小支付,我们把这种策略叫做最大最小策略 。
通常发生在竞争市场的风险规避者身上。
小中取大的保守策略将对方假设为“必欲致我于死地”的狠毒对手。不管你用一种什么策略,他总是设法使你在该策略下获利最小。既然你的对手是如此“狠毒”,因此你就只能期望在你的每一招交手后都只能获取最小回报。而你的理性选择就是在所有这些最小回报中选择最大的那个。相应的那个策略就是你的最优策略。
最大最小策略 (Maxmin Strategies )
迄今为止,对市场结构分析都以假定管理决策的中心是谋求最大利益。但是在如垄断寡头那样竞争十分激烈的场合,决策者可能采取一种风险厌恶政策,即确保在可能的最坏结果中得到最好的结果。
也就是每个博弈者将在可能最少的利润方案中选择利润最大的方案。
Nash 均衡为 (3,6) 和(6,3)
企业1 最小
3
2
企业2 最小 3 2
结果: 双方都没有新产品推出 在这个例子中,纳什均衡不是小中取大解!
最大最小策略 (Maxmin Strategies )
例子:
顺序性博弈 (Sequential Game )
顺序性博弈:先下弈的优势 (First-mover Advantage)
迄今为止,我们都隐含假定双方下弈者都是同时实施。在顺序性博弈(Sequential game)中,就是有先有后了。
进入新的市场就是一个顺序博弈的例子。
博弈论与企业管理中的权力
0
0
1
F
0
0
1
E
0
0
3
D
14
7
C
14
9
B
14
10
A
权力指数(%)
权力指数
票数
游戏者
总票数为31,16票通过
0
0
1
F
0
0
1
E
0
0
3
D
14
7
C
14
9
B
14
10
A
权力指数(%)
权力指数
票数
游戏者
ca
bdea bdfa befa
bda bea Bfa
cda cea cfa
ca
cdea cdfa cefa
班扎夫权力指数(1965年):把一个决策者作为“关键加入者”的个数称为“权力指数”
--权力支持和票数不是一回事,票数只是一个虚数的指标!
--在设计具体的投票制度时,票数的分配要考虑权力支持,合适的选举制度应该是:票数的安排要使得权力指数与人数成大体一致相同的比例!
企业管理中的权力
2
1
F
2
1
E
2
3
D
14
7
C
14
9
B
18
12
A
权力指数(%)
权力指数
票数
总票数为33,17票通过
多给A两票!
看D: BCD AEFD
假定:财产100万
A拥有50%的票力
B拥有40%的票力
C拥有10%的票力
规则:当超过50%的票认可了某种方案时,才能分配,否则三人将一无所得。
在这个例子里,任何人的权力都不是“决定性”的,也没有一个人的权力为0
联盟博弈:三人的财产分配
此时,财产分配是按照5:4:1分配吗?
如果是的话,C可以提出这样的方案:A7,B0,C3。这个方案AC可以接受,因为对他们是一个改进方案。
但是,B也会向A提出这样的方案,A8B2C0……
在各种可能的联盟次序下,参与者对联盟的边际贡献之和除以各种可能的联盟组合。
在财产分配问题上,我们可以写出各种可能的联盟次序。而边际贡献就在于在这个顺序中谁是联盟的“关键加入者”。如果是关键加入者,那么他的边际贡献就是100万元。
夏普里值(Sharpley Value):
A
A
A
A
C
B
关键加入者
CBA
CAB
BCA
BAC
ACB
ABC
次序
ABC的夏普里值分别是:
4/6 1/6 1/6
财产分配就是按照这个比例来的
美国总统与参议院及众议院的权力之比: :5
美国总统与参议员及众议员的权力之比:350:9:2
A50%;B40%;C10%
聪明的股东:51%为通过率
20
6
20
E
20
6
20
D
20
6
20
C
20
6
20
B
20
6
20
A
权力指数(%)
权力指数
股份(%)
股东
20
6
17
E
20
6
17
D
20
6
17
C
20
6
17
B
20
6
32
A
权力指数(%)
权力指数
股份(%)
股东
A为什么让BCDE再多减持一个百分点?
2
16
E
2
16
D
2
16
C
2
16
B
14
36
A
权力指数(%)
权力指数
股份(%)
股东
公共地的悲剧—如果一种资源没有排他性的所有权,就会导致资源的过度使用。
公海捕鱼
小煤窖的过度发展
环境污染
。。。
对社会均衡的打破开始于殉道者!
公共地悲剧(Tragedy of Commons)
4,4
0,5
合作
5,0
1,1
不合作
合作
不合作
乙
甲
3,3
3,0
合作
0,3
0,0
不合作
合作
不合作
乙
甲
7,7
3,5
合作
5,3
1,1
不合作
合作
不合作
乙
甲
人类的原始状态就是囚徒困境
英国哲学家霍布斯:“自然状态中”“人与人之间象狼与狼一样”“是每个人对每个人的战争”
他对自然状态的假定,就是要引申出他的政治主张。他认为,在这种原始状态下人的生活是悲惨的。为了摆脱这种状态,人们便汇集起来,建立契约,同意确立权力者或者权力集团,这就是利维坦。这就是霍布斯社会契约的思想。
猴子-香蕉-道德
2,2
0,4
和平
4,0
1,1
战争
和平
战争
乙
甲
0,0
0,-3
和平
-3,0
-3,-3
战争
和平
战争
乙
甲
2,2
0,1
和平
1,0
-2,-2
战争
和平
战争
乙
甲
自然状态
惩罚状态
国家状态
重复博弈案例
一个男孩被视为傻瓜,因为每当别人拿一枚1角硬币和5分硬币让他选的时候,他总是选5分的,有一个人觉得奇怪,就问他:“为什么你不拿1角钱的?”,男孩小声回答:“假若我拿了1角钱的硬币,下次他们就不会拿钱让我拿了。”
策略行为: 进入障碍
四种传统的进入障碍: (passive)
Economies of scale, product differentiation, control over scare resources, and legal factors
Market Entry Decision (Entry Game) (aggressive)
现期利润vs. 将来利润:限制进入定价(Entry-Limiting Pricing)
主要观点:
动机(Motivation): 短期垄断定价获得较多的利润,因此吸引更多的新加入者抢占市场份额,从而在长期内使价格下降。
限制进入定价(Entry-Limit Pricing): 需要制定一个低于短期垄断定价的价格
Stigler’s Open Oligopoly Model
目标: maximize the present value of profit
在一些情况下,这可以通过制定一个限制其他厂商进入的价格来实现。
最优策略取决于贴现率。
比较:
Entry-Limiting Pricing: long-time horizon & a lower discount rate
Open Oligopoly Model: short planning horizon & a bigger discount rate
策略行为: 进入障碍
限制进入定价(1)
限制进入定价(2)
短期
长期
策略行为: 进入障碍
价格报复( Price Retaliation )
当进入已经实际发生或即将来临之际,用降价进行报复,一旦进入威胁消失,管理当局就可以把价格提高到他们认为合适的水平。
策略行为: 进入障碍
Establishing Commitment:扩大生产能力( Capacity Expansion )
另一种阻止新厂商进入的策略是增加投资。
一旦进行了投资,就变成了沉没成本,已存在的企业就能够以相对降低的成本来增加产量。这种超额生产能力提供了一个强烈的信号:以存在的企业能够实施降低价格的策略来阻止新厂商的进入。
扩大生产能力制止进入
( 12, 0 ) (4, 4) (-4, -4) (8, 0)
原企业
小厂
大厂
不进入
进入
进入
不进入
新企业
新企业
使市场饱和
E
N1
N1
E1
E4
E3
E2
案例:电信服务业改革1
1984年,美国把AT&T(美国电报电话公司)分解为一个只提供长途电话的公司(大贝尔)和七家地方电话公司(小贝尔)。但经过90年代的世界电信业兼并浪潮,到1999年底,7家小贝尔只剩下3家了。继美国之后,澳大利亚、英国、法国、德国、日本等都在不同的时间里进行电信业的改革-开放和私有化。
案例:电信服务业改革2
中国的电信改革历程:
1994年,由原电子部、电力部和铁道部发起的中国联通公司成立。
1998年,信息产业部成立。
1999年至2001年,机构改革和产业重组。1999年2月,信息产业部决定对中国电信拆分重组,将中国电信的寻呼、卫星和移动业务剥离出去。原中国电信拆分成新中国电信、中国移动和中国卫星通信公司等3个公司,寻呼业务并入联通公司。此外,为强化竞争,政府又给网通公司、吉通公司和铁通公司颁发了电信运营许可证。
案例:电信服务业改革3
2001年12月,国务院批准了电信体制改革方案,对现有电信企业进行重组,2002年5月新的中国电信和中国网通挂牌。中国电信现有资源划分为南、北两个部分,华北地区(北京、天津、河北、山西、内蒙古)、东北地区(辽宁、吉林、黑龙江)和河南、山东共10个省(自治区、直辖市)的电信公司归属中国电信北方部分;其余归属中国电信南方部分。
北方部分和中国网络通信有限公司、吉通通信有限责任公司重组为中国网络通信集团公司;南方部分保留“中国电信集团公司”名称,继续拥有“中国电信”的商誉和无形资产。
案例:电信服务业改革4
重组后的两大集团公司仍拥有中国电信已有的业务经营范围,允许两大集团公司各自在对方区域内建设本地电话网和经营本地固定电话等业务,双方相互提供平等接入等互惠服务。南北两部分按光纤数和信道容量分别拥有中国电信全国干线传输网70%和30%的产权,以及所属辖区内的全部本地电话网。
电信重组后,我国电信业全新格局得以确立——形成中国移动、中国电信、中国网通、中国联通、中国卫通、铁通6家公司将在我国的电信市场上展开竞争的局面。
囚徒的救赎
好莱坞大片《肖申克的救赎》是一部很好看的电影,主要内容是一个被冤屈的囚犯如何凭借着坚定的信念和聪明才智逃出牢房。我们的“囚犯”也可以通过好的策略合作,摆脱“困境”的诅咒。
囚徒的救赎—一报还一报
一报还一报能够赢得竞赛不是靠打击对方,而是靠从对方引出是双方都有好处的行为。
如果重复波已多次,就有报复的机会,这种惩罚的规则是:人家对你怎么做,你就对他怎么做,如果他上次背叛了你,你这次背叛他,如果上次他与你合作,你这次就选择与他合作。
囚徒的救赎—一报还一报
埃克谢罗德认为,一报还一报体现了这个策略符合四个优点:清晰、善意、报复性和宽恕性。
这一法则不会引发作弊,所以是善意的。
他不会让作弊者逍遥法外,所以是报复的。
他不会长时间怀恨在心,只要作弊者改正,就愿意恢复合作,所以是宽恕的。
一报还一报从自己的不客欺负性得到好处,还放弃了占他人便宜的可能性。
囚徒的救赎
重复囚徒困境的几个建议:
不要嫉妒
不要首先背叛
对合作和背叛都要给予回报
不要耍小聪明
旅行者困境
一位富翁的狗在散步时跑丢了,于是他急匆匆到电视台发了一则启示:有狗丢失,归还者得酬金1万元,并附有狗的彩照。一个乞丐看到广告后,第二天一大早就抱着狗准备去领酬金,当他经过一家大商店的墙体屏幕时,发现酬金涨到了3万元,乞丐又折回住处,把狗重新拴 在那里,在接下来的几天里,乞丐从来没有离开过大屏幕,当酬金涨到市全市居名感到惊讶时,乞丐返回他的住处,可是那只狗已经死了—在这个世界上,金钱一旦被作为筹码,就不会再买到任何东西。
练习—强盗分赃
有5个强盗强的100枚硬币,在如何分赃上争论不休,于是他们决定:
抽签决定个人的号码(1,2,3,4,5)
有1号提出分配方案,然后5人表决,如果方案超过半数同意就通过,否则他被扔进大海为鲨鱼。
1号死后,2号提方案,4人表决,当且仅当超过半数同意时方案通过,否则2号被扔进大海。
以此类推,直到找到一个被通过的方案(当然,如果只剩下5号,他独吞)
结果会如何?
能打开所有门的钥匙
〖管理经济学〗- 第八讲
〖管理经济学〗- 第八讲
〖管理经济学〗- 第八讲