GT
博弈论 经济博弈论(第三版)· 第一、二章

博弈论 · 第一、二章

第一章回答"什么是博弈",把博弈按博弈方数量、策略、得益、过程、信息、理性六个维度拆开分类, 画出整本博弈论的理论结构;第二章回答"怎么解一个博弈",建立起上策均衡、严格下策反复消去法、划线法、箭头法、 反应函数法这一整套分析工具,并引出全书的核心概念 —— 纳什均衡

谢识予《经济博弈论》第三版 书页 1–104 49 张插图 · 1 张表 7 个可交互模型 两章 19 道思考题全解
第一章是分类学,第二章是工具箱。第二章的每个方法都因为前一个"管不了"才被逼出来: 上策均衡不存在 → 下策消去法 → 严格下策也没有 → 划线法与箭头法 → 策略无限多画不出矩阵 → 反应函数法 → 均衡不唯一或不存在 → 混合策略 → 混合策略也可能多解 → 帕累托/风险上策、聚点、相关、防共谋。 这条链条本身就是第二章的目录。

学习进度

已经做完的两章

§1.1–2.6
第一章 · 导论 1.1 什么是博弈论(定义的四方面)· 1.2 几类经典博弈模型(囚徒困境、赌胜博弈、古诺)· 1.3 博弈结构和博弈的分类(六条结构特征 → 六组分类 → 全书十章的结构)
从"分类"到"求解"
第二章 · 完全信息静态博弈 2.1 基本分析思路和方法 · 2.2 纳什均衡(中心概念)· 2.3 无限策略博弈分析和反应函数 · 2.4 混合策略和混合策略纳什均衡 · 2.5 纳什均衡的存在性 · 2.6 纳什均衡的选择和分析方法扩展
下一步(尚未制作)
第三章 · 完全且完美信息动态博弈 子博弈完美纳什均衡 —— 第二章末尾那句"需要在纳什均衡分析的基础上再作进一步深入分析"的去处

七个交互模型

拖动 · 点击 · 观察

博弈论的每个概念背后都是一次具体的策略互动,光看文字很难有手感。下面七个模型把两章的难点做成了可以动手改的东西 —— 拖一拖、点一点、跑一跑,看结论在什么条件下成立、什么条件下崩塌。

两章最该记住的六件事

考前回看
一、定义博弈的四个方面
博弈方(Players)、策略(Strategies)、次序(Orders)、得益(Payoffs)。 四个缺一不可,且次序不同就是不同的博弈
二、六条结构特征 → 六组分类
博弈方数量 · 策略数量 · 得益特征 · 博弈过程 · 信息结构 · 理性与行为逻辑。 六组分类交叉,就是全书十章的分工。
三、纳什均衡:没有谁想单独偏离
每个博弈方的策略都是针对其余博弈方策略组合的最佳对策。 上策均衡 ⊂ 纳什均衡;划线法和箭头法就是在矩阵上找它的手工办法。
四、纳什定理:有限博弈必有混合均衡
每一个有限博弈都至少有一个混合策略纳什均衡。这是纳什均衡成为中心概念的根本保证 —— 但注意,它不保证纯策略均衡,也不保证唯一。
五、求混合策略均衡的口诀
自己的概率分布,令对方在其各纯策略上的期望得益相等。 "让对手无机可乘"这六个字是整节的算法核心,也是最容易算反的一步。
六、非合作的结果往往是低效率的
囚徒困境、双寡头削价、古诺、伯特兰德、公共草地 —— 五个模型反复说同一件事: 个体理性 ≠ 集体理性,均衡常常偏向"用得多、赚得少"。这正是政府协调必要性的理论根据。
💡两章之间的一条暗线

第一章埋了一颗种子,第二章把它浇活了:第一章 1.3.5 节说"完全信息说的是得益,完美信息说的是过程,两者独立"。 第二章的整个讨论都建立在"完全信息 + 完美信息"这个最简情形上(静态博弈没有过程,所以自动满足完美信息), 于是纳什均衡得以成为中心概念。

而 2.6 节最后那句"纳什均衡分析仍然是有局限性的,必须在纳什均衡分析的基础上再作进一步的深入分析", 指向的正是第三章(动态)与第六至八章(不完全信息)。第一章画的分类表,到这里开始逐格兑现。

原著中的两处问题

已就地标注,未静默修改

制作过程中对照扫描原件逐页核校,发现两处问题。两处都保留原文并就地加注,没有替读者改掉。

位置问题处理
书页 8(1.2.1 节) 写作"只考虑自身利益的囚徒 2的选择是唯一的",但该段通篇在分析囚徒 1, 紧接的下一句"同样的……囚徒 2 ……也是坦白"表明前一句的主语应是囚徒 1 按文意保留其逻辑,在正文中注明这是原书排印错误
书页 83(2.4.2 节) "双方的期望得益分别为 0.664 和 1.296"。但按书里自己给出的得益矩阵(图 2.23)和概率分布 (厂商1 取 0.4/0.6,厂商2 取 0.67/0.33)算,第二个数应为 1.2 正文中写出完整演算过程,按演算结果取 1.2,并保留对原文的说明

另外,第一章正文的底本来自原书扫描件的 OCR 稿,其中"常和博弈"有三处被误识成"零和博弈", 已按扫描原件改正 —— 这类错误在文档里不留痕迹,只能靠双源校对发现。

第一章 · 第 1 节

1.1 什么是博弈论

书页 1–61.1.1 从游戏到博弈1.1.2 一个非技术性的定义
这一节只做两件事:说清楚博弈论为什么叫"游戏理论"却研究的不是游戏,以及给"博弈"下一个不依赖数学的直白定义。 定义里藏着的四个方面——博弈方、策略、次序、得益——是后文一切分类的源头。
0

这一节讲了什么

概念地图

1.1 节是一条从"名字"到"定义"的路线,中间只隔着一个关键认识:博弈论研究的不是游戏,而是游戏与经济活动共有的那种结构

从游戏到博弈 Game Theory 直译是"游戏理论"。把扑克、棋类、球赛抽象一下,抽出四条共同特征;其中"策略和利益相互依存"是全部博弈论的起点
关键认识:策略没有绝对好坏,只有相对于他方策略的好坏
一个非技术性的定义 面对一定环境条件、在一定规则下,同时或先后、一次或多次,从各自允许的策略中选择并实施,各自取得相应结果的过程
把定义拆开
定义博弈的四个方面 博弈方 · 策略 · 次序 · 得益。这四个词在 1.3 节会被各拆成一个分类维度,在 1.3.7 节汇总成整本教材的章节结构
1

1.1.1 从游戏到博弈

书页 1–4

"博弈论"译自英文 Game Theory。Game 的基本意思是游戏,所以直译过来应该叫"游戏理论"。 这个名字容易让人以为研究对象是躲猫猫、围棋、桥牌或球赛,其实不是。

博弈论真正盯上的是这样一类问题:它的外壳可以是游戏,也可以是商业竞争或政治谈判,但内核是同一个—— 决策者之间存在策略和利益的相互依存。书的原话是:"博弈论研究的主要不是这些真正的游戏,而是与这些游戏有共同本质特征的决策或者说策略问题。"

游戏的四条共同特征

把扑克、棋类、体育比赛放在一起看,抽象掉具体玩法,能抽出四条共性。这四条就是博弈论的研究对象:

① 有规则
规定参加者可以做什么、不可以做什么、按什么次序做、什么时候结束、犯规怎么罚。
② 有结果,且结果能数值化
一方赢一方输、平局或各有所得;结果常能用正负数值表示,或按一定规则折算成数值。
③ 策略至关重要
游戏者不同的策略选择,常常会带来不同的结果。
④ 策略和利益相互依存
每个游戏者所得结果的好坏,不仅取决于自己的策略,也取决于其他参加者的策略。

第 ④ 条是全部博弈论的起点。它推出一个反直觉的结论:在有策略依存性的博弈里,策略本身常常没有绝对的好坏之分,只有相对于他方策略的相对好坏。 一个差的策略选择也许带来并不差的结果,原因只是对手选了更差的策略。

⚠️为什么"策略没有绝对好坏"最重要

如果没有这一条,每个人的最优选择就只取决于自己,决策问题退化成一道最优化习题,不需要一门学问。 正因为你的最优选择依赖对方怎么选、对方的最优选择又依赖你怎么选,才需要博弈论。 后面第二章的纳什均衡,本质就是在解这个"互相依赖"的循环。

经济活动里的策略依存

书里给了三个经济场景,都不是游戏,但结构和游戏完全一样:

  • 寡头厂商的产量决策。某厂商的利润不仅取决于自己的产量,还取决于其他厂商的产量。别人产量大,市场拥挤、价格低,你的最佳产量和利润都下降;别人产量小则相反。
  • 市场阻入。先占领市场的厂商可以选择"宽容"接受后来者,也可以降价打击。阻入策略的效果很大程度上取决于后到者的反应——对方知难而退则阻入成功,对方知难而上则两败俱伤,此时容忍反而更合算。
  • 投标拍卖。你既想中标又想中标价低。竞争不激烈时低价能中标,竞争激烈时就必须出高价。你的报价与竞争者的报价之间是直接的决策较量

这类问题在经济、政治、军事中普遍存在。决策较量当然不像小游戏那么轻松,但原理相同—— "从研究游戏规律得出的结论,可用来指导经济、政治等活动中所遇到的重要决策问题"。这就是这门学科叫"游戏理论"的原因。

为什么中文叫"博弈"而不是"对策"

博弈论在我国也曾被称为"对策论",具体的博弈问题叫"对策问题"。作者认为这个译名并不恰当,理由值得一记:

📖两个译名的分歧

"对策"在实际中常用来表示具体的应对方案,是针对某一局面的一次性反应。

而博弈论研究的决策问题是有开始、有结束、有结果的完整过程,这种过程中常常包含多个面对一定局面的对策选择, 问题的解常常是由一组对策构成的完整行动计划。更进一步,研究的目的也不只是站在某一方立场找对策, 更重要的是分析各决策方相互制约、相互作用的规律,也为了指导政府及其机构制定合理的政策和规则

所以选"博弈"这个字面生僻、带文言味的词,是因为它更能表达"一个完整过程"的意思; 而"显得学术味浓一些"这个副作用,作者自嘲说可能会让一些读者不敢去碰博弈论的书——但他认为对真正想钻研策略问题的人,这反而是件好事。

2

1.1.2 一个非技术性的定义

书页 4–5

既然不需要数学,书里就给了"博弈"一个直白的、非技术性的定义:

📖博弈

博弈即一些个人、队组或其他组织,面对一定的环境条件,在一定的规则下,同时或先后一次或多次, 从各自允许选择的行为或策略中进行选择并加以实施,各自取得相应结果的过程。

这句话看起来平常,但每一个逗号都在排除一种情况。"同时或先后"排除了只允许同时决策的模型, "一次或多次"把重复博弈也装进来,"各自取得相应结果"则说明每个博弈方都要有一个明确归属的所得。

再往下一层,书的定义本身可以拆成四个必须设定的方面。这四个方面是本书此后每一章反复回访的坐标轴:

3

定义博弈必须设定的四个方面

书页 4–5
1. 博弈的参加者 Players
在所定义的博弈中究竟有哪几个独立决策、独立承担结果的个人或组织。 只要在博弈中统一决策、统一行动、统一承担结果,不管组织多大——哪怕是一个国家,甚至由许多国家组成的联合国——都算一个参加方。 规则确定之后各参加方一律平等,都必须严格按规则办事。本书统一称之为"博弈方"
2. 各博弈方可选择的全部策略或行为 Strategies / Actions
规定每个博弈方决策时可以选择的方法、做法,或经济活动的水平、量值等。 不同博弈中可选策略的数量差别很大:同一博弈里不同博弈方的策略内容与数量也常不同, 有时只有有限几种、甚至只有一种,有时可能有许多种甚至无限多种
3. 进行博弈的次序 Orders
有时需要各博弈方同时选择(保证公平合理),很多时候决策又有先后之分, 甚至一个博弈方要作不止一次决策。因此规定一个博弈必须规定次序。 次序不同一般就是不同的博弈,即使其他方面都相同。
4. 博弈方的得益 Payoffs
对应每一组可能的决策选择,都应有一个结果表示该策略组合下各博弈方的所得或所失。 得益可以为正也可以为负,是分析博弈模型的标准和基础

由此得到本书对博弈论的界定——它研究可以用上述方法定义的各种博弈问题,寻求在各博弈方具有 充分或有限理性(Full or Bounded Rationality)、能力的条件下,合理的策略选择和合理选择策略时博弈的结果, 并分析这些结果的经济意义、效率意义的理论和方法。

💡第 4 条里那句容易被忽略的话

关于得益,书里特别提醒:虽然各博弈方在各种情况下的得益应该是客观存在的, 但这并不意味着各博弈方都了解各方的得益情况

这句话是 1.3.5 节"完全信息 / 不完全信息"分类的全部来源。得益客观存在是一回事,大家知不知道是另一回事—— 后者是一个独立的、可以单独研究的结构特征。

5

速查卡

考前回看

1.1 节没有公式,速查的是定义本身。下面这份表可以当填空自测用:遮住右列,看能不能补全。

要素必须规定什么最容易错的一点
博弈方 Players 有哪些独立决策、独立承担结果的个人或组织 只定规则、不参与决策的(警察)不算;附属他人、不独立担责的(孙膑)也不算
策略 Strategies 每个博弈方可选择的全部行为、做法或水平、量值 不同博弈方的策略数可以不同;可以是有限的,也可以是无限的
次序 Orders 各博弈方作出选择的先后关系 次序不同一般就是不同的博弈,即使其他方面完全一样
得益 Payoffs 每一组策略组合下各博弈方的所得或所失 得益客观存在 ≠ 各博弈方都了解它。后者是 1.3.5 节完全/不完全信息的来源
博弈的定义(背诵版)
博弈即一些个人、队组或其他组织,面对一定的环境条件,在一定的规则下,同时或先后一次或多次, 从各自允许选择的行为或策略中进行选择并加以实施,各自取得相应结果的过程。
博弈论研究什么(背诵版)
系统研究可以用上述方法定义的各种博弈问题,寻求在各博弈方具有充分或有限理性、能力的条件下, 合理的策略选择和合理选择策略时博弈的结果,并分析这些结果的经济意义、效率意义
6

关键概念与易混点

术语表
Game Theory / 博弈论
直译"游戏理论"。中文用"博弈"是取其"有开始、有结束、有结果的完整过程"之意; "对策论"这个旧译名被作者否掉,因为"对策"只是针对某一局面的一次性反应。
博弈方 Player
博弈中独立决策、独立承担博弈结果的个人或组织。判据是"独立"二字——参与决策但不独立担责的仍不算。
策略依存性
本节的中心概念:每个博弈方的得益取决于所有博弈方的策略选择。 由它推出"策略本身没有绝对好坏之分",也由它决定了为什么需要博弈论这门学科。
个体理性
以个体自身利益最大化为决策目标(1.1 节已隐含使用,1.3.6 节正式展开)。 与它相对的"集体理性"是后面"合作博弈 / 非合作博弈"分类的由来。
得益矩阵 Payoff Matrix
表示博弈问题的一种常用方法(本节首次出现于图 1.1 的预告中,1.2.1 节正式使用)。
完全理性 / 有限理性
全称 Full or Bounded Rationality。定义博弈论的研究范围时就写了"充分或有限理性", 说明这门学科从一开始就把两类都算在内——有限理性在第五章专门讲。
⚠️本节最容易错的一处

把"博弈论研究游戏"当成定义。它研究的是与游戏有共同本质特征的决策问题——经营决策、市场竞争、 竞选谈判、投标拍卖都是。书里那句"我们完全可以按照游戏的规律来研究它们",说的正是这种抽象,而不是字面意义上的游戏。

4

随堂自测

3 题
Q1下面哪一项不属于书上所说定义或定义一个博弈必须设定的四个方面?
正确。四个方面是:参加者、策略(或行为)的集合、博弈的次序、得益。胜负判定并不是一个独立方面——它已经被"得益"吸收了,得益为正为负、谁大谁小,本身就承载了胜负。
不对。四个方面是:参加者、策略(或行为)的集合、博弈的次序、得益。"胜负判定"不是一个独立方面。
Q2为什么说"次序不同一般就是不同的博弈"?
正确。同时决策时谁也不能预知对方的选择;一旦允许后行动者先看到对方的行动,他就获得了针对性调整的机会。这改变了博弈的结构,而不只是换了个说法。书里在 1.3.4 节进一步说明:把静态博弈的"同时"改成"依次",结果很可能大不相同。
不对。关键在于"能否看到对方的行动再决策"会改变各方的相对地位,从而改变结果。策略数量本身未必变。
Q3关于"博弈"和"对策"两个译名,作者认为哪个更贴切,主要理由是什么?
正确。"对策"常被用来表示具体的应对方案,是针对某一局面的一次性反应;而博弈论研究的决策问题包含多个面对一定局面的对策选择,它的解通常是一组对策构成的完整行动计划。注意 D 是反的——作者说"博弈"其实是个不常用的文言词,反而难懂、学术味更浓。
不对。作者的理由是"博弈"表达了一个完整过程,而"对策"只是针对某一具体局面的一次性反应。注意"博弈"其实比"对策"更难懂、学术味更浓——这是作者承认的副作用。
0 / 3 题正确
第一章 · 第 2 节

1.2 几类经典博弈模型

书页 6–191.2.1 囚徒的困境1.2.2 赌胜博弈1.2.3 古诺模型
这一节用五个著名模型把"博弈"从定义变成看得见的东西:囚徒的困境、双寡头削价竞争、齐威王田忌赛马、猜硬币、石头剪子布, 最后落到唯一一个从经济学内部长出来的模型——古诺产量博弈。本节只作初步分析,完整的求解工具留到第二章。
0

这一节讲了什么

概念地图

五个经典模型分成两组:前四个是"从游戏或故事里抽象出来的",最后一个古诺模型是唯一从经济学内部长出来的。 本节只作直接分析,正式的求解工具(纳什均衡等)留到第二章。

1.2.1 囚徒的困境 上策 → 必然结果(坦白,坦白),而它不是最优结果。附双寡头削价竞争,同一结构换个经济场景
1.2.2 赌胜博弈 齐威王田忌赛马(6×6)· 猜硬币(2×2)· 石头剪子布(3×3)。共同点:零和、对称、必须随机出招
再从经济问题中引出一个
1.2.3 产量决策的古诺模型 三厂商离散产量版(表 1.1 的试探调整 → 均衡 5,5,5)· n 厂商连续产量版(策略无限多,只能用函数式表达)
💡读这一节时该盯住什么

五个模型表面上天差地别,但都是 1.1 节那四个方面的具体填法。读的时候不妨每看到一个模型就问: 博弈方是谁?各有哪些策略?同时还是先后?得益怎么来的?把这张表填完,1.3 节的分类就水到渠成了。

1

1.2.1 囚徒的困境

书页 6–9 · 图 1.1

这是全书第一个博弈模型,1950 年由图克(Tucker)提出。书里说它"虽然非常简单,但很好地反映了博弈问题的根本特征", 而且是"每本博弈论教材都必讲的、特别经典的博弈模型"。它的地位来自一个反差:模型极小,含义极大。

基本模型

警察抓住了两个合伙犯罪的罪犯,但缺乏足够证据指证罪行。只要其中至少有一人供认犯罪,就能确认罪名成立。 为防止串供,两名罪犯被分别关押,并得到同样的选择机会:

  • 两人都拒不认罪 → 各以较轻的妨碍公务罪判 1 年
  • 两人中有一人坦白认罪 → 坦白者从轻处理立即释放,另一人重判 8 年
  • 两人同时坦白认罪 → 各判 5 年

用 0 表示立即释放的得益,用 −1、−5、−8 表示判 1 年、5 年、8 年的得益,这个博弈就可以写成下面这个矩阵。 这种矩阵是表示博弈问题的一种常用方法,称为博弈的得益矩阵(Payoff Matrix)。

行 · 囚徒1
列 · 囚徒2
囚徒 2
坦白不坦白
囚徒 1坦白 −5, −5 0, −8
不坦白 −8, 0 −1, −1
图 1.1 囚徒的困境 · 每格中前一个数字是囚徒 1(行方)的得益,后一个数字是囚徒 2(列方)的得益

因为两名囚徒被隔离,任何一人在选择时都不可能知道另一人的选择,所以不管他们决策的时间是否真正相同, 都可以把他们的决策看作同时作出的。这是一个两博弈方、策略和得益都对称的博弈。

直接分析:为什么结果是(坦白,坦白)

对囚徒 1 来说,囚徒 2 有两种可能的选择,逐一假设:

  • 假设囚徒 2 选"不坦白":囚徒 1 不坦白得 −1,坦白得 0 → 应选坦白;
  • 假设囚徒 2 选"坦白":囚徒 1 不坦白得 −8,坦白得 −5 → 还是应选坦白。

无论对方怎么选,坦白给囚徒 1 带来的得益都是最大的。这时称"坦白"是囚徒 1 的一个上策(Dominant Strategy)。 囚徒 2 的情况完全相同,于是(坦白,坦白)是必然结果,两人各判 5 年。

⚠️原书此处有一处笔误

书页 8 第一句写作"只考虑自身利益的囚徒 2的选择是唯一的",但该段通篇在分析囚徒 1 的选择, 紧接着的下一句也说"同样的……囚徒 2 在这个博弈中唯一合理的选择也是坦白"——"也是"二字表明前一句的主语应是囚徒 1。 这是原书排印错误,此处按文意保留其逻辑,不作静默改动。

困境"困"在哪里

关键在于:(坦白,坦白)对双方都不是最好的结果。都"不坦白"各得 −1,明显好于都"坦白"各得 −5。 但两人不能串通,各人都追求自身最大利益而不会顾及同伙,又都不敢指望对方有合作精神,于是只能实现对双方都不理想的结果。 这种结果具有必然性,很难摆脱,所以叫"囚徒的困境"。

书里把它拆成两层矛盾,这两层要分清楚:

个体理性 ↔ 团体理性
从个体利益出发的行为,往往不能实现团体的最大利益。 这一点否定了传统经济学"看不见的手"总会把利己行为变成集体有利行为的论断,也说明政府在社会经济活动中的组织协调工作常常是必需的。
个体理性自身的内在矛盾
从个体利益出发的行为,最终也不一定能真正实现个体的最大利益,甚至会得到相当差的结果。 这才是"困境"二字的真正来源——不是运气不好,是理性本身把自己坑了。
2

双寡头削价竞争:同一个困境换了身衣服

书页 9–10 · 图 1.2

市场竞争中最典型的囚徒困境现象之一是寡头之间的价格战。降价争夺市场十分普遍,但削价竞争并不一定是成功的策略—— 一个厂商的削价往往引起对手报复,此时降价不一定扩大销量,却很可能白白降低利润率。

设寡头 1 和寡头 2 原来用同一种"高价"销售相同产品,各自获得 100 万元利润。如果某个寡头单独降价, 它可以获得 150 万元,此时另一寡头因市场份额被抢走,利润下降到 20 万元;如果两寡头都降价, 则双方都只能得到 70 万元。写成得益矩阵:

行 · 寡头1
列 · 寡头2
寡头 2
高价低价
寡头 1高价 100, 100 20, 150
低价 150, 20 70, 70
图 1.2 两寡头削价竞争 · 单位:万元

结论与囚徒的困境完全一致,用同样的思路走一遍即可:不论对方选高价还是低价,"低价"都是自己的最优选择 (150 > 100;70 > 20)。所以最终一定是双方都采用"低价",各得 70 万元,而各得 100 万元的结果无法实现

⚠️关键的一句

"即使两寡头都完全清楚上述利害关系和相应的效率意义,也无法改变这种结局。" 这句话初看多余,其实是在提前堵住一个常见误解—— 困境不是"信息不足"造成的,而是没有约束力的协议造成的。两个人都看得一清二楚,照样合作不了。 这一点在 1.3.6 节引出"合作博弈"时才正式接上。

模型 1

囚徒的困境:得益怎么改,结论才翻转

拖动滑块改变四个格子的得益,实时判断"坦白"还是不是上策、双方是否仍困在(坦白,坦白)。 预设按钮可以直接切到书里的囚徒困境和双寡头削价两个版本。

3

1.2.2 赌胜博弈

书页 10–14 · 图 1.3–1.5

赌胜博弈是一类很有特点的博弈,按后面的分类属于零和博弈,而且是具有某种对称性的零和博弈。 它大多来源于游戏,但社会经济中也有许多相似的问题。这一节用三个经典例子来说明。

一、齐威王田忌赛马

故事本身众所周知:齐威王的上、中、下三匹马分别比田忌的上、中、下三匹马略胜一筹, 而比赛规则是同等次的马对阵,所以田忌每次都连输三场、连输三千斤铜。 孙膑出的主意是改变出场次序——用下马对齐威王的上马,上马对中马,中马对下马,二胜一负,反而赢一千斤铜。

书里特意点出:如果故事到此结束,它还只是"单方面运用策略"的简单问题,因为只有田忌一方用了策略, 齐威王没有作出反应。一旦齐威王也改变出场次序,这才构成真正的博弈。下面这一步是本节的要点:

💡从故事到模型的四步

(1)博弈方:齐威王和田忌两人。

(2)策略:己方三匹马的出场次序。三匹马的排列共有 3! = 3×2 = 6 种,所以双方各有 6 种可选策略。

(3)次序:双方在决策之前都不能预先知道对方的决策,因此可以看作是同时选择策略的,没有先后次序关系。

(4)得益:赢一千斤铜记作 1,输记作 −1。于是双方各 6 种策略组合出 36 个结果,可以完整写成矩阵。

为什么必须规定"不能预先知道对方出场马的等级、一旦决定就谁也不准反悔"?因为不这样的话, 双方都想等对方决定之后再决定,或见到对阵形势不利就想换马,比赛就无法进行了。 书里还提醒:也可以硬性规定必须相同等级的马比赛,总让齐威王赢,但那时就不再存在策略较量问题,不再是一个博弈问题。

行 · 齐威王
列 · 田忌
田 忌
上中下上下中中上下中下上下上中下中上
齐威王上中下 3,−31,−11,−11,−1−1,11,−1
上下中 1,−13,−31,−11,−11,−1−1,1
中上下 1,−1−1,13,−31,−11,−11,−1
中下上 −1,11,−11,−13,−31,−11,−1
下上中 1,−11,−11,−1−1,13,−31,−1
下中上 1,−11,−1−1,11,−11,−13,−3
图 1.3 齐威王田忌赛马 · 36 个格子构成一个零和博弈,每格两数之和恒为 0
对角线(双方出场次序相同)都是 3, −3:同等次对阵时齐威王三场全胜。逐格验证可以确认这个矩阵自身是自洽的。

这个博弈的三个特点

  • 不能让对方猜中自己的策略。一旦策略被猜中,对方就能针对性选择,己方必输无疑。这意味着策略选择不能一成不变,甚至变动还不能有规律性,必须以随机的方式选择策略
  • 六种策略本身没有优劣之分。对齐威王来说,每一种策略都可能有六种不同结果——一种得益为 3、四种得益为 1、一种得益为 −1。究竟得哪种,主要看对方策略与己方策略的对应情况,而不是己方策略本身。田忌同理(一种得 1,四种得 −1,一种得 −3)。所以两博弈方对己方策略并无偏爱,应以相同的概率选用
  • 偏爱某种策略反而有害。因为一旦对方得知你的偏爱,就可以作针对性选择,从而有更多的机会赢你。

由此可以得出:这种博弈如果只进行一次,双方的策略选择和最终结果是无法确定的,输赢主要取决于机会和运气。 不过齐威王三匹马的总体实力强于田忌,所以他仍然占有优势,赢的机会比田忌大得多。 但如果博弈进行不止一次而是许多次,上面的讨论就给出了决策原则,进一步的讨论还能告诉我们多次博弈后的平均结果—— 这在第二章展开。

二、猜硬币博弈

两人通过猜硬币的正反面赌输赢:一人用手盖住硬币,另一人猜。猜对,猜者赢 1 元、盖者输 1 元;否则猜者输 1 元、盖者赢 1 元。 赢记 1、输记 −1,得益矩阵如下。这是一个"2×2 博弈",只有四种可能结果,比齐威王田忌赛马更简单, 但本质特征相似:双方利益严格对立,取胜关键都是不能让对方猜到自己的策略,同时自己又要尽可能猜出对方的策略。

行 · 盖硬币方
列 · 猜硬币方
猜硬币方
正面反面
盖硬币方正面 −1, 1 1, −1
反面 1, −1 −1, 1
图 1.4 猜硬币博弈 · 前一个数字是盖硬币方的得益,后一个数字是猜硬币方的得益

三、石头 · 剪子 · 布

石头胜剪子、剪子胜布、布胜石头,手势相同为和。用 0 表示没有输赢、1 表示赢、−1 表示输,得到 3×3 的得益矩阵。 书里评论这个游戏"虽小,却包含有相生相克、以柔克刚等相当深刻的哲理",其性质与齐威王田忌赛马、猜硬币都是相似的。

行 · 博弈方1
列 · 博弈方2
博弈方 2
石头剪子
博弈方 1石头 0, 0 1, −1 −1, 1
剪子 −1, 1 0, 0 1, −1
1, −1 −1, 1 0, 0
图 1.5 石头 · 剪子 · 布博弈 · 同样是一个对称的零和博弈

三个博弈合起来看,赌胜博弈的共同点是:双方利益严格对立,取胜的关键都是隐藏自己的策略同时猜出对方的策略。 在一次性博弈中结果取决于机会;在多次重复中,如果双方决策方式都正确,可以求得平均的双方得益。

模型 2

混合策略:为什么必须随机出招

在猜硬币和石头剪子布上跑上千次对局。可以让一个"总出正面 / 总出石头"的对手和一个真正随机的对手同场竞技, 看策略频率如何收敛、收益差从哪来;也可以自己手动出招,看是否有规律可循。

4

1.2.3 产量决策的古诺模型

书页 14–19 · 表 1.1

前面几个模型在分析经济问题时有许多应用,但它们本身却多数不是从经济问题中引出的。 为了让读者对经济博弈有更多了解,这一节介绍一个经典的经济博弈模型:寡头之间通过产量进行竞争的古诺模型。 书里给了两个版本——先是离散产量的三厂商版本,再是连续产量的 n 个厂商版本。

一、三厂商离散产量博弈

出发点是一个市场事实:市场容量总是有限的。在一定的价格水平上一个市场能销出的数量有限, 投放超出这个数量就必须降价才能全部销出。换言之,能够将商品全部销售出去的价格——也称为市场出清价格—— 是投放到该市场上商品数量的函数。

设三个厂商在同一市场生产销售完全相同的产品,产量分别为 q1q2q3, 且只能取 1、2、3… 等正整数(即产量是离散的)。市场出清价格是总产量 Q = q1+q2+q3 的函数, 也称为倒转的需求函数。假设它是:

P = P(Q) = 20 − Q = { 20 − (q1 + q2 + q3), Q < 20 0, Q ≥ 20

再假设生产无成本(主要是为了分析简单和突出博弈关系;当三厂商生产的是石油或矿泉水等天然资源型产品时,该假设也接近现实), 三个厂商同时决定各自的产量。

先排除不可能的范围

在求解之前先作一些粗线条的分析,把不可能选择的产量范围排除掉:

  • 即使生产没有成本,厂商也不会无限制扩大生产——总产量上升必然引起价格下降,总产量等于或超过 20 单位时利润完全为零,所以每个厂商的产量不可能超过 20。
  • 进一步,各自产量实际上不太可能超过 10。因为即使其他两个厂商都不生产,作为垄断者的厂商最佳产量也只有 10(据微观经济理论很容易证明),更何况这不是垄断市场,其他厂商的竞争必然使每个厂商的市场空间更小。
  • 加上产量只取正整数,实际需要分析的产量就只有有限的几种。

利润函数

由于三厂商产量之和超过 20 时价格和利润都降到 0——这是三家都不愿意的——可以假设总产量始终不大于 20。此时厂商 i 的利润函数为:

πi = P · qi = [20 − (q1 + q2 + q3)] · qi

这个公式明确反映了三厂商策略和利益的依存关系:每个厂商的利润都与所有厂商的产量有关,而不是只跟自己的产量有关。 根据它和上面的价格函数,很容易算出在产量组合(4, 8, 6)时市场价格为 2,三厂商利润分别为 8、16、12——这就是表 1.1 的第一行。

产量组合与结果q1q2q3Pπ1π2π3
第 1 行 · 起点486281612
第 2 行 · 厂商 2 降到 54565202530
第 3 行 · 厂商 1 提到 55564202024
第 4 行 · 厂商 3 降到 5 —— 均衡5555252525
低产组合 · 利润最大33311333333
第 6 行 · 一家单独超产到 77337492121

表 1.1 三厂商离散产量组合对应价格和利润(行序与原书一致)

试探与调整:从(4, 8, 6)走到(5, 5, 5)

书里采用"比较和试探"的方法来确定均衡产量。不妨假设三个厂商开始时分别生产 4、8、6 单位(从其他组合起步也行,区别只是调整路径不同,结果肯定相同):

  1. 起点(4, 8, 6):总产量 18,价格 2,利润(8, 16, 12)。总量明显太高了——任何一个厂商降低自己的产量都能使所有厂商的利润增加
  2. 厂商 2 降到 5 →(4, 5, 6):价格升到 5,利润升到(20, 25, 30)。此时厂商 2 和厂商 3 都满意,但厂商 1 不满意——它利润最低(20),而且提高 1 单位产量利润并不会降低,还能改善相对地位。
  3. 厂商 1 提到 5 →(5, 5, 6):价格降到 4,利润(20, 20, 24)。仍不稳定,因为此时厂商 3 将产量降低 1 个单位可以提高自己的利润
  4. 厂商 3 降到 5 →(5, 5, 5):价格 5,三家利润都是 25。任何一家单独提高或降低产量都只会减少利润而不会增加利润,所以这是一个均衡。
⚠️本节最容易被考的一处对比

(5, 5, 5)虽然是均衡,但它并不是这个市场能给三家提供的最大潜在利润。如果三家各生产 3 单位,价格将是 11, 利润都能达到 33,明显高于各生产 5 单位时的 25。

那么三家会采用各生产 3 单位的策略吗?答案是否定的。因为当其他两家都只生产 3 单位时, 一家单独把产量提到 7 单位能大大提高自己的利润(49),而坚持生产 3 单位的两家只能得到低得多的利润(21)。 在没有有力措施相互监管的前提下,(3, 3, 3)绝对不稳定——即使它确实能给三家都带来更大利益。

这就是又一个囚徒的困境:均衡的结果不是最优的结果。即使开始没有落在(5, 5, 5),长期中也会逐渐调整过去。

二、n 个厂商连续产量博弈

现在考虑 n 个厂商销售相同产品的寡头市场。假设各家可自由选择任何产量,厂商之间既不存在相互协商也不受相互限制, 并且在同一时间决定产量——严格意义上的同时决定不容易做到也不必要,这里的"同时"主要是表明各厂商在决定生产多少时 不能知道其他厂商的决定;由于许多商品生产周期相当长,这一点常常是可以成立的。

关键的变化在于:如果假设产量是连续可分的(为了数学处理方便),则每个厂商都有无限多种可供选择的产量, 意味着我们不可能用罗列的办法或者矩阵、图表的形式把它们表达出来——这就是后面"无限博弈"的雏形。

得益是生产的利润,也就是销售收益减去成本。设厂商 i 的产量为 qi,则总产量 Q = Σqi; 市场出清价格 P 是总产量的减函数 P = P(Q),因此 P = Pqi)。 厂商 i 的收益就是 qi · Pqi)。再假设单位产量的成本为固定常数 c (即没有不变成本,边际成本等于平均成本等于常数 c),则生产 qi 单位的总成本为 c qi。于是:

πi = qi · P(qi) − cqi = qi [ P(qi) − c ]

πi = 厂商 i 的利润 · qi = 厂商 i 的产量 · P(·) = 市场出清价格 · c = 单位产量的固定成本

从这个公式容易看出:厂商 i 的得益不仅取决于既定的单位成本 c自己的产量决策 qi, 还通过价格取决于其他厂商的产量决策。因此厂商 i 在决策时必须考虑其他厂商的决策方式以及它们对自己决策的可能反应。 换句话说,其他厂商的产量决策本身又是厂商 i 产量的函数——这种复杂的相互依存关系,"绝对没有表面上看起来这么简单"。

模型 3

古诺模型:从(4, 8, 6)走到(5, 5, 5)

完整复现表 1.1 的调整路径:拖动初始产量组合,然后逐轮让各家按"我的利润能否更高"试探修正, 看它如何收敛到(5, 5, 5);再切到连续产量版本看两条反应函数的交点,以及为什么(3, 3, 3)守不住。

6

公式与结论速查

考前回看

古诺模型的三条式子

市场出清价格: P = P(Q) = 20 − Q, Q = q1 + q2 + q3
单个厂商利润: πi = P · qi = [20 − (q1 + q2 + q3)] · qi
n 厂商、单位成本 c: πi = qi [ P(qi) − c ]

三条式子的共同含义:每个厂商的利润都取决于所有厂商的产量,而不是只取决于自己的产量。这正是策略依存性在函数式上的样子。

上策的判定条件

把四个关键得益记成 T(单独背叛)、R(相互合作)、P(相互背叛)、S(被对方背叛), 那么"背叛是上策"要同时满足两条,而"构成囚徒的困境"还要再加一条:

条件含义囚徒的困境双寡头削价
T > R对方合作时,我背叛更划算0 > −1 ✓150 > 100 ✓
P > S对方背叛时,我背叛比合作少亏−5 > −8 ✓70 > 20 ✓
R > P相互合作优于相互背叛 —— 这条才叫"困境"−1 > −5 ✓100 > 70 ✓

三条合起来就是经典排序 T > R > P > S。前两条保证背叛是上策,第三条保证那个上策均衡不是好结果。 缺了第三条,"困境"就消失了——用模型 1 把 R 拖到 P 以上就能看到。

五个模型速查

模型博弈方 / 策略数结构核心结论
囚徒的困境2 人 / 各 2 种变和 · 非零和上策(坦白,坦白)是必然结果,但不是最优结果——个体理性与集体理性冲突
双寡头削价竞争2 人 / 各 2 种变和 · 非零和同囚徒困境;即使双方完全清楚利害关系也无法改变结局
齐威王田忌赛马2 人 / 各 6 种零和 · 严格竞争六种策略无优劣之分,必须以相同概率随机选用;一次性结果取决于机会
猜硬币2 人 / 各 2 种零和 · 严格竞争2×2 最简版本,与赛马同构;第二章会反复用它作例子
石头 · 剪子 · 布2 人 / 各 3 种零和 · 严格竞争相生相克;随机化是唯一不被利用的打法
古诺(离散三厂商)3 人 / 各有限种变和 · 非零和均衡(5,5,5)不是最优;最优(3,3,3)不稳定
古诺(连续 n 厂商)n 人 / 无限变和 · 非零和只能用函数式表达;是"无限博弈"的典型
7

关键概念与易混点

术语表
上策 Dominant Strategy
无论对方怎么选,它带来的得益都是最大的——注意"无论"二字。 囚徒困境里的"坦白"、双寡头里的"低价"都是上策。上策存在时,博弈的结果就确定了,不需要均衡概念。
得益矩阵 Payoff Matrix
行代表一个博弈方的策略、列代表另一个的,格子里是得益数组。 约定:第一个数字属于行方,第二个属于列方。本工作台把两个数字分了色,方便核对。
赌胜博弈
狭义的概念,指来源于游戏、属于零和范畴、且具有某种对称性的博弈。 齐威王田忌赛马、猜硬币、石头剪子布三个都是。
市场出清价格 / 倒转的需求函数
能够把商品全部销售出去的价格,它是投放到该市场上商品数量的函数。 "倒转"是因为通常写需求量是价格的函数,这里反过来写价格是数量的函数。
策略空间
一个博弈方可选择的全部策略构成的集合。古诺模型里,连续产量下每个厂商的策略空间是无限的—— 这意味着不可能用矩阵或图表把它画出来
破坏者
多人博弈中可能出现的特殊博弈方:其策略选择对自身利益没有影响, 却对其他博弈方的得益有很大、有时是决定性的影响。它的存在使多人博弈的结果难以确定。
⚠️三处最容易混的地方

① "零和"不等于"囚徒困境"。囚徒困境和古诺都是变和博弈,因为双方得益之和会随结果改变 (囚徒困境两格之和:都坦白 −10,都不坦白 −2)。零和的是赌胜博弈那一组。

② "上策存在"和"结果是困境"是两件事。上策存在只说明结果被锁死了;它是不是"困境", 取决于相互背叛是否劣于相互合作。用模型 1 可以亲手把这两件事拆开看。

③ 古诺的均衡(5,5,5)与最优(3,3,3)不是笔误。均衡是"没人愿意单独偏离", 最优是"大家总利润最大"。两者重合与否,正是变和博弈才有的问题——零和博弈里根本不会出现。

5

随堂自测

4 题
Q1囚徒的困境中,(坦白,坦白)是必然结果。根本原因是什么?
正确。对每个囚徒,无论对方怎么选,"坦白"的得益都更大,所以它是上策。而书里特别强调:即使双方都完全清楚利害关系也无法改变结局——困境的根源是缺乏有约束力的协议,不是信息不足。
不对。书里明确说,即使两方都完全清楚利害关系也无法改变结局,所以根源不是信息。坦白是每个人的上策,而双方之间没有有约束力的协议,这才是困境的成因。
Q2齐威王田忌赛马中,为什么两方应当以相同的概率使用六种出场次序?
正确。书里说六种策略本身无好坏之分(齐威王每种策略都可能出现一种得益 3、四种得益 1、一种得益 −1),究竟得哪种主要看对方的对应情况;而一旦对方得知你的偏爱,就能作针对性选择,从而有更多机会赢你。
不对。理由是策略本身无优劣之分,而暴露偏好会被对方针对性利用。注意 D 恰恰相反——等概率并不能保证齐威王赢,只会让结果更依赖机会。
Q3古诺三厂商博弈中,(3, 3, 3)能让每家得到 33,远高于(5, 5, 5)的 25。为什么它不是均衡?
正确。这正是又一个囚徒困境:均衡(5, 5, 5)不是最优,而最优(3, 3, 3)不稳定。只要一家单独超产到 7(表 1.1 第六行),它自己从 33 涨到 49,另外两家从 33 跌到 21。没有相互监管措施时,(3, 3, 3)绝对不稳定。
不对。关键在稳定性:从(3, 3, 3)出发,任一家单独把产量提到 7,自己从 33 涨到 49,另外两家从 33 跌到 21。单个厂商有动机偏离,所以它不是均衡——尽管它给三家的总利润更高。
Q4为什么说齐威王田忌赛马的故事"到这里还只是一个单方面运用策略的简单问题",直到齐威王也调整出场次序才成为博弈?
正确。策略依存性是博弈的根本特征:你的最优选择必须取决于对方怎么选。只有田忌一方运用计谋时,齐威王的出场次序是固定的,田忌面对的是一个确定的环境,那只是一道最优化习题。齐威王一旦反应,双方的选择才互相牵制。
不对。核心是策略依存性。田忌单方面用计谋时,对方是"不反应"的既定条件,谈不上相互依存;双方都调整出场次序,才构成真正的策略较量。注意 B 说的是另一回事(孙膑确实不算博弈方,但那不是本句的理由)。
0 / 4 题正确
第一章 · 第 3 节

1.3 博弈结构和博弈的分类

书页 19–401.3.1 博弈方1.3.2 策略1.3.3 得益1.3.4 过程1.3.5 信息结构1.3.6 能力与理性1.3.7 分类与结构
这一节把 1.1 节那四个方面各自展开成一个维度,再从每个维度切出几种类型,最后汇总成博弈分类法与整本教材的理论结构。 它是第一章真正的骨架——后面每一章的标题,都能在这张分类表上找到出处。
0

这一节讲了什么

概念地图

1.3 节把 1.1 节给出的四个方面各自展开成一个维度,每个维度切出几种类型,最后在 1.3.7 节汇总成整本教材的章节结构。 七个小子节——七个格子。

1.3.1 博弈方单人 / 两人 / 多人
附"破坏者"
1.3.2 策略有限 / 无限
1.3.3 得益零和 / 常和 / 变和
1.3.4 过程静态 / 动态 / 重复
再加上两条维度
1.3.5 信息结构完全 / 不完全(管得益)
完美 / 不完美(管过程)
1.3.6 能力与理性完全 / 有限理性
个体 / 集体理性 → 合作 / 非合作
1.3.7 分类与结构六组分类汇总,排出层次,对应全书十章
💡这一节的隐藏主线

七个格子不是并列的。1.3.1 到 1.3.4 是"看得见"的结构——人数、策略数、得益怎么算、谁先谁后,这些在矩阵和博弈树上都能直接看出来。 1.3.5 和 1.3.6 是"看不见"的结构——知道什么、有多理性,它们不改变博弈的棋盘,却改变博弈的结果。 第六章之后的三章,讲的正是"看不见的结构"如何重塑整个分析。

1

1.3.1 博弈中的博弈方

书页 19–26 · 图 1.6–1.11

博弈方是博弈中独立决策、独立承担博弈结果的个人或组织。这个定义是排他性的,书里给了两个典型反例:

  • 囚徒的困境中只制定规则、自身不参与决策活动的警察,不是博弈方;
  • 齐威王田忌赛马中虽参与决策、但附属于田忌、既不独立决策也不承担后果的孙膑,也不是博弈方。

因为博弈的根本特征是策略依存性,博弈方越多,这种依存关系越复杂、分析越困难,所以博弈方的数量是博弈结构的关键参数之一。 按数量,博弈分为"单人博弈""两人博弈"和"多人博弈"——这里的"人"不一定是自然人,也可以是经济社会组织。

一、单人博弈

单人博弈即只有一个博弈方的博弈。书里说得很直白:严格地讲,单人博弈已经退化为一般的最优化问题,不属于博弈论研究的目标对象。 讨论它有三个理由——使博弈理论的结构更完整;为分析复杂的多人博弈提供启示;两人、多人博弈(包括多阶段动态博弈) 常要转化为多个、多层次的单人博弈来分析。所以单人博弈是博弈分析的基础。

例一:单人迷宫

游戏者从迷宫的入口进入后,能不走任何回头路而顺利到达出口,就能获得奖金 M,否则得不到任何奖金。

入口 A B 出口(奖金 M
图 1.6 单人迷宫 · 网点表示墙壁,底部右侧的缺口是出口

把这个迷宫写成一个博弈问题,四个方面是:(1)唯一的博弈方是游戏者; (2)他有"A 处左转,B 处左转""A 处左转,B 处右转""A 处右转,B 处左转""A 处右转,B 处右转"四种策略; (3)只有一个博弈方,不存在与其他博弈方选择、行动的先后次序问题; (4)得奖金算得益 M,得不到算 0,四种策略对应的得益分别是 0、M、0、0

因为只有一个博弈方,得益矩阵退化为一个向量

得益向量得益
游戏者A 左 B 左0
A 左 B 右M
A 右 B 左0
A 右 B 右0
图 1.7 单人迷宫得益矩阵(退化为一个向量)

当游戏者事先对这四种策略的得益很清楚、在 A、B 两处能对哪边走得通作出准确判断时,该博弈的解是简单明了的: 他必然选择"A 处左转,B 处右转",顺利走出迷宫并取得得益 M

由于策略包含两步行动选择,还可以画成扩展形(Extensive Form)。这种图形中的圆圈称为选择节点节点(Nodes), 也称信息集(Information Set);A、B 分别表示两节点对应的博弈方选择的两个地点,数字 1 表示博弈中唯一的博弈方。 从信息集引出的线条代表该处可选择的各种行动或方向,黑点表示终端,括号中的数字是沿相应行动路径到达终端时的得益。

A, 1 (0) B, 1 (M) (0)
图 1.8 单人迷宫扩展形 · 走得通的那条路径是 A 处左转、B 处右转
💡为什么 A 右转以后就画一个终端

图中博弈方在 A 信息集处选择右转以后就给一个终端,不再给出 B 处的选择。书里的解释是: "因为不管博弈方在 B 处是否选对方向,他都只能得到 0 的得益"。

注意这句话同时承认了"从实际游戏的角度来看,游戏者还必须在迷宫中继续走下去"—— 但在博弈的角度,该博弈方后面的决策选择是没有意义的。这是一个把现实问题抽象成博弈模型时"该丢掉什么"的好例子。

扩展形表示法有直观明了的好处,能比较形象地反映实现每个得益的策略路径。与得益矩阵相比, 由于它能反映博弈过程中选择、行为的先后次序,因此特别适合表示后面要介绍的"动态博弈"。

例二:运输路线(引入"大自然")

一个商人要从 A 地往 B 地运一批货。走陆路成本 10 000 元;走水路成本只要 7 000 元, 但走水路有风险——一旦遇到暴风雨会造成相当于货物总价值 10% 的损失。已知货物总价值 90 000 元, 运输期间出现暴风雨天气的概率为 1/4。问商人该选哪条路线?

与单人迷宫的关键不同是:这里博弈方决策时面临的条件中有一个不确定因素。只知道天气的概率分布,不知道实际情况。 为了把天气因素放进博弈,需要引进一个代表随机选择作用的博弈方——"大自然"(Nature),称为"博弈方 0", 真正决策的商人称为"博弈方 1"。

⚠️"博弈方 0"为什么不是普通博弈方

博弈方 0 的任务是分别以 3/4 和 1/4 的概率随机选择好天气和坏天气。它不会有追求"自身利益"的愿望, 因此不用费心考虑它的得益——这正是称它为"博弈方 0"而不是"博弈方 2"的原因。

以商人运输成本加上损失的负值作为得益,得到得益矩阵:

行 · 商人
列 · 自然
自然
好天气(75%)坏天气(25%)
商人水路 −7 000−16 000
陆路 −10 000−10 000
图 1.9 运输路线得益矩阵 · 自然的得益不用考虑,故每格只有一个数字

书里说明这个博弈的次序:商人决策时不知道未来天气的实际情况(即使自然对天气的选择可以被看作在商人决策前早就作出的), 而自然在选择天气时当然更不会去管商人作了怎样的决策。因此两个博弈方可以看作是同时决策的

用扩展形表示则如图 1.10。第一个信息集为博弈方 0,即自然的选择节点。注意这里有一个关键的画法: 虽然自然的选择有两条路径、分别到达两个不同的节点,但博弈方 1 却仍然只作一个选择,而不是针对两个节点分别作选择—— 这就是那个"椭圆"的含义。

0 好天气 (75%) 坏天气 (25%) 1 (−7 000) (−10 000) (−16 000) (−10 000)
图 1.10 运输路线扩展形 · 椭圆是博弈方 1 的信息集,表示他分不清自己处在哪个节点上

用期望值求解

这个博弈如何解?由于问题本身带有外生的不确定因素,最终结果不一定能预先确定。但如果商人按处理不确定性问题常用的数学期望值决策:

  • 走水路:得益为 −7 000 的概率 75%,为 −16 000 的概率 25%,期望得益 = (−7 000)×75% + (−16 000)×25% = −9 250
  • 走陆路:得益是确定的 −10 000

因为 −9 250 > −10 000,即走水路的期望费用 9 250 小于走陆路的 10 000,所以商人还是应该选择走水路。 若多次碰到同样的决策并每次都这样选择,平均每次的运输成本应接近 9 250。

💡单人博弈的一条独有性质

书里由这个例子引出一条结论:单人博弈实质是个体的最优化问题。对这样的博弈来讲,博弈方拥有的信息越多,决策的准确性就越高,得益自然也就越好。

但——"当博弈方数量达到两个以上后,信息越多得益越大的结论就不一定成立了"。这个反差是单人博弈区别于两人或多人博弈的重要特性之一。 书里没有当场举例,但在 1.3.1 两人博弈部分马上给了理由(见下)。

二、两人博弈

两人博弈是两个各自独立决策、但策略和利益具有相互依存关系的博弈方的决策问题,也是最常见、研究得最多的类型。 前面介绍的囚徒的困境、齐威王田忌赛马、猜硬币、石头剪子布,以及经济活动中的竞争、谈判、兼并收购、劳资纠纷等都属于此类。 书里讨论了三个关键特征,其中第二条直接回应了上面的疑问:

第一 · 不总是相互对抗
两人的利益方向也可能一致。例如一家电视机公司和一家录像机公司在采用制式问题上的博弈就是非对抗性的—— 制式相同则机器相互匹配、双方都获得互补性利益;制式不同则双方都无法享有。因此这两家公司利益一致而非对立。
第二 · 信息多≠得益多
信息较多的博弈方常常更清楚过度竞争的危险,为避免两败俱伤只能采取较保守的策略,从而只得到较少利益; 相反,信息较少、对危险了解较少的博弈方却可能因为不顾后果而掌握主动,得到更多利益。 书里说这与现实中的许多现象非常吻合。
第三 · 个体理性未必导致好结果
这是在囚徒的困境中已经证实过的结论:个人追求最大自身利益的行为,常常并不能实现社会的最大利益, 也常常不能真正实现个人自身的最大利益。
这三条都推广得出去
书里强调:以上几个特性都不仅存在于两人博弈,在两人以上的多人博弈中一般也成立,或存在相关现象。

三、多人博弈与"破坏者"

三个或三个以上博弈方参加的博弈称为多人博弈。基本性质和特征与两人博弈相似,常可用同样思路研究。 但由于独立决策者更多,策略和利益的相互依存关系更复杂——对三人博弈中的一个博弈方来说, 其他两人不仅会对自己的策略作反应,他们相互之间还有作用和反应

更重要的是,三人以上博弈有一个与两人博弈本质区别的特点:可能存在所谓的"破坏者"—— 其策略选择对自身的利益并没有影响,却会对其他博弈方的得益产生很大、有时甚至是决定性的影响。

奥运会主办权的三人博弈

三个城市争夺某届奥运会主办权,由 80 名国际奥委会委员投一次票决定,得票最多者获胜。 投票前估计得票情况为:A 城市 33 票,B 城市 29 票,C 城市只有 18 票。 各博弈方可选策略都是"竞争"或"退出竞争"。

如果三个城市都坚持参加竞争,则 A 城市将获胜。但如果 C 城市在明知自己无望获胜的情况下主动退出, 而在支持 C 城市的 18 名委员中有 11 人以上转而支持 B 城市,则最后获胜的将是 B 城市而不是 A 城市

结论:城市 C 就是这个博弈中的"破坏者"——它的选择对它自己的利益没什么影响(反正赢不了), 却对 A、B 两个城市的利益有决定性的影响。

破坏者的存在使得不少多人博弈的结果难以确定,因为破坏者的行为选择很难用给定环境条件下的经济规律和逻辑推理来判断。 因此分析多人博弈时要特别小心,注意是否存在这种破坏者。

表示方法上也有差别:得益矩阵一般只适合表示单人博弈和两人博弈; 少数离散策略的三人博弈还可以用两个或多个得益矩阵合起来表示;多于三个博弈方的多人博弈一般无法用得益矩阵表示, 复杂的多人博弈或非有限策略的博弈通常只能通过文字描述和函数式表达。

厂商3 用新技术厂商 2
新技术老技术
厂商 1新技术 2,2,25,0,5
老技术 0,5,51,1,10
(a) 厂商 3 —— 新技术
厂商3 用老技术厂商 2
新技术老技术
厂商 1新技术 5,5,010,1,1
老技术 1,10,12,2,2
(b) 厂商 3 —— 老技术
图 1.11 三厂商竞争优势博弈 · 三个厂商是否采用新技术加强竞争优势,每格三个数字依次是厂商 1、2、3 的得益

三人博弈靠两张表拼出来:先固定第三个人的选择,再看前两个人的 2×2 矩阵。这是把多人博弈"降维"成矩阵表示的唯一办法,也是它的上限。

模型 4

扩展式:把博弈画成一棵树

三个博弈的博弈树:单人迷宫、运输路线、先来后到。点选路径看得益怎么读, 切换"商人是否知道天气"看信息集如何把两个节点圈在一起——那个椭圆就是"不完美信息"的全部几何含义。

2

1.3.2 博弈中的策略

书页 26–27

博弈中各博弈方的决策内容称为策略(Strategies),通常是对行为取舍、经济活动水平等的选择。 给出各博弈方可以选择的全部策略或策略选择的范围(也称策略空间),是定义一个博弈时最重要的基本方面之一

不同博弈中可选策略的数量差异极大。把前面介绍的模型排一下,这个跨度一目了然:

博弈每位博弈方的策略数说明
囚徒的困境2坦白 / 不坦白
猜硬币2正面 / 反面
运输路线(商人)2水路 / 陆路
石头 · 剪子 · 布3石头 / 剪子 / 布
齐威王田忌赛马6三匹马的排列共 3! = 6 种
古诺模型(离散产量)可以很大每个可能实现的产量都是一个可选策略
古诺模型(连续产量)无限多产量连续可分时,理论上有无限多种选择

还要注意:并不是每个博弈的博弈方都有相同的可选策略。书里给了两个例子:

策略不同且数量也不同
A 和 B 洽谈一处产业的交易。A 是买方,可在高、中、低三个价格中任选一个出价; B 是卖方,只能选择接受或不接受。于是 A 有 3 种策略,B 有 2 种
一方有限、另一方无限
一个大厂商先占领市场,一些后来的小厂商也向该市场销售少量产品。各小厂商的可选策略是不同的产量, 因此都有无限种;而大厂商可选的策略却只有两种——"打击"和"不打击"。(小厂商总销量不够大时不值得计较,大到一定程度就无法容忍,于是有一个"度"的问题。)

有限博弈与无限博弈

如果一个博弈中每个博弈方的策略数都是有限的,称为有限博弈(Finite Games);如果至少有某些博弈方的策略有无限多个, 称为无限博弈(Infinite Games)。在有限博弈中,常见的是数种策略,最多是数十种策略,其中两三种可选策略的博弈最为普遍。

⚠️为什么这个区别很要紧

有限博弈只有有限种可能的结果——一种结果就是每个博弈方各一种可选策略构成的一个组合, 全部可能结果的数量等于各博弈方可选策略数的连乘积。因此理论上有限博弈总可以用得益矩阵法、扩展形法或简单罗列的办法 把所有策略、结果及对应的得益列出;而无限策略博弈不可能用这些列举方法表示,一般只能用数集或函数式表示。

书里还提示了两点:这使得两类博弈的分析方法常常表现出很大差异;而且策略数的有限和无限对各种均衡解的存在性也有非常关键的影响

3

1.3.3 博弈中的得益

书页 27–29

得益(Payoffs)即参加博弈的各个博弈方从博弈中所获得的利益,它是各博弈方追求的根本目标, 也是他们行为和判断的主要依据。得益可以是本身就是数量的利润、收入,也可以是量化的效用、社会效益、福利等; 由于人们除了获得正效用以外有时也会得到损失、失败和负效用,因此得益有正有负

把每个博弈方在同一结果中的得益相加,算出所有博弈方得益的总和,可以看作这些博弈方的"社会总得益"。 据此可以把博弈分成三类:

零和博弈 Zero-sum Games
不管博弈结果是什么,所有博弈方的得益总和始终为 0。 一方的得益必定是另一方的损失。书里说它"是常见的博弈类型,同时也是被研究得最早、最多的博弈问题"。 零和博弈的博弈方之间利益始终对立,偏好通常不一致——一个博弈方偏好的结果通常是另一个不偏好的结果。 因而双方无法和平共处,两人零和博弈也称为严格竞争博弈(Strictly Competitive Games)。
常和博弈 Constant-sum Games
不管结果是什么,所有博弈方的得益总和始终为某一非零常数。 典型的例子是在几个人或几个方面之间分配固定数额的奖金、财产或利润的讨价还价。 常和博弈可以看作零和博弈的扩展,零和博弈可以看作常和博弈的特例。 与零和博弈一样,各博弈方利益关系也是对立的、基本关系也是竞争关系;不过由于对立性体现在"各自得到利益的多少"上, 结果可能出现大家分得合理或满意的一份,因此也比较容易相互妥协和和平共处。
变和博弈 Variable-sum Games
零和博弈和常和博弈以外的所有博弈。在不同策略组合下各博弈方的利益之和往往不相同。 囚徒的困境和古诺模型都是变和博弈。变和博弈是最一般的博弈类型,常和博弈和零和博弈都是它的特例。
为什么变和博弈最有意义
因为变和博弈的结果存在社会总得益大小方面的区别。这意味着博弈方之间存在相互配合的可能性—— 书里特别澄清,这里的"配合"不是指串通,而是指各博弈方在利益驱动下各自自觉、独立采取的合作态度和行为。 因此这种博弈的结果可以从社会总得益的角度分为"有效率的"或"无效率的""低效率的",即可以站在社会利益的立场上作效率评价
4

1.3.4 博弈的过程

书页 29–32 · 图 1.12

博弈过程也是博弈结构的重要方面。前面介绍的大多数例子都是一次性同时决策,但社会经济活动中也有许多策略较量是 先后、反复或者重复的。例如寡头削价竞争就完全可能是先后进行的。按过程差异,博弈分为静态博弈、动态博弈和重复博弈几个大类。

一、静态博弈

在很多博弈中,如果决策有先后次序,某些博弈方就能事先知道其他博弈方的决策选择,从而有针对性地调整自己的策略, 使自己立于不败之地。这肯定会造成博弈方之间的不公平、不平等。为了公平,也为了使计谋和决策对抗更有意义,同时也有现实博弈问题的根据, 许多博弈常常要求或设定各博弈方是同时决策的——或者虽然决策时间不一定真正一致,但在他们作出选择之前不允许知道其他博弈方的策略, 在知道其他博弈方的策略之后则不能改变自己的选择,从而各博弈方的选择仍然可以看作是同时作出的。

真正同时决策
齐威王与田忌赛马、石头 · 剪子 · 布博弈。
可看作同时决策
猜硬币、古诺模型和投标活动。投标人投出标书一般会有先后, 但因为所有投标人在自己投标之前都无法知道其他投标人的标价,因此可看作是同时决策的。

所有博弈方同时或可看作同时选择策略的博弈称为静态博弈(Static Games)。

二、动态博弈

与静态博弈相对,动态博弈中各博弈方的选择和行动不仅有先后次序,而且后选择、后行动的博弈方在自己选择、行动之前, 可以看到其他博弈方的选择、行动,甚至还包括自己的选择和行动。这种博弈无论在哪种意义上都无法看作同时决策。 动态博弈也称多阶段博弈(Multistage Games)。

弈棋是典型的动态博弈——两个对弈者依次轮流按规则移动棋子。经济活动中的商业大战、各种商业谈判、讨价还价也属于此类。 书里给了一个具体的经济例子:

先来后到博弈

一个容量有限的市场已被厂商 A 抢先占领,另一个生产同样产品的厂商 B 很想加入该市场分享利润。 厂商 B 知道:一旦自己进入,先占领市场的厂商 A 有可能通过降价等手段打击他;如果 A 果真不肯善罢甘休, 厂商 B 不但不能盈利,而且肯定还会亏损。

进一步假设:A 独占市场时利润为 10;与 B 和平共处分享市场则双方各得 5; 如 B 进入市场而 A 对 B 进行打击,则 B 要亏损 2,A 的利润降为 3

为什么它必然是动态博弈:在这个博弈中必须是厂商 B 行为在先,厂商 A 要等 B 行为以后才知道是否有行为的必要、 才需要采取针对性的行为。因此这肯定不可能是一个静态博弈

B 打进 不进 (1, 10) A 打击 和平 (−2, 3) (5, 5)
图 1.12 先来后到博弈 · 每格括号中是(厂商 B 的得益, 厂商 A 的得益)

书里把图 1.12 中的 B 圈和 A 圈称为厂商 B 和厂商 A 的选择信息集,即两博弈方各自轮到选择的位置。 这是一个两博弈方的两阶段动态博弈,是动态博弈中最基本的一种类型。

💡先后顺序带来的不对称

由于行为有先有后,博弈方之间肯定有某种不对称性:先行为者可能利用先行之利获得利益,后行者可能吃一点亏。 但反过来,后行为方可根据先行为方的行为作针对性选择,而先行为方在自己决策时非但不能看到后行为方的选择, 还要顾忌、考虑到后行为方的反应。

书里给了一个思想实验:让一个静态博弈的其他所有规则、条件都保持不变,只把"同时行为"改成"依次行为",结果很可能会大不相同。 这句话预告了第二章(静态)与第三章(动态)为什么要分成两章。

三、重复博弈

重复博弈(Repeated Games)是同一个博弈反复进行所构成的博弈过程。构成重复博弈的一次性博弈(One-shot Games) 也称为"原博弈"或"阶段博弈"。大多数重复博弈的原博弈都是静态博弈。体育竞技中的多局制比赛、商业中的回头客问题、 企业之间的长期合作或竞争,都可以看作是重复博弈问题。

只要两次重复同一个博弈就可以构成重复博弈,所以最少重复次数是两次。按有无事先确定的重复次数,分成两类:

有限次重复博弈 Finitely Repeated Games
经过一定次数的重复就会结束。如签有一定年数合作协议的两企业之间, 把每年"维持还是破坏合作"看作一个阶段博弈,则以协议合作年数为重复次数的重复博弈就属于此类。
无限次重复博弈 Infinitely Repeated Games
没有事先确定的重复次数。一个长期稳定的市场上相互竞争的两个寡头企业之间的博弈就可能是此类。
⚠️"无限次"到底什么意思

书里很谨慎地处理了这个概念:"谁都无法证明一个博弈真正是永远进行下去的,根据唯物主义的观点,任何事物都有存在的极限, 因此真正的无限次重复博弈实际上是不可能存在的。"

但关键在于——"由于只要各个博弈方自己认为重复博弈不会停止,没有可以预期的结束时间,那么他们的决策思路就会与无限重复博弈的思路一致"。 所以"我们不妨把这种博弈理解成无限次重复博弈"。这是一个用主观预期而非客观事实来定义的概念,值得注意。

重复博弈和一次性博弈有明显的差异。一次性博弈中,各博弈方决策时只需考虑眼前利益,不存在"将来"利益的问题, 根据个体理性下的最大利益原则,一般来说不能期望博弈方会相互考虑对方的利益或"情绪"——只要能实现自身最大利益, 每个博弈方都不惜"欺骗""伤害"其他博弈方。

但如果博弈是重复的,各博弈方就可能在前面的阶段试图合作,采取对大家来说都较有利的策略, 因为一旦任何一方发觉他方不合作,可能在以后阶段进行报复。这种未来利益的约束可能使各方的得益都得到改善—— 或者说,重复博弈给博弈提供了实现更有效率博弈结果的新的可能性。重复次数越多,这种可能性越大; 重复次数无穷大时,博弈的结果更可能发生根本性的变化。

5

1.3.5 博弈的信息结构

书页 33–35

书里用一句老话开场:"知己知彼,百战不殆。"关于博弈环境和博弈方情况的信息,是影响博弈方选择和博弈结果的重要因素。 但要小心措辞——书里紧接着说:"我们不是说缺乏信息就不能决策,也不是说信息越多就有越大的利益,只是说信息方面的差异通常会造成决策行为的差异和博弈结果的不同。"

信息结构分两条轴,这是本节最容易混的地方:

一、关于得益的信息:完全 vs 不完全

这是关于得益的轴。各博弈方都完全了解所有博弈方各种情况下得益的博弈,称为完全信息博弈(Complete Information); 至少部分博弈方不完全了解其他博弈方得益情况的,称为不完全信息博弈(Incomplete Information)。

完全信息的例子
囚徒的困境(两囚徒地位相同,警察把双方处境都交代清楚了);齐威王田忌赛马、猜硬币(一方赢就是另一方输, 双方都有关于双方得益的全部信息);古诺模型(假设各厂商对市场价格、自己及其他厂商的销售和生产成本都很清楚)。
不完全信息的例子
投标、拍卖活动——各竞投者对其他人关于标的的估价很难了解, 因此即使最后的成交价是大家都能看到的,各个博弈方仍然无法知道其他人中标、拍得标的物的真正得益究竟是多少。 又如古诺模型中只要假设各厂商对其他厂商的实际生产成本不完全了解,就不再是完全信息。

不完全信息通常也意味着博弈方之间在对得益信息的了解方面是不对称的,因此不完全信息博弈也是不对称信息博弈 (Asymmetric Information),其中不完全了解其他博弈方得益情况的博弈方称"具有不完全信息的博弈方"。

二、关于博弈过程的信息:完美 vs 不完美

这是关于过程的轴,只对动态博弈有意义。在许多动态博弈中,轮到行为的博弈方全部能看到在他行为之前行为的 各个博弈方的所有行为,即对前面的博弈过程或"历史"有完美的知识——弈棋就是如此,每一步棋都是大家可以看见、一目了然的。

但社会经济活动中也显然存在许多竞争对手、合作伙伴有意无意隐藏自己行为的情况。动态博弈中在轮到行为时 对博弈进程完全了解的博弈方,称为具有完美信息(Perfect Information);如果所有博弈方都有完美信息, 则称为完美信息的动态博弈。轮到行为时不完全了解此前全部博弈进程的,称为具有不完美信息(Imperfect Information)。

⚠️这两条轴必须严格分开

完全信息说的是得益——大家知不知道彼此每种结果下的所得。

完美信息说的是过程——轮到行动时看不看得见此前的行动历史。

两者互相独立。所以分类时会出现"完全但不完美信息动态博弈"这样的格子(第八章), 指的是:得益大家都清楚,但行动历史上有人看不清。把这两条轴混起来是本章最常见的失分点。

书里指出,没有关于博弈进程的完美信息,意味着决策和行为必然有一定的盲目性, 只能依靠对博弈进程的某种"判断"、某种概率期望进行决策。因此区别完美与不完美信息也是很重要的。

6

1.3.6 博弈方的能力和理性

书页 35–37

这一节处理一个更根本的问题:博弈方凭什么行为?理性和能力决定了博弈方的行为逻辑, 不搞清基本的行为逻辑,就不可能对他们的策略选择和相互博弈的结果作出准确的判断预测。行为逻辑包括两个方面—— 决策行为的根本目标,以及追求目标的能力

前面几节事实上接受了经济学中通常采用的理性经济人假设:博弈方都以个体利益最大化为目标,有准确的判断选择能力, 也不会"犯错误"。以个体利益最大为目标称为个体理性(Individual Rationality);有完美的分析判断能力、 不会犯选择行为的错误称为完全理性。书里紧接着说:"但这样的假设肯定是有问题的。"

一、完全理性和有限理性

因为博弈问题通常包含复杂的相互依存关系,博弈分析往往很复杂,所以指望现实的博弈方都能通过博弈分析找到最优策略, 而且不会因为遗忘、失误、任性等原因偏离最佳选择,常常是不切实际的。因此博弈论既要研究完全理性的博弈问题, 也要研究有限理性——即博弈方的判断选择能力有缺陷情况下的博弈问题。

⚠️为什么"个别不理性"会毁掉全部分析

书里强调:由于博弈问题中博弈方之间都有很强的相互依赖和影响,因此只要有个别或部分博弈方的理性能力有局限性, 甚至只要博弈方相互对对方的能力和理性有怀疑,就会破坏整个博弈和博弈分析的基础,使得在"所有博弈方有完全的能力和理性"的前提下 所作的理论分析全部失效

这正是后来要专门用一章(第五章)讨论有限理性的原因。本书的处理办法是:介绍基本思想、原理和各种基础模型时仍采完全理性假设, 然后对理性能力的局限及其影响作讨论,并专门在第五章介绍进化博弈论

二、个体理性和集体理性

再讨论决策行为的目标问题。理性经济人假设人们以个体自身利益最大化为根本目标,但实际上, 现实中的决策者并不都是根据个体利益最大化决策的,至少在局部问题上存在以集体(团体)利益为目标、 追求集体利益最大化的情况。追求集体利益最大化称为集体理性(Collective Rationality)。

一般情况下,集体利益最大化本身不是博弈方的根本目标——人们在经济博弈中的行为准则是个体理性而不是集体理性。 但如果允许博弈中存在"有约束力的协议"(Binding Agreement),使得博弈方采取符合集体利益最大化而不符合个体利益最大化的行为时, 能够得到有效的补偿,那么个体利益和集体利益之间的矛盾就可以被克服,从而使博弈方按照集体理性决策和行为成为可能。

📖博弈论最上层的分类

一般地,允许存在有约束力协议的博弈称为合作博弈(Cooperative Game); 不允许存在有约束力协议的博弈称为非合作博弈(Uncooperative Game)。

由于两类博弈中博弈方基本的行为逻辑和研究方法有很大差别,它们是两类很不相同的博弈。 事实上,"合作博弈理论"和"非合作博弈理论"正是博弈论最基本的一个分类, 它们在产生和发展的路径,在经济学中的作用、地位和影响等许多方面都有很大的差别。

本书主要介绍非合作博弈理论,只有第九章对合作博弈理论作初步介绍。书里给了三条理由说明非合作博弈为什么更受重视:

  1. 更普遍。主导人们行为方式的主要还是个体理性而不是集体理性;或者换句话说,竞争是一切社会、经济关系的根本基础, 不合作是基本的,合作是有条件和暂时的,因此非合作博弈关系比合作博弈关系更普遍。
  2. 是合作理论的基础。搞清了非合作的博弈关系,合作的博弈关系就比较容易理解;在证明非合作博弈无效率或低效率的同时, 就自然说明了存在着合作的可能性和必要性。
  3. 更难,所以更不成熟。集体理性是更高级和更复杂的理性,因此研究合作博弈的难度更大, 更难找到分析的一般概念和系统方法。合作博弈和非合作博弈理论发展速度的差异(目前非合作博弈理论比合作博弈理论成熟得多)证实了这种难度差别。

联系前面的记录:1.2.1 节里那句"即使两寡头都完全清楚利害关系也无法改变结局", 根源正是这里——不允许存在有约束力的协议,所以那个困境是非合作博弈的困境。

7

1.3.7 博弈的分类和博弈理论的结构

书页 37–39

把前面对博弈结构的分析汇总起来,就得到博弈问题的分类法。博弈结构每个方面的特征都可以作为分类依据

分类依据分出的类型本教材在哪讲
博弈方的数量单人博弈 · 两人博弈 · 多人博弈
博弈方策略的数量有限博弈 · 无限博弈
得益情况零和博弈 · 常和博弈 · 变和博弈
博弈过程静态博弈 · 动态博弈 · 重复博弈第二、三章 / 第四章
信息结构完全信息 · 不完全信息;完美信息 · 不完美信息第六至八章
理性与行为逻辑完全理性 · 有限理性;非合作 · 合作第五章 / 第九章

书里提醒:各种分类相互之间都是交叉的,并不存在严格的层次关系。但可以根据各种分类对博弈分析方法影响程度的大小, 排出大致的次序——这个次序就是本书的结构:

第一层 · 非合作博弈 / 合作博弈 本书主要介绍非合作博弈理论,合作博弈理论只稍作提及(第九章)
第二层 · 完全理性博弈 / 有限理性博弈 基本概念、原理和分析方法都以完全理性假设为基础,因为这样分析比较简单;有限理性作为扩展放在相关章节后面,并在第五章专门讨论
第三层 · 静态博弈 / 动态博弈 /(重复博弈) 两者在表达和分析方法上都有很大不同,因此分别讨论。第二、三章分别讨论信息完全、完美的静态博弈和动态博弈;重复博弈是特殊的动态博弈,第四章专门讨论
第四层 · 按信息是否完全和完美细分 完全信息静态博弈 · 不完全信息静态博弈 · 完全且完美信息动态博弈 · 完全但不完美信息动态博弈 · 不完全信息动态博弈
💡第四层里有一句全章最重要的伏笔

书里说:其中完全但不完美信息的动态博弈、不完全信息的静态博弈和不完全信息的动态博弈,是新兴的信息经济学的重要基础, 将在第六、七、八章中讨论。

也就是说,第六章之后的内容不只是博弈论的技术延伸,它同时是信息经济学的理论基石。这一句话解释了为什么"不完全信息" 这个分类值得用三章去写。

此外,上述各类博弈还都可以分为零和博弈和非零和博弈、单人博弈和多人博弈等。对这些类型差别不再分章讨论, 只是在各章的分析中加以考虑。

⚠️别把分类当成物理定律

书里在结尾特意提醒:"不要机械地看待博弈分类。因为事实上博弈分类也有很大的主观性,上述分类的主要根据是 有利于理解和掌握博弈分析的思想和原理,随着博弈问题的发展,随着博弈理论的发展,博弈的分类方法也是完全可以发展变化的。"

9

分类速查卡

考前回看

把六个维度、各自的类型和判定标准浓缩成一张表。考前遮住右两列自测:

维度类型怎么判定
博弈方数量单人 / 两人 / 多人数独立决策、独立担责的主体。单人博弈已退化为最优化问题;三人以上要留意"破坏者"
策略数量有限 / 无限至少有一方的策略无限就是无限博弈。有限 = 可能结果数 = 各方策略数之积
得益特征零和 / 常和 / 变和得益总和:恒为 0 / 恒为某非零常数 / 随结果而变。变和 ⊃ 常和 ⊃ 零和
博弈过程静态 / 动态 / 重复同时选择 = 静态;有先后且后者能观察前者 = 动态;同一博弈反复进行 = 重复(特殊动态)
信息结构(得益)完全 / 不完全是否所有博弈方都了解所有人的得益。不完全 = 同时是不对称信息
信息结构(过程)完美 / 不完美轮到行动时是否看得见此前的行动历史。只对动态博弈有意义
理性与行为逻辑完全理性 / 有限理性是否有完美的分析判断能力、不犯选择错误
理性与行为逻辑合作 / 非合作是否允许存在有约束力的协议(Binding Agreement)

分类的层次(全书结构)

层次分法本教材对应章节
第一层非合作博弈 / 合作博弈全书以非合作为主;第九章略讲合作博弈
第二层完全理性 / 有限理性基础部分用完全理性;有限理性(进化博弈论)在第五章
第三层静态 / 动态 / 重复第二章(完全信息静态)· 第三章(完全且完美信息动态)· 第四章(重复)
第四层按信息是否完全和完美细分第六至八章:不完全信息静态、完全但不完美信息动态、不完全信息动态

第四层那三格是新兴的信息经济学的重要基础——这是本章埋下的最重要的一句伏笔。

10

四组易混概念辨析

考前对照

本节要记的术语很多,但真正容易在考试里写反的只有四组。逐一对照:

① 完全信息 ↔ 完美信息
完全信息管得益:是否大家都清楚每种结果下每个人的所得。
完美信息管过程:轮到行动时是否看得见此前的行动历史。
两者独立,所以存在"完全但不完美信息动态博弈"——得益都清楚,但行动有人看不清。
② 零和 ↔ 常和 ↔ 变和
只看得益总和
猜硬币、石头剪子布、齐威王田忌赛马:每格之和恒为 0 → 零和
囚徒的困境:都坦白 −10、都不坦白 −2 → 总和随结果变 → 变和
古诺模型同理是变和
③ 完全理性 ↔ 有限理性
说的是能力:能不能找到最优策略、会不会因遗忘失误任性而偏离。
与它相对的另一组是个体理性 ↔ 集体理性,那说的是目标:以谁的利益最大化为准。
"能力"和"目标"是两条不同的轴,不要混着答。
④ 非合作博弈 ↔ 合作博弈
判据只有一条:是否允许存在有约束力的协议
注意是"允许",不是"实际上有没有达成协议"。囚徒困境里两人不能串通,所以是非合作博弈—— 而困境本身之所以成立,正是因为不允许这种协议。
⚠️三处高频错误

① 把"信息越多得益越大"当通例。书里明确说这条只在单人博弈中成立; 两人以上就不一定了——信息多的博弈方反而可能因为更清楚过度竞争的危险而只能采取保守策略,得到更少的利益。

② 把"无限次重复博弈"当成真的无穷。书里承认它实际上不可能存在,定义靠的是博弈方的 主观预期——只要参与者自己认为不会停止、没有可预期的结束时间,决策思路就与无限重复一致。

③ 以为"破坏者"是恶意的一方。破坏者的定义只看效果:其策略对自身利益没有影响,却对他人的得益有决定性影响。 奥运会例子里退出的 C 城市谈不上恶意,只是它的选择对 A、B 的胜负具有决定性作用。

8

随堂自测

5 题
Q1齐威王田忌赛马中的孙膑,为什么不算博弈方?
正确。博弈方的定义是"独立决策、独立承担博弈结果"。孙膑虽参与决策,但附属于田忌,既不独立决策也不承担后果。对照囚徒困境里的警察——只制定规则、自身不参与决策活动——同样不是博弈方。
不对。判定标准是"独立决策、独立承担博弈结果"。孙膑虽参与决策(比 D 说的更接近),但附属于田忌、不独立承担后果,所以不是博弈方。
Q2关于"完全信息"和"完美信息",下面哪个说法正确?
正确。两条轴互相独立:完全信息管"得益知不知道",完美信息管"轮到行动时看不看得见此前的行动历史"。正因为独立,才会出现"完全但不完美信息动态博弈"这样的格子(第八章)。
不对。完全信息 = 得益是否大家都清楚;完美信息 = 轮到行动时是否看得见此前的行动历史(只管动态博弈)。两者互相独立,D 正好说反了,B 也不成立——正因为互不蕴含,才会有"完全但不完美"这种组合。
Q3运输路线博弈里的"大自然"(博弈方 0)与一般博弈方有何不同?
正确。博弈方 0 的任务是分别以 3/4 和 1/4 的概率随机选择好天气和坏天气,它不会有追求"自身利益"的愿望——书里说这正是称它为"博弈方 0"而不是普通编号的原因。注意 D 的措辞:不是"得益为零",而是根本不用考虑它的得益。
不对。关键是博弈方 0 按固定概率随机选择、不追求自身利益,所以它的得益无需考虑。注意它并不是"得益恒为零"——而是这个维度对它不适用。
Q4三人以上的多人博弈与两人博弈相比,书里特别强调的一个本质区别是什么?
正确。奥运会主办权的例子中,C 城市无论怎么选都赢不了,但它的进退直接决定 A 还是 B 获胜。书里说破坏者的存在使多人博弈的结果难以确定,"因为破坏者的行为选择很难用给定环境条件下的经济规律和逻辑推理来判断"。A 虽然也常成立,但那是表示方法上的差别,图书里并未称之为"本质区别"。
不对。书里称为"本质区别"的是破坏者的存在(奥运会主办权例子里 C 城市)。表示方法上的困难(A)确实存在,但那是技术问题;C 则完全错误——策略依存性依然存在,只是更复杂。
Q5为什么书里说"重复博弈也是动态博弈,是特殊的动态博弈"?同时又把它单独列为一章?
正确。各次重复之间存在相互影响和制约,必须把重复博弈过程作为一个整体研究;而大多数重复博弈的原博弈是静态博弈,所以它同时与动态、静态博弈都有关系,需要结合两者的分析方法。注意 A 说反了——原博弈大多数是静态博弈
不对。理由是:各次重复之间存在相互影响和制约,不能割裂为独立博弈分析,必须整体研究;且原博弈大多是静态博弈(A 说反了),所以需要结合静态与动态两套方法。C 也错——有限次重复博弈是最常见的类型之一。
0 / 5 题正确
第二章 · 第 1 节

2.1 基本分析思路和方法

书页 41–522.1.1 上策均衡2.1.2 严格下策反复消去法2.1.3 划线法2.1.4 箭头法
第一章把博弈分类讲清楚了,但没有给出"怎么解"的一般方法。这一节把四种由浅入深的方法依次建立起来: 上策均衡、严格下策反复消去法、划线法、箭头法。它们的适用面一级比一级宽,前两种是绝对优劣的思路, 后两种是相对优劣的思路 —— 而后者才是博弈分析真正的立足点。
0

这一节讲了什么

概念地图

四种方法不是并列的,而是一条适用面不断放宽的链条。每往下一步,都因为上一步"管不了"才被逼出来:

① 上策均衡 比较的是策略的绝对优劣:不管对方怎么选,我这个策略都更好。最稳定、预测最肯定,但极少存在
上策往往不存在 → 改成两两比较
② 严格下策反复消去法 仍然是绝对优劣,但只需策略之间两两可比。消去不可能被采用的策略,逐步缩小范围
很多博弈连严格下策都没有 → 换成相对优劣
③ 划线法 找每个博弈方针对对方每种策略的最佳对策,再看哪些组合互相都是最佳对策
换一个角度看同一件事
④ 箭头法 看每个组合处有没有人想单独改变策略。没有出发箭头的组合就是稳定的
💡这一节真正的落点

四种方法最后都会指向同一个东西:各博弈方的策略相互是对方的最佳对策。这个性质在 2.2 节被正式命名为 纳什均衡。所以这一节可以看成"用四种不同的路走到同一个概念",划线法和箭头法其实就是在得益矩阵上找纳什均衡的手工方法

1

2.1.1 上策均衡

书页 41–42

先从最简单的情况开始。如果不管其他博弈方选择什么策略,一个博弈方的某个策略给他带来的得益始终高于其他策略,至少不低于其他策略, 那么这个策略必然是他愿意选择的。第一章里囚徒困境中的"坦白"就是这样的策略。

上策 Dominant Strategy
不管其他博弈方选择什么策略,给该博弈方带来的得益始终高于(至少不低于)他其他策略的那个策略。 关键词是"不管"—— 它不依赖对方的任何选择。
上策均衡 Dominant-strategy Equilibrium
如果某个策略组合中所有策略都是各博弈方各自的上策, 那么这个组合肯定是所有博弈方都愿意选择的,必然是博弈比较稳定的结果。 囚徒困境中的(坦白,坦白)就是一个上策均衡。

上策均衡是博弈分析中最基本的均衡概念,其分析也是最基本的方法。它的价值在于:反映了所有博弈方的绝对偏好,因此非常稳定, 可以对博弈结果作出最肯定的预测。所以进行博弈分析时,应该首先判断各个博弈方是否都有上策、博弈中是否存在上策均衡—— 如果能找到一个上策均衡,就意味着博弈分析有了明确的结果,任务基本上完成了。

⚠️但它几乎不出现 —— 而这恰恰是好事

问题是并非每个博弈方都有这种绝对偏好的上策,而且常常是所有博弈方都没有。 因为"博弈方的最优策略随其他博弈方的策略而变化"正是博弈问题的根本特征,是策略相互依存性的主要表现形式。 所以上策均衡不是普遍存在的——齐威王田忌赛马、古诺产量博弈里就都没有。

书里换了个角度说:上策均衡并不普遍存在,正是博弈理论的价值所在。 如果它在所有博弈问题中普遍存在,那么博弈问题与一般的个人最优化问题就没有任何实质区别, 博弈分析也就不会有什么新意,更不可能成为一门独立的、重要的理论方法。

2

2.1.2 严格下策反复消去法

书页 42–46 · 图 2.1–2.3

一、思路和原理:选择法 vs 排除法

上策均衡分析的思路是选择法——在所有可选择的策略中挑出最好的那一个。但选择只是决策思路中的一种。 另一种同样常用的是排除法:通过把不可能采用的较差策略排除掉,从而筛选出较好的策略,或至少缩小候选范围。 排除法的思路就导出了严格下策反复消去法。

仍然以囚徒的困境为例。不管对方策略如何,两个囚徒各自两种策略中的"坦白"都比"不坦白"来得好。 这时称"不坦白"是相对于"坦白"的严格下策(Strictly Dominated Strategy)。

📖严格下策

如果在一个博弈中,不管其他博弈方的策略如何变化,一个博弈方的某种策略给他带来的得益, 总是比另一种策略给他带来的得益要小,则称前一种策略为相对于后一种策略的一个"严格下策"。

很显然,任何理性的博弈方都不可能采用严格下策。因此可以把它从策略空间中排除掉。 囚徒困境中消去双方的"不坦白"之后,各自只剩"坦白",于是双方都坦白成为必然选择,各判 5 年。 这里的结果与上策均衡分析完全相同。

值得注意的是,这种消去既可以在同一个博弈方的策略空间中反复运用,也可以在各个博弈方的策略空间上交叉运用—— 只要各博弈方剩余的策略空间中还有严格下策,就可以继续消去,直到找不出任何严格下策为止。

二、应用:图 2.1 这个例子

看下面这个抽象掉了现实问题内容的、两个博弈方分别有三种和两种策略的不对称博弈问题:

行 · 博弈方1
列 · 博弈方2
博弈方 2
博弈方 1 1, 0 1, 3 0, 1
0, 4 0, 2 2, 0
图 2.1 适合用严格下策反复消去法分析的例子

先判断上策:博弈方 1 的"上""下"之间没有始终占优的一方,博弈方 2 的"左""中""右"之间也没有。所以本博弈不存在上策均衡, 上策均衡分析在这里没有用武之地。改用严格下策反复消去法,逐步走三步:

  1. 消去博弈方 2 的"右"。不管博弈方 1 选"上"还是"下",博弈方 2 选"右"的得益(1 和 0)都小于选"中"的得益(3 和 2), 所以"右"是相对于"中"的严格下策。消去后博弈简化为图 2.2。
  2. 消去博弈方 1 的"下"。在剩下的四种组合里,"下"的得益(0 和 0)都小于"上"的得益(1 和 1), 所以"下"是相对于"上"的严格下策。消去后得到图 2.3。
  3. 消去博弈方 2 的"左"。只剩两个组合时,"左"的得益 0 小于"中"的得益 3,可以消去。 原来的博弈被精简到只剩唯一一个策略组合(上,中)
消去"右"后博弈方 2
博弈方 1 1, 01, 3
0, 40, 2
图 2.2 消去博弈方 2"右"策后的博弈
再消去"下"后博弈方 2
1, 01, 3 
图 2.3 进一步消去博弈方 1"下"策后博弈

因为所有被消去的策略都是两博弈方不可能采用的,所以最终的选择只能是唯一剩下的(上,中),它就是博弈的"解"。 注意:(上,中)并不是原博弈的上策均衡——事实上原博弈根本没有上策均衡。这就说明严格下策反复消去法的适用范围确实比上策均衡分析更大。

⚠️但它也不是万能的

在许多博弈问题中,相对意义上的严格下策往往也不存在。如猜硬币、齐威王田忌赛马、石头·剪子·布等赌胜博弈, 没有任何博弈方的任何策略是相对其他策略的严格下策——当然也就无从消起。

此外,在策略数较多的博弈中,往往只能消去部分策略,剩下不能消去的策略组合并不唯一,这时仅用它也无法作出准确判断。

失效的原因仍然在策略依存性:一个博弈方的不同策略之间往往不存在绝对的优劣关系,只存在相对的、有条件的优劣关系, 而严格下策反复消去法恰恰是靠绝对优劣关系工作的。

不过书里也强调,这不否定它的意义:它不仅能解决部分博弈问题,还能使不少博弈问题得到简化, 而且与上策均衡、纳什均衡、弱下策消去等概念都有密切联系,是博弈分析的标准工具之一

3

2.1.3 划线法

书页 46–49 · 图 2.4–2.8

前两种方法都有局限,所以必须寻找更普遍适用的方法。方向其实已经被上面的分析提示了: 适用性较强的方法,必然以策略之间的"相对优劣关系"而不是"绝对优劣关系"为基础。顺着这个思路就得到划线法。

博弈方决策时必须考虑其他博弈方的存在和策略选择,因此科学的决策思路是:先找出自己针对其他博弈方每种策略(或策略组合)的最佳对策 ——即给自己带来最大得益的策略(这种相对最佳对策总是存在的,不过不一定唯一)——然后在此基础上, 通过对其他博弈方策略选择的判断,预测博弈的可能结果并确定自己的最优策略。

怎么划

在图 2.1 的矩阵里,对每个博弈方的每个策略,找出对手相应策略下的最佳对策,把该得益数字下面划一短线

  • 博弈方 1:对方选"左"时"上"更好(1 > 0),选"中"时"上"更好(1 > 0),选"右"时"下"更好(2 > 0) → 划 上左的 1、上中的 1、下右的 2
  • 博弈方 2:对方选"上"时"中"最好(3 > 0、3 > 1),选"下"时"左"最好(4 > 2、4 > 0) → 划 上中的 3、下左的 4
行 · 博弈方1
列 · 博弈方2
博弈方 2
博弈方 1 1, 0 1, 3 0, 1
0, 4 0, 2 2, 0
图 2.4 划线法分析图 2.1 中博弈 · 短线表示"这是针对对方该策略的最佳对策"

六个得益数组里各有几种情况,读法正是划线法的全部内容:

划线的位置含义结论
两个数字下都无线(0,2)和(0,1)两个博弈方的策略都不是针对对方的最佳对策不可能是双方的选择
只有一个数字下有线(1,0)(0,4)(2,0)只有一方的策略是对另一方的最佳对策不是双方同时愿意接受的结果
两个数字下都有线(1,3)双方策略都是对对方策略的最佳对策具有稳定性,很可能是博弈的结果

通过在每个博弈方对其他博弈方每个策略的最佳对策所对应的得益下划线来分析博弈,这种方法称为划线法。 它是建立在策略之间相对优劣关系上的,因此在分析用得益矩阵表示的博弈问题时具有普遍适用性

四种典型情形

划线法能得出三种不同的结论,加上"划了也白划"的情形,正好覆盖第一章的四个博弈:

囚徒1 行
囚徒2 列
囚徒 2
坦白不坦白
囚徒 1坦白 −5, −5 0, −8
不坦白 −8, 0 −1, −1
图 2.5 划线法分析囚徒的困境 · 唯一一个两数都划线的组合
盖币方 行
猜币方 列
猜硬币方
正面反面
盖硬币方正面 −1, 1 1, −1
反面 1, −1 −1, 1
图 2.6 划线法分析猜硬币博弈 · 没有两数都划线的组合
妻子 行
丈夫 列
丈夫
时装足球
妻子时装 2, 1 0, 0
足球 0, 0 1, 3
图 2.7 / 图 2.8 夫妻之争及其划线 · 两个组合两数都划线
博弈划线后的结论
图 2.1 博弈唯一一个两数都划线的组合(上,中)→ 结果基本确定
囚徒的困境唯一一个(坦白,坦白)→ 结果基本确定
猜硬币一个都没有 → 根本不可能有可预言的结果
夫妻之争有两个(时装,时装)和(足球,足球)→ 反而无法确定哪个会出现
划线法的四种结局

注意最后一行:唯一性才是划线法给出确定结论的条件,而不只是"存在"。两个都合理,就等于无法预测。

关于"夫妻之争"这个经典模型

夫妻之争(Battle of Sexes)的设定是:一对夫妻得到两张时装表演票和同一时间的两张足球票。妻子更想去看时装、丈夫更想去看足球, 但不愿或不能分头行动,于是决定投票一次决定——同选时装则看时装,同选足球则看足球,选择不一致则哪儿都不去(双方得益都是 0)。

书里特意说明,讨论这个模型的意义主要不是解决夫妻矛盾。日常生活中与它相似的问题很多:两个人从不同地点出发而希望中途会合, 若存在两条不同路线,他们对路线的选择就与夫妻之争很相似;这个问题甚至可以推广到人类与可能存在的外星生物相互联络的尝试中, 对联系方式(介质、频率等)的选择上;企业之间在关联产品技术和规格等方面的合作也有类似特征。

💡夫妻之争与猜硬币的分野

猜硬币里,博弈方要拼命隐藏自己的选择;夫妻之争里恰恰相反——他们主观上并不想隐藏, 因为只要知道对方选了什么都愿意跟从。两类博弈的决策原则因此完全不同,这一点在 2.4 节展开。

4

2.1.4 箭头法

书页 49–52 · 图 2.9–2.12

还有一种分析思路与划线法不同、但效果相同的方法。箭头法的基本思路是:对每个策略组合,考察各个博弈方能否通过单独改变自己的策略而增加得益。 如果能,就从所分析的得益数组引一箭头,指向改变策略后到达的得益数组。综合所有策略组合的分析,就形成对博弈结果的判断。

用囚徒的困境走一遍

可以从四个组合中的任一个开始分析,不妨从(不坦白,不坦白)开始:

  1. (不坦白,不坦白)得(−1, −1)。两人都发觉单独改变策略能增加得益(从 −1 提高到 0), 于是囚徒 1 会改选坦白(→ 变到(坦白,不坦白)),囚徒 2 也会改选坦白(→ 变到(不坦白,坦白))。两个出发箭头,不稳定。
  2. (坦白,不坦白)得(0, −8)。囚徒 1 满意,但囚徒 2 会改选坦白,把得益从 −8 提高到 −5 → 指向(坦白,坦白)。
  3. (不坦白,坦白)得(−8, 0)。对称地,囚徒 1 会改选坦白 → 也指向(坦白,坦白)。
  4. (坦白,坦白)得(−5, −5)。无论谁单独改变策略都不合算(得益会从 −5 降为 −8), 因此没有任何指离它的箭头,只有指向它的箭头。这就是唯一稳定的组合。
箭头法
↑↓ 行方想换 · ←→ 列方想换
囚徒 2
坦白不坦白
囚徒 1坦白 −5, −5  0, −8
不坦白 −8, 0 −1, −1↑←
图 2.9 箭头法分析囚徒的困境 · 只有(坦白,坦白)没有指离的箭头

表格里画不了真正的箭头,所以把"想离开这一格"记成格子内的小方向符号: ↑↓ 是行方想改选上/下,←→ 是列方想改选左/右。例如(不坦白,不坦白)标着 ↑←, 意思是两方都想走;而(坦白,坦白)里是空的——没人想动,这就是稳定组合。

另外三个博弈

把箭头法用到图 2.1、猜硬币和夫妻之争上,结论与划线法完全一致:

行 · 博弈方1
列 · 博弈方2
博弈方 2
博弈方 1 1, 0 1, 3  0, 1
0, 4 0, 2 2, 0
图 2.10 箭头法分析图 2.1 中博弈 · 唯一稳定组合(上,中)
盖币方 行
猜币方 列
猜硬币方
正面反面
盖硬币方正面 −1, 1↑← 1, −1↓→
反面 1, −1↓→ −1, 1↑←
图 2.11 箭头法分析猜硬币博弈 · 每格都有指离的箭头
妻子 行
丈夫 列
丈夫
时装足球
妻子时装 2, 1  0, 0↑←
足球 0, 0↓→ 1, 3 
图 2.12 箭头法分析夫妻之争 · 两个稳定组合,因此也难断定一次博弈的实际结果
模型 5

博弈求解器:划线法 / 箭头法 / 纳什均衡

选一个经典博弈,切换三种视图看同一张矩阵:划线法标出各方的相对最佳对策,箭头法标出谁想离开这一格, 两种方法都会只剩下同一批稳定组合。也可以自己改矩阵里的数字,实时看结论怎么变。

5

四种方法速查卡

考前回看
方法比的是怎么用什么时候失灵
上策均衡绝对优劣 看每个博弈方是否有一个"不管对方怎么选都更好"的策略。全是上策的组合就是上策均衡 绝大多数博弈里没人有上策——最优策略随对方而变才是博弈的常态
严格下策反复消去法绝对优劣(两两比较) 把"不管对方怎么选都更差"的策略逐轮消去,交叉进行直到没有可消的。只剩唯一组合时它就是解 赌胜博弈里没有任何严格下策;或消去后仍剩多个组合
划线法相对优劣 对每个博弈方的每个策略,把针对对方各策略的最佳对策得益划短线。两数都划线的格子就是稳定组合 不出确定的结论,但总能给出信息:无线=无解,一个=确定,多个=无法择一
箭头法相对优劣 看每个组合处有没有人想单独改变策略。只有指入、没有指出箭头的组合就是稳定组合 同划线法,两者结论必定一致
四种方法的关系(一句话)
适用面从窄到宽是 上策均衡 < 严格下策反复消去法 < 划线法 = 箭头法。 前三者都可能"划不出来",但划线法和箭头法至少能告诉你这个博弈能不能有确定结果
它们共同的落点
划线法和箭头法找的"稳定组合",其共同特性就是每个博弈方的策略都是针对其他博弈方策略的最佳对策。 这正是 2.2 节要定义的纳什均衡。所以这两种方法其实就是在得益矩阵上找纳什均衡的手工办法
6

关键概念与易混点

术语表
上策 Dominant Strategy
不依赖对方选择、始终(不低于)优于其他策略的那个策略。注意是"始终"——只要存在一种对方的选择使另一个策略更好,它就不是上策。
上策均衡 Dominant-strategy Equilibrium
各博弈方都取上策构成的策略组合。它一定是纳什均衡,但反过来不成立。
严格下策 Strictly Dominated Strategy
不管其他博弈方怎么选,得益总是更小的那个策略。任何理性的博弈方都不会采用它。 注意"严格"二字:如果只是不优于(可能相等),那叫弱下策,是另一回事。
划线法
在得益矩阵上,把每个博弈方针对对方各策略的最佳对策得益划短线。两数都划线的格子是稳定组合。
箭头法
从每个策略组合出发,看谁能通过单独改变策略增加得益,能则引一箭头。只有指入、没有指出的组合是稳定的。
夫妻之争 Battle of Sexes
两个纯策略纳什均衡、且双方偏好相反、但都宁愿凑在一起也不愿落空的经典博弈。区别于严格竞争博弈的关键是: 双方不想隐藏自己的选择
⚠️三处最容易混的地方

① "绝对优劣"和"相对优劣"是这一节的分水岭。上策均衡和严格下策反复消去法靠绝对优劣(对方怎么选都成立), 划线法和箭头法靠相对优劣(针对对方的具体选择)。正因为博弈的常态是只有相对优劣,前两种方法才经常失灵。

② "没有纳什均衡"不等于"随便选都一样"。猜硬币划线法划不出结果,但这不代表选择不重要—— 恰恰相反,这时随机化的概率分布本身就是策略,选错了概率分布照样被对方占便宜(2.4 节)。

③ 消去顺序不影响结论,但前提是"严格"下策。严格下策反复消去法的消去顺序不影响最终结果; 但如果用的是下策,顺序就会影响结论——这是本章不展开、但考试常设的陷阱。

7

随堂自测

4 题
Q1为什么说"上策均衡并不普遍存在,正是博弈理论的价值所在"?
正确。书里的原话是:如果上策均衡在所有博弈问题中普遍存在,那么博弈问题与一般的个人最优化问题就没有任何实质性的区别,博弈分析也就不可能成为一种独立的理论方法。博弈的根本特征正是"最优策略随对方而变"。
不对。逻辑是反过来的:正因为上策(不依赖对方选择的最优策略)往往不存在,才有了"相对优劣"的分析需要,博弈论才成为独立理论。D 也不对——上策均衡与信息完全与否不是同一回事。
Q2在图 2.1 的博弈中,为什么第一步消去的是博弈方 2 的"右"而不是博弈方 1 的某个策略?
正确。博弈方 1 的"上""下"之间没有严格优劣:对方选"左""中"时"上"更好,选"右"时"下"更好——这正是"下"只在消去"右"之后才成为严格下策的原因。所以第一步没有别的选择。
不对。关键是博弈方 1 的两个策略不是严格可比:对方选"左""中"时"上"占优,选"右"时"下"占优。所以第一步只能消博弈方 2 的"右"(它严格劣于"中")。注意 D 只对了一半——顺序不影响最终结果,但每一步能消什么是由矩阵决定的。
Q3用划线法分析一个博弈后,发现有三个策略组合的两个数字下都划了短线。能得出什么结论?
正确。这正是夫妻之争那种情形。划线法给出的是"哪些组合具有稳定性",唯一性才是它能给出确定预测的条件。三个都稳定,就意味着仅靠划线法无法择一——2.6 节的帕累托上策、风险上策、聚点均衡、相关均衡正是为处理这种局面而生的。
不对。三个都划上线只说明它们各自都有内在稳定性(双方都愿意维持),并不构成"随意挑一个"的理由,也不是划线出错。缺的是唯一性——这正是 2.6 节要解决的问题。
Q4箭头法与划线法在思路上最主要的差别是什么?
正确。两者都基于策略之间的相对优劣关系,结论必然一致,是两种可以相互替代的方法;差别只在分析角度。书里说它们"对读者理解博弈的本质意义等应该会有不同的启发"——箭头法"谁想离开"的视角在引出纳什均衡时更直接。
不对。两者都基于相对优劣(C 说反了),适用范围也一样,都只处理可用得益矩阵表示的有限策略博弈(B 错)。真正的差别是提问方式:划线法找"最佳对策",箭头法找"谁想离开"。
0 / 4 题正确
第二章 · 第 2 节

2.2 纳什均衡

书页 52–582.2.1 定义2.2.2 一致预测性质2.2.3 与严格下策反复消去法的关系
上一节用四种方法走到的那个共同落点,这一节给它正式命名并给出定义。纳什均衡是整个非合作博弈理论的中心概念 —— 后面每一章的核心均衡概念(子博弈完美纳什均衡、贝叶斯纳什均衡、完美贝叶斯均衡)本身都是纳什均衡,都是它的某种精练。
0

这一节讲了什么

概念地图

三小节,回答三个层层递进的问题:它是什么它凭什么值得苦苦去找它和上一节那些方法什么关系

2.2.1 定义 先建立博弈、策略空间、得益的一般表示法(G = {S₁ … Sₙ; u₁ … uₙ}), 再给出"任何一方单独偏离都不会更好"的定义
为什么值得找
2.2.2 一致预测性质 如果所有博弈方都预测某个结果会出现,就没有人愿意采用与预测不一致的策略 —— 预测和自我强制的统一。 这是纳什均衡价值的来源
和旧方法的关系
2.2.3 与严格下策反复消去法 两个命题:消去后剩下的唯一组合必定是纳什均衡;纳什均衡必定不会被消去。 两者相容,所以可以先化简再求均衡
1

2.2.1 纳什均衡的定义

书页 52–54

用划线法或箭头法找出的那些"具有稳定性的策略组合",不管是否唯一,都有一个共同特性: 其中每个博弈方的策略都是针对其他博弈方策略或策略组合的最佳对策。在两人博弈的情况下就是: "给定你的策略,我的策略是我最好的策略;给定我的策略,你的策略也是你最好的策略。" 具有这种性质的策略组合,正是非合作博弈理论中最重要的解概念 —— 纳什均衡

先建立一套一般表示法

为了给出较正式的定义,先约定记号。这套记号后面每一章都会用到:

G = { S1, … , Sn ; u1, … , un }

G = 一个博弈 · n = 博弈方个数 · Si = 博弈方 i策略空间(他全部可选策略的集合)· sijSi = 博弈方 i 的第 j 个策略(j 可取有限个值即有限策略博弈,也可取无限个值即无限策略博弈)· ui = 博弈方 i 的得益,是各博弈方策略的多元函数

有了这套记号,纳什均衡的定义可以写成一个不等式:

📖纳什均衡的定义

在博弈 G = {S₁,…Sn; u₁,…un} 中, 如果由各个博弈方的各一个策略组成的某个策略组合(s₁*, …, sn*)中, 任一博弈方 i 的策略 si* 都是对其余博弈方策略的组合 (s₁*, …, si−1*, si+1*, …, sn*)的最佳对策,即

ui( si*, s−i* ) ≥ ui( si′, s−i* )   对任意 si′ ∈ Si 都成立

则称(s₁*, …, sn*)为 G 的一个纳什均衡(Nash Equilibrium)。

记号 s−i 读作"除 i 以外所有博弈方的策略组合"。这个缩写的用处在于: 把"其他人不动"这件事压成一个符号,于是纳什均衡就可以干脆地说成 "给定 s−isi* 是我能选的最好的"——对每个人、同时成立

拿前面几个博弈对号入座

博弈纳什均衡为什么
囚徒的困境(坦白,坦白)给定对方坦白,"坦白"是最佳对策;对两方都成立
图 2.1 的博弈(上,中)给定对方选中,"上"最好;给定对方选上,"中"最好
夫妻之争(时装,时装)和(足球,足球)两个组合都满足"谁也不想单独偏离",因此有两个纳什均衡
猜硬币不存在每个组合里输的一方都能通过单独改变策略反输为赢
2

2.2.2 纳什均衡的一致预测性质

书页 54–56

在介绍更多求纳什均衡的方法之前,必须先说明一件事:为什么值得花力气去找它? 纳什均衡的价值主要在于它有一些非常重要的性质,其中最重要的之一就是一致预测性

📖一致预测性

如果所有博弈方都预测一个特定的博弈结果会出现,那么所有的博弈方都不会利用该预测或者这种预测能力, 选择与预测结果不一致的策略,即没有哪个博弈方有偏离这个预测结果的愿望,因此这个预测结果最终真会成为博弈的结果。

这里"一致"的意义需要特别留意:它指的是各博弈方的实际行为选择与他们的预测一致, 而不是不同博弈方的预测彼此相同、没有差异。这一点书里专门强调过,很容易读反。

为什么这个性质这么重要

关键在于:一个博弈方在博弈中所作预测的内容包括他自己的选择。因此博弈方有可能会利用预测改变自己的选择 —— 这是一个自我指涉的圈套。具有一致预测性质的分析概念能避免这样的矛盾,从而是稳定的、自我强制的(Self-enforcing), 相应的选择也才是真正可预测的。

不具有一致预测性质的概念,则在分析和预测博弈结果时难以避免预测和行为之间的矛盾, 因此是不稳定的,甚至是自我否定的,作用和价值必然很有限。

两条方向的证明

书里给出一个简单证明,说明纳什均衡具有一致预测的性质,而且只有纳什均衡才有这种性质

正向:纳什均衡 ⇒ 一致预测
如果所有博弈方都预测结果是某个纳什均衡,那么由于该组合中各博弈方的策略都是对其他博弈方策略的最佳对策, 因此任一博弈方都不会单独改变策略,预测的结果会成为博弈的最终结果。
反向:一致预测 ⇒ 纳什均衡
如果每个博弈方预测到某个组合将是结果时都会主动坚持该组合中的策略,那说明该组合中每个博弈方的策略 都是对其他博弈方策略的最佳对策 —— 按定义,这个组合一定是纳什均衡。

反过来说更直观:如果所有博弈方都是理性的,那么当他们预测到结果将是某个非纳什均衡策略组合时, 一定至少有一个博弈方想改变自己的策略,因此该预测绝不可能是一致预测。于是纳什均衡与一致预测之间是密切联系、不可分割的。

💡由此推出的两条推论

第一,各博弈方可以预测它,还可以预测他们的对手会预测它,还可以预测他们的对手会预测自己会预测它……(无限递推)。

第二,预测任何纳什均衡组合将是最终结果,就意味着要么各博弈方的预测其实并不相同(比如各自预测了不同的纳什均衡会出现), 要么预期至少一个博弈方要"犯错误"——包括对博弈结构理解的错误、对其他博弈方策略预测的错误、 理性和计算能力有问题,或实施策略时会出现差错等。

所以在"各博弈方预测相同 + 各博弈方都有完全理性(不会犯错误)"的假设下,不可能预测任何非纳什均衡是博弈的结果

但一致预测性不是万能保证

书里紧接着作了三点限定,这几点决定了纳什均衡分析的边界:

  • 一致预测性本身并不保证各博弈方的预测是相同的。相同的预测是一致预测性质的前提而不是结果
  • 有些博弈不存在纳什均衡,根本无法准确预测。
  • 另一些博弈有多重纳什均衡,且相互无显著的优劣或效率差别 —— 同样无法预测(这是 2.6 节的主题)。
  • 此外还存在博弈方的理性、能力等与假设不符的情况。
3

2.2.3 纳什均衡与严格下策反复消去法

书页 56–58

这一小节回答一个实用问题:第一节那些方法和纳什均衡相容吗?能不能先用严格下策反复消去法把博弈简化了, 再去求纳什均衡?—— 答案是可以,而这两个命题就是保证。

📖命题 2.1 与命题 2.2

命题 2.1 在 n 个博弈方的博弈 G = {S₁,…Sn; u₁,…un} 中, 如果严格下策反复消去法排除了除(s₁*,…,sn*)之外的所有策略组合, 那么(s₁*,…,sn*)一定是该博弈唯一的纳什均衡

命题 2.2 如果(s₁*,…,sn*)是 G 的一个纳什均衡, 那么严格下策反复消去法一定不会将它消去

两个命题的证明都用反证法。命题 2.2 的证明更简单,书里先证它:

  1. 假设有某一纳什均衡策略组合在消去过程中被消去。设博弈方 i 的策略 si* 是该组合中第一个被消去的策略 (也许是在其他某些策略被消去以后)。
  2. 那么必然存在博弈方 i 的某个策略 si′,它在 si* 被消去时还没有被消去, 并且是相对于 si* 的严格上策,即
    ui( s₁*, … , si−1*, si′, si+1*, … , sn* ) > ui( s₁*, … , si−1*, si*, si+1*, … , sn* ) (2.2)
    对任意由其他博弈方此时尚未消去的所有策略构成的组合都成立。
  3. 由于 si* 被假设为该均衡组合中第一个被消去的,因此其他博弈方的策略 s₁*,…,si−1*, si+1*,…,sn* 在 si* 被消去时都还没有被消去 —— 所以 (2.2) 必须对它们成立。
  4. 但 (2.2) 表明 si* 不是博弈方 i 对其他博弈方策略组合的最佳对策, 这显然与(s₁*,…,sn*)是纳什均衡的假设矛盾。假设不成立,命题 2.2 得证。

证明了命题 2.2,命题 2.1 的后半部分(唯一性)也随之成立:既然消去的所有策略都不可能是构成纳什均衡的, 那么只要能证明未消去的最后一个策略组合确实是纳什均衡,唯一性就由命题 2.2 保证了。命题 2.1 的证明思路相同, 只是要多走一步 —— 若最后剩下的组合不是纳什均衡,则存在某个更优的策略 si′, 而这个 si′ 既然已被消去,它在某个阶段就必然被某个当时未消去的策略严格优于; 沿着这条链一直推下去,最终必然走到 si* 本身,从而与假设矛盾。

💡这两个命题的实际价值

它们保证了严格下策反复消去法和纳什均衡分析之间的相容性,从而保证了 在进行纳什均衡分析之前先通过严格下策反复消去法简化博弈是可行的。 这对提高博弈分析的效率、增加分析方法都是很有价值的 —— 这正是一个"先用便宜工具砍掉明显不合理的部分,再上重武器"的标准工作流。

⚠️两个命题合起来说的是什么

把两条放在一起:消去的永远不是纳什均衡,剩下的唯一组合一定是纳什均衡。 换句话说,严格下策反复消去法对纳什均衡是"只做减法、不做错杀"的。

注意这里限定的是严格下策。如果用下策(只要求"不优于"),命题就不再成立 —— 弱下策可能把纳什均衡消掉,消去顺序也会影响结论。这是一个常被忽略的分界。

4

速查卡

考前回看
博弈的一般表示: G = { S1, … , Sn ; u1, … , un }
纳什均衡: ui( si*, s−i* ) ≥ ui( si′, s−i* ), 对任意 si′ ∈ Si 与任意 i 都成立

读法:每个人、在别人都不动的前提下、都选了自己能选的最好的那个。一句话概括——没有谁想单独偏离

概念与纳什均衡的关系
上策均衡上策均衡一定是纳什均衡,反之不成立。所以上策均衡是更强、更稳定的概念,只是普遍性差得多。 分析顺序:先看上策均衡,没有再看纳什均衡
划线法 / 箭头法就是在得益矩阵上纳什均衡的手工方法。只适用于可用矩阵表示的有限策略博弈
严格下策反复消去法与纳什均衡相容:消去的绝不是纳什均衡,剩下唯一组合时它必是纳什均衡。 所以可以放心地先化简再求均衡
5

关键概念与易混点

术语表
纳什均衡 Nash Equilibrium
策略组合中每一个博弈方的策略,都是针对其余博弈方策略组合的最佳对策。等价说法:任何一方单独改变策略都不会更好
策略空间 Strategy Space
一个博弈方全部可选策略构成的集合,记作 Si。注意它和"策略"是整体与元素的关系,别混用。
一致预测性 Self-enforcing
若所有人都预测某结果会出现,则没有人愿意选择与预测不一致的策略。 "一致"指的是实际行为与预测一致,不是各人的预测彼此相同。
自我强制 Self-enforcing
一致预测性质带来的直接后果:不需要外部强制,各方自己就会坚持该策略。
命题 2.1
严格下策反复消去后剩下的唯一组合,一定是该博弈唯一的纳什均衡。
命题 2.2
任何纳什均衡都不会被严格下策反复消去法消掉。
⚠️三处最容易混的地方

① "一致预测"不是"预测相同"。书里专门澄清过:这里的"一致"是各博弈方的实际行为选择与他们的预测一致, 与前文"各博弈方的预测彼此相同"是两件事。前者是一致预测性质,后者只是它的前提

② 纳什均衡不保证能预测结果。一致预测性的前提是"大家预测相同",而这个前提本身不被保证: 无均衡的博弈预测不了,多重均衡的博弈也预测不了。存在性 ≠ 唯一性 ≠ 可预测性。

③ 命题 2.1/2.2 只对"严格"下策成立。换成弱下策,两条都会失效 —— 弱下策可能消掉纳什均衡, 而且消去顺序会影响最终结果。

6

随堂自测

4 题
Q1纳什均衡定义中的"最佳对策"是相对于什么而言的?
正确。定义里的关键是把别人的策略固定住(记作 s−i*),再看我在这个前提下能不能选到更好的。所以纳什均衡是"给定别人不动,我也不想动",而不是"大家加起来最好"——后者是帕累托效率,是另一回事(2.6 节)。
不对。关键在"给定其余博弈方的策略组合"这个前提。A 少了"别人不动"这个条件;C 和 D 说的都是效率意义上的最优,那是帕累托标准,不是纳什均衡。
Q2关于"一致预测性",下面哪一句是对的?
正确。书里专门澄清过这一点。A 描述的"预测相同"是一致预测的前提而非它本身——正因为这个前提不被保证(存在无均衡和多重均衡的博弈),纳什均衡分析才不总能作出准确预测,所以 B 也错。
不对。"一致"指的是实际行为与预测一致(而不是各人预测相同,A 错)。正因如此结果是自我强制的,不需要外部强制。但相同预测只是前提而非结论,所以它不保证预测得了所有博弈(B 错),也与纯/混合策略无关(C 错)。
Q3命题 2.1 和命题 2.2 合起来保证了什么?
正确。命题 2.2 保证消去的永远不是纳什均衡,命题 2.1 保证剩下唯一组合时它必是纳什均衡——"只做减法、不做错杀",所以先化简是安全的。B 的存在性要等 2.5 节的纳什定理;C 正好反了(上策均衡 ⊂ 纳什均衡)。
不对。两者的作用是保证两种分析相容——消去法不会消掉纳什均衡,剩下唯一组合时必是纳什均衡,因此可以放心先化简。B 的存在性属于 2.5 节的纳什定理;C 说反了;D 显然不成立(赌胜博弈就消不动)。
Q4为什么划线法和箭头法在古诺模型这类博弈上用不了?
正确。划线法和箭头法都是在得益矩阵的格子上做两两比较,而连续产量下策略数是无限的,矩阵根本画不出来。但纳什均衡概念本身仍然有效——只是要找别的方法,这就是 2.3 节反应函数法的由来。
不对。根子在策略无限多、画不出得益矩阵,所以没法逐格比较。注意 D 是错的——古诺模型(2,2)正是它的纳什均衡;A、B 也与模型设定不符(古诺是完全信息静态博弈,两家或 n 家都行)。
0 / 4 题正确
第二章 · 第 3 节

2.3 无限策略博弈分析和反应函数

书页 58–692.3.1 古诺的寡头模型2.3.2 反应函数2.3.3 伯特兰德寡头模型2.3.4 公共资源问题2.3.5 反应函数的局限
划线法和箭头法在策略无限多时失效了,但纳什均衡概念本身并没有失效 —— 缺的只是方法。这一节给出反应函数法: 把"最佳对策"从一张离散的表变成一条连续的曲线,而纳什均衡就是这些曲线的交点。 四个模型(古诺、伯特兰德、公共草地)会反复说明同一件事:非合作的结果是低效率的
0

这一节讲了什么

概念地图

一条方法主线(古诺 → 反应函数 → 推广),加三个应用(伯特兰德、公共资源、局限)。

2.3.1 古诺的寡头模型 直接按纳什均衡的定义求导解方程。两厂商各产 2 单位是均衡,而合谋只需各产 1.5 —— 又一场囚徒的困境
换一个更通用的算法
2.3.2 反应函数 把划线法的思路推广到连续策略:先求每个博弈方对对方每个取值的最佳对策函数,再解它们的交点
拿去用
2.3.3 伯特兰德模型 把"选产量"换成"选价格"。结构完全平行,同样是囚徒的困境
2.3.4 公共资源问题 n 个农户的公共草地。纳什均衡下的总放牧量远高于最优量 —— 公地的悲剧
2.3.5 反应函数的局限 得益不连续就求不了导;即使能求,反应函数也可能不相交交点不唯一
💡四个模型共同的落点

书里在这一节反复说同一句话的不同版本:古诺"说明了自由竞争的经济同样也存在低效率问题,放任自流也不是最好的政策"; 伯特兰德"其纳什均衡也不如各博弈方通过协商、合作得到的最佳结果";公共草地"非合作博弈的结果有可能是低效率的"。

合起来就是本节的政治经济学含义:对市场的管理、政府对市场的调控和监管都是必须的。

1

2.3.1 古诺的寡头模型

书页 58–61 · 图 2.13

第一章介绍过连续产量的古诺模型,这里用两厂商版本正式求它的纳什均衡 —— 这是无限策略博弈的典型例子。

模型设定

市场上有 1、2 两家厂商生产同样的产品。厂商 1 的产量为 q₁,厂商 2 的产量为 q₂,市场总产量 Q = q₁ + q₂。市场出清价格是总产量的函数:

P = P(Q) = 8 − Q

两厂商生产都无固定成本,且每增加一单位产量的边际成本相等,c₁ = c₂ = 2 —— 即各自生产 q₁ 和 q₂ 单位产量的总成本分别为 2q₁ 和 2q₂。 最后强调两厂商同时决定各自的产量。

博弈方就是两家厂商,策略空间是他们可以选择的产量。因为假设产量连续可分,两厂商都有无限多种可选策略 —— 即使受生产能力限制产量有上限,仍然是无限的。得益是各自的利润,即销售收益减成本:

u1 = q1P(Q) − c1q1 = q1[8 − (q1+q2)] − 2q1 = 6q1q1q2q12
u2 = q2P(Q) − c2q2 = q2[8 − (q1+q2)] − 2q2 = 6q2q1q2q22

容易看出,两博弈方的得益都取决于双方的策略(产量)。虽然无法用得益矩阵表示该博弈,但纳什均衡的概念仍然适用: 只要策略组合(q₁*, q₂*)满足其中的 q₁* 和 q₂* 相互是对对方的最佳对策,就构成一个纳什均衡。

直接按定义求

两个式子都是各自变量的二次式,且二次项系数都小于 0,所以只要令两式各自对 q₁、q₂ 的导数为 0, 就一定能实现最大值:

u1q1 = 6 − 2q1q2 = 0 , u2q2 = 6 − q1 − 2q2 = 0

解之得唯一一组解 q₁* = q₂* = 2。所以策略组合(2, 2)是本博弈唯一的纳什均衡,也是博弈的结果。 此时:

均衡结果
各生产 2 单位 · 市场总产量 4 · 市场价格 8 − 4 = 4 · 各自利润 2×(8−4) − 2×2 = 4 · 两厂商利润总和 8
若按总体利益最大化
总得益 U = P(QQ − 2Q = Q(8−Q) − 2Q = 6QQ²。 求最大值得总产量 Q* = 3,最大总得益 u* = 9。各生产一半即 1.5 单位时, 各自可分到 4.5 —— 比独立决策时的 4 更高。
⚠️合作结果为什么守不住

在独立决策、缺乏协调机制的两个企业之间,(1.5, 1.5)不是纳什均衡。 在这个组合下,双方都可以通过独自增加产量得到更高利润,它们都有突破 1.5 单位产量的冲动。

在缺乏有强制作用的协议等保障手段的情况下,这种冲动注定了维持较低产量是不可能的, 两厂商早晚都会增产,只有达到纳什均衡的产量水平(2, 2)时才会稳定下来 —— 因为只有这时候任一厂商单独改变产量才不利于自己。

如果把"遵守限额"还是"突破限额"作为厂商面临的选择,就得到下面这张得益矩阵。它的结构正是囚徒的困境:

行 · 厂商1
列 · 厂商2
厂商 2
不突破突破
厂商 1不突破 4.5, 4.53.75, 5
突破 5, 3.754, 4
图 2.13 两寡头间的囚徒困境博弈 · "不突破"= 守 1.5 的限额,"突破"= 生产纳什均衡的 2 单位
石油输出国组织(OPEC)的限额与突破

古诺模型在现实经济中最好的例子之一,是 20 世纪八九十年代国际经济中石油输出国组织的限额和突破问题。

成员国已知各自为政、自定产量的博弈结果肯定是油价下跌、利润受损,因此有共同磋商制定产量限额以维持油价的意愿。 但一旦规定各国的生产限额并照此生产,每个成员国都会发现:如果其他国家都遵守限额而只有自己超产,自己将获得更多利润, 并且因为只有一国超产时油价不会跌很多,所以其他各国只是普遍受少量损失。

反过来,如果其他国家都超产而只有自己遵守限额,那么自己会受很大损失。

结果:各成员国在本位利益驱使下都会希望利用其他国家遵守限额的机会偷偷超产,独享较多利益。 最终各国都普遍突破限额,限产计划破产,油价严重下跌,各国都只能得到不是最满意的纳什均衡的利润。 书里也补了一句时过境迁的话:由于产油国、产油地区政治军事方面的不稳定因素以及石油需求的变化,情况已经变化,油价已经涨得过高了。

我国也有许多古诺模型的例子。书里举的是"前一阶段我国钢铁企业竞相突破政府制订的产量限额的竞争", 认为它也是类似的博弈规律在起作用。更一般地,古诺模型可以是包括 n 个寡头的产量决策,价格函数也可以更复杂、 成本也可以不同 —— 分析思路完全相同,只是纳什均衡变成 n 个偏微分为 0 的联立方程组的解。

2

2.3.2 反应函数

书页 61–63 · 图 2.14

古诺模型的纳什均衡也可以通过对划线法思路的推广来求。划线法先找每个博弈方针对对方所有策略的最佳对策, 再找相互构成最佳对策的组合。在无限策略的博弈中这个思路照样可行 —— 只是对方的策略现在有无限多种, 因此最佳对策也有无限种,它们之间往往构成一种连续函数关系

对厂商 2 的任意产量 q₂,厂商 1 的最佳对策产量 q₁ 就是使自己在厂商 2 生产 q₂ 的情况下利润最大化的产量。 令 u₁ 对 q₁ 的导数等于 0,不难求出:

q1 = R1(q2) = 12(6 − q2)

这样我们得到了对于厂商 2 的每一个可能产量、厂商 1 的最佳对策产量的计算公式。它是厂商 2 产量的一个连续函数, 称为厂商 1 对厂商 2 产量的一个反应函数(Reaction Function)。同样方法可求出厂商 2 的反应函数:

q2 = R2(q1) = 12(6 − q1)

两个反应函数都是连续的线性函数,因此可以用坐标平面上的两条直线表示:

(2, 2) (0, 6) (0, 3) (3, 0) (6, 0) R₁(q₂) R₂(q₁) q₂ q₁
图 2.14 古诺模型的反应函数 · 横轴厂商 1 的产量,纵轴厂商 2 的产量

从图中可以读出三件事:

  • 当一方的产量选择为 0 时,另一方的最佳反应为 3。这正是实现市场总利益最大的产量 —— 因为这时候等于由一个厂商垄断市场,市场总体利益就是该厂商的利益。
  • 当一方的产量达到 6 时,另一方被迫选择 0,因为这时候坚持生产已经无利可图。
  • 在两条直线上,只有交点(2, 2)代表的产量组合才是由相互对对方的最佳反应产量构成的: R₁(q₂) 上的其他所有点只有 q₁ 是对 q₂ 的最佳反应、q₂ 不是对 q₁ 的最佳反应; R₂(q₁) 上的点则刚好相反。

根据纳什均衡的定义,(2, 2)是该古诺模型的纳什均衡;并且因为它是唯一的一个,因此应该是该博弈的结果 —— 与前面直接根据定义得到的完全一样。

📖反应函数法

对一个一般的博弈,只要得益是策略的多元连续函数,我们都可以求出每个博弈方针对其他博弈方策略的最佳反应构成的函数, 也就是反应函数,而解出的各个博弈方反应函数的交点就是纳什均衡。这种求纳什均衡的方法称为"反应函数法"。

模型 6

古诺与公共资源:均衡为什么总是"太多"

两个模型共用一个道理。拖动市场容量 a 和边际成本 c,看反应函数的交点、垄断点和合谋产量各在哪里; 再切到公共草地,把农户数从 3 加到 10,看纳什均衡的放牧总量如何一路冲向资源毁灭。

3

2.3.3 伯特兰德寡头模型

书页 63–65

把反应函数法用到伯特兰德(Bertrand)模型上。伯特兰德 1883 年提出了另一种形式的寡占模型, 它与古诺模型的差别在于:各厂商所选择的是价格而不是产量

这里分析简单的两寡头、且产品有一定差别的伯特兰德价格博弈。所谓有一定差别,是指两厂商生产同类产品, 但在品牌、质量和包装等方面有所不同 —— 因此产品之间有很强的替代性,但又不是完全可替代, 即价格不同时价格较高的不会完全销不出去。两厂商价格分别为 P₁ 和 P₂ 时,需求函数为:

q1 = q1(P1, P2) = a1b1P1 + d1P2 , q2 = q2(P1, P2) = a2b2P2 + d2P1

其中 d₁, d₂ > 0 即两厂商产品的替代系数。也假设两厂商无固定成本,边际生产成本分别为 c₁ 和 c₂,仍同时决策。

策略空间为 S₁ = [0, Pmax] 和 S₂ = [0, Pmax], 其中 Pimax 是厂商 i 还能卖出产品的最高价格。得益是各自的利润:

u1 = P1q1c1q1 = (P1c1)(a1b1P1 + d1P2)
u2 = (P2c2)(a2b2P2 + d2P1)

同样利用偏导数为 0 时有最大值,可求出两厂商对对方策略(价格)的反应函数,而纳什均衡 (P₁*, P₂*)必是两反应函数的交点 —— 解方程组即可求得,它是该博弈唯一的纳什均衡。

一组具体数值

a₁ = a₂ = 28,b₁ = b₂ = 1,d₁ = d₂ = 0.5,c₁ = c₂ = 2。

此时反应函数为 P₁ = 15 + 0.25P₂ 与 P₂ = 15 + 0.25P₁(对称),解之得

P₁* = P₂* = 20 , u₁ = u₂ = (20 − 2) × (28 − 20 + 0.5 × 20) = 18 × 18 = 324

均衡结果:两家各定价 20,各得利润 324

更一般的情况是有 n 个寡头的价格决策,产品也可以是无差别的。对产品无差别的情况, 必须考虑消费者对价格的敏感性问题 —— 因为如果所有消费者对价格都非常敏感, 则生产完全同质商品的厂商之间的价格差别根本不可能存在,此时价格高的一方将完全卖不出去。 多于两寡头的分析则是两寡头模型的简单推广:求出每个厂商对其他各个厂商价格的反应函数,再解出它们的交点即可。

⚠️又是囚徒的困境

价格决策与古诺模型中的产量决策一样,其纳什均衡也不如各博弈方通过协商、合作得到的最佳结果,因此也是囚徒困境的一种。

书里给了我国的现实例子:以彩电为代表的家电企业之间的价格战和失败的高峰会议 —— "高峰会议"指的是试图协调价格 却因为缺乏强制力而失败的行业会议,正好对应古诺模型里"缺乏有强制作用的协议"那一句。

4

2.3.4 公共资源问题

书页 65–68

在经济学中,公共资源是指具有这样两个特征的自然资源、或人类生产的供大众免费使用的设施和财货: (1)没有哪个个人、企业或组织拥有所有权;(2)大家都可以自由利用。 例如大家都可以开采使用的地下水、可自由放牧的草地、可自由排放废水的公共河道(假设政府未予限制),以及公共道路、楼道的照明灯等。

由于这两个特征,利用这些资源时不支付任何代价。而一旦政府将这些资源收归国有并对使用者征收资源税或类似费用, 这些资源也就不再是上述经济学意义上的公共资源,而更应该称为国有资源了。

书里指出:最晚从休谟(David Hume)1739 年开始,政治经济学者们就已经认识到, 在人们完全从自利动机出发自由利用公共资源时,公共资源倾向于被过度利用、低效率使用和浪费, 并且过度利用会达到任何利用它们的人都无法得到实际好处的程度。下面用公共草地的放牧问题来论证这个结论。

模型设定

某村庄有 n 个农户,村里有一片大家可以自由放牧羊群的公共草地。草地面积有限,只能让不超过某一数量的羊吃饱; 超过这个限度则每只羊都无法吃饱,每只羊的产出就会减少。各农户在春天决定养羊数量, 因此在决定自己的养羊数时不知道其他农户养羊数 —— 决策是同时作出的。再假设所有农户都清楚这片草地最多能养多少羊、 以及羊只总数不同水平下每只羊的产出。这就构成了 n 个农户关于养羊数的静态博弈

博弈方是 n 个农户;策略空间是他们可能选择的养羊数目 qi; 总放牧量 Q = q₁ + … + qn;每只羊的产出是总数的减函数 V = V(Q)。设购买和照料每只羊的成本对每个农户都是相同的不变常数 c,则:

ui = qi · V(Q) − qic = qi · V(q₁ + … + qn) − qic

为进一步得到直观结论,设定具体数值:n = 3(只有三个农户),每只羊的产出函数 V = 100 − Q = 100 − (q₁+q₂+q₃),成本 c = 4。三家农户的得益函数分别为:

u1 = q1[100 − (q1+q2+q3)] − 4q1 (其余两家同构)

羊的数量本不是连续可分的,但技术上可以把羊的数量看作连续可分的,因此上述得益函数仍然可当作连续函数处理。 求三家各自对其他两家策略的反应函数,三个反应函数的交点就是纳什均衡。代入并解联立方程组,得:

q1* = q2* = q3* = 24 , u1* = u2* = u3* = 576

再算一次"总体最优"

为了对公共资源的利用效率作出评价,同样可以讨论总体利益最大时的最佳羊只数量。 设草地上羊只总数为 Q,则总得益为:

u = Q(100 − Q) − 4Q = 96QQ2

使总得益最大的养羊数 Q* 必使导数 96 − 2Q* = 0,解得 Q* = 48,代入得 u* = 2304。把这个结果与纳什均衡对比:

情形总放牧量每户养羊总得益
各户独立决策(纳什均衡)72241728
总体利益最大化48162304
差距多放 24 只多养 8 只少得 576

也就是说:三家独立决策时实际上使草地处于过度放牧的情况,浪费了资源,农户也没有获得最好的效益。 如果各农户能自觉把养羊数限制在 48/3 = 16 只,他们都能得到更多利益 —— 但他们面临的是一种囚徒的困境局面,因此很难实现这种理想的合作结果。

⚠️农户越多,均衡越低效

在本例中,如果利用该草地资源的农户数进一步增加,则纳什均衡策略的效率会更低。 如允许外来者任意加入,则所有利用该资源的人的利益很快都会消失 —— 羊只总数会随着放牧农户数的增加而增加到刚好不至于亏损的水平,各农户将完全不能从公共草地上养羊得到任何好处, 公共资源等于完全被浪费掉了。

用模型 6 把农户数从 3 一路加到 10,可以直接看到这条趋势。

为什么会这样

书里把原因说得非常清楚,值得逐句读:在公共资源利用方面常会出现这样的悲剧,原因是 每个可以利用公共资源的人都相当于面临着一种囚徒的困境

  • 在总体上有加大利用资源的可能(至少加大利用者自身还能增加得益)时, 自己加大利用而他人不加大利用则自己得利
  • 自己加大利用但其他人也加大利用则自己不至于吃亏
  • 最终是所有人都加大利用资源,直至再加大只会减少利益的纳什均衡水平 —— 而这个水平肯定比实现资源最佳利用效率、同时也是个人最佳效率的水平要高
防风防沙林带与搭便车

公共资源的悲剧在我国有许多例子。书里举的是受风沙、沙漠化威胁的地区,当地居民关于保护还是毁坏防风防沙林带的选择:

"每个人都想,如果只有自己砍几棵树,只要别人不砍就无关紧要,自己却可得利; 而如果其他人都砍而只有自己不砍,则防护林也保护不了,还不如自己也砍。最后的结论是砍总是合算的。"

结果:大家这样想的结果是防护林带完全被破坏,整个地区都被沙漠吞没,人人都被迫离乡背井, 最终倒霉的还是自己 —— 一个把囚徒困境推到极端的例子。

公共设施问题也类似:在许多需要人类生产、提供的公共设施上,做搭便车者(Free Rider)总是比做提供者合算, 因此许多必需的公共设施,如楼道里的电灯等就总是没人提供。

书里由这些结果得出结论:在公共资源的利用、公共设施的提供方面, 政府的组织、协调和制约是非常必要的,这也可以说是政府之所以有必要存在的主要理由之一。

5

2.3.5 反应函数的问题和局限性

书页 68–69 · 图 2.15

反应函数法概念和思路非常简洁明了,它解决了分析一般的具有无限多种策略、有连续策略空间的博弈模型, 或者有离散的大量策略、可以看作有连续策略空间的博弈模型(如公共草地养羊数博弈)的问题。因此它在博弈分析中非常有用。

但书里随即指出,这并不等于有了反应函数概念就能解决所有博弈的分析。有两层局限:

局限一:压根求不了导
在许多博弈中,博弈方的策略是很有限的而不是很多的,更不是连续的,得益函数并不是连续的可导函数, 所以无法用"先求导数找反应函数、再解联立方程组"的方法求纳什均衡。划线法、箭头法处理的那类矩阵博弈就属于这种。
局限二:求得出也不一定有解
即使得益函数可以求导、可以导出反应函数,也不意味着反应函数法一定能完全解决这些博弈。 因为得益函数比较复杂时,反应函数也比较复杂,并不总是能够保证各个博弈方的反应函数有交点, 特别是不能保证有唯一的交点

图 2.15 用两种情形说明了第二个问题:(a)图是反应函数不相交的情况,(b)图则是交点不唯一的情况。

(a) 反应函数不相交 (b) 交点不唯一
图 2.15 反应函数的问题 · 两种都会让反应函数法"有方法却无结果"

书里点明:虽然这些图形本身是虚构的,但具有这样特点的反应函数是完全可能存在的—— 事实上后面把反应函数扩展到混合策略时,就很容易出现多重交点反应函数的图形(这正是 2.4.4 节的内容, 也是夫妻之争在反应函数图上出现三个交点的原因)。

6

四个模型速查卡

考前回看
模型决策变量纳什均衡总体最优结论
古诺(两厂商)产量各 2 单位,价格 4,各得 4总产 3,各 1.5,各得 4.5 均衡产量偏高、利润偏低 —— 囚徒的困境
伯特兰德价格各定价 20,各得 324(数值例)协商定价更高 同样不如合作结果 —— 也是囚徒的困境
公共草地(3 户)养羊数各 24 只,总 72,总得益 1728总 48 只,各 16,总得益 2304 过度放牧,农户越多均衡越低效
反应函数:令 uisi = 0 解出 si = Ri(s−i),再解联立方程组

反应函数法的三步:① 写出得益函数 → ② 对自家策略求偏导并令其为 0,解出反应函数 → ③ 解各反应函数的交点。 交点即纳什均衡。它成立的前提是得益函数连续可导,且交点存在且唯一

7

关键概念与易混点

术语表
反应函数 Reaction Function
一个博弈方针对其他博弈方每一种策略的最佳对策所构成的连续函数。它是划线法"最佳对策"思想在无限策略博弈中的推广。
反应函数法
求出各博弈方的反应函数,解它们的交点即为纳什均衡。适用于得益函数连续可导的博弈。
古诺模型 Cournot
厂商选择产量的寡占模型。均衡产量高于合谋产量,价格低于合谋价格。
伯特兰德模型 Bertrand
厂商选择价格的寡占模型。与古诺的唯一结构差别就在决策变量,其余分析完全平行。
公共资源
(1)没有哪个个人、企业或组织拥有所有权;(2)大家都可以自由利用。这两个特征使利用它不支付任何代价, 也使它必然被过度使用。
搭便车者 Free Rider
只享用公共品而不承担其提供成本的人。在公共设施问题上"做搭便车者总是比做提供者合算", 因此必需设施常常没人提供。
⚠️三处最容易混的地方

① 反应函数上的点不都是纳什均衡。R₁(q₂) 上除交点外的点,只有厂商 1 的策略是最佳对策, 厂商 2 的不是。只有交点才满足"相互都是最佳对策"。这是读图 2.14 时最常见的错。

② 均衡 ≠ 最优,这一节里出现了三次但形式不同。古诺是"产量太高、价格太低", 伯特兰德是"价格太低",公共草地是"放牧量太高"。共同点都是:纳什均衡偏离了总体利益最大化的点, 而且是朝着"用得多、赚得少"的方向偏。

③ 公共资源的问题不在"人多",而在"没有排他性"。书里说得很明确:一旦政府把资源收归国有并征收资源税, 它就不再是公共资源、而成为国有资源了 —— 性质改变的关键是利用它开始需要支付代价,而不是人数的多少。 农户数增加只是让均衡更低效。

8

随堂自测

4 题
Q1古诺模型里(1.5, 1.5)能实现两厂商总利润最大,为什么它不是均衡?
正确。纳什均衡的判据是"没人想单独偏离"。在(1.5, 1.5)处双方都有增产的冲动,所以它不稳定。缺乏有强制作用的协议时,两厂商早晚都会增产,只有到(2, 2)才会稳定下来——因为那时单独改变产量才不利于自己。
不对。判据是"有没有人想单独偏离"。在(1.5, 1.5)处任一方增产都能改善自己的利润,所以守不住。C 也不成立——1.5+1.5=3,价格 5,远高于边际成本 2。
Q2在图 2.14 的反应函数图上,为什么只有交点(2, 2)是纳什均衡?
正确。R₁(q₂) 上的点保证厂商 1 是在最佳反应,但厂商 2 未必;R₂(q₁) 上反之。只有交点同时满足两边——这正是纳什均衡定义里"相互是对对方的最佳对策"的几何含义。注意 B 也不对:(0,3)/(3,0) 那条线上总产量是 3,才是总利益最大的。
不对。关键在于相互最佳对策:R₁ 上的点只有厂商 1 满足,R₂ 上的点只有厂商 2 满足,唯交点两边都满足。B 说反了——总产量 3(各 1.5)才是总利益最大的点。
Q3公共草地例子里,三户独立决策放养 72 只、总得益 1728;最优是 48 只、总得益 2304。这个对比说明什么?
正确。书里的原话是"每个可以利用公共资源的人都相当于面临着一种囚徒的困境"。理性人各自算对了自己的最优,加总起来却是过度放牧。这类结果正说明政府在公共资源利用、公共设施提供方面的组织协调是必需的。
不对。要抓的是"个体理性 ≠ 集体理性":每个农户都没算错,但非合作的结果就是低效。B 只说了产权一种可能(书里确实提到收归国有并征税会改变性质),但把它说成"自动解决"过头了。
Q4反应函数法在什么情况下会"有方法却得不到结果"?
正确。两层局限:一是得益函数不连续不可导(有限策略的矩阵博弈)就根本求不了导;二是即使能求导,反应函数也可能不相交(图 2.15a)或交点不唯一(图 2.15b)。书里还提示:把反应函数扩展到混合策略时,多重交点很常见。
不对。两道坎:不可导(有限策略博弈)和无唯一交点(不相交或交点不唯一,见图 2.15)。这两点都与博弈方人数、信息是否完全无关,所以 B、C 不成立;D 显然过于乐观。
0 / 4 题正确
第二章 · 第 4 节

2.4 混合策略和混合策略纳什均衡

书页 69–862.4.1 混合策略的引进2.4.2 多重均衡与混合策略2.4.3 与下策消去法2.4.4 混合策略反应函数
前面几节的纳什均衡分析有两个够不着的角落:没有纯策略纳什均衡的博弈(猜硬币、齐威王田忌赛马),和有多个纯策略纳什均衡的博弈 (夫妻之争、制式问题)。这一节用一个概念把两个角落一起补上 —— 混合策略:博弈方不再选一个确定的策略,而是选一个概率分布。 第一章说"必须以随机的方式选择策略",到这里终于有了精确的含义。
0

这一节讲了什么

概念地图

四个小节,从"为什么要随机"一路走到"如何用反应函数求随机化的概率"。

2.4.1 混合策略的引进 没有纯策略纳什均衡的严格竞争博弈出发:猜硬币 → 数值例子 → 齐威王田忌赛马 → 小偷与守卫(激励的悖论)
另一半:有多个纯策略均衡时也需要它
2.4.2 多重均衡博弈和混合策略 夫妻之争 → 制式问题 → 市场机会博弈。这里双方不想隐藏选择,决策原则与严格竞争博弈相反
扩充之后的旧工具
2.4.3 混合策略和严格下策反复消去法 引进混合策略后,原来的严格下策可能变得"可消去"了 —— 消去法的用处反而更大
2.4.4 混合策略反应函数 把 2.3 的反应函数推广到"概率对概率"的反应。夫妻之争在这里出现三个交点,正好回看图 2.15(b)
1

2.4.1 严格竞争博弈和混合策略的引进

书页 69–80 · 图 2.16–2.21

一、猜硬币:随机不是"随便"

猜硬币博弈在"正面""反面"两种策略的意义上不存在纳什均衡 —— 无论采用哪个组合,输的一方总可以通过单独改变策略而反输为赢。 那么这个博弈中各方选什么都一样、可以随意选吗?答案是否定的。事实上策略选择的好坏对得益仍有很大影响。

行 · 盖硬币方
列 · 猜硬币方
猜硬币方
正面反面
盖硬币方正面 −1, 11, −1
反面 1, −1−1, 1
图 2.16 猜硬币博弈 · 零和、典型的严格竞争博弈

由此引出此博弈中决策的第一个原则自己的策略选择不能预先被另一方知道或猜测到。 保持秘密、不让其他博弈方事先了解你的选择,是该博弈中各博弈方首先必须遵循的原则 —— 这正是没有纳什均衡的博弈与存在唯一纳什均衡的博弈之间的一个重要的本质区别

从这条原则再推论下去:在该博弈的多次重复中,博弈方一定要避免自己的选择带有规律性。 一旦选择有某种规律并被对手发觉,对手就能据此预先猜到你的选择,从而作针对性选择轻易战胜你。 例如你总是一次正面、一次反面轮流出,对手就能根据你前一次的策略轻易猜中你本次将出的面。

更细一层:即使盖硬币方已经随机选择了,但总体上出正面的概率大于出反面(即 p > 1/2), 那么猜硬币方仍然有机可乘 —— 他只要全猜正面,平均来讲就一定赢多输少。反之如果 p < 1/2,他就全猜反面。 因此对盖硬币方来说最可靠的方法是以相同的概率随机出正面和反面,即取 p = 1 − p = 1/2。 同样的讨论适用于猜硬币方 —— 他也必须以 1/2 的相同概率随机选择,否则就会给对方获利的机会。

💡"随机"的精确含义

书里用了一个很形象的比喻:在这个博弈中,两个博弈方最正确的决策方法,就是将自己当作一台抽签的机器

关键在于"以 1/2 的概率"不是随便,而是唯一不让自己被占便宜的概率。偏离 1/2 一步,对方就有针对性的纯策略可以稳赚。

二、混合策略与混合策略纳什均衡

当双方都以 1/2 的概率随机选择时,双方都无法根据对方的选择方式调整自己获得利益, 从而在"对两种可选策略随机选择概率分布"的意义上达到了一种稳定,或者说均衡。这种决策方式称为混合策略

📖混合策略 Mixed Strategies

在博弈 G = {S₁,…Sn; u₁,…un} 中,博弈方 i 的策略空间为 Si = {si¹, … , sik}, 则博弈方 i 以概率分布 pi = (pi¹, … , pik) 随机在其 k 个可选策略中选择的"策略",称为一个"混合策略", 其中 0 ≤ pij ≤ 1 对 j = 1,…k 都成立,且 pi¹ + … + pik = 1。

与此相对,博弈中原来意义上的策略称为纯策略(Pure Strategies)。两者关系值得记住:

  • 纯策略可以看作混合策略——即选择相应纯策略的概率为 1、选择其余纯策略的概率为 0 的混合策略;
  • 反过来,混合策略又可以看作纯策略的扩展。给每个博弈方的纯策略空间赋予不同的概率分布,就形成不同的混合策略;
  • 因为概率分布是连续的、可以取无限多组值,所以混合策略的数量肯定是无限多的

当把博弈方在这个混合策略空间中的选择看作一个博弈时,原博弈的混合策略就成了后面这个扩展出来的博弈的纯策略。 扩展出来的博弈可称为原博弈的"混合策略扩展博弈",它与原博弈在形式上有很大差别,但本质其实是一样的。

于是纳什均衡的基础扩大了:把策略扩展到包括混合策略时,纳什均衡概念仍然成立,本质规定性也仍然相同 —— 如果一个策略组合满足各博弈方的策略相互是对其他博弈方策略的最佳对策,就是一个纳什均衡, 只不过其中的策略既可能是纯策略也可能是混合策略。这时纳什均衡意味着:任何博弈方单独改变自己的策略, 或者随机选择各个纯策略的概率分布,都不能给自己增加任何利益。如果确实是一个严格意义上的混合策略组合构成纳什均衡, 则称为一个混合策略纳什均衡

据此,猜硬币博弈中双方都以(1/2, 1/2)随机选择的组合就是一个混合策略纳什均衡,而且是该博弈唯一的混合策略纳什均衡。 因为这个博弈没有纯策略纳什均衡,因此它也是该博弈唯一的纳什均衡;采用它,是两博弈方唯一正确的选择

三、一个数值例子

用下面这个博弈练习这套算法。它不存在纯策略纳什均衡(任何一个纯策略组合都有博弈方可以单独改变策略而得到更好得益):

行 · 博弈方1
列 · 博弈方2
博弈方 2
CD
博弈方 1A 2, 35, 2
B 3, 11, 5
图 2.17 一个数值例子的混合策略均衡

设博弈方 1 选 A 的概率为 pA、选 B 的为 pB。 根据"让对方无机可乘"的原则,这两个概率必须使博弈方 2 选 C 和选 D 的期望得益相等

pA × 3 + pB × 1 = pA × 2 + pB × 5 ⟹ pA = 4pB

又因 pA + pB = 1,因此 pA = 0.8,pB = 0.2。 同理,博弈方 2 选 C 和 D 的概率也应使博弈方 1 选 A 的期望得益等于选 B 的:

pC × 2 + pD × 5 = pC × 3 + pD × 1 ⟹ 4pD = pC ⟹ pC = 0.8,pD = 0.2

当博弈方 1 以(0.8, 0.2)随机选择 A 和 B、博弈方 2 以(0.8, 0.2)随机选择 C 和 D 时, 谁都无法通过单独改变随机选择的概率分布改善自己的期望得益,因此这个混合策略组合是稳定的 —— 本博弈唯一的混合策略纳什均衡。 此时双方期望得益为:

u1 = 0.8×0.8×2 + 0.8×0.2×5 + 0.2×0.8×3 + 0.2×0.2×1 = 2.6 , u2 = 0.8×0.8×3 + 0.8×0.2×1 + 0.2×0.8×2 + 0.2×0.2×5 = 2.6

四、齐威王田忌赛马:1/6 是怎么来的

第一章里说齐威王和田忌"应以相同的概率选用"六种出场次序,现在可以把那个结论算出来。 这个博弈的得益矩阵与第一章的图 1.3 完全相同(见 1.2.2 节):36 个格子中,每一行只有一个 3、四个 1、一个 −1。

为了简便,把齐威王的六个策略从上到下称为 af,田忌的六个策略从左到右称为 gl。 设齐威王分别以概率 papf 随机选择, 则田忌采用 g 的期望得益为 −3papbpc + pdpepf, 采用 h 的期望得益为 −pa − 3pb + pcpdpepf,依此类推。

齐威王若想让田忌没有任何可乘之机,所选概率分布必须使这六个期望得益都相等。解之得 pa = pb = pc = pd = pe = pf, 又因它们之和为 1,所以每个都是 1/6。同样的推导对田忌也成立。于是双方都以 1/6 的相同概率随机选择各自的六个纯策略, 构成本博弈唯一的混合策略纳什均衡。

为什么这个结论理所当然
第一章已经说明:每种纯策略对齐威王和田忌来说本身都无好坏之分,结果怎样主要取决于双方策略的组合情况; 并且他们对任一纯策略的偏爱都只会给对方以可乘之机。因此以均等的概率随机选择各纯策略确实是他们的最佳策略。
均衡下谁占优
齐威王的期望得益为 1,田忌为 −1。即多次进行这样的赛马, 齐威王平均每次能赢田忌一千斤铜 —— 这是因为齐威王三匹马的总体实力略胜田忌三匹马的缘故。 随机化抹平了运气,只剩下实力差距。

五、小偷和守卫:图解与"激励的悖论"

这个例子来自 1994 年诺贝尔经济学奖得主之一塞尔顿(Selten)教授 1996 年 3 月在上海的一次演讲。

设定:一小偷欲偷窃有一守卫看守的仓库。如果偷窃时守卫在睡觉,则小偷得手,偷得价值为 V 的赃物; 如果守卫没睡,则小偷被抓。设小偷被抓后要坐牢,负效用为 −P;守卫睡觉而未遭偷窃有 S 的正效用, 因睡觉被窃要被解雇,其负效用为 −D;小偷不偷则既无得也无失,守卫不睡意味着出一份力挣一份钱,他也没有得失。

行 · 小偷
列 · 守卫
守卫
不睡
小偷 V, −D −P, 0
不偷 0, S 0, 0
图 2.19 小偷与守卫的博弈 · 第一个数字是小偷的得益,第二个是守卫的 · 非对称的非零和博弈

这个博弈不存在纯策略纳什均衡。书里用了一段很生动的因果循环来说明:

💡一环套一环

假设小偷选择"偷",那么对守卫来说最好的策略是"不睡",这样可以抓住小偷完成职责并保住工作; 但当守卫"不睡"时,小偷的正确策略是"不偷";既然小偷"不偷",守卫选择"睡"当然比较合算; 而守卫偷懒"睡"觉时,小偷"不偷"又白不偷,当然要去"偷"……

这种一环套一环的因果循环永远不可能停止,无论从哪里开始都一样。因此这个博弈与猜硬币、齐威王田忌赛马一样, 在一次性博弈中没有会自动实现的均衡策略组合,也无法预测博弈结果。

它与猜硬币的本质特征相同,因此决策原则也相同:不能让对方预先知道或猜到策略,应以随机方式选择, 且概率不能让对方有可乘之机。不过书里在这里改用图解方法 —— 因为图解对理解混合策略中概率分布的意义有特殊价值。 先用图 2.20 确定小偷"偷"的概率:横轴是 pt(小偷选"偷"的概率), 纵轴是守卫选择"睡"的期望得益。从 S 到 −D 的连线给出每个 pt 下守卫"睡"的期望得益 S(1−pt) + (−D)pt

S −D pₜ* 守卫「睡」的期望得益 小偷「偷」的概率 → S → −D
图 2.20 小偷的混合策略 · 最佳"偷"的概率是这条线与横轴的交点
−P V pₔ* 小偷「偷」的期望得益 守卫「睡」的概率 → −P → V
图 2.21 守卫的混合策略 · 同理,交点是守卫的最佳"睡"的概率

为什么交点就是最佳水平?书里的推理值得逐句读:假设小偷的"偷"概率大于 pt*, 此时守卫"睡"的期望得益小于 0,因此他肯定百分之百选择"不睡",从而小偷偷一次被抓一次有赔无赚 —— 所以大于 pt* 的"偷"概率对 thief 是不可取的。反过来,如果"偷"的概率小于 pt*, 则守卫"睡"的期望得益大于 0,守卫天天睡大觉是合算的;此时即使小偷提高一些作案频率,只要不大于 pt*, 守卫都会选择"睡",小偷不用害怕被抓,而"偷"得越多收获越大 —— 因此他会使"偷"的概率趋向于 pt*。

均衡点上,守卫"睡"与"不睡"的期望得益都等于 0,选哪个纯策略或混合策略的期望得益都相同。 不过为了让小偷也没有可乘之机,守卫也必须选择特定概率分布的混合策略(图 2.21)。

⚠️激励的悖论(本节最著名的一个结论)

加重对小偷的惩罚会怎样?P 增大 → 图 2.21 中 −P 向下移动。 若守卫概率分布不变,小偷"偷"的期望得益变为负值,因此短期中小偷会停止偷窃。 但在长期中,小偷减少偷窃会使守卫更多地选择"睡"觉,最终守卫会把"睡"的概率提高, 达到新的均衡 —— 而此时小偷"偷"的期望得益又恢复到 0,他会重新选择混合策略。 由于小偷的混合策略概率分布是由图 2.20 决定的,并不受 P 值的影响, 因此政府加重对小偷的惩罚在长期中并不能抑制盗窃,最多只能抑制短期的盗窃发生率, 它的主要作用是使得守卫可以更多地偷懒

加重对失职守卫的处罚会怎样?D 增大 → 图 2.20 中 −D 向下移动 → 小偷"偷"的最佳概率 pt* 下降。 所以加重处罚失职守卫在长期中的真正作用,恰恰会降低盗窃发生的概率;而它在短期中的效果只是使守卫真正尽职, 长期中并不能使守卫更尽职 —— 守卫的勤勉程度不是由 D 决定的

政策目标和政策结果之间的这种意外关系,常被称为"激励的悖论",对制定经济政策、进行经济管理体制改革很有启发性。

2

2.4.2 多重均衡博弈和混合策略

书页 80–84 · 图 2.22–2.24

混合策略不只是为"没有纯策略均衡"的博弈准备的。在有多个纯策略纳什均衡的博弈中它同样重要 —— 因为多个均衡之间往往没有优劣关系,混合策略至少给出了一个确定的期望结果。

一、夫妻之争的混合策略纳什均衡

夫妻之争(图 2.22)有两个纳什均衡(时装,时装)和(足球,足球)。它与严格竞争博弈明显不同: 如果一方知道另一方已选择了某种策略,则前者唯一明智的选择就是与对方保持一致,以免得最差的得益 0。 这就是这个博弈中两博弈方的利益一致性所在 —— 换句话说,本博弈的两个博弈方都不会害怕对方猜到自己的选择, 他们主观上并不想隐藏自己的选择。因此决策思路和原则应该与严格竞争博弈不同。

行 · 妻子
列 · 丈夫
丈夫
时装足球
妻子时装 2, 10, 0
足球 0, 01, 3
图 2.22 夫妻之争 · 每格是(妻子得益, 丈夫得益)

但由于两个均衡分别对夫妻中不同的一方有利(妻子偏好前一个、丈夫偏好后一个), 当两人各自从自身最大利益出发独立同时决策时,无法肯定究竟会做怎样的选择。 也就是说,在纯策略范围内该博弈也无法对选择提出确定性建议。因此需要考虑混合策略:

妻子的混合策略
pw(C) 和 pw(F) 为妻子选时装和足球的概率。若妻子不想让丈夫利用自己的选择倾向占上风, 自己的概率选择应使丈夫选两种策略的期望得益相同:
pw(C)·1 + pw(F)·0 = pw(C)·0 + pw(F)·3
pw(C) = 3pw(F),配合和为 1 的条件得 pw(C) = 0.75,pw(F) = 0.25
丈夫的混合策略
ph(C) 和 ph(F) 为丈夫选时装和足球的概率。同理要使妻子的期望得益相等:
ph(C)·2 + ph(F)·0 = ph(C)·0 + ph(F)·1
即 2ph(C) = ph(F),得 ph(C) = 1/3,ph(F) = 2/3

此时双方都无法通过单独改变概率分布提高利益,构成一个混合策略纳什均衡。它给双方带来的期望得益为 妻子 0.67、丈夫 0.75(书里的演算:妻子 = 3/4×1/3×2 + 1/4×2/3×1 ≈ 0.67;丈夫 = 3/4×1/3×1 + 1/4×2/3×3 = 0.75)。

⚠️书里对这个结果的评论

"这个结果明显不如夫妻双方能交流协商时、任何一方迁就另一方时双方的得益好,因为那时任何一方都至少得 1。" 这是因为双方缺乏沟通时很可能出现最差结果而造成的。

书里由此得出一个重要的方法论结论:"如果不强行设定双方不能交流串通的博弈规则,双方在决策时没有被客观或人为的原因隔离开来, 也没有因为赌气而采取不理性的态度,那么这种夫妻之间的决策问题一般不应该用上述博弈方式解决。" —— 换句话说,模型用错了地方,结论就没有意义。

二、制式问题

经济活动中有许多与夫妻之争相似的博弈,制式问题就是典型一例。电器和电子设备往往有不同的原理或相关技术标准, 称为不同的制式。如果厂商采用相同的制式,产品之间就能相互匹配、零配件也可能相互通用,这对推广产品和合作很有帮助。

假设两个厂商同时计划引进彩电生产线,彩电有 A、B 两种不同制式。设两厂商同时采用 A 制式时厂商 1 有 1 单位好处、厂商 2 有 3 单位好处; 同时采用 B 制式时两厂商都有 2 单位好处;制式不同时大家都没有好处:

行 · 厂商1
列 · 厂商2
厂商 2
AB
厂商 1A 1, 30, 0
B 0, 02, 2
图 2.23 制式问题 · 两个纯策略纳什均衡(A,A)和(B,B),但双方偏好相反

它有两个纯策略纳什均衡(A,A)和(B,B)。厂商 1 更喜欢后一个、厂商 2 更喜欢前一个,因此究竟哪个会出现没有必然结论 —— 又是一个混合策略问题。用与夫妻之争同样的方法解出:厂商 1 以概率分布(0.4, 0.6)随机选择 A 和 B, 厂商 2 以(0.67, 0.33)随机选择 A 和 B

⚠️原书此处的一个数值问题

书里接着写"在该混合策略纳什均衡下,双方的期望得益分别为 0.6641.296"。 但按书里自己给出的得益矩阵和上面这两个概率分布算,第二个数字应当是 1.2

厂商1 的期望 = 0.4 × (0.67×1) + 0.6 × (0.33×2) = 0.268 + 0.396 = 0.664
厂商2 的期望 = 0.4 × (0.67×3) + 0.6 × (0.33×2) = 0.804 + 0.396 = 1.2

用精确均衡概率(厂商1 取 2/5,厂商2 取 2/3)算,结果是 2/3 ≈ 0.667 与 1.2,同样不是 1.296。 所以 0.664 与 1.296 这一对数字内部并不一致,第二个数字很可能是原书的排印错误。 此处按演算结果取 1.2,并保留这条说明。

书里对这个结果本身的评论不受影响:两博弈方采取不相互协商、各自独立选择制式的方法也是不理想的。 因为如果他们通过协商共同决定采用两个纯策略纳什均衡中的任意一个,双方的得益都比混合策略的期望得益更高 ((A,A) 下为 1 和 3,(B,B) 下为 2 和 2,都优于 0.664 和 1.2 中的至少一方)。 这个博弈从一个侧面证明了:在引进技术、投资、开发产品等问题中,不同厂商各自为政的行为方式常常会导致低效率

三、市场机会博弈

另一种有两个纳什均衡博弈的典型代表。现实背景是:两厂商同时发现一个市场机会,但市场容量并不大 —— 如果只有一个厂商进入能赚到 100 单位利润,但如果两厂商同时进入,则不仅赚不到钱,而且要各亏损 50 单位。

行 · 厂商1
列 · 厂商2
厂商 2
不进
厂商 1 −50, −50100, 0
不进 0, 1000, 0
图 2.24 市场机会 · 两个纯策略纳什均衡(进,不进)和(不进,进)

用划线法或箭头法很容易证明(进,不进)和(不进,进)两个纯策略纳什均衡, 但前者对厂商 1 有利、后者对厂商 2 有利。显然两厂商都既不希望让对方独占市场,也不希望两败俱伤, 因此混合策略也是一种值得考虑的思路。

设厂商 1 选择进与不进的概率分别为 p₁(进) 和 p₁(不)。厂商 1 的混合策略必须使厂商 2 选进与不进的期望得益相同:

p1(进)·(−50) + p1(不)·100 = p1(进)·0 + p1(不)·0

解得 p₁(进) = 2p₁(不),配合和为 1 得 p₁(进) = 2/3,p₁(不) = 1/3。 因为厂商 2 与厂商 1 的情况完全对称,因此厂商 2 的混合策略概率也是 2/3 和 1/3。 双方各以(2/3, 1/3)选择进与不进,正是本博弈的一个混合策略纳什均衡 —— 此时两厂商的期望得益都是 0

3

2.4.3 混合策略和严格下策反复消去法

书页 84–86 · 图 2.25–2.27

把策略从纯策略扩展到混合策略之后,关于严格下策反复消去法的结论仍然成立

  • ① 任何博弈方都不会采用任何严格下策,不管它们是纯策略还是混合策略
  • ② 严格下策反复消去法不会消去任何纳什均衡,包括纯策略纳什均衡和混合策略纳什均衡;
  • ③ 如果经过反复消去后留下的策略组合是唯一的,那么一定是纳什均衡。

因此,考虑混合策略的情况下我们仍然可以利用严格下策反复消去法进行分析。而且实际上, 引进混合策略只有使严格下策反复消去法的用处更大 —— 因为有些策略在纯策略意义下不是严格下策, 在混合策略意义下却成了严格下策。

看下面这个博弈:

行 · 博弈方1
列 · 博弈方2
博弈方 2
LR
博弈方 1U 3, 10, 2
M 0, 23, 3
D 1, 31, 1
图 2.25 混合策略和严格下策反复消去法

纯策略意义上,这个博弈中不存在任何严格下策:从博弈方 2 的角度看,当博弈方 1 选 U、M 两策时 R 优于 L, 而当博弈方 1 选 D 时 L 优于 R,因此 L 和 R 都不是严格下策;博弈方 1 的三个策略两两之间也没有哪个绝对更好或更差。 所以只考虑纯策略时,严格下策反复消去法无从运用。

但如果允许博弈方 1 采取混合策略,情况就不同了。设博弈方 1 采取以概率分布(1/2, 1/2, 0)随机选择 U、M、D, 即各一半机会选 U、M、不选 D。那么与这个混合策略相比,D 一定是博弈方 1 的严格下策

博弈方 2 采用纯策略 L 时: u1* = ½×3 + ½×0 + 0×1 = 3/2
博弈方 2 采用纯策略 R 时: u1* = ½×0 + ½×3 + 0×1 = 3/2
博弈方 2 采用任意混合策略 (q, 1−q) 时: u1* = ½×3×q + ½×(1−q)×0 + ½×q×0 + ½×(1−q)×3 = ½×3×[q+(1−q)] = 3/2

也就是说,不管博弈方 2 采用哪种策略(包括所有可能的纯策略和所有混合策略), 博弈方 1 采用上述混合策略的期望得益始终为 3/2,都大于采用 D 策略时能得到的确定性得益 1。 由于假设博弈方是风险中性的,因此 D 相对于混合策略(1/2, 1/2, 0)是严格下策。

既然 D 在有混合策略时是严格下策,就可从博弈方 1 的策略空间中消去。此时 L 策又成为博弈方 2 相对于 R 策的严格下策, 也可消去。最后在剩下的两个策略组合中,博弈方 1 当然选到纳什均衡 (M, R),此时双方得益为 (3, 3)

⚠️但也有消不动的时候

需要注意的是,并不是包括混合策略以后,博弈中就一定会存在可以先行消去的纯策略严格下策。 如果把本例的得益改成图 2.27 那样(D 行的得益改为 2,3 和 2,1),则 U、M、D 就都不会是相对于任何纯策略或混合策略的严格下策。

实际上,这时 D 策非但不是博弈方 1 相对于混合策略(1/2, 1/2, 0)的严格下策,而且还是对博弈方 2 的混合策略 (q, 1−q)(其中 1/3 < q < 2/3)的最佳反应对策

消去 D 后博弈方 2
LR
博弈方 1U 3, 10, 2
M 0, 23, 3
图 2.26 消去 D 策后的得益矩阵 · (M, R)是纳什均衡
改了得益后博弈方 2
LR
博弈方 1U 3, 10, 2
M 0, 23, 3
D 2, 32, 1
图 2.27 无严格下策的情况 · D 反而成了对某些混合策略的最佳反应
4

2.4.4 混合策略反应函数

书页 86–89 · 图 2.28–2.31

把策略空间扩展到包括混合策略、把纳什均衡扩展到包括混合策略纳什均衡以后, 2.3 节的反应函数分析方法也可以扩展过来。

在纯策略范畴内,反应函数是各博弈方选择的纯策略对其他博弈方纯策略的反应。在混合策略范畴内, 博弈方的决策内容是选择概率分布,反应函数就是一方对另一方的概率分布的反应,同样也是一定的概率分布。 由于纯策略可以理解为混合策略,因此反应函数的概念实际上可以在"混合策略概率分布之间反应"的意义上统一起来。

猜硬币:两个阶梯

设(r, 1−r)是盖硬币方随机选择正反面的混合策略, (q, 1−q)是猜硬币方的混合策略,那么两博弈方的反应函数就是 rq 之间的相互决定关系。

根据前面的讨论:当猜硬币方选择猜正面的概率 q < 1/2 时,盖硬币方应选正面(即 r = 1),因为这样赢多输少; 相反,如果 q > 1/2,则盖硬币方应选反面(即 r = 0); 而当 q = 1/2 时,对盖硬币方来说 r 等于任何值都一样。 把 rq 的这种变化写成函数,就是图 2.28 中粗线所示的 r = R₁(q)。

1 0 1/2 q r r = R₁(q)
图 2.28 博弈方 1(盖硬币方)的反应函数
1 0 1/2 r q q = R₂(r)
图 2.29 博弈方 2 的反应函数 · 注意横轴是自变量、纵轴是因变量

把两条反应函数合并在一张图上就得到图 2.30:

(1/2, 1/2) 1 0 1/2 q r r = R₁(q) q = R₂(r)
图 2.30 混合策略纳什均衡 · 两条反应函数相交于(1/2, 1/2),且这是唯一的交点

从图 2.30 我们看到,两博弈方的反应函数相交于(1/2, 1/2),且这是唯一的交点。 这就是说只有 r = 1/2 和 q = 1/2 才是相互对对方最佳反应的混合策略概率分布 —— 这正是本博弈唯一的混合策略纳什均衡,与前面得到的结论完全一致。

夫妻之争:三个交点

混合策略反应函数也可以用来研究夫妻之争。设妻子的混合策略为(r, 1−r),丈夫的为(q, 1−q)。

  • 如果 q < 1/3,则妻子选时装的期望得益 2q < 2/3,不如选足球的期望得益 1−q > 2/3, 因此妻子应选足球,即 r = 0;
  • 如果 q > 1/3,则妻子选时装的得益 2q > 2/3,大于选足球的得益 1−q < 2/3,因此该选时装,即 r = 1;
  • q = 1/3 时,r 取 0 与 1 之间任何值对妻子的得益都一样。

因此妻子的反应函数如图 2.31 中的 r = R₁(q)。同样,根据 r < 3/4、r > 3/4 和 r = 3/4 分别确定 q 的反应,得出丈夫对妻子的反应函数 R₂(r)。

(0, 0) (1, 1) (3/4, 1/3) 1 0 1/3 3/4 q r R₁(q) R₂(r)
图 2.31 夫妻之争两博弈方的反应函数 · 三个交点,正好是 2.4.2 节求出的三个纳什均衡

图 2.31 中两博弈方的反应函数有三个交点

  • (0, 0),即 r = q = 0 —— 纯策略纳什均衡(足球,足球);
  • (1, 1),即 r = q = 1 —— 纯策略纳什均衡(时装,时装);
  • (3/4, 1/3) —— 对应妻子以(3/4, 1/4)随机选时装、足球,丈夫以(1/3, 2/3)随机选时装、足球, 正是 2.4.2 节求出的那个混合策略纳什均衡
模型 7

混合策略求解器:让对手无机可乘

选一个博弈,拖动你自己的概率分布,实时看对手的期望得益如何随你变化。 目标是让对手在两个纯策略上的期望得益相等 —— 那一刻他就无机可乘,而你就处在混合策略纳什均衡上。

5

速查卡

考前回看
📖求混合策略纳什均衡的标准两步

① 让自己无差异:设自己的混合策略概率为未知数,令对手在其各纯策略上的期望得益彼此相等,解出这些概率。

② 对每个博弈方各做一次。注意方向容易记反 —— 我设的概率是为了让"对方"无差异, 因为只有当对方选哪个都一样时,他才无法针对我。

博弈类型混合策略均衡均衡期望得益
猜硬币无纯策略均衡 · 严格竞争双方都(1/2, 1/2)0, 0
齐威王田忌赛马无纯策略均衡 · 严格竞争双方都(1/6, …, 1/6)齐威王 1,田忌 −1
图 2.17 数值例无纯策略均衡双方都(0.8, 0.2)2.6, 2.6
夫妻之争两个纯策略均衡妻子(0.75, 0.25)· 丈夫(1/3, 2/3)妻子 0.67,丈夫 0.75
制式问题两个纯策略均衡厂商1(0.4, 0.6)· 厂商2(0.67, 0.33)0.664,1.2(原书印作 1.296)
市场机会两个纯策略均衡双方都(2/3, 1/3)0, 0
小偷与守卫无纯策略均衡 · 非零和小偷 pt* = S/(S+D) · 守卫 pg* = P/(V+P)守卫 0,小偷 0
6

关键概念与易混点

术语表
纯策略 Pure Strategy
博弈中原来意义上的策略,博弈方确定地选择某一个行动。
混合策略 Mixed Strategy
博弈方以一定的概率分布在其可选纯策略中随机选择的"策略"。纯策略是它的特例(某个概率为 1)。
混合策略纳什均衡
一个严格意义上的混合策略组合(即未退化为纯策略组合的)构成的纳什均衡。 此时任何一方单独改变自己的概率分布都不能增加利益。
严格竞争博弈
各博弈方的利益和偏好始终不一致、在通常策略的基础上没有纳什均衡的博弈。零和博弈是典型。 与它相对的是"利益有很大一致性"的博弈(如夫妻之争)。
激励的悖论
政策目标与政策结果之间的意外关系。小偷与守卫博弈中:加重对小偷的惩罚,长期看只会让守卫更偷懒; 加重对失职守卫的处罚,长期看才会降低盗窃率。
群体行为解释
纳什本人对混合策略均衡给出的第二种解释:把概率分布理解为大量个体中采用各纯策略的频率/比例。 它不要求参与者有计算概率的意识和能力,因此比"理性主义解释"更贴近现实。
⚠️四处最容易混的地方

① 两类博弈的决策原则正好相反。严格竞争博弈里要拼命隐藏自己的选择(被猜到就输); 夫妻之争这类博弈里双方都不想隐藏(被猜到反而好,因为可以跟从)。别把随机化的理由套错对象。

② 阶梯状的反应函数不是"不连续所以有毛病"。图 2.28 的跳跃点恰恰是均衡所在 —— 在 q = 1/2 处,盖硬币方的任何 r 都一样好,这正是他无从被利用的状态。

③ 混合策略均衡的期望得益可能低于任何一个纯策略均衡。夫妻之争的混合均衡给妻子 0.67、丈夫 0.75, 而任一纯策略均衡下双方都至少得 1。"有均衡"和"结果好"完全是两回事。

④ "让对手无差异"是针对对手算的,不是针对自己。设自己的概率使对方在各纯策略上无差异 —— 这是本节最容易在考场上算反的一步。

7

随堂自测

5 题
Q1猜硬币博弈里,盖硬币方"以 1/2 的概率随机出正反面"和"随便出"有什么区别?
正确。书里说得很直接:若 p > 1/2,猜硬币方只要全猜正面就赢多输少。1/2 是唯一让对手无机可乘的概率。注意 B 也不对——1/2 保证的是"不被占便宜",不是"赢"(这个零和博弈的均衡期望是 0)。
不对。关键在"让对手无机可乘":p > 1/2 时对手全猜正面即稳赚,p < 1/2 时全猜反面即稳赚。只有 1/2 使对手两个纯策略的期望相等。但也别理解成 1/2 能赢——均衡期望得益是 0。
Q2求混合策略纳什均衡时,设自己的概率分布,是要让谁在各个纯策略上的期望得益相等?
正确。这正是本节最容易算反的一步。逻辑是:我调整自己的概率,目的是让对方在我能对他做的事里挑不出更好的,即让他无差异。对方无差异了,他就无法针对我获利。当然,均衡时双方各自都满足这个条件(所以 C 描述的是均衡的结果),但计算时是各设各的、各有各的方程。
不对。要设自己的概率让对方无差异——因为只有对方无差异,他才无法针对我。均衡时确实双方都无差异,但那是分别解出来的两个方程,不是一个方程组里同时设两边。
Q3按照"激励的悖论",政府长期来看最有效的抑制盗窃手段是什么?
正确。加重对小偷的惩罚(P↑)只改变图 2.21 里守卫的混合策略,不改变图 2.20 决定的小偷概率,所以长期中盗窃率不变,只是守卫可以更多地偷懒。而加重对失职守卫的处罚(D↑)会让图 2.20 里的 −D 下移,直接压低小偷"偷"的最佳概率
不对。关键在于:小偷的均衡概率由图 2.20 决定,只受 SD 影响、不受 P 影响。所以加重对小偷的惩罚(A)长期无效;只有加重对失职守卫的处罚(D)才能真正压低盗窃率。C 与模型无关。
Q4夫妻之争的混合策略纳什均衡期望得益是妻子 0.67、丈夫 0.75,而两个纯策略均衡下双方都至少得 1。这说明什么?
正确。书里的评价正是如此:"这个结果明显不如夫妻双方能交流协商时、任何一方迁就另一方时双方的得益好,因为那时任何一方都至少得1。"并由此指出这种夫妻决策问题一般不应该用这种博弈方式解决。
不对。算得没错(0.67 和 0.75 就是混合均衡的期望)。有意义的是它的含义:混合均衡效率很低,协商选定一个纯策略均衡对双方都更好。书里还据此提醒——若双方本可交流,这个模型就不该这么用。
Q5引进混合策略后,为什么说"严格下策反复消去法的用处反而更大"?
正确。图 2.25 里博弈方 1 的 D 策在纯策略意义下不是任何策略的严格下策,但与混合策略(1/2, 1/2, 0)相比它严格更差(D 只得 1,混合策略稳定得 3/2),于是可以消去。注意 D 也不对——图 2.27 就说明了加上混合策略也未必存在可消去的严格下策。
不对。因为混合策略扩大了可比较的范围:D 打不过任何一个纯策略,却打不过混合策略(1/2,1/2,0),于是成了严格下策,可以消去。但这不是必然的——图 2.27 改了得益之后,连混合策略也消不动 D。
0 / 5 题正确
第二章 · 第 5–6 节

2.5 存在性 · 2.6 均衡的选择与扩展

书页 89–1042.5.1 纳什定理2.5.2 意义与扩展2.6.1 帕累托与风险上策2.6.2 聚点与相关均衡2.6.3 共谋与防共谋
前四节把"怎么找纳什均衡"讲完了。这两节处理两个收尾问题:它一定存在吗(2.5),以及存在但不唯一时怎么办(2.6)。 后者给出了五个新概念 —— 帕累托上策、风险上策、聚点、相关、防共谋,它们的共同身份是纳什均衡的精练与选择
0

这两节讲了什么

概念地图
2.5 纳什均衡的存在性 纳什定理:每一个有限博弈都至少有一个混合策略纳什均衡。证明靠角谷不动点定理
存在 ≠ 唯一 → 多重均衡怎么选
2.6.1 帕累托 / 风险上策均衡 两个均衡有明显优劣时选好的(帕累托);有风险考量时可能选稳的(风险上策)
2.6.2 聚点 / 相关均衡 没有优劣之分时,靠共同的文化习惯(聚点)或主动设计的信号机制(相关)来协调
2.6.3 共谋 / 防共谋均衡 多人博弈中,部分人结盟能破坏原均衡 —— 要求"任何小团体串通也改不了结果"
💡为什么这两节合起来最重要

2.5 给了纳什均衡"值得找"的最后一个理由(它总能找到),2.6 则诚实地标出了它的边界(找到也未必唯一、未必能预测、未必稳定)。 书里在 2.6 结尾说得很清楚:纳什均衡分析"仍然是有局限性的",需要"在纳什均衡分析的基础上再作进一步的深入分析" —— 这正是第三章之后各章要做的事。

1

2.5 纳什均衡的存在性

书页 89–93 · 图 2.32

猜硬币、小偷和守卫等许多常见博弈都不存在纯策略纳什均衡,但如果把策略扩展到包括混合策略, 这些博弈在混合策略的意义上就有了纳什均衡。虽然混合策略纳什均衡与纯策略纳什均衡有差别 (如对一次性博弈结果的预测作用很小),但它在揭示博弈方决策的方法、揭示博弈问题的效率意义等方面还是非常有用的。

于是关键问题变成:混合策略纳什均衡具有普遍性吗?换句话说,如果所有没有纯策略纳什均衡的博弈都有混合策略纳什均衡, 对博弈分析的理论和应用价值就是非常重要的支持。幸运的是,这个问题的结论是肯定的。1950 年纳什提出的纳什定理首先证明了这个结论。

📖纳什定理(Nash 1950)

在一个有 n 个博弈方的博弈 G = {S₁,…Sn; u₁,…un} 中, 如果 n 是有限的,且 Si 都是有限集(对 i = 1,…n), 则该博弈至少存在一个纳什均衡,但可能包含混合策略。

用更通俗的语言:每一个有限博弈都至少有一个混合策略纳什均衡。这句话是本章(乃至整本书)最重要的一个保证。

证明的思路:不动点

纳什对这个定理的证明可以这样表述:每个 n 博弈方的博弈组成的策略组合,都是 n 个博弈方策略空间相乘得到的 n 维乘积空间中的一个点。对每个这种策略组合,都可以找出由 n 个博弈方对它的最佳反应策略构成的 一个或多个策略组合,这就形成了一个从上述乘积空间到它自身的一对多(One-to-many)的映射

由于引进混合策略以后,在期望得益的意义上得益函数都是连续函数,因此映射的图形是封闭的(闭集), 且每个点在映射下的影像都是凸集。根据角谷(Kakutani)的不动点定理,可知该映射至少有一个不动点 —— 这个不动点就是一个纳什均衡策略组合。

为了理解这个证明中起关键作用的不动点定理,书里先用一个更基本的形式来说明:

📖布鲁威尔(Brouwer)不动点定理

如果 f(x) 是定义域和值域都是闭区间 [0,1] 的连续函数,则在 [0,1] 中至少存在一点 x*, 满足 f(x*) = x*。称 x* 为函数 f(x) 的一个不动点

用图形来说,这个定理的意义就是:函数 f(x) 对应的曲线至少与图中的 45° 线有一个交点

x* 45° 1 0 1 f(x) x
图 2.32 布鲁威尔的不动点定理 · 连续曲线与 45° 线至少有一个交点,那个交点就是不动点

角谷的不动点定理实际上就是关于一维空间上映射(也就是一元函数)的布鲁威尔不动点定理, 在 n 维空间映射上的推广,其意义是:在 n 维空间的有界闭凸集上的连续映射,至少存在一个不动点, 即影像与原像是同一点。因为在混合策略的意义上,博弈方之间的策略反应构成的正是 n 维空间上的连续映射, 因此根据角谷不动点定理,这种映射至少存在一个不动点 —— 而这种不动点就是混合策略意义上的纳什均衡

2.5.2 纳什定理的意义和扩展

纳什均衡的普遍存在性,意味着纳什均衡分析在我们所遇到的大多数博弈问题中,都是一种基本的分析方法。 书里给出的逻辑链条很值得记:

没有存在性,一致预测性就没意义
正是因为有普遍存在性,纳什均衡是博弈结果的"一致预测"这个性质才有意义, 纳什均衡才会成为分析博弈和预测博弈结果的中心概念和基本出发点
所以纳什的证明特别重要
如果纳什均衡没有普遍存在性、多数博弈不存在纳什均衡, 那么即使纳什均衡与博弈结果关系很强、是一致预测,它和纳什均衡分析的意义也是很有限的。 因此纳什均衡的存在性是纳什均衡概念最重要的性质 —— 这就是为什么纳什首先证明存在性的开创性工作特别重要。

1950 年以后,纳什自己和其他人又用不同的方法、或对不同的博弈类型范围,重新证明了纳什均衡的存在性。 其中最重要的扩展是把针对有限策略形博弈的纳什定理,推广到策略不可数、有连续得益函数的无限博弈中

结果条件结论
Debreu (1952) · Glicksberg (1952) · Fan (1952) 策略空间是欧几里德空间的非空紧凸子集,得益函数连续且拟凹 一定存在纯策略纳什均衡
Glicksberg (1952) 策略空间是矩阵空间的非空紧子集,得益函数连续 存在混合策略纳什均衡
Kuhn (1953) 完美信息的 n有限博弈 都有一个纯策略纳什均衡
Zermelo (1913) 象棋博弈 是有"解"的"确定性"博弈 —— 实际上是博弈论的第一个定理,Kuhn 的定理是它的一般化和扩展

这些工作的基本结论是:纳什均衡在相当广泛的博弈类型中是普遍存在的,至少可以保证存在一个混合策略纳什均衡, 在有些类型的博弈中更可以证明至少存在一个纯策略纳什均衡。

⚠️注意"普遍存在"的代价

书里强调:纳什均衡的普遍存在性通常是在允许采用混合策略的情况下才成立的。 对限定比较少的一般非合作博弈,纯策略纳什均衡的存在性并没有保证 —— 前面的许多例子都已经说明了这一点。

2

2.6.1 帕累托和风险上策均衡

书页 93–97 · 图 2.33–2.35

纳什均衡分析"并不一定能彻底解决一个博弈问题",因为纳什均衡的存在性不等于唯一性。 在许多博弈中纳什均衡不唯一,而且不同的纳什均衡相互之间也没有明显的优劣关系,从而博弈方的选择会遇到困难。 这一节讨论的就是多重纳什均衡导致的选择问题。

一、帕累托上策均衡

并不是所有多重均衡博弈都会导致分析困难。因为虽然有些博弈存在多个纳什均衡,但很可能这些纳什均衡有明显的优劣差异, 所有博弈方都偏好其中同一个。换句话说,可能有某个纳什均衡给所有博弈方带来的利益,都大于其他所有纳什均衡会带来的利益。 这时候各方的选择倾向性就会一致 —— 不仅自己会选它,而且可以预料其他人也会选它,因此不会有选择困难。

这种选择依据的实际上就是帕累托效率意义上的优劣关系,因此用这种方法选择出来的纳什均衡也称为帕累托上策均衡。 书里用"战争与和平"博弈来说明:

行 · 国家1
列 · 国家2
国家 2
战争和平
国家 1战争 −5, −58, −10
和平 −10, 810, 10
图 2.33 帕累托上策均衡 · (和平,和平)在帕累托效率意义上明显优于(战争,战争)

这个得益矩阵"充分反映了战争对双方都是不利的,但当一个国家选择战争时,另一个国家不作抗争会更悲惨的一般规律"。 博弈中有两个纯策略纳什均衡(战争,战争)和(和平,和平),而(和平,和平)在帕累托效率意义上明显较好, 因此它构成本博弈的一个帕累托上策均衡。

书里给出的推理是:虽然对双方来说最佳选择都取决于对方的选择(对方和平时自己选和平最佳,对方战争时自己选战争最佳), 但因为和平共处对双方都更有利,因此每个国家不仅自己希望实现(和平,和平),而且能指望对方也会选择和平, 所以(和平,和平)应该是这个博弈的合理结果。这正是帕累托上策均衡的现实基础和意义。

⚠️那为什么世界上还有那么多战争

书里主动回应了这个疑问,给出的答案包括:决策者考虑短期利益、个人或小集团利益更多; 决策者确实缺乏理智和理性;或者局部地区或特定时期战争的利益比上述博弈中所假设的要大。

此外,其他国家选择战争时还击比不还击损失小、先发制人则更能使自己相对有利, 也是导致发生战争机会增大的重要原因。(这个问题在第五章讨论进化博弈论时还会进一步分析。)

书里还提示:寡头市场的价格竞争与两国之间关于战争与和平的选择其实很相似 —— 企业之间的价格竞争有时候就是一场战争,因此这个模型也可以用来分析寡头市场的价格竞争问题。

二、风险上策均衡

帕累托上策均衡并不是有强制力的法则。更重要的是,有时候其他某种同样是合理的选择逻辑的作用会超过帕累托效率的逻辑, 因此完全理性的决策者也不一定会选择帕累托上策均衡。

行 · 博弈方1
列 · 博弈方2
博弈方 2
LR
博弈方 1U 9, 90, 8
D 8, 07, 7
图 2.34 风险上策均衡 · (U,L)是帕累托上策均衡,(D,R)才是风险上策均衡

本博弈有两个纯策略纳什均衡(U, L)和(D, R),并且(U, L)的双方得益大于(D, R), 因此前者是帕累托上策均衡,采用它显然符合双方最大利益。但事情并不一定这么简单

  • 虽然双方都采用(U, L)时得益都比(D, R)多 2 单位,但如果一方采用了(U, L)的策略而另一方没有, 那么前者的得益是很差的 0 单位 —— 比他们分别采取 D 或 R 的得益(至少 7 单位,不管对方策略是什么)要低得多;
  • 这意味着采用(U, L)对两博弈方来说都有较大的风险。事实上对两个博弈方来说, 只要另一方偏离(U, L)的可能性大于 1/8,(D, R)就是比(U, L)更明智的选择;
  • 所以如果考虑风险因素,(D, R)就有相对优势:虽然它在帕累托效率意义上不如(U, L), 但在风险较小的意义上却优于(U, L)。当人们希望更保险一些、想要回避风险时就会选择(D, R)。

称(D, R)是这个博弈的一个风险上策均衡(Risk-dominant Equilibrium)。

📖风险上策均衡的识别标准

一种简单的理解方法或识别标准是:如果所有博弈方在预计其他博弈方采用两种纳什均衡的策略的概率相同时, 都偏爱其中某一纳什均衡,则该纳什均衡就是一个风险上策均衡。

用这个标准验算图 2.34:对方 50% 选 L、50% 选 R 时,我选 U 的期望是 (9+0)/2 = 4.5, 选 D 的期望是 (8+7)/2 = 7.5 —— 两边都偏爱 D,所以(D, R)是风险上策均衡。

猎鹿博弈:一个生动的例子

猎鹿(Stag-hunting)博弈是体现风险上策均衡思想的一个生动例子:两个人同时发现 1 头鹿和 2 只兔子。 如果两人合力抓鹿,则可以把这头价值 10 单位的鹿抓住,兔子当然抓不到了; 如果两人都去抓兔子,则各可以抓到 1 只价值 3 单位的兔子,鹿就会跑掉; 但如果一个人选择了抓兔子而另一个人选择了抓鹿,那么选择抓兔子的人能抓到 1 只兔子,选择抓鹿的人则什么也抓不到。 由于两人的决策必须在瞬间作出、根本来不及商量,因此这就是一个静态博弈。若合作猎获的鹿双方平分:

行 · 博弈方1
列 · 博弈方2
博弈方 2
鹿兔子
博弈方 1鹿 5, 50, 3
兔子 3, 03, 3
图 2.35 猎鹿博弈 · (鹿,鹿)是帕累托上策均衡,(兔子,兔子)才是风险上策均衡

这个博弈也有两个纳什均衡(鹿,鹿)和(兔子,兔子),而且前一个也是帕累托上策均衡。 但由于在另一人选择抓兔子的情况下,选择抓鹿的人会一无所获,而选择抓兔子的利益则是有保障的, 因此选择抓鹿有很大的风险。例如从其中一人的立场上,假设另一人选择抓鹿和抓兔子的概率都是 1/2, 那么此时他抓兔子能得到确定性的得益 3 单位,而选择抓鹿的期望得益为 2.5 单位,前者显然优于后者。 因此(兔子,兔子)是这个猎鹿博弈的一个风险上的均衡,精明的博弈方往往会选择抓兔子而不是抓鹿

💡自我强化的正反馈机制

书里指出一个很重要的动态性质:博弈方对风险上策均衡的选择倾向,有一种自我强化的机制。 当部分或所有博弈方选择风险上策均衡的可能性增强时,任一博弈方选择帕累托上策均衡策略的期望得益都会进一步变小, 这就使各博弈方更倾向于选择风险上策均衡,而这又进一步使选择帕累托上策均衡策略的得益更小 —— 从而形成一种选择风险上策均衡的正反馈机制,使其出现的机会越来越大。

书里的结论很有分量:"往往会使得开始时并不是很大的各个博弈方采用风险上策均衡策略的概率, 甚至只是对其他博弈方可能会采用风险上策均衡策略的担心,演变为实现相对低效率的风险上策均衡的现实。"

而且这个反馈机制会随着相互信任的难度而加强:当合作猎鹿需要 10 人同心协力才能成功、只要其中一人不合作就必然失败时, 人们就很难自觉选择合作 —— 因为相信其他 9 人会同时选择合作,比相信其他一人会选择合作要难得多, 此时选择合作的风险非常大。

3

2.6.2 聚点和相关均衡

书页 97–101 · 图 2.36

多重纳什均衡的真正困难,主要还在于不存在帕累托上策均衡。如夫妻之争的三个纳什均衡中, 除了混合策略均衡明显较差以外,两个纯策略均衡之间不存在帕累托效率意义上的优劣关系 —— 一个对丈夫有利,另一个对妻子有利,因此两个博弈方究竟会怎么选择很难判断。

也不是所有此类博弈中人们的选择都无法判断。事实上,人们在许多情况下的决策选择常会受到心理、习惯、文化、环境等多种因素的影响, 而且也会发展出特定的方法来解决决策选择的困难。聚点均衡相关均衡就是很好的例子。

一、聚点均衡

根据人们对类似夫妻之争这类博弈所进行的实验,发现大多数博弈方通常似乎知道在这样的博弈中该怎么选择, 而且博弈方之间经常能够相互理解对方的行为;也发现博弈方往往会利用博弈规则以外的特定信息 —— 如共同的文化背景中的习惯或规范、共同的知识,或者具有特定意义事物的特征,某些特殊的数量、位置关系等。

报时博弈

让两个博弈方同时报一个时间,所报时间相同则各获得 100 元奖励,不同则不能获得奖励。

这个博弈显然有无穷多个纳什均衡 —— 双方选择任何相同的时间都是纳什均衡, 而且这些纳什均衡相互之间完全不存在效率意义上的优劣关系

但我们不难理解,双方选择类似"中午 12 点""0 点"的可能性比较大,而选择类似"上午 10 点 01 分"" 下午 3 点 46 分"等的可能性就很小,更不大可能同时成为双方的选择。

理由:前几个时间既是整点,又都有特殊意义 —— 第一个代表上下午的分界,第二个是一天的开始, 因此双方同时想到的希望较大。而后面两个时间没什么特殊意义,即使某个博弈方想选,也不敢指望对方会做同样的选择—— 而这就足以使他放弃这类打算了。

称"中午 12 点"和"0 点"这样的策略为上述博弈的聚点(Focal Points)。 在多重纳什均衡的博弈中,双方同时选择一个聚点构成的纳什均衡称为聚点均衡。 当然,聚点均衡首先是纳什均衡,是多重纳什均衡中比较容易被选择的纳什均衡。

城市博弈(Cities Game)

要求两博弈者各自独立将上海、南京、长春、哈尔滨 4 个城市分为每组 2 个城市的 2 组,若两人分法相同则各得 100 元,否则没有奖金。

这个博弈中也有多个纳什均衡,包括分别将上海和南京分为一组、将上海和长春分为一组、将上海和哈尔滨分为一组, 然后将余下两个城市分为一组的三种分法。

如果是两个中国人参加,通常两人都会将上海和南京分为一组,长春和哈尔滨分为一组。 理由很简单:上海和南京是两个相对于长春和哈尔滨的南方城市,这种以地理位置给城市分类的方法是具有基本地理常识的人都容易想到的, 因此它是一个聚点。反之,如果有一个博弈方仅仅因为自己的父母分别来自哈尔滨和南京就把这两个城市分为一组, 那么恐怕不能指望获得奖金

⚠️聚点均衡的局限

夫妻之争本身也是适用聚点均衡的博弈问题 —— 生日、双方的性格脾气等都可能作为聚点的根据。 从几个例子可以看出,聚点均衡确实反映了人们在多重纳什均衡选择中的某些规律性。

但因为它们涉及的方面众多,虽然对每个具体的博弈问题可能可以找出聚点,但对一般的博弈却很难总结普遍规律, 只能具体问题具体分析。

二、相关均衡

人们在现实中遇到选择困难时,特别是在长期中反复遇到类似难题时,常会通过收集更多信息,形成特定的机制和规则, 也就是某种形式的制度安排等主动寻找出路。因此对于多重纳什均衡选择的难题,我们也应该考虑博弈方主动寻求方法、 设计某种形式的均衡选择机制的可能性。"相关均衡"(Correlated Equilibrium)就是这样的一种均衡选择机制。

行 · 博弈方1
列 · 博弈方2
博弈方 2
LR
博弈方 1U 5, 10, 0
D 4, 41, 5
图 2.36 相关均衡 · 两个纯策略纳什均衡的双方得益总和都是 6,但分配极不均

在这个博弈中,(U, L)和(D, R)是两个纯策略纳什均衡,另外有一个混合策略纳什均衡 [(1/2,1/2), (1/2,1/2)]。 问题在于:

  • 两个纯策略纳什均衡虽然都能使两博弈方得到 6 单位得益总和(5+1 和 4+4), 但双方的利益相差很大,因此很难在两博弈方之间形成自然的妥协 —— 聚点均衡的概念是不适用的
  • 如果采用混合策略纳什均衡,因为有 1/4 的可能性遇到最不理想的(U, R), 因此双方的期望得益都只有 2.5 单位,显然也不理想。

由于避免出现(U, R)结果符合双方的利益,因此双方有可能通过协商约定采用这样的选择规则:

💡抛硬币的约定

"抛一硬币,出现正面博弈方 1 采用 U、博弈方 2 采用 L;出现反面博弈方 1 采用 D、博弈方 2 采用 R。"

按照这样的规则选择,两个纯策略纳什均衡各有 1/2 出现的可能,且可以保证排除(U, R), 双方的期望得益都是 3,明显好于双方各自采用混合策略的期望得益 2.5,也解决了双方在两个纯策略纳什均衡选择方面的僵局。

同样的思想用到夫妻之争博弈中,就是双方可能形成这样的约定:"如果天气好一起去看足球赛,天气不好则一起看时装表演。"

进一步发展上述思路,其实图 2.36 中博弈还可能实现更好的结果 —— 该博弈有一个总得益更高的策略组合 (D, L) (总得益 8,而两个纯策略均衡都只有 6)。由于它不是纳什均衡,因此除了混合策略纳什均衡中包含采用它的可能性以外, 在一次性博弈中无法实现它。如果把抛硬币的方法加以发展,就可以设计出一种能够包含这个策略组合、同时又能排除(U, R)的方法。

这种方法的关键是发出下列"相关信号"(Correlated Signals)的"相关装置":

  1. 该装置以相同的可能性(各 1/3)发出 A、B、C 三种信号;
  2. 博弈方 1 只能看到该信号是否 A,博弈方 2 只能看到该信号是否 C;
  3. 博弈方 1 看到 A 采用 U,否则采用 D;博弈方 2 看到 C 采用 R,否则采用 L。
信号(各 1/3)博弈方 1 看到博弈方 2 看到结果
A是 A → 采用 U非 C → 采用 L(U, L)
B非 A → 采用 D非 C → 采用 L(D, L)
C非 A → 采用 D是 C → 采用 R(D, R)

该机制有下列重要性质:(1)保证 U 和 R 不会同时出现,即排除掉了(U, R); (2)保证 (U,L)、(D,L) 和 (D,R) 各以 1/3 的概率出现,从而两博弈方的期望得益达到 3 + 1/3(3)上述策略组合是一个纳什均衡(4)该相关装置并不影响双方各种策略组合下的得益,因此并不影响原来的均衡 —— 即如果一个博弈方忽视信号,另一个博弈方也可以忽视信号,并不影响各博弈方原来可能实现的利益。

称双方根据上述相关装置选择策略构成的纳什均衡为相关均衡。上述相关均衡虽然仍不能完全实现(D, L), 但至少在具有稳定性的前提下部分实现了它,因此对提高博弈效率是有意义的。

⚠️相关均衡最大的问题

书里的评语是:"这种机制或均衡的最大问题还是现实性问题。特别是在比较复杂的、 设定得没有这么清楚的现实博弈问题中,博弈方是否有能力设计出这种机制, 并且有足够的理解和相互信任采用这种机制,是有一定疑问的。"

"相关均衡作为社会经济中制度创新的一种解释也许更有意义。"

4

2.6.3 共谋和防共谋均衡

书页 101–104 · 图 2.37

进一步考虑静态博弈中纳什均衡分析的有效性,很容易发现在多人博弈中, 有可能存在部分博弈方之间联合追求小团体利益的行为,也可能会导致纳什均衡的不稳定性。 对这种可能性的考虑,导出了"防共谋均衡"(Coalition-proof Equilibrium)的概念。

一、多人博弈中的共谋问题

在有多个博弈方的多人博弈中,如果部分博弈方通过某种形式的默契或串通形成小团体, 可能得到比不串通时更大的利益,那么这些博弈方就有很强的相互串通、联合行动的动机。 这时候通常的纳什均衡分析在这样的博弈问题中也会遇到问题。

博弈方3 选 A博弈方 2
LR
博弈方 1U 0,0,10−5,−5,0
D −5,−5,01,1,−5
(博弈方 3 —— A)
博弈方3 选 B博弈方 2
LR
博弈方 1U −2,−2,0−5,−5,0
D −5,−5,0−1,−1,5
(博弈方 3 —— B)
图 2.37 多人博弈中的共谋问题 · 每格三个数字依次是博弈方 1、2、3 的得益

博弈方 1 选择行策略 U、D,博弈方 2 选择列策略 L、R,博弈方 3 选择矩阵 A、B。 不难发现该博弈有两个纯策略纳什均衡(U, L, A)和(D, R, B),且前者: 帕累托优于后者(0 > −1、0 > −1、10 > 5),而且在风险上策的意义上前者也优于后者。

如果博弈方各自独立决策和采取行动、不考虑部分博弈方串通一致行动的可能性,那么该博弈的结果应该是(U, L, A)

⚠️但串通能推翻它

如果考虑到串通或共谋的可能性,那么(U, L, A)却并不一定是最终结果。因为如果博弈方 3 选择 A, 则只要博弈方 1 和博弈方 2 达成一致行动的默契、分别采用 D 和 R,他们就都可以获得 1 单位得益,大于(U, L, A)时得到的 0 得益。

这意味着在这个博弈中,不仅以往的纳什均衡分析本身不能解决这个博弈问题, 而且帕累托上策均衡和风险上策均衡同样也不能解决这个问题。这时候必须运用新的概念和思想进行分析。

二、防共谋均衡

上述共谋问题引出了"防共谋均衡"的思想。它是两个以上博弈方的博弈中, 博弈方之间在帕累托上策均衡中进行合作的思想的扩展。防共谋均衡可以通过对共谋(串通)范围的归纳过程来定义:

📖防共谋均衡的定义

如果一个博弈的某个策略组合满足下列要求:

(1)没有任何单个博弈方的"串通"会改变博弈的结果,即单独改变策略无利可图 (这意味着该策略组合首先是一个纳什均衡);

(2)给定选择偏离的博弈方有再次偏离的自由时,没有任何两个博弈方的串通会改变博弈的结果;

(3)依次类推,直到所有博弈方都参加的串通也不会改变博弈的结果。

满足上述要求的均衡策略组合称为"防共谋均衡"。

显然,防共谋均衡的目标就是要排除由于多人博弈中可能存在部分博弈方结成小团体联合行动会给博弈结果带来的不稳定性和问题。 由于它排除了这样的可能性,因此能使博弈分析的结论和预测更加可靠。 在串通和勾结有利可图的情况下,防共谋均衡解释社会经济现象和预测结果的能力, 往往比一般的纳什均衡概念或其他博弈分析概念更强。

事实上,在排除了共谋的影响以后,多人博弈与两人博弈之间就不再有明显的区别, 前面所使用的纳什均衡、帕累托上策均衡、风险上策均衡分析等就都可以适用了。

(U, L, A)不是防共谋均衡
因为它在受到小团体和局部串通行为威胁时是不稳定的 —— 博弈方 1 和 2 可以串通转向(D, R),各得 1 而非 0。
(D, R, B)是防共谋均衡
虽然它从帕累托效率意义上明显不如(U, L, A),但给定偏离者还能继续偏离的约束, 无论是个人偏离(D, R, B),还是任何 2 人、或者所有 3 人的联合偏离,都不能增加他们的利益。 因此当不能排除串通的可能性时,(D, R, B)比(U, L, A)具有更大的稳定性,更可能是博弈的结果。

由于(D, R, B)在帕累托效率意义上明显比(U, L, A)差,因此上述分析揭示的实际上是 存在于多人博弈中的、另一种意义上的更复杂的"囚徒的困境"问题

5

五个均衡概念速查卡

考前回看
概念解决什么问题判据
纳什定理纳什均衡存在吗 有限博弈一定有混合策略纳什均衡(纯策略不保证)。靠角谷不动点定理证明
帕累托上策均衡多个均衡中明显更好的那个 所有博弈方在该均衡下的得益都大于其他所有纳什均衡下的得益
风险上策均衡考虑对方可能偏离时更稳妥的那个 预计对方采用两种均衡策略概率相同时,所有博弈方都偏爱的那一个
聚点均衡均衡无优劣、又无法协商 依靠共同文化背景、习惯、特殊意义的事物等"规则外信息"选出的那个
相关均衡均衡无优劣、但双方能事先约定机制 借助一个发出"相关信号"的装置协调选择,可排除最差组合、甚至部分实现非均衡的好结果
防共谋均衡多人博弈中小团体串通会破坏均衡时 任何单个、任意两个、直到全体博弈方的联合偏离都不能改善其成员的利益
💡一句话串起来

纳什定理说均衡总能找到;帕累托上策和风险上策处理"有优劣"的多重均衡;聚点和相关处理"没优劣"的多重均衡; 防共谋处理"多人结盟"对均衡的破坏。五者都是纳什均衡的精练或选择,本身仍然以纳什均衡为基础。

6

关键概念与易混点

术语表
纳什定理 Nash 1950
有限博弈至少存在一个纳什均衡,但可能包含混合策略。等价说法:每一个有限博弈都至少有一个混合策略纳什均衡
不动点定理
布鲁威尔:闭区间上的连续函数 f(x) 至少有一点满足 f(x*) = x*(图形上即曲线与 45° 线至少交一次)。 角谷把它推广到 n 维空间的有界闭凸集上的连续映射。
帕累托上策均衡 Pareto-dominant
给所有博弈方带来的利益都大于其他所有纳什均衡的那个纳什均衡。没有强制力 —— 不保证一定被选中。
风险上策均衡 Risk-dominant
预计对方在两种均衡策略间等概率时,所有博弈方都偏爱的那一个。它牺牲效率换取保险。
聚点 Focal Point
多重均衡博弈中,各方凭共同的规则外信息(文化、习惯、特殊意义)容易同时想到的那个策略。
相关均衡 Correlated Equilibrium
各方按一个发出相关信号的装置来协调选择所构成的纳什均衡。它是主动设计的制度安排,正因此现实性存疑。
防共谋均衡 Coalition-proof
任何单个、任意两个、直到全体博弈方的联合偏离都不能改善其成员利益的策略组合。 它仍是非合作博弈的概念(串通靠自愿,没有强制力)。
拟凹 Quasi-concave
在 2.5.2 节的存在性扩展定理中出现:策略空间是紧凸集、得益函数连续且拟凹时,存在纯策略纳什均衡。
⚠️四处最容易混的地方

① "存在"和"纯策略存在"是两件事。纳什定理保证的是混合策略均衡;纯策略均衡的存在性需要更强的条件 (紧凸策略空间 + 连续拟凹得益),一般非合作博弈没有这个保证。

② 风险上策和帕累托上策可以指向不同的均衡。图 2.34、图 2.35 都是例子 —— 而且书里说这种"更保险"的考虑会通过正反馈自我强化,甚至只是"担心别人会选它"就足以让它真的发生。

③ 聚点均衡和混合策略是两个不同的出路。夫妻之争里,混合策略给的是双方都只有 0.67 / 0.75 的低效结果; 聚点(如生日、约定)才是能拿到纯策略均衡收益的办法。书里对混合策略均衡的评价是"明显不如协商"。

④ 防共谋均衡不属于合作博弈。串通是无强制力、自愿的,因此它仍是非合作博弈的概念。 凡是看到"有约束力的协议",那才是合作博弈的地界(第一章 1.3.6)。

7

随堂自测

4 题
Q1纳什定理保证了什么?
正确。书里的通俗表述就是"每一个有限博弈都至少有一个混合策略纳什均衡"。注意 A 少了"混合"二字——纯策略均衡的存在性没有一般保证。B 把"至少一个"错成"恰好一个",而存在性恰恰不等于唯一性。D 也超出定理范围:无限博弈要另加条件(见 2.5.2 的扩展定理)。
不对。纳什定理说的是:有限博弈至少有一个混合策略纳什均衡。A 漏了"混合"(纯策略不保证),B 把存在性当成了唯一性,D 超出定理条件(无限博弈要附加紧凸、连续拟凹等条件)。
Q2猎鹿博弈中(鹿,鹿)帕累托优于(兔子,兔子),为什么精明的博弈方往往还是选择抓兔子?
正确。书里的演算:假设对方抓鹿和抓兔子各 1/2,抓兔子的确定性得益是 3,而抓鹿的期望只有 (5+0)/2 = 2.5。所以(兔子,兔子)是风险上策均衡。书里还提醒这个倾向会自我强化——越担心对方抓兔子,抓鹿的期望就越低。
不对。关键在风险:抓兔子稳得 3,抓鹿在对方抓兔子时得 0,对方五五开时抓鹿的期望只有 2.5 < 3。注意 C 是错的——(鹿,鹿)总得益 10 更大;D 也是错的,(鹿,鹿)确实是纳什均衡。
Q3图 2.36 的相关均衡里,那个"相关装置"的关键作用是什么?
正确。装置发出 A/B/C 三种信号各 1/3,博弈方 1 只看得到"是否 A"、博弈方 2 只看得到"是否 C"——这个信息结构恰好保证 U 和 R 不会同时被采用,于是 (U,L)、(D,L)、(D,R) 各以 1/3 出现,期望得益升到 3+1/3,还把非均衡的(D,L)也纳了进来。注意书里强调它不改变得益(所以 B 错),也不是简单各半(C 错,那是抛硬币的版本)。
不对。装置的信息结构是关键:双方各只看到一部分信号,于是(U,R)在物理上就不可能同时发生,而(D,L)这类非均衡的好结果却能被纳入。它不改变得益矩阵(B 错),效果也比简单抛硬币更强(C 只是抛硬币版本的描述)。
Q4为什么说图 2.37 中的(D, R, B)反而是防共谋均衡?
正确。防共谋的定义就是逐级排除:单个偏离、任意两个串通、直到全体串通,都不能改善成员利益。(D,R,B)满足这一串要求,而(U,L,A)在"博弈方1+2 串通转向 (D,R) 各得 1"这一点上就被推翻了。所以书里说它揭示的是"多人博弈中另一种意义上的更复杂的囚徒的困境"。
不对。判据是逐级排除串通:单人不偏离、任意两人串通不改善、全体串通也不改善。(D,R,B)满足全部三条,而(U,L,A)会因为 1、2 两人可以串通各得 1 而被推翻。注意 B、C 都反了——(D,R,B)的得益(−1,−1,5)帕累托上明显不如(U,L,A)的(0,0,10)。
0 / 4 题正确
第一章 · 第二章 · 自测

两章章末思考题全解

书页 39–40 · 103–104共 19 道思考题答案由本工作台推导,书上未附答案
下面 19 道题是原书两章的章末思考题,书里没有给答案。这里的解答是依据本章正文推导的, 其中第 3 题(举例题)和第 4 题(开放题)给的是参考思路而非唯一答案。 第 6 题有一处口径陷阱,务必先看解析里的提示。
1

第一章思考题

书页 39–40 · 7 题
1什么是博弈?博弈论的主要研究内容是什么?

博弈的定义(非技术性):博弈即一些个人、队组或其他组织,面对一定的环境条件,在一定的规则下, 同时或先后一次或多次,从各自允许选择的行为或策略中进行选择并加以实施,各自取得相应结果的过程。

博弈论的主要研究内容:系统研究可以用上述方法定义的各种博弈问题,寻求在各博弈方具有充分或有限理性(Full or Bounded Rationality)、 能力的条件下,合理的策略选择和合理选择策略时博弈的结果,并分析这些结果的经济意义、效率意义

答题时容易漏掉的两点:一是"充分或有限理性"——研究范围不限于完全理性;二是"经济意义、效率意义"—— 它不只是求一个解,还要对解作效率评价(这正是变和博弈中"有效率/无效率"评价的由来)。

2设定一个博弈模型必须确定哪几个方面?

四个方面,缺一不可:

  1. 博弈的参加者(Players)——有哪些独立决策、独立承担结果的个人或组织。只要统一决策、统一行动、统一承担结果, 不管组织多大都算一个参加方,本书称之为"博弈方"。
  2. 各博弈方各自可选择的全部策略或行为的集合(Strategies / Actions)——规定每个博弈方决策时可以选择的方法、做法, 或经济活动的水平、量值等。
  3. 进行博弈的次序(Orders)——次序不同一般就是不同的博弈,即使其他方面都相同。
  4. 博弈方的得益(Payoffs)——对应每一组可能的决策选择,都要有一个结果表示各博弈方的所得或所失。得益可正可负。

补充一句可以加分:得益虽然应当是客观存在的,但这并不意味着各博弈方都了解各方的得益情况—— 后者是 1.3.5 节"完全/不完全信息"分类的来源。

3举出烟草、餐饮、股市、房地产、广告、电视等行业的竞争中策略相互依存的例子。

这是举例题,只要抓住核心——你的最优选择取决于对方怎么选——即可。参考思路:

  • 烟草。提价与广告投放互相牵制:一家大幅提价会把顾客让给对方;但一家大幅增加广告投入, 对手若不跟进则份额被蚕食、若跟进则双方利润同时被广告费吃掉。属于典型的囚徒困境结构。
  • 餐饮。相邻两家餐馆的选址、折扣力度、外卖补贴互相依存。一家做"满减",对手不做就丢单, 都做则双方利润率同时下降——又是囚徒困境。
  • 股市。典型的猜硬币(赌胜)结构:每个交易者的买卖决策取决于他预期别人怎么判断, 而不是取决于资产本身;"猜别人怎么猜"是关键,因此必须避免自己的策略有规律可循。
  • 房地产。同一地段的开发商在拿地节奏开盘定价上互相依存:抢先开盘可以截客, 但正面对抗可能两败俱伤——这正是 1.3.4 节的"先来后到"动态博弈,且顺序真实存在(先拿地者先动)。
  • 广告。最标准的囚徒困境:都不投广告时双方按原有份额分利润;一家单独投可抢份额; 两家都投则份额回到原状而利润被广告费侵蚀。所以书里说广告投资是"耗资巨大但并不一定有利可图的争夺战"。
  • 电视。同一时段的节目编排与版权采购互相依存:一家把王牌剧放在黄金档,对手是避开还是硬碰, 取决于对对方收视反应的预期——这是有先后的动态博弈。
4"囚徒的困境"的内在根源是什么?举出现实中囚徒的困境的具体例子。

内在根源有两层,答题时建议分两层写:

  1. 结构根源:个体理性与团体理性的矛盾。每个博弈方以自身利益最大化为目标, 而"坦白"(或降价)对每个人都是上策——无论对方怎么选,它都带来更大得益。
  2. 制度根源:博弈是非合作的,即双方之间没有有约束力的协议这就是书里强调的那句 "即使两寡头都完全清楚上述利害关系和相应的效率意义,也无法改变这种结局"的原因。 困境不是信息不足造成的,而是缺少能把两方绑住的机制。

书里由此推出两层结论:(i)从个体利益出发的行为往往不能实现团体的最大利益——这否定了"看不见的手"总会把利己行为 变为集体有利行为的论断;(ii)从个体利益出发的行为最终也不一定能真正实现个体的最大利益——这是"困境"二字的真正来源。

现实例子(任选其二三展开):

  • 价格战 / 广告战(书里给的双寡头削价竞争就是原型)。
  • 公共资源的掠夺式使用——书里点名的例子。草场过度放牧、渔业过度捕捞、地下水超采,每个使用者多用的收益归自己、成本由大家分摊。
  • 环境保护——书里点名的另一个例子。单个企业治污要自己掏钱,不治污则成本由全社会承担。
  • 军备竞赛:双方都扩军则都不更安全,但单方面裁军会被对方压制。
  • 团队中的搭便车:小组成果共享时,每个人都希望别人多干。
  • 教育 / 职场的过度竞争(内卷):人人都补习或加班,相对位置不变而总成本上升。

注意书里提醒的两面性:研究囚徒困境的目的,有时是利用它达到有益于社会的目的(如打击犯罪—— 罪犯都受到应有的惩罚对社会是理想结果),有时是要设法避免它(如环保和公共资源)。

5博弈有哪些分类方法,有哪些主要的类型?

六条分类依据,各自的类型如下:

分类依据类型
博弈方的数量单人博弈、两人博弈、多人博弈
策略的数量有限博弈、无限博弈
得益情况零和博弈、常和博弈、变和博弈
博弈过程静态博弈、动态博弈、重复博弈
信息结构完全信息 / 不完全信息;完美信息 / 不完美信息
理性与行为逻辑完全理性 / 有限理性;非合作博弈 / 合作博弈

加分部分:这些分类相互之间都是交叉的,不存在严格的层次关系;但可以按对分析方法影响的大小排出一个大致次序, 这个次序就是本书的结构:非合作/合作 →(非合作内)完全理性/有限理性 → 静态/动态/重复 → 按信息是否完全和完美细分为五类(完全信息静态、不完全信息静态、完全且完美信息动态、完全但不完美信息动态、不完全信息动态)。

书里还提醒:分类有主观性,不要机械看待,随着博弈理论发展,分类方法也可以变化。

6考虑是否投资 100 万元开设一家饭店:决定开,则 0.35 的概率收益 300 万元(包括投资), 0.65 的概率全部亏损掉;不开则能保住本钱但没有利润。
(a) 用得益矩阵和扩展形表示该博弈;(b) 风险中性时如何选择?(c) 风险规避、期望得益折扣系数 0.9 时如何选择?(d) 风险偏好、折算系数 1.2 时如何选择?
⚠️先解决口径问题——这题有一处陷阱

"收益 300 万元(包括投资)"说明 300 万是你最终拿回的总金额,其中 100 万本来就是你的。 因此的两个结果是 3000不开是保住本钱,即 100

如果把得益错记成净收益(开:+200 / −100,不开:0),那么 (c) 的答案会反过来——这就是本题的陷阱所在。下面按 300/0/100 计算。

(a) 得益矩阵。本博弈只有一个真正决策的博弈方(你),但含有不确定因素,因此要引进"大自然"作为博弈方 0。 矩阵中自然的得益不用考虑,所以每格写一个数字:

行 · 你
列 · 自然
自然
成功(35%)失败(65%)
3000
不开 100100
开饭店的得益矩阵 · 单位:万元。注意"不开"一行两格相同——它不受天气(市场)影响,是确定结果

扩展形:决策节点在前、自然节点在后,这一点与运输路线博弈正好相反。

不开 (100) 0 成功 35% 失败 65% (300) (0)
开饭店的扩展形 · 与图 1.10 对比:那里是"自然在前、你在后",这里是"你在前、自然在后"

开的期望得益:0.35 × 300 + 0.65 × 0 = 105 万元。  不开的得益:确定的 100 万元。

风险态度折算系数开的折算后期望不开(确定值)选择
(b) 风险中性1.0105.0100
(c) 风险规避0.994.5100不开
(d) 风险偏好1.2126.0100

所以答案是:(b) 开;(c) 不开;(d) 开。

💡这题在考什么

考的正是 1.3.1 节那条脚注里对风险态度的三种划分:风险中性认为 1 单位期望得益等于 1 单位确定得益; 风险偏好认为 1 单位期望得益好于 1 单位确定得益;风险规避则相反。

折算系数就是把这个态度写成数:0.9 表示"我宁愿要 100 万确定的,也不要 105 万期望的"。 注意 (b) 和 (d) 的答案其实不依赖口径(净收益口径下开是 5 和 6,都大于 0),只有 (c) 依赖口径—— 所以答题时把"得益 = 最终到手金额"这句写在最前面,是最稳妥的。

7一逃犯从监狱中逃走,一看守奉命追捕。逃犯逃跑有两条可选择的路线,看守只要追捕方向正确就一定能抓住逃犯。 逃犯逃脱可少坐 10 年牢,但一旦被抓住则要加刑 10 年;看守抓住逃犯能得 1 000 元奖金。 请分别用得益矩阵和扩展形表示该博弈,并作简单分析。

(a) 得益矩阵。记两条路线为"路线 1""路线 2"。看守方向正确则必抓住,因此这是一个猜硬币式的博弈—— 逃犯求"不一致",看守求"一致"。

行 · 逃犯
列 · 看守
看守
守路线 1守路线 2
逃犯走路线 1 (−10, 1000) (10, 0)
走路线 2 (10, 0) (−10, 1000)
逃犯与看守的得益矩阵 · 前者是逃犯的得益(年),后者是看守的得益(元)

扩展形与前文的"先来后到"不同:这里两人是同时决策的(逃犯选路线时不知道看守守哪条, 看守也不知道逃犯走哪条),因此不存在真正的先后节点。若硬画成树,必须用信息集把看守的两个节点圈在一起, 表示他分不清自己处在哪个节点上:

逃犯 路线 1 路线 2 看守的信息集 — 他不知道自己站在哪个节点上 看守 看守 (−10, 1000) (10, 0) (10, 0) (−10, 1000)
逃犯与看守 · 椭圆把看守的两个节点圈成一个信息集

(b) 简单分析。本博弈没有纯策略意义下的稳定结果

  • 若逃犯固定走路线 1,看守就会守路线 1,逃犯被抓(−10);
  • 若看守固定守路线 1,逃犯就会走路线 2,看守白忙(0);
  • 所以任何一方把策略固定下来都会被对方针对——与猜硬币、齐威王田忌赛马完全同构

因此双方都必须以随机方式选择。设逃犯走路线 1 的概率为 p,看守守路线 1 的概率为 q

  • 对看守:守路线 1 的期望 = 1 000p;守路线 2 的期望 = 1 000(1 − p)。令两者相等得 p = 1/2
  • 对逃犯:走路线 1 的期望 = −10q + 10(1 − q) = 10 − 20q;走路线 2 的期望 = 10q − 10(1 − q) = 20q − 10。 令两者相等得 q = 1/2

结论:双方各以 1/2 的概率随机选择两条路线。此时逃犯的期望得益为 0 (平均而言逃脱与被抓各半,少坐的 10 年和加刑的 10 年互相抵消),看守的期望得益为 500 元

0 / 7 题已展开
2

第二章思考题

书页 103–104 · 12 题
1上策均衡、严格下策反复消去法和纳什均衡相互之间的关系是什么?

三者的关系可以用包含关系相容性两句话说完:

  • 上策均衡 ⊂ 纳什均衡。上策均衡一定是纳什均衡,但反过来不成立。因为上策是"不管对方怎么选都最好", 自然满足"给定对方的选择我也是最好"。所以上策均衡是更强、更稳定的概念,只是普遍性差得多。 分析顺序应是:先看上策均衡,没有再看纳什均衡。
  • 严格下策反复消去法与纳什均衡相容。命题 2.2 保证消去的绝不是纳什均衡;命题 2.1 保证消去后剩下的唯一组合必是纳什均衡。 所以可以放心地先化简、再求均衡
  • 划线法与箭头法不是独立的"第三种方法",它们就是在得益矩阵上纳什均衡的手工办法。

用一句话概括这张关系网:上策均衡和严格下策消去法靠"绝对优劣"工作,适用面窄;划线法、箭头法靠"相对优劣"工作,适用面宽; 而它们最终都指向同一个中心概念 —— 纳什均衡。

2为什么说纳什均衡是博弈分析中最重要的概念?

可以从三条线索回答:

① 它是唯一具备"一致预测性"的概念。如果所有博弈方都预测某个结果会出现,则没有人愿意选择与预测不一致的策略 —— 预测与行为统一,因此结果是自我强制的。书里证明了"纳什均衡具有一致预测性质,而且只有纳什均衡才有这种性质"。 预测是博弈分析最基本的目的之一,所以这点决定了纳什均衡不可替代的地位。

② 它有普遍存在性(2.5 节)。纳什定理保证每个有限博弈至少有一个混合策略纳什均衡。 正是因为有存在性,"一致预测"这个性质才有意义;否则多数博弈没有均衡,纳什均衡分析的价值就很有限。 这就是纳什首先证明存在性的工作特别重要的原因。

③ 它是后续所有均衡概念的母体。分析动态博弈、不完全信息博弈、不完美信息博弈的核心概念 —— 子博弈完美纳什均衡、贝叶斯纳什均衡、完美贝叶斯均衡 —— 本身都是纳什均衡,都是纳什均衡的某种精练。 第二章之后的每一章,都是在"纳什均衡"这个基础概念上加条件。

补一句边界:存在性不等于唯一性,也不保证能预测。多重均衡、无帕累托优劣时仍需 2.6 节的精练概念。

3找出现实经济或生活中可以用帕累托上策均衡、风险上策均衡分析的例子。

这是举例题,关键要说清两个(或更多)均衡各是什么它们之间的优劣关系、以及为什么实际会选那个

帕累托上策均衡的例子:

  • 道路交通靠左还是靠右。两个均衡(都靠左 / 都靠右)都能避免对撞,但都要靠"同一侧"。 当一国已有明确规则时,该规则就是帕累托上策(相对"无序"而言)。
  • 技术标准之争。两家厂商都采用同一制式(图 2.23)比各自为政好,但两个制式之间无优劣, 所以它其实不是帕累托上策的例子 —— 正好是一个反例,可用来说明"有多个均衡但没有优劣关系"时, 需要靠聚点或相关均衡解决。
  • 战争与和平(图 2.33)。和平共处对双方都更好,是帕累托上策均衡。这是书里给的正面例子。
  • 垃圾分类、排队、遵守交规这类"大家都守规矩"的协调问题:所有人都守 → 都好;都不守 → 都差。 守规矩是帕累托上策均衡。

风险上策均衡的例子:

  • 猎鹿(图 2.35)。书里的标准例子:合作猎鹿收益高但风险大,各抓兔子收益低但稳妥, 因此精明的博弈方往往选抓兔子 —— 这就是风险上策。
  • 两家企业共同进入一个新市场 vs 各自守老市场。一起进入成功则都赚更多,但若一方不进则另一方亏; 守老市场稳妥。当对对方的信心不足时,稳妥的选择胜出。
  • 小组作业中的"投入 vs 划水"。大家都投入成果最好,但"我投入而别人划水"最亏; 担心别人划水的人会先划水 —— 而且这个倾向会自我强化。
  • 金融危机中的"抢兑"。都不挤兑则银行正常,但担心别人挤兑就先去挤兑,于是挤兑真的发生。

书里特别提示了一个关键:风险上策的吸引力会通过正反馈自我强化 —— 甚至只是"担心别人会选风险上策"这件事本身,就足以让风险上策真的实现。这是答这类题最值得写的一句。

4多重纳什均衡是否会影响纳什均衡的一致预测性质,对博弈分析有什么不利影响?

这是本章最容易答错的一题,要点是分清"性质"和"前提"。

结论:多重纳什均衡不破坏一致预测性本身,但破坏了它的前提,从而削弱了预测能力。

理由是书里 2.2.2 节讲得很清楚的一点:

  • 一致预测性说的是"若所有博弈方都预测某结果会出现,则没人愿意偏离它"—— 多重均衡中每一个均衡都满足这一点,所以性质本身并没有被破坏。
  • 一致预测还有一个前提:各博弈方的预测是相同的。书里原话是"相同的预测是一致预测性质的前提而不是结果"。
  • 当博弈有多个均衡且相互无显著优劣时,各博弈方完全可能预测不同的均衡(我预测(时装,时装), 你预测(足球,足球))。此时前提不成立,一致预测无从谈起。

对博弈分析的不利影响:无法对博弈结果作出明确预测,也就无法给博弈方提供明确的决策建议 —— 而"预测"和"建议"恰恰是博弈分析的两个基本目的。以夫妻之争为例:三个纳什均衡中,混合均衡明显较差, 两个纯均衡又一利于妻子一利于丈夫,因此仅靠纳什均衡分析无法告诉任何一方该怎么做

这正是 2.6 节要引入帕累托上策均衡、风险上策均衡、聚点均衡、相关均衡这些"均衡精练与选择"概念的原因 —— 它们是在纳什均衡之上加一层选择标准,而不是替代纳什均衡。

5下面的得益矩阵表示两博弈方之间的一个静态博弈。该博弈有没有纯策略纳什均衡?博弈的结果是什么?
行 · 博弈方1
列 · 博弈方2
博弈方 2
LCR
博弈方 1T 2, 01, 14, 2
M 3, 41, 22, 3
B 1, 30, 23, 0

有,而且有两个纯策略纳什均衡:(T, R)和(M, L)。

先分别求出每一方对对方每个策略的最佳对策(即划线法的两条线索):

对方的选择博弈方 1 的最佳对策博弈方 2 的最佳对策
列 L(对博弈方 1)M,得益 3(3 > 2 > 1)
列 C(对博弈方 1)T 或 M,得益都是 1(并列)
列 R(对博弈方 1)T,得益 4(4 > 3 > 2)
行 T(对博弈方 2)R,得益 2(2 > 1 > 0)
行 M(对博弈方 2)L,得益 4(4 > 3 > 2)
行 B(对博弈方 2)L,得益 3(3 > 2 > 0)

逐格核对"双方是否互相都是最佳对策":

  • (T, R):给定对方选 R,博弈方 1 选 T 最优 ✓;给定对方选 T,博弈方 2 选 R 最优 ✓ → 纳什均衡,得益(4, 2)。
  • (M, L):给定对方选 L,博弈方 1 选 M 最优 ✓;给定对方选 M,博弈方 2 选 L 最优 ✓ → 纳什均衡,得益(3, 4)。
  • 其余组合都至少有一方想离开,例如(T, C):博弈方 2 想改选 R(2 > 1)。

博弈的结果是什么?——无法唯一确定。两个均衡中(T, R)对博弈方 1 有利(得 4), (M, L)对博弈方 2 有利(得 4),两者之间不存在帕累托效率意义上的优劣关系。 这和夫妻之争、市场机会博弈是同一类结构,因此仅靠纳什均衡分析无法告诉任何一方该怎么做, 需要 2.6 节的聚点均衡或相关均衡来协调。

6求出下图中得益矩阵所表示的博弈中的混合策略纳什均衡。
行 · 博弈方1
列 · 博弈方2
博弈方 2
LR
博弈方 1T 2, 10, 2
B 1, 23, 0

先确认它没有纯策略纳什均衡:博弈方 1 对 L 选 T(2>1)、对 R 选 B(3>0); 博弈方 2 对 T 选 R(2>1)、对 B 选 L(2>0)—— 最佳对策永远对不上,所以无纯策略均衡,只有混合的。

第一步:设博弈方 1 以概率 p 选 T、(1−p)选 B,令博弈方 2 在 L 和 R 上无差异。 (注意是让对方无差异。)

博弈方 2 选 L:p×1 + (1−p)×2 = 2 − p ; 选 R:p×2 + (1−p)×0 = 2p

令二者相等:2 − p = 2p,解得 p = 2/3。 即博弈方 1 的混合策略为 (2/3, 1/3)

第二步:设博弈方 2 以概率 q 选 L、(1−q)选 R,令博弈方 1 无差异。

博弈方 1 选 T:q×2 + (1−q)×0 = 2q ; 选 B:q×1 + (1−q)×3 = 3 − 2q

令二者相等:2q = 3 − 2q,解得 q = 3/4。 即博弈方 2 的混合策略为 (3/4, 1/4)

均衡结果:博弈方 1 以(2/3, 1/3)随机选 T、B,博弈方 2 以(3/4, 1/4)随机选 L、R。 此时双方的期望得益为

u1 = 2q = 2 × 3/4 = 1.5 , u2 = 2 − p = 2 − 2/3 = 4/3 ≈ 1.33

验算:u₁ = Σi,j piqjAij = (2/3)(3/4)(2) + (2/3)(1/4)(0) + (1/3)(3/4)(1) + (1/3)(1/4)(3) = 1 + 0 + 0.25 + 0.25 = 1.5

7博弈方 1 和博弈方 2 就如何分 10000 元进行讨价还价。规则:双方同时提出自己要求的数额 s₁ 和 s₂, 0 ≤ s₁, s₂ ≤ 10000。如果 s₁ + s₂ ≤ 10000,则两方的要求都得到满足;但如果 s₁ + s₂ > 10000,则该笔钱就被没收。 问该博弈的纯策略纳什均衡是什么?如果你是其中一个博弈方,你会要求什么数额,为什么?

(1)纯策略纳什均衡:所有满足 s₁ + s₂ = 10000 的组合,共无穷多个。

证明分两步:

  • s₁ + s₂ = 10000,则(s₁, s₂)是纳什均衡。 给定对方要求 s₂,我要求 s₁ = 10000 − s₂ 拿到 10000 − s₂; 要求更多s₁ + s₂ > 10000,一分不得(得 0); 要求更少则自己白白吃亏。所以 s₁ = 10000 − s₂ 正是我的最佳对策 ✓。对方同理。
  • s₁ + s₂ < 10000,则不是纳什均衡。 因为此时双方都还有钱留在桌上 —— 任一方把自己的要求提高到 10000 − s₋ᵢ,仍满足和不超过 10000, 得益严格增加,所以有人想偏离 ✓。

注意若 s₁ + s₂ > 10000,双方都得 0,也都不稳定(任一方降到 10000 − s₋ᵢ 就能拿到正数)。

(2)你会要求多少?—— 这题没有唯一的"正确答案",考的是能否看出这个问题本身的不确定性并给出有依据的选择

关键在于:理论上有无穷多个纳什均衡,纳什均衡分析无法在它们之间挑选。所以必须借助 2.6 节的概念:

  • 聚点思路:5000 vs 5000(一人一半)是最自然的"公平"聚点,因此双方同时报 5000 的概率最高 —— 毕竟这是最容易被双方同时想到的分法。
  • 风险上策思路:如果担心对方要得很多,报一个略低一点的数(如 4000 或 4999)能保证在对方要求 ≤ 6000/5001 时成交, 牺牲一点收益换取成交概率。要求越接近 10000,一旦对方也要得多就血本无归。
  • 相关均衡思路:如果允许事先约定(抛硬币决定谁拿大头),双方都能避免"钱被没收"这个最差结果, 期望收益可能高于各自冒险。

所以一个稳妥的答法是:先说清楚均衡是 s₁ + s₂ = 10000 这一整条线(无穷多个), 再说实际选择取决于对对方的判断;在这个博弈里"公平对半分"是最显著的聚点,因此 5000 是常见的选择, 而风险规避者会略低于 5000。

8设古诺模型中有 n 家厂商。qi 为厂商 i 的产量, Q = q₁+…+qn 为市场总产量,P = P(Q) = aQ(当 Q < a 时,否则 P = 0)。 假设厂商 i 生产 qi 产量的总成本为 Ci = c qi, 即没有固定成本且各厂商边际成本都相同,为常数 cc < a)。 假设各厂商同时选择产量,该模型的纳什均衡是什么?当 n 趋向于无穷大时博弈分析是否仍然有效?

(1)纳什均衡。厂商 i 的得益(利润)为

ui = qi(aQ) − c qi = qi(acQ)

对自家产量求偏导并令其为 0(这就是反应函数的求法):

uiqi = (acQ) − qi = 0

由对称性令所有 qi = qQ = nq),得

acnqq = 0 ⟹ qi* = acn + 1 , 总产量 Q* = n(ac)n + 1

市场价格 P* = aQ* = c + (ac)/(n+1), 每家利润 ui* = (ac)²/(n+1)²。

验算两个特例:

  • n = 2、a = 8、c = 2:q* = 6/3 = 2 ✓ —— 正是 2.3.1 节的结果。
  • n = 1:q* = (ac)/2 —— 垄断厂商的最优产量 ✓(与 (0,3) 那个点的含义一致)。

(2)当 n 趋向于无穷大时,博弈分析是否仍然有效?—— 仍然有效,而且给出的结论很有意义。

看极限行为:

n → ∞ 时: qi* = (ac)/(n+1) → 0 , Q* → ac , P* → c , ui* → 0

也就是说:厂商数越多,纳什均衡越接近完全竞争的结果 —— 价格趋近于边际成本,利润趋近于零。 这与微观经济学中"完全竞争市场长期利润为零"的结论完全一致,说明古诺模型把完全竞争当作厂商数趋于无穷的极限情形, 是它的合理推广。

关于"博弈分析是否仍然有效"的几点说明:

  • 纳什均衡概念本身依然适用。策略数是无限的(产量连续),但 2.5.2 节的扩展定理保证了: 策略空间是紧凸集、得益函数连续且拟凹时,纯策略纳什均衡存在 —— 本例完全满足。
  • 反应函数法也依然可用,只是从"两条直线的交点"变成"n 条直线的共同交点", 靠的是对称性假设把 n 个方程化成一个。
  • 要注意的是效率含义:均衡利润趋于 0,说明厂商数增加本身就是一种"竞争性的效率改进", 但同时也意味着行业里没有一家能赚钱 —— 这正是书里反复强调的"自由竞争同样存在低效率问题"的另一面。
9两寡头古诺模型,P(Q) = aQ 等与上题相同, 但两厂商的边际成本不同,分别为 c₁ 和 c₂。 如果 0 < ci < a/2,问纳什均衡产量各为多少? 如果 c₁ < c₂ < a,但 2c₂ > a + c₁,则纳什均衡产量又为多少?

(1)0 < ci < a/2 时:两家都生产(内点解)。

分别对两家的利润求偏导并令其为 0:

u1 = q1(aq1q2) − c1q1 ⟹ a − 2q1q2c1 = 0
u2 = q2(aq1q2) − c2q2 ⟹ aq1 − 2q2c2 = 0

解这个二元一次方程组得

q1* = a − 2c1 + c23 , q2* = a − 2c2 + c13

条件 0 < ci < a/2 的作用正是保证这两个解都是正的(即内点解成立): 由 2c₁ < aa − 2c₁ + c₂ > c₂ > 0 ✓,同理另一方也正。 成本低的一方产量更高

(2)c₁ < c₂ < a,但 2c₂ > a + c₁ 时:只有厂商 1 生产(角点解)。

把条件代入上面的公式:q₂* = (a − 2c₂ + c₁)/3。 由 2c₂ > a + c₁ 得 a − 2c₂ + c₁ < 0, 即"公式解"给出的 q₂* 是负数

产量不可能为负,所以这是角点解:厂商 2 的最优选择是不生产,退出的原因是成本太高、生产无利可图。 此时厂商 1 独占市场,按垄断者决策:

u1 = q1(aq1) − c1q1 ⟹ q1* = (ac1)/2 , q2* = 0

验证厂商 2 确实不愿进入:给定 q₁* = (ac₁)/2,厂商 2 的最佳反应是

q2 = ac2q1*2 = a + c1 − 2c24 < 0 (由 2c2 > a + c1

最佳反应为负意味着厂商 2 的最优产量就是 0 —— 角点解自洽 ✓。

这道题的核心考点:用偏导数法解古诺模型时,解出来的产量必须检查非负性。 当成本差异足够大时,高成本厂商会退出市场,均衡从"内点"变成"角点"。 这也是这类题最常见的失分点 —— 只写出公式解而不检验条件。

10甲、乙两公司分属两个国家,在开发某种新产品方面有下面得益矩阵表示的博弈关系(单位:百万美元)。 该博弈的纳什均衡有哪些?如果乙公司所在国政府想保护本国公司利益,有什么好的方法?
行 · 甲公司
列 · 乙公司
乙公司
开发不开发
甲公司开发 −10, −10100, 0
不开发 0, 1000, 0

(1)纳什均衡有两个:(开发,不开发)和(不开发,开发)。

  • (开发,不开发):给定乙不开发,甲开发得 100 > 不开发得 0 ✓;给定甲开发,乙不开发得 0 > 开发得 −10 ✓ → 纳什均衡。甲得 100,乙得 0。
  • (不开发,开发):对称,乙得 100,甲得 0。

其余两格都不是均衡:(开发,开发)虽然是"双方都努力",但各亏 10,任一方改选"不开发"就能回到 0,因此不稳定; (不开发,不开发)则是双方都错失机会,任一方单独开发就能得 100。

这个结构就是 2.4.2 节的市场机会博弈(图 2.24)—— 两个纯策略纳什均衡,分别对一方有利, 而且双方对两个均衡的偏好完全相反,所以仅靠纳什均衡分析无法确定结果。 混合策略纳什均衡是双方各以(2/3, 1/3)选择开发与不开发,期望得益为 0。

(2)乙国政府可以怎么做?——给乙公司补贴,把"开发"变成乙公司的上策。

看乙公司的得益:甲开发时,乙开发得 −10、不开发得 0,所以乙会选不开发;甲不开发时,乙开发得 100、不开发得 0,乙会选开发。 "开发"不是上策,乙的选择取决于甲的动向,于是甲就敢开发、把乙挤出去。

如果政府给予额度为 s 的补贴(如研发补贴、税收返还、政府采购承诺),使乙在两格下的得益都变得"开发更好":

甲开发时:−10 + s > 0 ⟹ s > 10 ; 甲不开发时:100 + s > 0 恒成立

只要 s > 10(本例即补贴超过 1000 万美元),"开发"就成为乙公司的上策 —— 不管甲怎么做,乙开发都更好。此时甲知道乙一定会开发,而甲在乙开发时: 自己开发得 −10、不开发得 0,于是甲的最优选择变成不开发

结果:博弈的均衡从"两国各占一半机会"变成确定的 (不开发,开发),乙稳拿 100(扣掉补贴后仍为正), 甲退出。政府花不超过 100 的补贴,换来了本国公司独占 100 的收益。

更一般的答法:凡是"两个均衡分别对一方有利、且双方偏好相反"的博弈, 政府可以通过改变本国公司的得益结构(补贴、承诺采购、提供担保)来把某个策略变成占优策略, 从而把均衡锁定在对自己有利的那一个。这与第四章"重复博弈"里的承诺问题、以及第六章之后的 "信号传递"思想是同一个道理:让对手相信你的行动不受他影响,比事后临时反应更有力。

11设一个地区选民的观点标准分布于 [0,1] 上,竞选一个公职的每个候选人同时宣布他们的竞选立场, 即选择 0 到 1 之间的一个点。选民将投票给立场与自己最接近的候选人。例如两个候选人立场分别为 x₁ = 0.4 和 x₂ = 0.8, 那么观点在 x = 0.6 左边的所有选民都会投候选人 1 的票,右边的都会投候选人 2,候选人 1 将以 60% 的选票获胜。 再设如果有候选人的立场相同,那么立场相同的候选人将平分该立场所获得的选票,得票领先的候选人票数相同时则用抛硬币决定哪个候选人当选。 假设候选人唯一关心的只是当选(即不考虑自己对观点的真正偏好), 如果有两个候选人,问纯策略纳什均衡是什么?如果有三个候选人,也请作出一个纳什均衡。

这是经典的霍特林(Hotelling)选址博弈,也叫"选票竞争"或"冰淇淋小贩问题"。

(1)两个候选人:(0.5, 0.5)是唯一的纯策略纳什均衡。

先看为什么不在中点就不稳定。设两人立场分别为 a < b。此时分界点在 (a+b)/2 处,候选人 1 得票 (a+b)/2,候选人 2 得 1 − (a+b)/2。

  • a < b,候选人 1 只要把立场稍微向右移(趋近 b),分界点右移,自己的得票增加 —— 所以 a < b 时候选 1 一定有动机向右靠。
  • 对称地,候选人 2 一定有动机向左靠。
  • 因此两人立场不同时不可能稳定 —— 双方都会向中间挤。

再看相同的情况。设两人都在 x。若 x < 0.5,则候选人 1 稍微向右移一点, 就能获得 x 右侧几乎全部选民,得票从 50% 跳到接近 (1+x)/2 > 50%,所以有动机偏离。 若 x > 0.5,对称,候选 2 有动机向左移。只有当 x = 0.5 时, 谁向任何一侧移动都只会失去自己那半边选票 —— 没人愿意动。

所以(0.5, 0.5)是唯一的纯策略纳什均衡。含义:双方立场向中间收敛,政策趋同,各得 50%。

(2)三个候选人:不存在纯策略纳什均衡 —— 这一点与题目问的"作出一个"正好相反,需要说明。

先检验几个自然候选,都会失败:

  • (0, 0.5, 1):三人分别得 25%、50%、25%。但站在 0 的人只要稍微右移就能抢到 [0, 0.5] 这段的大部分,得票超过 25% → 有动机偏离。
  • (1/4, 1/4, 3/4):前两人各得 25%,第三人得 50%。但第三人只要移到 1/2, 就能包下 [0.375, 1] 共 62.5% 的选票 > 50% → 有动机偏离。

一般性证明:设有三人立场 a < b < c(至少有两个不同位置)。

  • 最左边的候选人 a:得票为 [0, (a+b)/2],长度 (a+b)/2。 他只要向右移动 ε,得票变为 (a+ε+b)/2,严格增加 ε/2。所以 a 一定有动机右移。
  • 最右边的候选人 c:对称地,一定有动机左移。
  • 三人全在同一位置时,每人得 1/3;但任一人稍微移开,就能获得近一半的选票(> 1/3),同样有动机偏离。

因此任何位置组合都至少有一位候选人可以通过移动增加得票,纯策略纳什均衡不存在。

那该怎么回答这道题?—— 指出"纯策略均衡不存在",再给出由纳什定理保证的混合策略纳什均衡是存在的 (三人各以连续分布随机选址),这是数学上正确的答法。书里 2.5 节的纳什定理保证了有限博弈的混合均衡存在; 本博弈策略空间虽连续,但 2.5.2 节的扩展定理(紧凸策略空间 + 连续拟凹得益)同样覆盖它。

💡这道题真正想让你注意的

候选人从 2 个增加到 3 个,博弈的性质发生了质变:两个候选人时结果高度确定(都站中间), 三个候选人时反而完全不确定。这正是第一章"多人博弈可能有本质不同的性质"那句话的实例, 也和 2.3 节"破坏者"的意思相通 —— 第三个进入者改变了整个博弈的结构。

12运用本章的均衡概念和思想讨论下列得益矩阵表示的静态博弈。
行 · 博弈方1
列 · 博弈方2
博弈方 2
LR
博弈方 1U 6, 62, 7
D 7, 20, 0

这是一道综合讨论题,按"先找均衡 → 再作精练 → 最后说效率"三层来写最完整。

第一层:纯策略纳什均衡有哪些?

先求各方的最佳对策:博弈方 1 对 L 选 D(7 > 6)、对 R 选 U(2 > 0); 博弈方 2 对 U 选 R(7 > 6)、对 D 选 L(2 > 0)。逐格核对:

  • (U, R):给定 R,博弈方 1 选 U 最优 ✓;给定 U,博弈方 2 选 R 最优 ✓ → 纳什均衡,得益(2, 7)。
  • (D, L):给定 L,博弈方 1 选 D 最优 ✓;给定 D,博弈方 2 选 L 最优 ✓ → 纳什均衡,得益(7, 2)。
  • (U, L)与(D, R)都至少有一方想离开,都不是纳什均衡。

第二层:多重均衡怎么选?—— 这是本题的关键难点。

概念在本博弈中的适用性
帕累托上策均衡 不适用。两个均衡的得益分别是(2,7)和(7,2),一个对博弈方 1 有利、一个对博弈方 2 有利, 不存在任何一方在两个均衡中都更好的情形,因此没有帕累托上策均衡。这与夫妻之争、市场机会博弈同类
风险上策均衡 让对方两个策略等概率(各 1/2)时:博弈方 1 选 U 的期望 = (6+2)/2 = 4, 选 D 的期望 = (7+0)/2 = 3.5 → 偏向 U。博弈方 2 选 L 的期望 = (6+2)/2 = 4, 选 R 的期望 = (7+0)/2 = 3.5 → 偏向 L。但双方偏好的组合(U, L)不是纳什均衡, 所以这个博弈也没有风险上策均衡
聚点均衡 可能适用但很弱。两个均衡对双方完全对称,并没有哪个更"自然"。唯一可能的聚点是某种 规则外的共同知识(如"上次是谁先选的"、双方的习惯等),不像"中午 12 点"那样有强聚点
相关均衡 这才是本题最有价值的出路。双方可以事先约定一个协调机制(如抛硬币决定谁选 L 谁选 R), 使(U, R)和(D, L)各以 1/2 出现,期望得益都是 (2+7)/2 = 4.5高于各自冒险。更妙的是还可以设计相关信号把双方都更好的(U, L)(双方都得 6)部分纳入

第三层:效率讨论 —— 这个博弈的"囚徒困境"在哪里?

把四个结果的得益总和列出来:

结果博弈方1博弈方2总和是否纳什均衡
(U, L)6612
(U, R)279
(D, L)729
(D, R)000

三条结论:

  • (U, L)是总得益最大、且双方最"公平"的结果(各得 6),但它不是纳什均衡。 这正是本题最像囚徒困境的地方 —— 每个人都想偷偷多占一点(博弈方 1 想改选 D 拿 7,博弈方 2 想改选 R 拿 7), 结果反而谁也拿不到 6。
  • 两个纳什均衡的总得益(都是 9)低于非均衡的(U, L)(12)。 这是变和博弈的典型特征:均衡未必是总得益最大的结果(对比 1.3.3 节的分类与第二章古诺模型的同款结论)。
  • (D, R)是最差结果,而它恰恰是"双方都选择对对方最不友好的策略"的组合。 这与 2.4.2 节市场机会博弈里的"两败俱伤"位置完全同构。

综合结论。本博弈属于 2.6 节所讨论的"多重纳什均衡且无帕累托优劣关系"那一类: 纳什均衡分析能告诉你有两个均衡,但不能告诉你哪一个会出现;风险上策在这里也无从下手(双方偏好的组合不是均衡)。

出路在相关均衡:通过事先约定的协调机制(共同遵守一个信号规则),双方能把期望得益提高到 4.5, 甚至可以通过更精细的相关装置部分实现双方都更好的(U, L)。 而如果双方能够直接沟通并建立有约束力的协议,那就跳出了非合作博弈的范畴 —— (U, L)作为合作解对双方都最优。这也正是这道题把本章所有均衡概念串起来的地方。

3

自测进度

两章 19 题

19 道章末思考题全部是"查看答案"型,展开任意一道即计入进度。答案由本工作台依据正文推导,原书未附答案。

0 / 19 题已展开
2

本章基本概念

书页 39

原书列出的两章基本概念表,加上一句话释义:

概念一句话释义
博弈各博弈方面对一定环境条件、在一定规则下,同时或先后、一次或多次,从各自允许的策略中选择并实施,各自取得相应结果的过程
博弈论系统研究博弈问题,寻求在充分或有限理性、能力条件下合理策略选择及其结果,并分析其经济意义与效率意义的理论和方法
博弈方博弈中独立决策、独立承担博弈结果的个人或组织
策略博弈中各博弈方的决策内容,即行为取舍、经济活动水平等的选择
策略组合每个博弈方各取一种策略所构成的一个结果
博弈次序各博弈方作出选择的先后关系;次序不同一般就是不同的博弈
得益各博弈方从博弈中所获得的利益,可正可负,是分析博弈模型的标准和基础
得益矩阵用二维矩阵表示博弈的策略组合与对应得益的常用方法
扩展形用节点、连线与终端表示博弈的树形方法,能反映选择与行为的先后次序
囚徒的困境两个博弈方各自追求个体最大利益、最终得到对双方都不理想结果的经典博弈
单人 / 两人 / 多人博弈按博弈方数量划分;单人博弈已退化为最优化问题,多人博弈可能存在"破坏者"
有限博弈 / 无限博弈按策略数量划分;有限博弈总可列举,无限博弈只能用数集或函数式表示
零和 / 常和 / 变和博弈按得益总和划分:恒为 0 / 恒为某非零常数 / 随结果而变。变和 ⊃ 常和 ⊃ 零和
静态 / 动态 / 重复博弈按过程划分:同时选择 / 有先后且后者能观察到前者 / 同一博弈反复进行
完全信息 / 不完全信息得益是否众所周知划分
完美信息 / 不完美信息博弈过程是否被观察到划分,只对动态博弈有意义
个体理性 / 集体理性以个体利益最大化为目标 / 以集体利益最大化为目标
合作博弈 / 非合作博弈是否允许存在有约束力的协议;这是博弈论最基本的分类
完全理性 / 有限理性有完美分析判断能力、不犯选择错误 / 判断选择能力有缺陷
💡复习时的一句话自检

合上工作台,试着对任意一个决策问题回答六个问题:几个人?几种策略?得益总和变不变?同时还是先后? 得益和过程大家都看不清?他们理性吗、合作吗?六个都答得出来,这一章就过关了—— 因为后面十章要讲的,无非是这六个答案的不同组合。