第12章已经把博弈思想用于寡头竞争:古诺、斯塔克尔伯格、伯特兰、囚徒困境和重复博弈。第13章把这些工具抽象成一套通用语言,用来回答三个问题:
本章的主线是:
博弈(game)是参与者在相互影响的环境中选择策略的决策问题。一个参与者的收益不仅取决于自己的行动,也取决于其他参与者的行动和反应。因此,单独研究“自己的最优选择”不够,还必须考虑对手的决策。
博弈至少包含:
合作博弈允许参与者通过谈判制定具有约束力的共同策略。只要协议确实能够被执行,参与者就可以把共同协议作为决策约束。
非合作博弈不允许参与者达成具有约束力的协议,或者不允许他们相互协调。每个人优先考虑自己的利益和个人最优策略;结果可能有效,也可能出现集体效率损失。现代微观经济学的竞争策略分析主要使用非合作博弈。
策略(strategy)是参与者在博弈中遵循的行动规则或行动计划。它不仅是某一个时点的动作,还应说明在不同信息节点上将如何行动。
最优策略是使参与者预期收益最大的策略。由于最优策略取决于对手的策略、行动顺序和信息,不能脱离博弈环境孤立判断“这一步看起来是否合理”。
如果无论竞争者采取什么策略,某一策略带来的收益都不低于其他策略,并且至少在一种情况下严格更高,那么它是严格占优策略。
如果每个参与者都有严格占优策略,且每个人都采用自己的占优策略,我们称相应的结果为占优策略均衡。
占优策略的判断顺序是:固定对手的一列或一行,比较本方各行动的收益;对所有对手行动都完成比较后,才能宣布某策略占优。不能只看一格收益就下结论。
是。因为在占优策略均衡中,给定对手的策略,每个参与者采用的策略已经是自己的最优策略,不存在单方面偏离获利的可能,所以它一定是纳什均衡。
但反过来不成立:纳什均衡不一定包含占优策略。很多协调博弈没有严格占优策略,却有一个或多个纳什均衡。
纳什均衡(Nash equilibrium)是一组策略组合,在给定其他参与者策略的条件下,每个参与者都选择了自己的最优策略。也就是说:
其中 是参与者 的均衡策略, 表示其他参与者的均衡策略。
直觉上,纳什均衡是“给定别人不改,我也不想单独改”的状态。它不等于“大家都最满意”,也不等于社会总剩余最大。
帕累托有效(Pareto efficient)要求不存在另一种可行结果,能让至少一方变好且不让任何一方变坏。纳什均衡只描述个人在给定对手行动时没有单方面偏离激励,二者衡量的对象不同。
囚徒困境中,双方背叛是纳什均衡,但双方合作可以让两个人都更好,因此背叛均衡不是帕累托有效。这一例子说明:市场或博弈机制可能使个人理性与集体有效发生冲突。
方法一:最佳反应法。
方法二:反应函数法。 连续策略的古诺模型中,写出每家厂商的反应函数,两条反应函数的交点就是纳什均衡。第12章的 与 正是这种方法。
纯策略(pure strategy)是确定性行动规则:在给定信息下,参与者明确选择某一个行动。例如,在价格博弈中始终报,在进入博弈中进入后始终容纳,都是纯策略。
混合策略(mixed strategy)不是每次都机械地选择同一行动,而是按照概率在多个纯策略之间随机选择。例如,以概率 降价、以概率 维持价格。
混合策略的作用是使对手无法通过确定性反应获得额外优势。求二人有限博弈的混合均衡时,通常令每个参与者在其支持集内的几个纯策略具有相同的期望收益,再解出概率。
纳什定理指出:有限博弈至少存在一个纳什均衡,均衡可以是纯策略,也可以是混合策略。不能因为找不到纯策略均衡,就断言“没有纳什均衡”。
极大化极小策略(maximin strategy)是先考虑自己在对手最不利行动下的最低收益,再选择使这个最低收益尽可能大的策略:
它是一种安全策略,适用于参与者对对手行为和信息缺乏把握、宁愿保障最坏结果的场景。极大化极小策略不必等于纳什均衡,也不必等于利润最大化策略;纳什均衡要求的是在实际均衡策略组合下没有单方面偏离,而极大化极小只关注最坏情况。
重复博弈是同一结构的博弈反复进行,每一次称为阶段博弈。第12章已经推导了无限(或未知终止期)重复博弈、以牙还牙策略和有限重复博弈的逆向归纳。本章只保留分类结论:
答题时不要把“重复次数很多”直接等同于“合作一定成立”,还要说明终止期是否已知以及参与者是否足够重视未来。
序贯博弈(sequential game)中,参与者不是同时行动,而是按照某种顺序行动;后行动者可以观察先行动者的行动或至少知道其结果,再作出自己的反应。斯塔克尔伯格产量模型就是序贯博弈:领导者先选产量,追随者观察后再选择产量。
在产量竞争中,先行动者可以先承诺较大的产量,从而把竞争者的行动空间压缩到一个较低的反应水平,通常获得先发优势。领导者的优势来自可信承诺,不是“只要先动就自然获胜”。
先行动者未必在所有竞争中占优:在价格竞争中,先报价可能给后行动者留下降价抢市场的机会;若先行动者的行动无法承诺,后行动者也会把它视为暂时声明而不是约束。
序贯博弈可以用博弈树表示。树的节点是行动时点,分支是可选行动,末端是收益。一个完整策略必须写出参与者在自己可能到达的每一个信息节点上将怎么做。
先行动者
├─ 行动 A
│ ├─ 后行动者选 X → 末端收益
│ └─ 后行动者选 Y → 末端收益
└─ 行动 B
├─ 后行动者选 X → 末端收益
└─ 后行动者选 Y → 末端收益
策略性行动(strategic behavior)是参与者主动限制自己的行动空间,以改变对手的预期,从而为自己带来更有利的结果。脱离博弈环境看,这种行动可能显得“不理性”;但只要对手会据此改变反应,它就可能是理性的。
例如,厂商可以公开宣布:只要某一消费者获得折扣,就会把过去的所有消费者都改为折扣价。这个承诺可能损害厂商眼前的收入,但它向竞争者传递“不主动打价格战”的信号,目标是让竞争者也不降价。
空头威胁(empty threat)是指威胁者口头声称会采取某行动,但真正到达该决策节点时并没有实施该行动的理性动机。如果威胁者是理性的,竞争者就不会把这种声明当作约束。
典型例子是既有厂商对潜在进入者说:“你一进入,我就把价格降到亏损水平,发动价格战。”如果进入后既有厂商打价格战的收益低于容纳进入者,它实际上不会这样做;潜在进入者预见到这一点,就不会被空头威胁吓退。
要让威胁可信,厂商必须通过策略性行动限制自己未来的选择,使“实施威胁”在真正到达节点时变成最优行动。常见方式包括:
承诺的本质是改变对手对未来反应的预期,而不是靠语言把一个本来不愿执行的行动说得更强硬。
进入壁垒是既有厂商阻止竞争者的主要来源,可能来自规模经济、专利、许可证、关键资源或战略性投资。分析进入阻止问题时,按两阶段做逆向归纳:
如果进入后既有厂商最优是容纳,那么“进入就打价格战”的声明是空头威胁,进入者通常会进入;如果既有厂商已经通过可验证的沉没投资使价格战成为进入后的最优行动,威胁才可信,进入者才可能被阻止。
讨价还价是一个非零和博弈:参与者之间对分配结果存在利益冲突,但双方又有共同利益,即避免谈判失败和两败俱伤。每个人都要在“争取更大份额”和“达成协议避免损失”之间权衡。
拍卖是通过竞标实现买卖的一种交易方式。拍卖规则规定谁可以报价、报价如何公开、何时停止以及最终价格如何确定。不同规则会改变参与者的最优出价策略。
英式拍卖从一个较低价格开始,潜在买者不断报出更高价格。所有参与者都知道当前最高报价;当没有人愿意再提高报价时,拍卖结束,物品卖给最高报价者,成交价是最高报价。
荷式拍卖先给出一个较高价格,再逐步降低,直到某个买者愿意接受当前价格。第一个接受价格的买者获得物品,并按当时价格支付。
英式是“价格向上、等待最后竞争者退出”,荷式是“价格向下、先接受者获胜”;二者都公开报价,但行动时点和信息结构不同。
在密封投标拍卖中,所有投标同时秘密提交,参与者不知道其他人的报价。最高报价者获胜,但支付价格取决于拍卖规则:
一级密封:最高报价者获胜 → 支付自己的报价
二级密封:最高报价者获胜 → 支付第二高报价
二级密封价格拍卖又称维克里拍卖,规则上把“赢不赢”和“支付多少”部分分开,因此与一级密封价格拍卖的出价激励不同。
私人价值(private value)拍卖中,每个投标者都准确知道物品对自己的价值,但不同投标者的价值不同。例如,某件收藏品对不同收藏者的偏好价值各不相同。
一个投标者可以估计别人可能如何出价,但别人的估计不会改变自己对物品的私人价值。分析私人价值拍卖时,重点是比较自己的估值、出价成本和不同拍卖规则,而不是推断物品对所有人的共同真实价值。
共同价值(common value)拍卖中,物品对所有投标者的真实价值相同,但这个价值事前未知,参与者只能根据各自信息估计。例如,近海石油储备的共同价值可以理解为石油价格减去开采成本;所有投标者面对的是同一储量和成本,但对储量或成本的估计可能不同。
赢者诅咒(winner's curse)主要出现在共同价值拍卖中:最高报价者往往也是最乐观、最可能高估物品价值的人。结果是他虽然赢得拍卖,却可能支付了高于真实价值的价格,获胜反而带来较差收益。
因此,共同价值拍卖的投标者不能只问“我愿意支付多少”,还要问“为什么恰恰是我的估计成为所有估计中最高的”。私人价值拍卖通常没有同样意义上的共同价值赢者诅咒,但投标者仍应考虑信息、竞争者和规则。
博弈论研究的是相互依赖的决策。策略是完整行动规则,占优策略不依赖对手行动,纳什均衡要求给定对手策略时每个人都在做最优反应;占优策略均衡一定是纳什均衡,但纳什均衡不一定包含占优策略,更不保证帕累托有效。纯策略确定行动,混合策略按概率随机化,极大化极小策略只保护最坏结果。
序贯博弈要画博弈树并逆向归纳,先行动优势必须以可承诺为基础。空头威胁在真正到达节点时不值得实施,只有通过沉没投资、合同或制度限制未来选择,威胁才能变成可信承诺。进入阻止、讨价还价和价格竞争都可以按“先找后续子博弈最优反应,再回到前一阶段”的顺序处理。拍卖题则先识别公开/密封、升价/降价、一级/二级支付和私人价值/共同价值;共同价值环境还要检查赢者诅咒。