概念地图
扩展式
把先后顺序写进树,策略变成对每个节点的完整计划。
深色为本章概念,浅色为其他章
陪练模式
不想只是读?让它带你走一遍。
导师把这一章拆成小步,每一步先问你,再讲;你用自己的话答,它先认下对的部分再纠偏。用你自己的 AI,对话只存在这台设备上。
定位01
延伸阅读
策梅洛 · 二十世纪一十年代 · 有限完美信息博弈的可解性
证明了国际象棋这类有限完美信息博弈在原则上有确定的结果。他反对的是把这类对局看成不可分析的技艺;代价是「原则上」与「算得出来」之间隔着组合爆炸,这条鸿沟至今没有被填上。
奠基
泽尔滕 · 1965 年前后 · 子博弈完美
指出纳什均衡可以靠不可信威胁支撑,因而提出在每个子博弈上都要成立的加强条件。这一步反对的是把纳什均衡当作序贯博弈的终点;代价是精炼在信息不完美时还需要进一步的信念条件。
转向
蜈蚣博弈的实验一线 · 上世纪九十年代起
在逆向归纳预测立刻停止的博弈里,被试往往合作若干轮。这是对「逆向归纳是对人的预测」这一读法最直接的反例。
反例
博纳诺 · 开放教材关于扩展式与逆向归纳的章节
本课对象。教材把「策略必须指定所有节点的动作」讲得很明确,本章要说清这条形式要求为什么承载了全部关于可信度的推理。
本课对象
机制02
把顺序写进树
策略式丢掉了先后,而先后正是承诺能不能起作用的全部依据。库恩一线用来补回它的表示法是扩展式。换了表示之后,第 1 章那句「策略要覆盖全部情形」才显出分量:均衡路径之外有大量走不到的位置,策略必须对它们也表态,而下一块会说明整章的推理全部压在这些位置上。
机制先后顺序通过被写成树的层次让「后动者看到什么」成为模型的一部分。
可迁移性测试
换到审批流程:把「谁先签、后签的人能不能看到前面的意见」画成流程图之后,才能讨论前一环的签字会不会影响后一环。不同构的地方在于流程图通常只画会发生的路径,而扩展式必须把不会发生的分支也画全。
机制03
走不到的节点决定可信度
上一章的质保条款例子里,那句「一律索赔」在博弈论里有个专名:不可信威胁。泽尔滕 1965 年前后正是为了把这一类筛掉,才提出了子博弈完美。要紧的是筛选依据落在哪里:全部落在那些走不到的节点上——所以第 1 章那条形式要求不是洁癖,是这一整套推理的承重墙。
机制均衡外的节点通过决定威胁是否会被执行筛掉一部分纳什均衡。
可迁移性测试
换到质保条款:条款写「任何延期一律索赔」,但真延期时索赔的成本高于损失,对方据此判断你不会索赔,条款就不起作用。不同构的地方在于合同可以靠第三方强制执行,从而把不可信变成可信,而博弈里要靠改变自己的收益结构才行。
推导04
从有限完美信息到逆向归纳的解
这一段要证的是:在有限完美信息树上逆向归纳必然给出一个子博弈完美均衡,以及这个结论用掉了哪几条前提。
树有限:节点数与每个节点的分支数都有限
定理前提。去掉有限性,倒推没有起点,整个过程无法启动。
完美信息:每个信息集都是单点
定理前提。存在非单点信息集时,子博弈的划分被打断,逆向归纳无法逐节点进行。
每个节点上的最优动作可选出(无平局,或平局时任选其一)
定理前提。有平局时解不唯一,但至少存在一个。
推导 · 0 / 4
推导实例05
同一个博弈的两个纳什均衡,只有一个可信
在位者与进入者:进入者选进或不进,进入后在位者选打价格战或分享。为什么「威胁打价格战」是纳什均衡却不是子博弈完美?
先算在位者真轮到时的最优动作,再回头看那个威胁站不站得住。
裂缝06
本章命题的边界
争议地形07
本书主张
逆向归纳是序贯理性的直接后果:在每个节点上都取最优动作,得到的组合排除了所有不可信威胁。
另一种看法
有限推理与信念修正一线主张:逆向归纳要求「即使观测到与理论矛盾的行为,仍相信对方今后理性」,这个信念条件本身有内在张力;在长树上,一次偏离就使推理的前提失效。
分歧扎在
分歧扎在「偏离之后该怎么更新信念」这一条上,而不在算法上。逆向归纳的推理默认偏离不改变对未来的判断;对手认为偏离本身就是关于对方类型的证据。
什么证据能裁决
能裁决它的是偏离之后的行为:在蜈蚣博弈中记录一方偏离预测之后另一方的选择。若后续仍按逆向归纳行动,默认信念条件成立;若后续显著转向合作,说明偏离被读成了类型信息。
目前的证据把天平压向「偏离被读成信息」:被试在对方合作一轮后合作概率上升。还差的是把「读成信息」与「单纯的模仿或互惠」分开的设计——两者的行为后果在多数实验里重合。
边界与反例08
把「按逆向归纳行动」的建模承诺写成可检验的规格
要检验的建模承诺是:现实中的人会完成整棵树的倒推,并相信对方也会。
去掉哪条假设:倒推的步数不受限,且相互理性在偏离后仍被保持
这是逆向归纳能对应现实的前提;步数一多,前提就同时在计算与信念两方面吃紧。
该情形下的具体反例:六节点蜈蚣博弈中被试在第一步停止的比例远低于预测的全部
预测是「第一步就停」,观测到的合作轮数直接可比。
这条承诺对应的可观测量:真实支付下首次对局的停止步数分布
首次对局,避免学习混入;支付固定,避免事后拟合收益。
什么观测算它不成立:第一步停止的比例低于事前登记的阈值
阈值按「多低会让逆向归纳失去预测意义」事前定死。
事前登记的失败条件:第一步停止比例低于阈值,或停止步数随树长单调后移
第二种同样按承诺不成立处理:那说明倒推的步数受限。
推导 · 0 / 3
接口09
挂在哪个槽位
挂在哪个槽位你已有的那条结论多半是「先动的人有优势」——一条关于先后顺序的判断。本章要动的是它的条件。
本章对你已有的结构做的是 (a) 替换「先动有优势」这条结论,还是 (b) 约束它:先动的优势来自承诺,而承诺要靠改变自己的收益?
慢变量登记两个慢变量:你最近做出的承诺里有几条改变了自己的收益结构,以及有几条只是措辞更强。三天后先看第二个。
小结10
本章小结
01扩展式把先后写进树,策略因此必须覆盖走不到的节点。
02「逆向归纳给出子博弈完美均衡」是定义展开加归纳,不是关于人的发现。
03不可信威胁能撑纳什均衡,撑不住子博弈完美;分辨依据全在均衡外的节点上。
04非单点信息集打断子博弈划分,无限树没有倒推起点,两条前提各自可以失效。
05承担观测风险的是「人会完成倒推并相信对方也会」这条承诺。
提取练习 · 合上书,先自己答一遍。
?「逆向归纳在有限完美信息树上必然终止」是 (a) 由归纳法得到的 还是 (b) 关于现实的建模承诺?
?「威胁打价格战」不是子博弈完美,靠的是检查 (a) 均衡路径上的动机 还是 (b) 走不到的节点上的动机?
受迫二选一11
A 机制辨识
下面哪一条是机制?
二选一
受迫二选一12
C 裂缝定位
哪个情境下本章框架会给出自信而错误的答案?
二选一
读到这里,把它记为已读。