博弈论
第 1 章 · 20 分钟

最小对象:策略、结果、偏好

把互动写成什么,以及「理性」在这里的确切含义。

概念地图
形式化
把互动写成玩家、策略、结果与偏好四件事。
深色为本章概念,浅色为其他章
陪练模式
不想只是读?让它带你走一遍。
导师把这一章拆成小步,每一步先问你,再讲;你用自己的话答,它先认下对的部分再纠偏。用你自己的 AI,对话只存在这台设备上。
对话只存在本机
定位01

延伸阅读

冯·诺依曼与摩根斯特恩 · 1944 年 · 《博弈论与经济行为》
第一次把互动决策写成形式对象,并给出零和二人博弈的完整解。他们反对的是把经济行为当作单人对自然的最优化;代价是零和之外的情形当时没有解概念,整本书的适用范围比书名窄得多。
奠基
纳什 · 1950 年前后 · 非合作博弈与均衡的存在性
把解概念推广到任意有限博弈,并证明混合策略下均衡必存在。这一步让「非零和」进入视野,代价是均衡通常不唯一,此后半个世纪的精炼工作都在处理这个代价。
转向
谢林 · 1960 年 · 《冲突的战略》
指出多均衡时真正起作用的是共同的显著性与承诺能力,而不是更精细的计算。这是对「均衡即预测」这一读法最持久的反例一线。
反例
博纳诺 · 开放教材《Game Theory》
本课对象。教材把定义与定理分得很干净,也因此把「这个形式对象代表现实中的什么」这一步基本留给了读者——本课把它单独拎出来处理。
本课对象
机制02

四件事压缩

要把一次互动变成可算的对象,只需要四样东西:谁在选、每人能选什么、选完得到什么结果、每人怎么排序这些结果。把这四样写下来就得到一个策略式。这一步做的是压缩:现实互动里的语气、历史、面子全部被丢掉,只留下这四样。本课后面每一次出问题,几乎都能追溯到某样被丢掉的东西其实要紧。

机制一次互动通过被压成四样东西转成一个可以计算的对象。
可迁移性测试
换到排队叫号系统:把「谁在等、能不能插队、叫到号得到什么、每个人多急」写下来,就能算出插队会不会发生,而不必知道任何人的表情。不同构的地方在于叫号系统的规则是明文写死的,而多数现实互动的规则本身也是参与者可以改的。
机制03

策略要覆盖全部情形

这里的「策略」不是日常说的「打算」。它必须对所有可能面对的情形都给出动作,哪怕其中很多情形在均衡路径上根本走不到。第 4 章会看到,正是那些走不到的情形决定了哪些威胁可信——这不是形式上的洁癖,是整套推理的承重部分。

机制一份完整计划通过为走不到的情形也指定动作使威胁的可信度成为可判定的。
可迁移性测试
换到应急预案:真正让人放心的不是「起火了怎么办」,而是那些几乎不会发生的分支也被写了下来,因为对手正是据此判断你会不会真的执行。不同构的地方在于预案可以事后修改,而博弈里策略一旦被理解为已确定,修改本身要单独建模。
推导04

从四件事到「理性」的确切含义

这一段要证的是:本课全书用的「理性」只承诺一件事,比日常用法弱得多。

玩家集合 与每人的策略集合 给定且有限
定理前提。去掉有限性,第 6 章的存在性定理需要另外的连续性条件才成立。
每人对结果有一个完全且传递的排序 (读作「i 至少不差于」)
定理前提。去掉完全性,最优反应可能不存在;去掉传递性,「更好」不再能排成序。
每人只关心自己的排序
定理前提,也是最常被误读的一条:它不排除利他,利他会写进排序本身。
推导 · 0 / 4
推导实例05

利他不违反「只关心自己的排序」

甲宁可自己少拿一块钱让乙多拿两块。这与第三条前提矛盾吗?
先分清「结果」是什么,再看排序定义在什么上面。
裂缝06

本章命题的边界

争议地形07
本书主张
把互动压成玩家、策略、结果、偏好四件事,是分析互动决策的正确起点;这一步丢掉的东西可以在需要时再加回模型。
另一种看法
行为与演化一线主张:被丢掉的东西(有限计算、学习、模仿、情境框架)不是可以事后加回的修饰,它们改变的是均衡本身;演化博弈用复制动态取代最优反应,得到的稳定点与纳什均衡集合并不一致。
分歧扎在
分歧扎在「最优反应是否是行为的正确原语」这一条上,而不在数学上。两边都同意策略式写法是清楚的,争的是那个被压缩掉的部分能不能作为二阶修正处理。
什么证据能裁决
能裁决它的是重复互动实验中的收敛点:让被试在同一博弈上反复对局并给出反馈,看长期频率收敛到纳什均衡还是收敛到复制动态的稳定点。两者在某些博弈(如剪刀石头布的非对称版本)上预测不同,可以直接分辨。
目前的证据把天平压向「取决于博弈结构」:在均衡唯一且占优可解的博弈上两者一致,在多均衡与循环结构上演化预测更接近观测。还差的是把学习速度与人群构成分开的手段——两者都会改变收敛点。
边界与反例08

把「四件事压缩」的建模承诺写成可检验的规格

要检验的建模承诺是「四件事压缩」:一次现实互动可以由固定的玩家、策略、结果与稳定排序四元组代表。

去掉哪条假设:偏好排序在同一情形下保持不变
这是压缩能成立的关键;参与者若被互动本身改变了偏好,四元组就不再代表它。
该情形下的具体反例:同一人在同一物质结果上,因描述方式不同而给出相反选择
此时不存在单一排序能同时表示两次选择。
这条承诺对应的可观测量:同一被试在同一物质结果集合上的重复选择
必须是物质结果相同、只有呈现不同的成对题目。
什么观测算它不成立:成对题目上出现系统性反转,比例超过事前登记的阈值
阈值按「多大反转会让四元组失去代表性」事前定死。
事前登记的失败条件:反转比例超过阈值,或选择出现可重复的循环
两者都按承诺不成立处理。
推导 · 0 / 3
接口09
挂在哪个槽位
挂在哪个槽位你已有的那条结论多半是「博弈论假设人是理性自私的,所以它不适用于真实的人」——一条关于适用范围的判断。本章要动的是它的前半句。
本章对你已有的结构做的是 (a) 替换「理性自私」这个前提的内容,还是 (b) 约束你对博弈论适用范围的判断?
慢变量登记两个慢变量:你手上有几次互动能真的写出完整的四元组,以及其中有几次参与者的偏好在过程中变了。三天后先看第二个。
小结10
本章小结
01策略式是一次压缩:只留玩家、策略、结果、偏好四样。
02效用函数是排序的记号,任何保序变换给出同一套偏好。
03「理性」在本课只意味着取最优反应,不含预见、不含正确信念、不含自私。
04策略必须覆盖走不到的情形,否则威胁的可信度无法判定。
05唯一承担观测风险的是「排序稳定」这条建模承诺,而不是任何数学结论。
提取练习 · 合上书,先自己答一遍。
?「效用函数只是把排序写成数」是 (a) 由定义得到的 还是 (b) 关于现实的建模承诺?
?甲宁可少拿一块让乙多拿两块,违反的是 (a) 第三条前提 还是 (b) 什么都不违反?
受迫二选一11

B 标签辨识

「效用函数满足 当且仅当 」这一步是什么?
二选一
受迫二选一12

D 接口判断

哪一条能挂进你已有的结构?
二选一
读到这里,把它记为已读。