工具变量的两大核心:如何论证相关性和外生性?需要什么检验?论证角度从何思考?
你研究\"教育年限对收入的影响\"。你知道 OLS 有一个经典的内生性问题——能力($ui$)同时影响教育选择和收入水平,遗漏能力导致教育年限的系数有偏。你需要一个工具变量。
一、开篇:你找到了一个工具变量——然后审稿人问了三个问题,你只回答出了一题
你研究"教育年限对收入的影响"。你知道 OLS 有一个经典的内生性问题——能力()同时影响教育选择和收入水平,遗漏能力导致教育年限的系数有偏。你需要一个工具变量。
你读到了一篇经典论文——Angrist 和 Krueger(1991)用出生季度作为教育的工具变量。逻辑是:义务教育法规定学生在满 6 岁那年的 9 月入学、满 16 岁后可以辍学——出生在年初的孩子比出生在年末的孩子更早达到辍学年龄,因此受教育年限更短。出生季度影响教育年限(相关性)——但出生季度似乎不应该直接影响收入(外生性)。
你决定效仿。你找到了一套工具变量,跑了两阶段最小二乘(2SLS):
ivreg2 income (education = quarter_of_birth), first输出显示:一阶段 F = 18.7(> 10,不错的),一阶段系数 = 0.082(出生季度和教育正相关)。你用这个结果写了论文的初稿。
然后审稿人问了三个问题:
-
"你的工具变量是相关的——一阶段 F 确实大于 10。但大于 10 就够了吗?多大才算'足够强'?"
-
"你的工具变量是外生的吗?你说出生季度'似乎不应该'直接影响收入——但你能证明吗?有没有可能的渠道——比如出生季度影响入学时的成熟度优势、进而影响长期的认知发展——使得出生季度通过教育之外的其他渠道影响收入?"
-
"你有几个工具变量?只有一个吗?如果只有一个,你怎么检验外生性?如果有多个——过度识别检验通过了吗?通过了就说明工具都是外生的吗?"
你的第一个问题还能用 Stock-Yogo 临界值表回答。后两个问题你愣住了——因为外生性在本质上是无法被统计检验完全证明的。
核心信息:工具变量的论证分为两个不对称的部分。相关性(Relevance)是可以被统计检验的 ——一阶段 F 统计量(> 10 是旧标准,> 104.7 是 5% 最坏偏误的新门槛)、弱工具变量的 Stock-Yogo 临界值、有限信息最大似然(LIML)作为弱 IV 下的稳健替代——这些工具提供了清晰、可量化的判断标准。外生性(Exogeneity)是 无法被正式检验的 ——它本质上是一个"排除性限制"(Exclusion Restriction)的论证,只能通过理论和制度的推理、证伪检验(falsification tests)、过度识别检验(当有多个 IV 时)、以及灵敏度分析来"积累证据"而非"提供证明"。论证外生性最有力的角度来自三条路径:(1)制度/自然实验的叙事——为什么这个 IV 的变异来源可以合理地被视为"如同随机"?(2)证伪检验——在理论上不应该存在因果效应的样本中,IV 对 Y 的简约式是否不显著?(3)排除替代渠道——逐一论证为什么 IV 不可能通过 X 以外的其他路径影响 Y。好的工具变量论文不只是报告一阶段 F > 10 和过度识别检验的 p > 0.05——它讲了一个完整的故事:这个工具变量从何而来、为什么它只通过 X 影响 Y、以及你做了哪些努力来让读者相信这一点。
二、工具变量的两个必要条件——什么是相关性和外生性?
2.1 工具变量解决的是什么问题?
标准回归模型:
如果 (X 是内生的——存在遗漏变量、测量误差或反向因果),OLS 的 是不一致的。
工具变量 Z 的引入是为了提取 X 中和 不相关的那个部分的变异——只用这部分干净的变异来识别 。这就是两阶段最小二乘(2SLS):
- 第一阶段:用 Z(和所有外生控制变量)预测 X,得到 。
- 第二阶段:用 替代 X,对 Y 做回归。
2.2 两个必要条件——少了任何一个,IV 就失效了
工具变量 Z 必须同时满足:
条件一:相关性(Relevance)
Z 和内生变量 X 之间必须有足够强的偏相关(在控制了其他外生变量之后)。如果 Z 和 X 的相关太弱——"弱工具变量问题"——2SLS 不仅有偏(向 OLS 的方向偏),而且标准误被低估,推断不靠谱。
条件二:外生性(Exogeneity / Exclusion Restriction)
Z 和结构方程中的误差项不相关。等价地说——Z 对 Y 的影响仅通过 X 这条唯一的路径。Z 不能直接进入 Y 的方程,也不能通过任何未被控制的中间变量间接影响 Y。
两个条件合在一起的意思是:Z 是 X 的一个"外生推动力"——它推动 X 变化,但它自己不在 Y 的方程里。就像一个实验室里的仪器——它通过拨动 X 来间接影响 Y,但它不直接碰到 Y。
2.3 为什么外生性比相关性更难论证?
相关性是一个统计特征——你可以用数据和检验来量化它。外生性是一个因果陈述——"Z 不影响 Y,除了通过 X 这条路径"——这在逻辑上是无法用数据直接检验的。因为你需要检验的是 ——但 是不可观测的。你能观测的只是 ——而这些残差本身是在"假设 IV 有效"的前提下算出来的。
这是一个根本性的不对称:你可以用数据来量化你的工具变量有多"强"——但你无法用数据来证明你的工具变量是"干净"的。后者需要的不是更多的检验,而是更好的故事、更深的制度理解和更具创造性的证伪设计。
三、论证相关性——从"一阶段 F > 10"到完整的强工具诊断
3.1 第一步:一阶段回归——看 F 统计量
一阶段回归的形式(假设只有一个内生变量 X,一个工具变量 Z,K 个控制变量 W):
核心问题是检验 (Z 和 X 无关——工具变量不相关)。
一阶段 F 统计量是对这个原假设的标准检验。F 统计量越大 → Z 和 X 的关系越强 → 工具变量越"相关"。
* 报告一阶段 F 和系数
ivreg2 y (x = z), first
* 输出包含一阶段 F、偏 R² 等3.2 第二步:理解 F 的门槛——从"F > 10"到 Stock-Yogo 临界值
旧标准:F > 10(Staiger and Stock, 1997)
Staiger 和 Stock 的经验法则——如果一阶段 F < 10,你的工具变量是"弱的"。在弱工具变量下,2SLS 的有限样本偏误可以相当大(向不一致的 OLS 方向偏),且标准误被低估,置信区间的覆盖率远低于名义水平。
但"F > 10"只是一个大拇指法则——它没有考虑内生变量的数量、工具变量的数量、以及你能容忍多大的最坏情况偏误。
新标准:Stock-Yogo(2005)临界值
Stock 和 Yogo 提供了一个更精确的诊断框架。他们计算了在给定的"最坏情况相对偏误"容忍度下,所需的最小一阶段 F:
| 容忍的最坏偏误 | 1 个内生变量, 1 个 IV | 1 个内生变量, 3 个 IV | 2 个内生变量, 3 个 IV |
|---|---|---|---|
| 10%(r = 0.10) | 16.38 | 9.23 | 11.76 |
| 15%(r = 0.15) | 8.96 | 6.08 | 7.29 |
| 20%(r = 0.20) | 6.66 | 4.87 | 5.68 |
| 25%(r = 0.25) | 5.53 | 4.24 | 4.79 |
建议:在现代实证论文中,引用 Stock-Yogo 临界值而非简单地说"F > 10"。如果你的 F = 18.7,你应该写:"一阶段 F 统计量为 18.7,超过了 Stock-Yogo(2005)10% 最坏偏误临界值 16.38——表明本文的工具变量不存在严重弱 IV 问题。"
近期的重新评估:Lee, McCrary, Moreira 和 Porter(2022)建议了一个更保守的标准——在 5% 显著性水平上控制最坏情况下的过度拒绝,需要的 F 统计量远大于旧的临界值(对于单个工具变量且单个内生变量,建议 F > 104.7)。这在实践中是一个很高的门槛——大多数 IV 研究的一阶段 F 远低于此。因此,在实证中,不应机械地使用任何单一阈值——而是应综合 F 统计量、LIML(有限信息最大似然)的稳健性、以及 Anderson-Rubin 检验等多维信息来评估弱 IV 的严重性。
3.3 第三步:多个内生变量和多个 IV 时——不止一个 F
在多个内生变量的情况下,仅看单个变量的 F 是不够的——你需要看偏 F 统计量和Cragg-Donald Wald F 统计量(等同于一阶段 F 的多元推广)。
ivreg2 y (x1 x2 = z1 z2 z3), first
* 关注 Cragg-Donald Wald F statistic
* 和 Kleibergen-Paap rk Wald F(当使用聚类或异方差稳健标准误时)如果 Cragg-Donald F(或 Kleibergen-Paap F)小于 Stock-Yogo 临界值 → 你可能有弱工具变量问题。
3.4 第四步:如果真的弱——怎么办?
如果一阶段 F 低于 Stock-Yogo 临界值:
- 使用 LIML(有限信息最大似然)而非 2SLS。LIML 在弱工具变量下的有限样本偏误远小于 2SLS,是弱工具变量情境下的默认选择。LIML 的缺点是标准误稍大于 2SLS(中等程度)。
ivreg2 y (x = z), liml- 报告 Anderson-Rubin 检验。AR 检验直接检验了" = 某个候选值"——它对弱工具变量是稳健的——不依赖于"弱 IV 还是强 IV"的判断。
ivreg2 y (x = z), first
* AR 检验在 first-stage 输出中(Weak identification robust tests)-
使用 Fuller 修正估计量(Fuller-k 估计量)——k = 1 对应 LIML,k = 4 对应 Fuller 建议的调整,在保持 LIML 的偏误性质的同时降低了标准误。
-
寻找更强的工具变量。如果以上都不够——最诚实的做法是承认"本文的工具有弱 IV 问题,结论应以 Anderson-Rubin 置信区间为准,建议后续研究寻找更强的工具变量"。
3.5 相关性论证的完整清单
- 报告一阶段 F 统计量(或 Cragg-Donald / Kleibergen-Paap F)。
- 对比 Stock-Yogo 临界值表——说明你的工具在什么偏误容忍度下通过了弱 IV 检验。
- 报告一阶段回归的完整系数表——不只是 F,也包括 的大小和方向是否符合理论预期。
- 如果有一个以上 IV → 报告过度识别检验(注意:这不直接检验相关性,但过多的、弱相关的 IV 会放大 2SLS 的偏误——使用 LIML 而非 2SLS 可以减少这种偏误)。
- 如果一阶段 F 不够高 → 使用 LIML 作为主回归,并报告 Anderson-Rubin 弱 IV 稳健置信区间。
四、论证外生性——不能直接被检验,但可以被"围攻"
4.1 根本的困境:排除性限制无法被统计检验
外生性条件 ——Z 只能通过 X 影响 Y——在逻辑上是不可检验的。因为 包含的是所有影响 Y 且不被 X 中介的未观测因素——你无法观测 ,自然也无法检验它和 Z 是否相关。
这就意味着:任何声称"我用某个检验证明了工具变量的外生性"的说法,都是错误的。 你能做的不是"证明"外生性——而是积累各种来源的证据,让外生性假设变得"更可信"。这需要的不是 p 值,而是叙事、制度和证伪的层层递进。
4.2 论证角度一:制度和理论的叙事——"为什么 Z 如同随机?"
最有力的外生性论证通常来自制度和自然实验的叙事——而不是统计数据。
核心问题是:在你的研究情境中,Z 的变异来源是什么?为什么这部分变异可以被合理地视为"外生推动力"——即为什么它和决定 Y 但未被模型控制的其他因素不相关?
三类最经典的叙事模式:
模式 A:自然实验 / 制度冲击
"联邦法律要求各地区将最低合法辍学年龄从 16 岁提高到 17 岁——这项法律在全国范围内统一推行,不受各地区自身的经济条件或教育水平的直接影响。一个学生是否受这项法律影响,取决于他的出生年份——出生年份在政策实施年份之前或之后。出生年份和政策的交互作用构造了一个外生的受教育年限的变化。"
→ 核心论证:政策的制定和推行是外生的(不是由受影响的个体的行为决定的)+ 政策对个体的影响取决于一个外生于个体控制的特征(出生年份、所在地区等)。
模式 B:距离 / 地理特征
"每个县到最近的两年制大学的距离——大学选址的决策通常取决于数十年前的历史因素(如铁路线、土地捐赠)、而不是当前的当地收入水平或就业率。"
→ 核心论证:历史或地理因素在短期内是固定的——它们不受当期个体行为的影响。
模式 C:随机 / 准随机分配
"Draft lottery(抽签征兵)——生日号码(1—365)的抽签结果是一个完全随机过程。生日号码决定一个人是否被征召入伍(X——是否服兵役),但生日号码本身和个人的任何入伍前特征(家庭背景、教育、能力)都不相关。"
→ 核心论证:Z 的生成机制是一个已知的、可审计的随机过程。
这三种叙事的共同点:它们不是在说"检验表明 Z 和 ε 不相关"——它们在说"Z 的生成过程使 Z 和 ε 的相关在逻辑上不可行"。这才是外生性论证的黄金标准。
4.3 论证角度二:过度识别检验(当你有多个工具变量时)
如果你有至少两个工具变量——且至少有一个是有效的(外生的)——你可以使用过度识别检验(Overidentification Test)来检验:
原理:如果所有 IV 都是外生的,那么用任意一个 IV 子集估计出的 应该和用另一个子集估计出的 是"接近的(在抽样误差范围内)"。如果某些 IV 是内生的,不同的 IV 子集会给出系统性地不同的 ——过度识别检验检测到了这种不一致。
- Sargan 检验:在条件同方差下使用。
- Hansen J 检验:在异方差或聚类下使用(但少工具变量 + 多内生变量时可能缺乏功效)。
ivreg2 y (x = z1 z2 z3), robust
* Hansen J statistic: p > 0.05 → 不能拒绝"所有 IV 都是外生的"过度识别检验的三个关键局限(这是你需要知道但不能过度依赖它的原因):
-
"不能拒绝原假设" ≠ "证据表明所有 IV 外生"。 样本量不足、IV 之间的共线性、或检验本身缺乏功效都可能使你在 IV 确实内生时得到 p > 0.05。这是一个"沉默的防守"——不是积极的证据。
-
过度识别检验的可靠性依赖于"至少有一个 IV 有效"的前提。 如果所有的 IV 都内生了——且它们内生偏误的方向恰好相同(如所有 IV 都和一个被遗漏的变量正相关)——过度识别检验可能仍然不显著。这个前提本身就是无法检验的。
-
当你有许多 IV 时(如 > 5),过度识别检验的功效下降,而 2SLS 在弱 IV 下的偏误增大。 具有讽刺意味的是:更多的 IV 给了你过度识别的自由度——但也可能放大了弱 IV 偏误。
关于过度识别检验的实践建议:如果你有多个 IV → 报告 Hansen J 的 p 值,但不要写"J 检验证明了 IV 的外生性"。正确的措辞是"过度识别检验不能拒绝工具变量外生性的原假设(Hansen J p = 0.42),这与本文基于制度分析的外生性论证一致,但不构成对外生性的独立证明。"
4.4 论证角度三:证伪检验(Falsification Tests)——"假如 IV 应该在某个地方无效,它确实无效吗?"
证伪检验是论证外生性最强有力的方式之一——它不试图直接证明"Cov(Z, ε) = 0",而是试图在 IV 本应无效的情境中,检验 IV 是否确实无效。
常见策略:
策略 1:在理论上不受影响的样本中测试简约式
如果你的 IV 是"地方教育支出政策变化"——这个政策只应影响学龄儿童的教育结果,不应影响已经毕业的成年人的收入。对样本中年龄 > 25 岁、已完成教育的人群做简约式回归(Y 对 Z 回归)——如果 Z 在这些人群中仍然显著预测 Y → Z 可能通过 X 之外的渠道影响了 Y(外生性被质疑)。
简而言之:(简约式)在一个"遮断路径"的子样本中—— 应该 ≈ 0。如果 显著非零 → 外生性存疑。
策略 2:测试 IV 是否预测了前定变量(Predetermined Variables)
如果 Z 是外生的——它不应该和任何处理前的个体特征系统性地相关。选择一组重要的、在 Z 实现之前已经确定的前定变量(如性别、出生年份、处理前的收入/教育水平),对每个变量用 Z 做回归——看 Z 的系数是否显著。
这种方法类似于 RCT 中的平衡性检验(Balance Test):在随机实验中,处理组和控制组在处理前的观测特征应该平衡。同理——一个外生的 Z 应该在处理前的特征上是"平衡的"(Z 不能预测这些特征)。
策略 3:使用一个"伪结果"(Placebo Outcome)
找到一个在理论上和 X 无关但和 Y 可能有共同混淆因素的变量——如果 Z 通过除 X 之外的渠道影响 Y,这个伪结果也应该被 Z 预测。如果 Z 不预测伪结果但预测 Y → 支持外生性。
证伪检验的逻辑本质:你向外生性的壁垒发射各种"攻击"——如果壁垒挡住了所有的攻击(所有证伪检验都不显著),你在积累"这个壁垒可能是真的"的证据。但你不能说这个壁垒是不可能被攻破的——你只是没有找到能攻破它的那个攻击。
4.5 论证角度四:排除替代渠道——逐一关闭 Z 对 Y 的其他路径
这是最需要"思考"而非"计算"的部分。对于你的工具变量,画一张从 Z 到 Y 的所有逻辑上可能的因果路径图——然后对每一条非 X 的路径,逐一论证为什么在你的研究情境中,这条路径被关闭或已被控制。
以 Angrist 和 Krueger(1991)——"出生季度"为例:
-
路径 1(主路径):出生季度 → 受教育年限(因为义务教育法)→ 收入。✅
-
替代渠道 1:出生季度 → 入学时的相对年龄(成熟度优势)→ 认知发展 → 收入(不通过教育)。Angrist 和 Krueger 的回应:如果存在这种"相对年龄效应",它应该在小年级时最强,但随着年级的增长应该消失——但他们在数据中没有看到这种衰减模式。
-
替代渠道 2:出生季度 → 出生时的季节(营养、光照、母体健康)→ 长期的健康和认知 → 收入。回应:如果存在季节性出生效应,它应该在不同地区和不同时期之间一致——实证中这种效应非常小且不一致。
-
替代渠道 3:父母的生育计划——特定类型的父母更可能在特定季节生育(如高社会经济地位的父母更倾向于在春天生育)。回应:如果存在这种选择效应,出生季度应该和父母的教育/收入相关——但平衡性检验中未见这种相关。
你在论文中的写法:在你的工具变量章节中,加上一个"排除替代渠道"的小节——"如表 X 所示,IV 和处理前的观测特征不系统性地相关(平衡性),在理论上不应受影响的子样本中简约式不显著(证伪检验)——这些发现并不能证明外生性,但与此前基于制度的论证一致,支持了 IV 的有效性。"
4.6 论证角度五:灵敏度分析——"即使外生性不完全成立,我的结论会不会翻?"
近年来,越来越多实证论文开始加入灵敏度分析——不是声称"IV 是完全外生的",而是问:"如果 IV 不是完全外生的——即如果它有一个很小的、独立于 X 的直接影响——我的结论还站得住吗?"
**Conley, Hansen 和 Rossi(2012)**提供了一个框架:允许 IV 有一个"近似外生"的偏误(plausibly exogenous),然后在 Z 和 ε 之间的相关在某个范围("支持区间")内重新估计 β 的置信区间。
直觉:而不是坚持 (完全外生)→ 假设 在 范围内(近似外生)→ 看看 的置信区间在这个范围内是否仍然排除了零。如果你的结论在合理的 范围内仍然成立——那么即使 IV 不是完美外生的,你的主要推断仍然可能是稳健的。
这种分析在实证中尚未成为标配——但它代表了一个更成熟、更诚实的对外生性的态度:不只是声称"Z 是外生的"——而是让读者看到,在最坏的合理情况下,你的结论会不会翻。
五、完整的论证框架——从理论到检验的系统路径
5.1 论证相关性的完整路径
├── 1. 理论层面:Z 为什么应该影响 X?经济理论/制度机制是什么?
│
├── 2. 一阶段回归:报告完整的系数表(不只是 F,还有系数大小和方向)
│ ├── 方向和理论预期一致吗?
│ └── 系数的量级合理吗?
│
├── 3. 一阶段 F 统计量
│ ├── F > Stock-Yogo 临界值(指定偏误容忍度)
│ ├── 如果多个内生变量 → Cragg-Donald / Kleibergen-Paap F
│ └── 如果 F 不够高 → 使用 LIML(主回归)+ Anderson-Rubin 稳健置信区间
│
└── 4. 弱 IV 稳健性:LIML + AR 检验 + Fuller 修正
5.2 论证外生性的完整路径
├── 1. 制度/理论叙事:Z 的变异来源是什么?为什么可被视为"外生推动力"?
│ ├── 自然实验/制度冲击?
│ ├── 距离/地理特征/历史因素?
│ └── 随机/准随机分配?
│
├── 2. 统计证伪检验
│ ├── 平衡性检验:Z 是否系统性地预测处理前的个体特征?
│ ├── 证伪检验:在理论上不受影响的子样本中,简约式是否不显著?
│ └── Placebo 结果:Z 是否不预测"伪结果"?
│
├── 3. 排除替代渠道
│ └── 逐一列出 Z 到 Y 的可能路径(除 X 外)→ 逐一关闭或控制
│
├── 4. 如果多个 IV → 过度识别检验(Hansen J)
│ └── 正确措辞:"不能拒绝原假设",而非"证明了外生性"
│
└── 5. 灵敏度分析(可选但推荐)
└── Conley-Hansen-Rossi:如果允许 Z 有"近似外生"的偏误,结论是否稳健?
5.3 在论文中的呈现顺序
一篇好的 IV 实证论文通常按以下顺序呈现工具变量的论证:
- 制度背景与 IV 构造(第 3 节)——"我的 IV 从哪来、为什么它可以被合理地视为外生的"——这是全文最重要的部分,通常在数据和基准结果之前。
- 一阶段回归结果(第 4 节或第 5 节的第一部分)——报告一阶段系数、方向和 F 统计量。
- 平衡性和证伪检验(同一节的后续部分)——表格式展示"IV 不预测前定特征"和"在不相关子样本中简约式不显著"。
- 过度识别检验(如果适用,在 2SLS 输出中附带报告)。
- 弱 IV 稳健性(LIML + AR + Fuller)——在稳健性检验的表格中呈现。
六、常见误区
6.1 误区一:"过度识别检验的 p > 0.05 → 我的 IV 都是外生的"
过度识别检验不显著意味着你不能拒绝"所有 IV 都是外生的"这个联合原假设。但"不能拒绝" ≠ "确认为真"。原因有三:(1)检验的功效有限——它可能因为噪音而检测不到系统性的外生性违背;(2)只有在至少一个 IV 有效的前提下,过度识别检验才是有意义的;(3)如果所有 IV 的内生性方向相同——过度识别检验可能仍然不显著。过度识别检验的 p > 0.05 提供的是"没有看到外生性被违背的信号"——而不是"外生性被确认"。这是两种根本不同的结论。
6.2 误区二:"一阶段 F > 10 → 弱 IV 不是问题"
F > 10 是 Staiger-Stock 1997 年的经验法则。Stock-Yogo 2005 年的研究表明,即使在 10% 最坏偏误的容忍度下,F 的临界值在大多情况下都高于 10(单个 IV 时需要 16.38)。而 Lee, McCrary, Moreira 和 Porter(2022)建议的替代性 F 阈值甚至更高。在论文中,你应该引用 Stock-Yogo 的临界值而非简单地说"F > 10"——更不要因为 F > 10 就放弃使用 LIML 或 AR 检验。
6.3 误区三:"工具变量的外生性是一个统计假设——可以通过数据检验"
外生性是工具变量论证中最核心的部分——而它恰恰是无法被数据完全检验的。你能做的不是"找到正确的检验然后说'看,它是外生的'"——而是积累多种来源的证据:制度叙事 + 证伪检验 + 排除替代渠道 + 过度识别(如果有)+ 灵敏度分析。这是一个综合治理,不是一颗检验的子弹。
6.4 误区四:"我有多个工具变量 → 一个通过了过度识别检验 → 所有 IV 都可以用"
2SLS 在多个 IV 下的表现取决于最弱的那个 IV。如果一个 IV 内生,整个 2SLS 估计可能被其污染(尽管方向取决于内生的性质和 IV 的相对强弱)。过度识别检验通过了 ≠ 所有 IV 都安全——仍是那句话,它可能漏掉同方向的内生违背。与其多加 IV,不如精选少数几个、制度上干净且足够强的 IV。更多的 IV 不一定带来更大的安全性——它经常带来更糟糕的弱 IV 偏误(因为弱 IV 间的共线性会被 2SLS 的偏误放大)。
6.5 误区五:"证伪检验通过了 → 外生性得到证明"
证伪检验不显著意味着你没有发现外生性被违背的证据——而不是你发现了外生性成立的证据。"未发现罪证" ≠ "证明清白"。这同样是"不能拒绝原假设"和"确认原假设为真"之间的根本性不对称。你的措辞应反映这种谦逊:"证伪检验结果未能提供反对 IV 外生性的证据"——而非"证伪检验证明了 IV 的外生性"。
6.6 误区六:"只要一阶段 F 大就行了——弱 IV 问题解决"
一阶段 F 大是好事——但如果你的样本量非常大,F 大可能是因为 N,而不是因为 Z 和 X 之间关系的实质强度——这种"大 F"在存在即使是轻微的 IV 内生时会放大 2SLS 的偏误(Bound, Jaeger, and Baker, 1995)。因此,不应仅依赖 F 统计量的数值——也应报告 的大小和方向是否符合理论预期,以及偏 R²(Z 对 X 的额外解释力,在控制了其他变量后)来衡量相关性不仅仅是"统计上显著且 F 大"——也是"经济上相关"。
七、总结
论证 IV 相关性和外生性的七条核心知识:
-
相关性是可检验的——外生性不可。 这是 IV 论证中最根本的不对称性。相关性有 F 统计量、Stock-Yogo 临界值、LIML 和 AR 检验——你可以量化你的工具变量的强度。外生性没有这样一个终极检验——它需要理论、制度叙事和证伪检验的积累。
-
相关性不是"F > 10"——而是"F > Stock-Yogo 临界值"。 指定你最坏情况下能容忍的相对偏误(如 10%)→ 查找对应的 Stock-Yogo 临界值 → 报告你的 F 超过了它。如果 F 不够高 → LIML + Anderson-Rubin。
-
外生性的论证起点是"为什么 Z 如同随机?" 最好的 IV 论文从制度、历史、法律或地理中找到了一个可信的"外生推动力"——然后才用数据和检验来加固它。叙事是骨架,检验是血肉——没有骨架的血肉是无力的。
-
证伪检验是外生性论证的支柱。 在理论上不应该存在效应的子样本中测试简约式——如果 Z 在这些地方"安静",它在应该"说话"的地方的可信度就更高。平衡性检验展示 Z 和处理前特征无关。Placebo 结果展示 Z 不预测"伪结果"。
-
过度识别检验是防御性的——不是进攻性的。 它不能"证明"外生性——它只能"找不到证据来反驳"外生性。如果显著 → 至少有一个 IV 内生(但不知道是哪一个)。如果不显著 → 可能是所有 IV 外生,也可能是功效不足或偏误方向一致。
-
排除替代渠道需要"思考",不是"计算"。 画一张从 Z 到 Y 的所有因果路径图 → 对你关心的渠道以外的每一条路径,逐一解释为什么它在你的情境中被关断或已被控制。
-
灵敏度分析是未来。 不声称 IV 是完美外生的——而是展示"即使 IV 有一个合理的偏误,结论是否还成立?" 这比仅仅报告一个 J 检验的 p 值更诚实,也更有说服力。
一句话收尾:
"工具变量的相关性你可以用 F 统计量来量化——在多大程度上 Z 推动 X。你可以用 LIML、Anderson-Rubin 和 Fuller 修正来保护自己免受弱 IV 偏误的影响。但工具变量的外生性——Z 是否只通过 X 影响 Y——你永远无法用一个检验来回答。你可以展示过度识别检验的 p 值为 0.42,可以展示证伪检验中 Z 在理应无效的样本中确实无效,可以展示 Z 和二十个处理前的特征都不相关——但最终,在那个排除性限制的城堡深处,你需要一个故事。这个故事不是说'统计检验证明了外生性'——这个故事是说'历史、制度和逻辑使 Z 的变异接近于一个自然实验中的随机分配'。而这个故事——不是你的检验——才是你的工具变量在审稿人和读者心中真正'通过'的那个论证。"
八、B站/公众号呈现建议
-
B站视频:建议用"两道门"作为核心视觉隐喻。开场:一扇门上写着"相关性",门框旁边有一个精密的仪表盘(F 统计量、Stock-Yogo 临界值,各种数值显示在闪动)。旁白:"第一道门的钥匙是统计。一阶段 F = 18.7——超过了 Stock-Yogo 的 16.38 门槛。这扇门有一个精密的锁——你可以用数据和检验来打开它。" 画面走向第二扇门——"外生性"。这扇门上没有仪表盘、没有数值——只有一个故事。门框上写着:"出生季度为什么像随机分配?""河流密度为什么和政策偏好无关?""法律推行的时间为什么不受地方经济状况影响?" 旁白:"第二道门没有钥匙——你只能说服它自己打开。它问的不是'你这个检验的 p 值是多少'——它问的是'你在什么制度的历史中找到了这个工具?为什么我相信你的故事?'" 第一幕"相关性的阶梯":逐级展示 F → Stock-Yogo → LIML → AR。F = 14(低于 Stock-Yogo 10% 门槛 16.38)→ 画面出现警告灯。切换到 LIML——警告灯变黄("LIML 减少了偏误"),旁边出现 AR 置信区间("对弱 IV 稳健")。标注:"不需要完美才能进门——你有备选武器。" 第二幕"外生性的围攻":数个"攻击者"(标注"替代渠道""伪结果""处理前特征")向外生性壁垒发射攻击波。壁垒挡住每一个——画面显示:证伪检验——Z 在不应影响的样本中不显著 ✅。平衡性检验——Z 和 20 个处理前特征都不相关 ✅。过度识别检验——J p = 0.42 ✅。旁白:"你不能证明这面墙是打不穿的——你只能展示你用了所有能想到的武器去攻击它,每次攻击都被挡住了。然后你说:'基于现有的证据——外生性在这个案例中是一个合理的假设。'"
-
公众号:工具变量两大条件的对比表(相关性可检验 vs 外生性不可检验、检验工具、论证方式)做成信息图核心。相关性论证的完整阶梯(F → Stock-Yogo → LIML → AR)做成纵向流程图。外生性论证的五条路径(制度叙事、过度识别、证伪检验、排除替代渠道、灵敏度分析)做成五张论证卡。证伪检验的三种策略(不受影响子样本、前定变量平衡性、Placebo 结果)做成模板卡。过度识别检验的正确与错误表述的对比做成"措辞指南"卡。常见误区六则做成纠错卡。
-
推荐标题:
- 主标题:《工具变量的相关性和外生性——一个可以检验,一个只能论证》
- 备选标题:《从"一阶段 F > 10"到"排除替代渠道"——工具变量论证的完整框架》
- 新媒体标题:《你找到了工具变量——但审稿人问的这三个问题,你可能只会回答一题》
-
金句提炼:
"相关性是一扇有钥匙的门——F 统计量、Stock-Yogo 临界值、LIML、Anderson-Rubin。你可以用数据和检验来开这把锁。外生性是另一扇门——门上没有锁,只有一个故事。你只能用制度、历史和逻辑来说服它自己打开。"
"F > 10 是过去的经验法则——但现在你需要的不只是一个手指指向的'大于 10'。引述 Stock-Yogo——指明你在什么偏误容忍度下、你的 F 是否够强。如果不够——LIML 是你的退路,Anderson-Rubin 是你的底线。"
"外生性不能被检验——因为你需要检验的假设包含了一个不可观测的误差项。你能做的不是'找到正确的检验然后完成了'——而是用证伪检验、制度叙事和排除替代渠道构造一个'综合治理'。你不能证明你的工具是干净的——你只能让读者相信,在你用尽一切努力之后,它看起来仍然是干净的。"
"过度识别检验不是外生性的'通过'——它是外生性的'没被驳回'。p > 0.05 意味着数据没有鼓起勇气说'你的 IV 可能是内生的'——但这不等于数据主动说'我确认你的 IV 是外生的'。沉默不等于证词。"
"一个好的工具变量的故事比十个 p 值更有说服力。你说'出生季度如同随机'——这句话的说服力取决于你对义务教育法和辍学年龄制度的描述,而不是你的过度识别检验。检验是外生性论证的卫兵——但故事是国王。卫兵可以有,但没有国王,你打不赢这场仗。"