实证研究中是否需要严谨的统计学检验来检验变量的内生性?
你学完了计量经济学的内生性章节。你知道了 DurbinWuHausman(DWH)检验——先用工具变量回归,然后比较 IV 估计和 OLS 估计的差异。如果差异显著 → OLS 有内生性偏误 → 应该用 IV。如果差异不显著 → 不能...
一、开篇:教科书说"DWH 检验"——但你看的论文里几乎没人做
你学完了计量经济学的内生性章节。你知道了 Durbin-Wu-Hausman(DWH)检验——先用工具变量回归,然后比较 IV 估计和 OLS 估计的差异。如果差异显著 → OLS 有内生性偏误 → 应该用 IV。如果差异不显著 → 不能拒绝 OLS 的一致性 → OLS 更有效,用 OLS。
逻辑清晰,操作简单。你打开 Stata:
ivreg2 y (x = z), endog(x)
* DWH 检验的 p 值在输出中你准备把 DWH 检验放进你的实证论文——作为"内生性是否存在的正式统计证据"。
但你翻遍了你要投的期刊上最近三年的论文。几乎没有人报告 DWH 检验。 他们讨论内生性——大量讨论——但讨论的形式不是"检验 p < 0.05,故存在内生性"。讨论的形式是"本文面临的内生性挑战包括:遗漏变量(能力、动机……)、反向因果(高 Y 可能导致高 X……)、测量误差(X 存在系统性度量偏误……)。本文通过以下策略应对……"
你困惑了:如果存在一个成熟的、被写进教科书的检验——为什么实证前沿几乎不依赖它来做内生性的核心论证?内生性到底应该被"检验"还是被"分析"?
核心信息:内生性在本质上是不可被统计检验完全证明或证伪的——因为内生性的核心定义()涉及一个不可观测的误差项。Durbin-Wu-Hausman 检验能回答的问题是"OLS 和 IV 的估计值在统计上是否有显著差异"——而不是"X 是否内生"。两者的区别至关重要:如果 IV 本身是弱的或无效的(不满足排除性限制),DWH 的不显著可能不是"没有内生性"的信号——而是"IV 太弱或同样内生,检验没有功效来检测差异"。相反,如果工具变量是相关的且外生的,DWH 的显著性确实暗示了 OLS 和 IV 之间的差异——但这种差异可能不完全由内生性驱动(如局部平均处理效应 LATE 和 ATE 之间的差异)。因此,实证前沿不依赖 DWH 来做内生性论证的核心——不是因为研究者"不懂"这个检验,而是因为他们认识到内生性论证是一个研究设计和理论推理的综合工程,而非一个可以被单个 p 值解决的统计问题。在这套范式中,内生性的论证方式从"我检验了内生性 → 它存在/不存在"转变为"我分析了内生性的潜在来源 → 我估计了每种来源可能导致的偏误方向和量级 → 我采取了识别策略来应对最重要的来源 → 我展示了在多种合理的情境下结论仍然稳健"。
二、"检验内生性"——你到底在检验什么?
2.1 内生性的定义涉及不可观测的误差
内生性的核心定义是:
其中 是结构方程中不可观测的误差项。你可以计算残差 ——但这些残差是在"假设 X 外生"的前提下估计出来的。你无法观测真正的结构误差 ,因为你不知道真实的 。
这是一个根本性的认识论困境:内生性涉及一个不可观测的量——而任何需要你去估计这个不可观测的量来"检验"内生性的方法,都在某个假设之下运行。 如果这个假设本身成立——那么检验的结论是有效的。但如果这个假设在真实数据中不成立——检验的结论可能完全误导你。
2.2 DWH 检验在做什么?
DWH 检验比较 OLS 和 IV 的估计值:
- :OLS 和 IV 的差异只来自抽样误差(即两个估计都是 的一致估计 → X 外生)。
- :OLS 不一致而 IV 一致(即 X 内生)。
* 方法一:直接使用 ivreg2 的 endog 选项
ivreg2 y x1 x2 (x = z), endog(x)
* 方法二:手动两步法
* 第一步:一阶段回归,计算残差
reg x z x1 x2
predict v, residual
* 第二步:在结构方程中加入一阶段残差
reg y x x1 x2 v
* 检验 v 的系数是否显著 ≠ 0
test vDWH 检验回答的问题不是"X 是否内生"——而是"在假设 IV 是正确指定的(相关且外生)前提下,OLS 和 IV 是否给出了在统计上不同的答案"。
2.3 DWH 检验的三个结构性局限
局限一:检验依赖于"IV 有效"这个前提。 DWH 检验的原假设是"OLS 和 IV 都一致"——备择假设是"OLS 不一致,IV 一致"。但"IV 一致"这个前提是一个维持假设(maintained assumption)——检验本身不能验证它。如果 IV 也是内生的——或者 IV 是弱的——DWH 的结论可能完全错误。DWH 显著 → 不一定意味着 OLS 内生,可能意味着 IV 内生而 OLS 反而更接近真相。或者 IV 刚好补偿了 OLS 的内生偏误(反向偏误刚好抵消),两者在数值上接近但机制完全不同。
局限二:在弱工具变量下,DWH 检验可能缺乏功效。 如果一阶段 F 不高,IV 估计的方差很大,DWH 检验可能无法检测出 OLS 的偏误——即使 OLS 确实存在严重的内生性。在极端弱 IV 下,DWH 检验实际上是在拿一个非常噪音的 IV 估计和一个精确但不一致的 OLS 估计比较——噪音让两者的差异不显著,而不是"OLS 外生"。
局限三:统计显著 ≠ 经济上有影响。 即使 DWH 显著 → 只能说明 OLS 和 IV 在统计上有差异——不说明这个差异在经济上是否重要。在大 N 下,微小的、在经济上无意义的差异可能被检测为显著。你需要判断的是偏差对结论的影响方向与程度——而非仅有 p 值。
2.4 关键的结论
在任何一篇实证论文中,DWH 检验的结果都不能构成内生性论证的核心支柱。 它可以作为辅助证据——"IV 估计和 OLS 估计在统计上不同,这与本文的内生性分析一致"——但你不应该写"DWH 检验 p < 0.05,故 X 是内生的,因此使用 IV"。
为什么?因为 DWH 在告诉你"OLS 和 IV 不同"——但你不应该需要检验来告诉你这一点。 你应该在研究设计阶段就已经分析了 X 可能的内生性来源(遗漏变量、反向因果、测量误差),并在经济理论的基础上判断内生性的方向和大致量级。如果理论告诉你 X 几乎肯定是内生的(如教育年限和能力)——你不需要 DWH 来告诉你。如果理论告诉你 X 可能外生(如随机实验中的处理变量)——你也不需要 DWH 来告诉你。
三、如果不靠检验——内生性应该如何被"分析"?
3.1 从"检验内生性"到"分析内生性威胁"
实证前沿的内生性方法论经历了从"检测"到"分析"的范式转移。现代实证论文不依赖统计检验来判断内生性是否存在——而是在研究设计阶段系统地分析内生性的来源、方向和量级,然后选择合适的识别策略来应对。
这个转移的根源是对内生性的深层理解:内生性不是一个在你的数据中"存在或不存在"的二元状态——它是一个程度和来源的问题。X 和 ε 之间的协方差 不像是"0 或非 0"的开关——它是一个连续的量。在某些情境中这个协方差很小(接近零),在另一些情境中它很大。一个检验不能替你判断这个协方差的来源和量级——但你的理论分析和识别策略可以。
这套分析框架包含三个步骤:
3.2 步骤一:分类内生性的来源——三种经典来源
对内生性的分析从"识别来源"开始。内生性的三个源头,每一个需要不同的应对策略:
来源 1:遗漏变量(Omitted Variables)——最常见
有一个未观测变量 W 同时影响 X 和 Y。W 被遗漏在误差项 ε 中 → X 和 ε 相关。
例如:(先天能力)→ 同时影响 教育(X)和 收入(Y)。
应对策略:
- 面板固定效应(如果遗漏变量不随时间变化)。
- 工具变量(寻找一个只影响 X 但不通过 W 影响 Y 的 Z)。
- 控制更多可观测变量(在可观测混淆因素上尽可能丰富模型)。
- 利用外生冲击(DID、RDD、自然实验)。
来源 2:反向因果(Reverse Causality / Simultaneity)——X 和 Y 相互决定
X 影响 Y,但 Y 也影响 X。你无法区分哪个方向在数据中占主导。
例如:企业利润高(Y)→ 更多资金投入研发(X)→ 研发提高利润(Y)。
应对策略:
- 使用滞后自变量( 而非 ——但这只能解决同期的反向因果,不能解决序列上的前定性问题)。
- 工具变量(寻找只通过 X 影响 Y 的 Z)。
- 利用外部冲击(如政策变化只影响 X 而非 Y)。
来源 3:测量误差(Measurement Error)——X 的真实值和你测到的值不同
你观测到的是 ,其中 是测量误差。如果 是经典的()→ OLS 产生衰减偏误(系数向零偏)。
如果 不是经典的(如系统性报告偏差——高收入者倾向于低报收入)→ 偏误方向不确定。
应对策略:
- 工具变量(寻找另一个对真实 X 的测量,和 不相关)。
- 使用行政数据或更可靠的测量源。
- 如果只有经典测量误差 → 可以估计衰减因子的上界/下界。
在论文中,你应该清晰地区分你的数据中内生性主要来自哪一种(或哪几种)来源——因为不同的来源对应不同的识别策略和不同的偏误方向判断。
3.3 步骤二:判断内生性偏误的方向——有时比"是否存在"更重要
内生性偏误的符号(正或负)往往可以在不清楚具体偏误量级的情况下,通过经济理论来推断。而这个方向判断,有时比"是否存在内生性"更重要——因为它告诉你 OLS 的估计值是上界还是下界。
三个经典判断法则:
法则 1(遗漏变量):偏误符号 = 遗漏变量和 X 的相关的符号 × 遗漏变量对 Y 的影响的符号。
- 能力(W)和教育(X)正相关(能力高的人更可能接受更多教育)。
- 能力(W)对收入(Y)的影响为正。
- → , → OLS 高估了教育的真实回报(上偏)。
法则 2(反向因果):偏误符号 = 反向因果路径的符号。
- 企业利润(Y)→ 企业增加研发(X)→ 研发对利润有正向影响 → 你估计的 X→Y 的影响被双向因果叠加了。
- → OLS 高估了研发对利润的因果效应(上偏)。
法则 3(经典测量误差):偏误方向总是向零衰减。
- 如果 , 独立于 X 和 Y → OLS 的系数向零偏。
- 这是一种特殊的"内生性"——它让你低估真实的效应。
在论文中,如果你能论证内生性偏误的方向("本文的内生性偏误很可能为正——因此 OLS 估计值应被视为教育回报的上界 ")——这本身就是对内生性一个非常有价值且诚实的分析。 它告诉读者:真实的效应可能在 OLS 系数的哪一侧。即使你不能给出一个精确的无偏估计量,你也能给出一个偏误方向的判断——这是对内生性问题的实质回应,而非仅关注统计检验。
3.4 步骤三:多重识别策略的收敛——"它们都在指向同一个方向"
现代实证论文的内生性论证经常不再依赖单一的工具变量或自然实验——而是使用多重识别策略,从不同的假设出发,观察结论是否收敛。
典型的"多重策略"组合:
- 策略 A:OLS(基准)——存在内生性偏误,但作为出发点。
- 策略 B:面板固定效应——控制不随时间变化的遗漏变量。
- 策略 C:工具变量 2SLS——基于不同的外生性假设。
- 策略 D:DID 或自然实验——如果存在政策冲击或外生变异。
- 策略 E:匹配或逆概率加权——基于可观测变量上的条件独立性假设。
如果 A—E 给出了同一个符号且在量级上合理一致 → 结论对识别假设的选择不敏感。 这本身构成了强有力且可信的论证——比单一策略加上一个 DWH 检验更有说服力。
如果某些策略给出的结果明显不同于其他 → 这正是你需要在论文中分析和解释的。 这种分歧是信息,不是噪音——它告诉你内生性的来源可能在什么地方。不要让 DWH 检验替你隐藏了这种分歧。
四、辅助性的定量工具——在你完成理论分析之后
虽然内生性不能被一个检验完全解决——但在你完成了理论分析之后,以下定量工具可以作为辅助证据。
4.1 检验选择偏差的严重程度:Oster 的 δ 统计量
Oster(2019)提出了一种方法来评估"不可观测变量的选择偏差"在多大程度上可能推翻你的结论。核心思想是:将可观测变量的选择偏差的严重性作为不可观测变量选择偏差的基准。
实操中计算一个叫 的量——它回答的是:"相对于可观测变量的选择偏差,不可观测变量的选择偏差需要多大,才能使你的核心系数变成零?"
- δ 越大 → 你的结论对不可观测变量的遗漏越不敏感 → 越稳健。
- 建议标准:如果 δ > 1(即不可观测变量的选择偏差需要比可观测变量更严重,才能推翻结论)→ 结论比较稳健。
* Oster 的 δ 检验(使用 psacalc)
psacalc delta y, mcontrol(x1 x2 x3)4.2 Altonji-Elder-Taber(2005)比率
Altonji, Elder 和 Taber(2005)提出了一种"用可观测变量的选择来校准不可观测变量的选择"的方法。他们的核心比率为:
这个比率度量的是:加入全部控制变量后,系数衰减了多少——相对于没有控制变量时系数的大小。如果这个比率很大 → 说明可观测变量的选择偏差不足以完全解释效应 → 不可观测变量的选择需要比可观测变量大得多才能推翻结论。
4.3 工具变量可用时——DWH 作为辅助而非核心
如果你的论文已经使用了 IV(基于理论和制度的外生性论证),DWH 检验可以作为辅助证据被顺带报告——但它在论文中的位置不应是"论证内生性的核心证据"。它在论文中的措辞应是:
"Durbin-Wu-Hausman 检验在 5% 水平上拒绝 OLS 的一致性(p = 0.03),这与本文的理论分析一致——即教育年限可能是内生的。然而,本文使用 IV 的主要理由并非在于这一检验的结果,而是在于[制度的论证——为什么 Z 是外生的、为什么它提供了一组独立的识别变异]。"
五、不同场景下的内生性论证策略
5.1 场景 A:你只有 OLS(没有面板、没有 IV、没有自然实验)
在这种场景下,你的内生性论证不能是"我做了 DWH 检验,它说没问题"——也不能是"我假设 X 是外生的"然后不管了。你需要做到以下几点:
- 明确列出内生性的潜在来源:遗漏变量(哪些?)、反向因果(为什么 Y 可能影响 X?)、测量误差(你的 X 可能是如何被错误测量的?)。
- 判断偏误的方向:基于每一种来源,论证 OLS 系数是上偏还是下偏。你在估计的是真实效应的上界还是下界?
- 在可观测的范围内尽可能控制混淆:加入你能观测的所有相关控制变量——展示核心系数在不同控制集下的稳定性。
- 使用 Oster δ 或 Altonji-Elder-Taber 比率:评估不可观测变量的选择偏差需要多大才能推翻你的结论。
- 坦诚地表述:不声称 OLS 是"无偏的因果效应"——而是将 OLS 定位为"在控制了可观测混淆因素后,X 和 Y 之间的偏相关关系"。诚实地讨论"这不等于因果"。
5.2 场景 B:你有面板数据——固定效应是你的主要策略
面板固定效应控制了不随时间变化的遗漏变量——但你不能声称"FE 解决了所有内生性问题"。在论文中你应该:
- 明确区分内生性的两个来源:FE 控制了不随时间变化的遗漏(如能力、文化、位置)→ 但随时间变化的遗漏仍然可能使 X 内生。
- 举例说明时变的混淆因素:"企业可能在某一年遇到了一个同时提高生产率和增加数字化投资的外部机会"——这种冲击是时变的,FE 无法处理它。
- 如果可行,寻找外生变异来源(如行业内其他企业的平均变化、政策冲击——即工具变量)在 FE 模型中进一步处理时变的内生性。
5.3 场景 C:你有工具变量——IV 是你的主要策略
在这种场景下,你的内生性论证不是关于"内生性是否存在"——而是关于"IV 是否满足外生性"。DWH 检验可以被报告为辅助——但不应是核心。论证的焦点转移到了排除性限制(详见本书"工具变量的相关性与外生性"一文)。
六、常见误区
6.1 误区一:"DWH 检验不显著 → X 外生 → 用 OLS 就行了"
DWH 检验不显著可能是因为:(a)X 确实外生,(b)IV 太弱导致检验缺乏功效,(c)IV 同时内生且偏误方向和 OLS 偏误方向刚好抵消。在这三种可能中,只有第一种允许你安全地使用 OLS——但你的数据无法区分这三种可能。 DWH 的不显著不能排除(b)或(c)——而这两种可能都意味着继续用 OLS 是不安全的。
6.2 误区二:"DWH 检验显著 → IV 一定比 OLS 好 → 我应该只报告 IV 的结果"
DWH 显著只说明 OLS 和 IV 不同——但如果 IV 本身也是弱的或略微内生的,IV 可能比 OLS 更差。DWH 显著 + 一阶段 F 不够高 + IV 的外生性仅被微弱论证 → IV 可能不比 OLS 更可信。 在这种情况下,应同时报告 OLS 和 IV 的结果,讨论两者的差异来源,而非简单地用 IV 替代 OLS。
6.3 误区三:"内生性需要被'检验'——我的论文必须有这个检验才能通过审稿"
你应该检验的不是"内生性是否存在"——而是你的识别策略是否可信、结论对替代假设是否稳健。审稿人会问你:"你的识别假设是什么?为什么这些假设在你的研究情境中是合理的?如果这些假设不成立——你做了哪些分析来展示结论在这些替代情境下是否仍然成立?"这些问题需要的不是 DWH 的 p 值——而是你在研究设计上的分析和在稳健性检验上的投入。
6.4 误区四:"OLS 有内生性偏误 → 不能用 → 必须找到 IV"
不是所有的研究问题都需要(或都能找到)一个好的工具变量。如果找不到可信的 IV——你可以:
- 用面板 FE 控制不随时间变化的混淆因素。
- 用匹配或回归调整来改善可观测变量上的平衡性。
- 用 Heckman 选择模型或类似的修正方法。
- 坦诚地表述你的结果的含义和局限——将 OLS 的结果视为"偏相关关系"而非"因果效应"。
"因为内生性,所以我不能做这个研究"——这本身是一种过度反应。 好的实证研究不是完美地解决了所有内生性问题——而是在清晰地表述了内生性威胁的前提下,诚实地呈现了现有的最佳证据。
七、总结
内生性论证的五条核心范式转换:
-
从"检验内生性→用 p 值判断" → 到"分析内生性的来源→评估性质与方向"。 内生性不是一个可以被 DWH 检验干净地裁决的二元状态——它是一个需要在研究设计阶段就通过理论分析来系统理解的数据特征。你的论证不是"我证明了 X 不内生"——而是"我分析了可能的内生性来源,并采取了针对性的策略"。
-
从"DWH 检验 → 选 OLS 或 IV" → 到"多重策略 → 看它们是否指向同一结论"。 单一检验 + 单一策略的论证是脆弱的。现代实证论文的标准是:从不同假设出发的多种识别策略共同支持同一个结论。OLS、FE、IV、DID、匹配——它们在不同假设下识别的是不同参数——如果这些参数在方向上和量级上一致,论证的强度远超任何单一检验。
-
从"默认 OLS 直到被检验推翻" → 到"明示内生性威胁并采用最合理的应对策略,无论检验结果如何"。 如果你的理论分析表明 X 几乎肯定内生——你不应该等待 DWH 来批准你使用 IV。反之,如果你的理论分析表明 X 在特定情境中外生——你不应该让 DWH 来阻止你使用 OLS。
-
从"只关注内生性是否存在" → 到"同时关注内生性偏误的方向 "。 判断偏误的方向往往比判断偏误是否存在更有信息量——OLS 是真实效应的上界还是下界?这种方向判断在你的数据和理论中是可行的,且对读者来说是极其有用的。
-
从"有内生性 → 研究无效" → 到"有内生性 → 但在讨论了这个威胁之后,结论是诚实的且仍具价值"。 任何观测性研究都面临内生性。一篇好的实证论文不是说"我们不需要担心内生性"——而是说"我们诚实地分析了内生性的威胁,在这个前提下,现有的最佳证据指向了X"。
一句话收尾:
"Durbin-Wu-Hausman 检验是你的工具包里的一把螺丝刀——它可以告诉你 OLS 和 IV 在统计上是否不同。但内生性论证需要的不是一把螺丝刀——而是一份完整的建筑图纸:内生性从哪来(遗漏变量?反向因果?测量误差?)、偏误的方向朝哪(X 的效应被高估还是低估?)、你用了什么策略来应对(面板 FE?IV?DID?自然实验?)、以及在不同的假设下结论是否仍然成立。在'我检验了内生性,p < 0.05'和'我分析了内生性的来源、方向、量级,并在多重策略下进行了压力测试'之间——后者才是审稿人和读者在意的论证。前者只是一个你在完成了后者之后顺便往论文里加的一个辅助备注。"
八、B站/公众号呈现建议
-
B站视频:建议用"侦探 vs 裁判"的核心隐喻。开场:两个角色——一个是"裁判"(DWH 检验),举着一个 p 值的牌子,在比赛结束后说"OLS 和 IV 没有显著差异——比赛有效!"。另一个是"侦探"(研究者),在比赛前、比赛中不断地提问:"遗漏了谁?""谁在反方向影响我们的 X?""X 是怎么被测量的?" 画面在"裁判"轻率地挥牌和在"侦探"仔细地勘查现场之间对比。旁白:"DWH 检验是一个裁判——它在比赛结束后宣布结果。但内生性论证需要的是一个侦探——它在比赛前和比赛中不断地质问:X 和 ε 之间到底为什么会相关?这种相关有多大?偏误朝哪个方向?裁判只能看到一个统计量——侦探看到了整个案情。" 第一幕"为什么检验不够":三种 DWH 失效场景。场景一——IV 很弱(一阶段 F = 3.2),IV 估计的方差巨大,DWH 不显著。标注:"不是 OLS 外生——是 IV 太弱,检验没有功效来检测差异。" 场景二——IV 也是内生的,且偏误方向和 OLS 恰好相反 → OLS 和 IV 接近,DWH 不显著。标注:"不是大家都正确——是两个都错了,只是错的方向刚好让它们看起来一致。" 场景三——N 极大,微小的 OLS-IV 差异 → DWH 显著。标注:"显著不等于是内生性——可能只是大 N 放大了抽样噪音。" 第二幕"正确的内生性分析":三步流程——(1)画出内生性的三个来源(遗漏变量→红色线同时连 X 和 Y;反向因果 → Y→X 的箭头方向错误;测量误差 → X*摇晃/模糊),(2)判断偏误方向(箭头指向上界或下界),(3)多重策略收敛——三个独立的识别策略各自给出了在同一个方向的系数和近似的量级 → 它们在这一结论处汇集。旁白:"你不是在'检验'内生性——你是在'分析'内生性。分析比检验更难——但它也更诚实。"
-
公众号:内生性的三种来源(遗漏变量、反向因果、测量误差)配相应应对策略表做成对症图。DWH 检验的三种失效场景做成警告卡。从"检验"到"分析"的范式转换做成左右对比图(旧范式:DWH → 选模型 vs 新范式:分析来源 → 识别策略 → 多重检验 → 灵敏度)。偏误方向判断的三个法则(遗漏变量、反向因果、测量误差)做成快速判断卡。Oster δ 和 Altonji-Elder-Taber 比率的使用模板做成方法卡。不同数据场景下的论证策略(只有 OLS、有面板、有 IV)做成场景对照卡。常见误区四则做成纠错卡。
-
推荐标题:
- 主标题:《内生性应该被"检验"还是被"分析"?——DWH 检验在实证前沿中的位置》
- 备选标题:《教科书让你做 Durbin-Wu-Hausman 检验——但你的论文可能需要的不是它》
- 新媒体标题:《DWH 检验 p < 0.05——这是内生性的证据,还是一个统计巧合?》
-
金句提炼:
"DWH 检验回答的问题是'OLS 和 IV 是否不同'——而不是'X 是否内生'。而你需要回答的是后者——一个关于不可观测的误差项的问题。对不可观测的东西——没有检验可以替你做判断。你需要的是分析,不是 p 值。"
"内生性不是一个'你的数据里有没有'的二元状态——它是一个'有多少、从哪来、朝哪个方向'的连续问题。DWH 检验是一个二元开关——它只能告诉你'开或关'。但它不能告诉你开关后面是遗漏变量、反向因果还是测量误差——更不能告诉你偏误的方向和大致量级。"
"偏误的方向判断是内生性分析中最被低估的工具。你说不清偏误有多大——但你通常可以说清偏误朝哪边。如果 OLS 高估了真实效应——你有了上界。如果 OLS 低估了——你有了下界。一个有边界的未知效应,比一个无边界的未知效应,更接近知识。"
"多重识别策略是现代内生性论证的黄金标准。工具变量在你的地盘上识别、DID 在我的地盘上识别、面板 FE 在他的地盘上识别——三个独立地盘的证据汇到同一个结论上。这不是一个 p 值的说服力——这是三重独立的证据的说服力。审稿人和读者被说服的从来不是一个检验——而是一个从多方面攻击同一问题的完整论证结构。"