计量小课:计量经济学基础
计量经济学计量小课

用滞后变量做工具变量——什么时候合理?什么时候是自欺欺人?

你研究\"FDI 对经济增长的影响\"。你知道 FDI 存在内生性——经济增长快的国家也更能吸引外资,Cov(FDI, ε) ≠ 0。你需要一个工具变量。

作者:计量科研导航站发布:2026-07-29★★

一、开篇:内生性来了,你手边没有好的工具变量——"那就用滞后项吧"

你研究"FDI 对经济增长的影响"。你知道 FDI 存在内生性——经济增长快的国家也更能吸引外资,Cov(FDI, ε) ≠ 0。你需要一个工具变量。

你翻了几篇文献,发现一个常见的操作——用 FDI 的滞后一期做工具变量。理由是:去年的 FDI 和今年的 FDI 高度相关(满足相关性条件),而"去年的 FDI 不应该被今年的经济增长的误差冲击所影响"(满足外生性条件)。

你照做了。2SLS 的第二阶段结果显示:FDI 的系数显著为正。审稿人看了一眼你的 IV 策略,问了一句话:

"你假设了 Cov(FDIt1,εt)=0\text{Cov}(\text{FDI}_{t-1}, \varepsilon_t) = 0。但如果经济冲击是持续的——今年的正向经济冲击和去年的正向经济冲击是相关的——你还能保证这个假设成立吗?"

你沉默了。因为如果误差项存在序列相关——εt\varepsilon_tεt1\varepsilon_{t-1} 不独立——那么去年的 FDI(它和 εt1\varepsilon_{t-1} 相关)就自然也和你今年的 εt\varepsilon_t 相关了。你的工具变量不再外生。它的"外生性"建立在一个你从未检验、而且很可能不成立的假设之上。

核心信息:用滞后变量做工具变量的合理性,取决于一个关键假设——Cov(Xt1,εt)=0\text{Cov}(X_{t-1}, \varepsilon_t) = 0,即滞后期的 X 和当期的误差不相关。这个假设等价于要求误差项不存在序列相关。如果经济冲击是持续的(大多数宏观和微观面板中都是),这个假设就不成立——滞后项不是有效的工具变量。更一般地,滞后变量作为 IV 的有效性不是一个 "是或否" 的问题,而是一个连续光谱——从"明确不合理"(存在强序列相关)到"勉强可接受"(冲击是短暂的、X 是缓慢调整的存量变量)再到"合理且正确"(在 System GMM 的框架下,利用差分方程和水平方程的系统矩条件)。


二、滞后变量做 IV 的基本逻辑——为什么直觉上是诱人的?

2.1 设定

你的结构方程是:

Yt=β0+β1Xt+εtY_t = \beta_0 + \beta_1 X_t + \varepsilon_t

其中 XtX_t 是内生的:Cov(Xt,εt)0\text{Cov}(X_t, \varepsilon_t) \neq 0。你需要一个工具变量 ZZ 满足两个条件:

  • 相关性Cov(Z,Xt)0\text{Cov}(Z, X_t) \neq 0
  • 外生性Cov(Z,εt)=0\text{Cov}(Z, \varepsilon_t) = 0

你提出 Z=Xt1Z = X_{t-1}(滞后一期的 X)。

相关性Xt1X_{t-1}XtX_t 通常高度相关——大多数经济变量(GDP、投资、就业、收入)都具有持续性。这个条件容易满足。

外生性Xt1X_{t-1} 是"过去"的变量。它是在 t1t-1 期被确定的——而 εt\varepsilon_ttt 期的冲击。从时序上看,"过去"的变量不会受"未来"的冲击影响。逻辑上听起来合理。

2.2 这个逻辑的隐藏前提

Xt1X_{t-1} 不受 εt\varepsilon_t 的影响——这在数学上是必然成立的(因果关系不可能逆时间流动)。 但 IV 的外生性需要的不只是"Xt1X_{t-1} 不被 εt\varepsilon_t 影响"——它需要 Cov(Xt1,εt)=0\text{Cov}(X_{t-1}, \varepsilon_t) = 0。两者不完全相同。

为什么会有 Cov(Xt1,εt)0\text{Cov}(X_{t-1}, \varepsilon_t) \neq 0 的可能性?

因为 Xt1X_{t-1}t1t-1 期被决定的——它受到 εt1\varepsilon_{t-1} 的影响。如果 εt1\varepsilon_{t-1}εt\varepsilon_t 是相关的(即误差项存在序列相关),那么 Xt1X_{t-1}(通过 εt1\varepsilon_{t-1})间接地和 εt\varepsilon_t 相关。

Xt1=+γεt1+X_{t-1} = \cdots + \gamma \varepsilon_{t-1} + \cdots εt=ρεt1+νt\varepsilon_t = \rho \varepsilon_{t-1} + \nu_t

如果 ρ0\rho \neq 0(误差存在序列相关),那么 Cov(Xt1,εt)=γρVar(εt1)0\text{Cov}(X_{t-1}, \varepsilon_t) = \gamma \rho \cdot \text{Var}(\varepsilon_{t-1}) \neq 0滞后变量不再是有效的工具变量。


三、什么时候合理?——一个从"绝对不行"到"基本可以"的判断光谱

3.1 情况一:明确不合理——误差项存在强序列相关

在大多数宏观时间序列中,经济冲击是高度持续的。 今年的正生产率冲击(εₜ > 0)很可能意味着去年也是正冲击(εₜ₋₁ > 0)。此时:

Cov(FDIt1,εt)>0\text{Cov}(\text{FDI}_{t-1}, \varepsilon_t) > 0

用滞后 FDI 作为 IV,你本质上是在用一个和 εₜ 正相关的变量去"替代"另一个和 εₜ 正相关的变量(FDIₜ)。这并不是真正的工具变量——你只是把偏误从一个变量转移到了另一个变量,而且你没有任何独立的变异来源来识别因果效应。

更糟糕的是,如果 X 也具有强持续性(即 XtXt1X_t \approx X_{t-1}),那么 Xt1X_{t-1}XtX_t 几乎是一回事——你等于在用 X 自己作为自己的工具变量。工具变量应该提供"独立于内生变量且外生于误差项"的变异——一个和内生变量几乎相同且被同一个序列相关误差污染的变量,不提供任何新的独立变异。

判断标准:如果你的回归误差在 AR(1) 检验中显著存在序列相关,滞后变量作为 IV 的外生性就站不住脚。

3.2 情况二:勉强可接受——经济冲击是短暂的、X 是存量变量

在某些微观场景中,影响当期 Y 的冲击可能是短暂且不延续的。比如:

  • 天气冲击:今年的降雨量只影响今年的农业产出。去年的降雨量和今年的降雨量可能无关,且去年的 FDI 投资决策(在去年的天气条件下做出的)和今年的天气冲击无关。在这种情况下,εt\varepsilon_tεt1\varepsilon_{t-1} 可能近似不相关 → Cov(Xt1,εt)0\text{Cov}(X_{t-1}, \varepsilon_t) \approx 0

  • X 是一个"缓慢调整的存量变量":比如"企业的资本存量"。资本存量由过去的投资累积而成,今年的调整只改变很小一部分。Kt1K_{t-1}KtK_t 高度相关(好工具),但 Kt1K_{t-1} 几乎不受 εt\varepsilon_t 的影响(因为今年的冲击 εₜ 只能改变今年的少量投资,对存量本身影响微乎其微)。

但即使在这些情况下,"滞后变量作为 IV"仍然不是一个令人信服的 IV 策略——它最多只能作为一个"比 OLS 稍微好一点"的基准模型,在稳健性检验中报告。 如果你声称这是你唯一的识别策略,审稿人通常不会买账。

3.3 情况三:在正确框架下合理——System GMM

在动态面板模型(包含滞后因变量的模型)中:

Yit=β0+ρYi,t1+β1Xit+ui+εitY_{it} = \beta_0 + \rho Y_{i,t-1} + \beta_1 X_{it} + u_i + \varepsilon_{it}

Yi,t1Y_{i,t-1} 天然内生——因为它和个体固定效应 uiu_i 相关(uiu_i 同时影响 Yi,t1Y_{i,t-1}YitY_{it})。此时,使用滞后变量作为 IV 不再是临时的"旁门左道"——它是被正式推导、被广泛接受的系统估计方法的核心组件。

Arellano-Bond(Difference GMM):对差分方程 ΔYit=ρΔYi,t1+β1ΔXit+Δεit\Delta Y_{it} = \rho \Delta Y_{i,t-1} + \beta_1 \Delta X_{it} + \Delta \varepsilon_{it},使用 Yi,t2,Yi,t3,Y_{i,t-2}, Y_{i,t-3}, \dots(更早期的滞后水平值)作为 ΔYi,t1\Delta Y_{i,t-1} 的工具变量。这些更早期的滞后值在"误差没有序列相关"的假设下和 Δεit\Delta \varepsilon_{it} 不相关。

Blundell-Bond(System GMM):在差分方程的基础上,额外利用水平方程——用 ΔYi,t1,ΔYi,t2,\Delta Y_{i,t-1}, \Delta Y_{i,t-2}, \dots(滞后的差分值)作为水平方程中 Yi,t1Y_{i,t-1} 的工具变量。System GMM 比 Difference GMM 更有效——尤其是当 Y 具有强持续性(ρ 接近 1)时,滞后水平值是弱工具变量,而滞后差分值提供了额外的识别力。

在 System GMM 的框架下,使用滞后变量作为 IV 是合理且正确的——前提是你正确使用了这些矩条件,并报告了相关诊断检验:

  • Hansen/Sargan 过度识别检验:检验所有工具变量的联合外生性。p > 0.05 → 不能拒绝工具变量外生的原假设。
  • AR(2) 检验:检验差分后的误差项是否存在二阶序列相关。p > 0.05 → 不能拒绝无二阶自相关的原假设(如果存在 AR(2),Yi,t2Y_{i,t-2} 不再是有效的 IV)。
  • 工具变量数量:如果工具变量数量接近或超过个体数 N → 过度拟合的警告信号。通常要求 IV 数量 < N。

四、什么时候绝对不行?——三个红灯

4.1 红灯一:你只有一个滞后一期作为 IV,且没有任何诊断检验

只使用 Xt1X_{t-1} 作为 IV,模型是恰好识别的——你无法检验这个工具变量的外生性。过度识别检验(Sargan/Hansen)需要"工具变量数 > 内生变量数"——恰好识别时,你无法对 IV 的外生性进行任何统计检验。

一个恰好识别且无法被检验的 IV 策略,加上一个很可能不成立的序列无关假设,加上一个和内生变量几乎相同的工具变量——这在逻辑上几乎是循环论证。 你的 IV 本质上就是"X 的稍微旧一点的版本"——如果新的 X 是内生的,为什么旧的 X 就突然外生了?

4.2 红灯二:X 是一个"流动变量"而非"存量变量"

  • 存量变量(如资本存量、累积受教育年限):今天的值包含了大量过去累积的信息。Xt1X_{t-1}XtX_t 高度相关,但 Xt1X_{t-1} 被当期冲击 εₜ 污染的程度较小。
  • 流动变量(如当年的 R&D 支出、当年的广告费用、当年的 FDI 流入):今天的值和去年的值相关,但相关程度远不如存量变量。而且流动变量本身就是当期决策的结果——Xt1X_{t-1} 同样是一个"内生决策"——只不过发生在一个时期之前。如果两期的决策由同一个持续性因素驱动(如"管理质量"或"市场前景"),Xt1X_{t-1} 和 εₜ 仍然相关。

流动变量 + 滞后项作为 IV = 红灯。

4.3 红灯三:你的面板 T 很短,但你声称使用"内部 IV"解决了内生性

在短面板中(T = 3 或 4),你能使用的滞后 IV 数量极其有限,且滞后项和当期项的差异很小。如果你声称用 Xi,t1X_{i,t-1} 作为 XitX_{it} 的 IV 就"解决了内生性",审稿人只需要问一句——"一个变量和自己的滞后项之间的差异,到底是什么独立的外生变异来源?"——你就无法回答。


五、如果不应该用滞后变量,应该用什么?——替代方案的优先级排序

5.1 第一优先:寻找真正的"外部"工具变量

一个好的工具变量应该来自"模型之外"——它不应该只是模型内生变量的一个滞后版本。外部工具变量的变异来源独立于内生变量的生成过程:

  • 制度/政策冲击:义务教育法改革 → 受教育年限的变化
  • 自然/地理特征:降雨量 → 农业产出;距离港口距离 → 贸易量
  • 历史事件:殖民历史 → 当代制度质量
  • 随机实验/抽签:越南征兵抽签 → 是否服役

寻找外部 IV 需要的是研究设计层面的思考,而不是数据操作层面的技巧。 在规划你的研究时,先问自己:"什么因素让一些人得到了更多的 X,而这个因素和影响 Y 的其他所有因素都无关?"——而不是"我的数据里有什么变量可以拿来当 IV?"

5.2 第二优先:面板数据方法——固定效应 + 准自然实验

如果你的数据是面板数据,且内生性主要来自不随时间变化的遗漏变量(如能力、地理位置、制度传统),固定效应模型可以直接消除这一层面的内生性——不需要工具变量。

如果你的内生性来自时变的混淆因素反向因果,而你有某种准自然实验(如交错实施的政策),可以使用:

  • DID + 事件研究:利用政策在时间和地区上的变异来识别因果效应。
  • Bartik 工具变量(Shift-Share IV):利用"初始份额 × 总体增长率"的交互作为 IV——它具有面板结构中的"外部"变异。

5.3 第三优先:如果只能用滞后项——System GMM + 完整的诊断报告

如果你确实没有任何外部 IV,而你的数据是面板结构(N 较大,T 中等),System GMM 可能是你的最佳选择。但使用 System GMM 不是"偷懒"的借口——你需要在论文中完整报告:

  1. Hansen/Sargan 检验的 p 值
  2. AR(2) 检验的 p 值
  3. 工具变量的数量(以及是否超过 N)
  4. Difference-in-Hansen 检验(检验 System GMM 额外矩条件的有效性)
  5. 作为稳健性:OLS(上限)和固定效应(下限)的系数范围,展示 GMM 估计是否落在这个合理范围内

六、一个自查清单

在决定"用滞后变量做 IV"之前,问自己六个问题:

  1. 我的内生变量是存量还是流动变量? → 存量:稍微可接受。流动:基本不行。
  2. 我的数据中,误差项是否存在序列相关? → 检验一下。有 → 滞后 IV 的外生性不成立。
  3. 我只用了一个滞后项作为 IV 吗? → 恰好识别,无法检验外生性。至少需要两个 IV 才能做过度识别检验。
  4. 我有面板数据吗? → 如果有,考虑 System GMM + 完整诊断。如果没有,滞后 IV 几乎不可能令人信服。
  5. 我有没有寻找过外部 IV? → 如果没有——先去找。滞后项是"没有办法的办法"——但不能是"唯一的办法"。
  6. 我的 T 是否很短(≤3)? → 如果是,滞后项和当期项的差异太小,IV 几乎没有独立的识别力。

七、总结

滞后变量做 IV 的五条核心知识

  1. 滞后变量的外生性假设 = 误差项不存在序列相关。 如果冲击是持续的(大多数经济数据中都是),滞后变量就不再外生——它被上一期的误差污染了,而上一期的误差和本期的误差相关。

  2. 滞后变量作为 IV 的问题不在于"相关性"(通常足够强),而在于"外生性"不可检验。 恰好识别时,你无法对 IV 的外生性进行任何统计检验——你只能"假设"它成立。

  3. 存量变量比流动变量更适合用滞后项做 IV。 存量变量包含大量过去的信息,被当期冲击污染的程度小。流动变量是当期决策的结果——滞后一期同样是一个内生决策。

  4. System GMM 是在一定条件下合理使用滞后 IV 的正确框架。 但它要求面板结构、需要大量诊断检验、且对工具变量数量和序列相关假设高度敏感。它不是"万能的滞后项处理器"。

  5. 在寻找"数据里的 IV"之前,先寻找"研究设计里的 IV"。 一个好的工具变量来自模型之外的制度、自然、历史或随机变异——而不仅仅是你手头变量的上一期。


一句话收尾

"用滞后变量做 IV,本质上是在说:'我不知道什么外生因素让 X 发生变化——但我知道一年前的 X 和今年的 X 差不多,而且它'应该'和今年的误差无关。'第一句话是事实,第二句话是你没有检验过、而且很可能不成立的一个假设。当你只有恰好识别、无法检验外生性、且误差可能存在序列相关——你用的不是一个工具变量,你用的是同一个内生变量的旧版本,在穿着 IV 的外衣假装自己是外生的。"


八、B站/公众号呈现建议

  • B站视频:建议用"穿越时空的作弊"作为叙事框架。开场:两个时间点——去年(t−1)和今年(t)。今年的 X(FDI)和今年 Y(GDP)之间存在内生性——"GDP 高了也会吸引更多 FDI,你分不清谁因谁果"。一个研究者掏出一个"时光机遥控器",把去年的 FDI 拿出来:"我用去年的 FDI 来做工具变量——去年的投资和今年的投资高度相关,但去年的投资不应该被今年的 GDP 冲击影响!"画面闪现一个"IV 有效"的绿色印章。但旁白:"等等——如果经济冲击是持续的呢?去年的好年景和今年的好年景是相关的。去年的 FDI 里包含了去年的冲击——去年的冲击延续到了今年。"绿色印章裂开,露出红色的"Cov(Z, ε) ≠ 0"。然后四幕展开:第一幕"为什么诱人"——相关性(去年的 FDI 和今年的 FDI 的紧密散点图)+ 时序逻辑(时间轴,过去不逆),两个绿色标记。第二幕"藏在背后的假设"——两个希腊字母入场:ρ(冲击的持续性)+ γ(X 对冲击的敏感性)。如果两者都不为零 → 滞后 IV 的外生性被污染。用两个旋钮演示——旋钮越高,外生性被污染得越厉害。第三幕"光谱"——三个场景依次展示:绝对不行(宏观序列,强持续误差,滞后期 = 同一件事的旧版本)、勉强OK(天气冲击,短暂且不延续的误差)、正确框架(System GMM 方程式,N 大 T 中,完整的诊断检验表)。第四幕"该怎么办"——一个"IV 选择的阶梯":第一梯 → 外部 IV(降雨、法律制度、历史);第二梯 → 面板方法 + 准实验;第三梯 → System GMM + 完整报告;第四梯(灰暗)→ 滞后 IV 恰好识别。
  • 公众号:滞后变量做 IV 的时序逻辑链(Xt1X_{t-1}εt1\varepsilon_{t-1}εt\varepsilon_t 的相关系数传导)建议做成因果路径图。三盏红灯(恰好识别、流动变量、短面板)做成警告卡片。三种情况的判断光谱(不合理 → 勉强 → 合理)做成横向渐变色条。IV 选择的优先级阶梯建议做成纵向流程图。System GMM 的"三步诊断报告"(Hansen/AR(2)/IV 数量)做成检查清单卡。自查清单的六个问题做成问答卡片。
  • 推荐标题
    • 主标题:《用滞后变量做工具变量——是聪明还是自欺欺人?》
    • 备选标题:Cov(Xt1,εt)=0\text{Cov}(X_{t-1}, \varepsilon_t) = 0——滞后 IV 唯一需要但最容易被违反的假设》
    • 新媒体标题:《你用的"滞后项工具变量"——可能只是同一个内生变量的旧版本》
  • 金句提炼

    "用滞后变量做 IV,本质上是把同一个内生变量复制了一份——只是日期戳换成了 t−1。如果冲击是持续的,这个旧版本和新版本被同一个持续污染源所污染——你的 IV 不是外生的,它是同一个变量的年轻版。"

    "恰好识别 + 滞后 IV + 未检验的序列无关假设 = 你无法区分'我识别了因果效应'和'我只是跑了一个带了时光偏移的 OLS'。"

    "好的工具变量来自模型之外——降雨、法律、历史、抽签。差的工具变量来自模型之内——就是同一个变量,只是早了一期。两者的区别不在于回归表里的系数好不好看,而在于你是否找到了一个真正独立于内生过程的变异来源。"

    "System GMM 是在正确条件下使用滞后项做 IV 的正当途径——但它不是万能药。它要求你报告 Hansen 检验、AR(2) 检验、工具变量数量——它要求你诚实地展示你的 IV 策略经得起推敲。如果你只是把 X_{t-1} 扔进 ivreg2 然后报告 2SLS 结果——你没有在'解决内生性',你在'借用内生性'。"