计量小课:计量经济学基础
计量经济学计量小课

线性回归模型中的\"残差\"和\"误差\"是什么关系?

如果你翻看计量经济学课本中关于线性回归的章节,你会反复遇到两个长得几乎一模一样、但含义完全不同的词——

作者:计量科研导航站发布:2026-07-29★★

一、开篇:两个只差一个字的概念,一个天上一个地下

如果你翻看计量经济学课本中关于线性回归的章节,你会反复遇到两个长得几乎一模一样、但含义完全不同的词——

误差(Error)残差(Residual)

模型里写的是:

Yi=β0+β1Xi+εiY_i = \beta_0 + \beta_1 X_i + \varepsilon_i

那个 εi\varepsilon_i误差

你跑完回归,Stata 可以帮你生成一个新变量,叫 residual,它等于:

ε^i=Yiβ^0β^1Xi\hat{\varepsilon}_i = Y_i - \hat{\beta}_0 - \hat{\beta}_1 X_i

这个是残差

初学者很容易把它们当成一个东西——不都是"模型没解释的部分"吗?符号不都是 ε 吗(一个有帽子一个没帽子)?讨论误差项假设的时候(εN(0,σ2)\varepsilon \sim N(0, \sigma^2)),用来检验这些假设的不就是残差图吗?

但误差和残差有一个根本性的区别:一个是你永远看不到的,一个是你每次跑回归都能算出来的。

混淆这两者,会导致一系列理解上的错误——包括但不限于:以为残差很小说明模型正确、以为残差独立说明误差独立、把残差的诊断结果不加思考地等同于对误差的诊断。

核心信息:误差是理论模型中不可观测的随机扰动,是总体概念;残差是可从样本数据中计算出来的观测值与拟合值之差,是样本概念。残差是误差的"影子"——你可以看到影子,但你不能把影子和产生影子的东西混为一谈。


二、误差(Error)——藏在模型底层的理论量

2.1 误差是什么?

在总体回归模型中:

Yi=β0+β1Xi+εiY_i = \beta_0 + \beta_1 X_i + \varepsilon_i

εi\varepsilon_i 被定义为 Yi(β0+β1Xi)Y_i - (\beta_0 + \beta_1 X_i)——即真实的 Y 值和真实的总体回归线之间的垂直距离

因为 β0\beta_0β1\beta_1 是未知的真实参数,εi\varepsilon_i 也是永远不可观测的。它不是"你还没算出来的东西"——它是根本算不出来的东西

2.2 误差里装着什么?——三种成分

误差项 εi\varepsilon_i 不是一个"装啥都行的垃圾桶"。它在理论上装着三种东西:

成分一:被省略的变量(Omitted Variables)。

工资不只取决于教育年限,还取决于能力、家庭背景、行业、地区、运气……这些你或多或少会在模型里遗漏一些。被遗漏的、对 Y 有系统性影响的变量,就进入了 ε\varepsilon

这就是为什么误差项和遗漏变量偏误(OVB)有直接关系:如果某个被遗漏的变量既影响 Y 又与 X 相关,那它就会同时出现在 ε 里和 X 里——导致 Cov(X, ε) ≠ 0,OLS 估计有偏。

成分二:测量误差(Measurement Error)。

你测到的 X 和 Y 本身就有误差。自报的收入通常低于真实收入,GDP 核算中包含了大量估算,问卷中的主观评分带有随机波动。这些测量误差也进了 ε。

成分三:真正的随机性(Intrinsic Randomness)。

即使你把所有相关的变量都测到了、测得很准,人的行为本身仍然包含不可消除的随机成分。两个在年龄、教育、家庭背景、能力上完全相同的人,他们的工资仍然不会一模一样——因为存在一些真正的、不可约化的个体随机差异。这部分是最"纯粹"的误差。

2.3 计量经济学的方法,很大程度上建立在误差的假设之上

为什么课本要花大量篇幅讲"误差项的假设"?因为 OLS 的一切优良性质——无偏性、有效性、假设检验的有效性——都建立在关于 ε 的假设之上,而不是关于残差的假设之上。

五大经典假设(高斯-马尔可夫假定):

假设 数学表述 如果违反
① 零条件均值 E[εX]=0\mathbb{E}[\varepsilon \mid X] = 0 OLS 有偏且不一致——这是最致命的
② 同方差 Var(εiX)=σ2\text{Var}(\varepsilon_i \mid X) = \sigma^2(常数) OLS 仍然无偏,但不再有效;标准误是错的
③ 无自相关 Cov(εi,εj)=0\text{Cov}(\varepsilon_i, \varepsilon_j) = 0(i≠j) OLS 无偏但标准误是错的
④ X 是固定的(或外生的) Cov(X,ε)=0\text{Cov}(X, \varepsilon) = 0 OLS 有偏——这是假设①的直接推论
⑤ 正态性(小样本推断需要) εN(0,σ2)\varepsilon \sim N(0, \sigma^2) t 检验和 F 检验在小样本中不准确

注意到一条关键信息:这五条假设全都是关于 ε(误差)的,不是关于残差的。 但你能观察到的只有残差——这就是一切紧张关系的根源。


三、残差(Residual)——你手里唯一能看到的线索

3.1 残差是什么?

当你用样本数据跑完 OLS 回归,你得到了一个拟合值 Y^i=β^0+β^1Xi\hat{Y}_i = \hat{\beta}_0 + \hat{\beta}_1 X_i。残差就是实际值和拟合值之间的差距:

ε^i=YiY^i=Yiβ^0β^1Xi\hat{\varepsilon}_i = Y_i - \hat{Y}_i = Y_i - \hat{\beta}_0 - \hat{\beta}_1 X_i

注意符号:误差是 εi=Yiβ0β1Xi\varepsilon_i = Y_i - \beta_0 - \beta_1 X_i(用真实参数),残差是 ε^i=Yiβ^0β^1Xi\hat{\varepsilon}_i = Y_i - \hat{\beta}_0 - \hat{\beta}_1 X_i(用估计参数)。就差在用的是 β 还是 β̂。这个小帽子的区别,决定了一切。

3.2 残差是用来干什么的?——残差诊断

这是残差最重要的实战用途。因为你看不到 ε,所以你只能通过观察残差的行为,来间接推断误差的假设是否成立。

常用的残差诊断手段:

  • 残差 vs 拟合值图:检查同方差性。如果残差的散布范围随拟合值增大而扩张(喇叭形),这是异方差的典型信号。
  • 残差的 Q-Q 图:检查正态性。如果残差的分位数系统性地偏离正态分布的理论分位数,误差很可能不服从正态分布。
  • 残差 vs 自变量图:检查是否存在非线性关系。如果残差在X的取值范围内呈现弯曲模式(如U形),说明线性函数形式可能设定错误。
  • 残差的自相关图(ACF):对时间序列数据,检查残差是否存在自相关。如果存在,说明误差很可能也存在自相关。
  • Cook's Distance / 杠杆值图:检查个别观测是否对回归结果产生了不成比例的影响(影响点诊断)。

这些诊断的核心逻辑是:如果残差呈现某种系统性模式,那么产生这些残差的误差大概率也有相同的问题——因为如果模型设定正确,残差应该是误差的一个"不完美但合理的近似"。


四、残差 ≠ 误差:混淆它们会出什么问题?

4.1 核心区别对照表

维度 误差(ε) 残差(ε̂)
定义 Yi(β0+β1Xi)Y_i - (\beta_0 + \beta_1 X_i) Yi(β^0+β^1Xi)Y_i - (\hat{\beta}_0 + \hat{\beta}_1 X_i)
所属世界 总体(理论模型) 样本(经验计算)
能否观测 不可观测——因为 β 是未知真值 可观测——跑完回归就算出来了
自由度 n 个自由变化的量 n - k 个(k = 参数个数)——残差之间存在 k 个线性约束
相互独立性 经典假设下,不同观测的 ε 相互独立 即使 ε 独立,残差之间也不独立——它们的和为 0,且被 β̂ 牵制
均值为零 假设 E[ε]=0\mathbb{E}[\varepsilon] = 0(总体均值) 自动成立ε^i=0\sum \hat{\varepsilon}_i = 0(只要模型有截距项)
与X的关系 假设 Cov(X, ε) = 0 自动成立:Cov(X, ε̂) = 0(OLS 的正交条件)
方差估计 方差 σ2\sigma^2 未知 ε^i2nk\frac{\sum \hat{\varepsilon}_i^2}{n-k}σ2\sigma^2 的无偏估计

4.2 混淆的第一种危险:把 OLS 的正交条件当成"假设被满足的证据"

OLS 有一个数学性质:残差和 X 的样本协方差自动为零。Xiε^i=0\sum X_i \hat{\varepsilon}_i = 0——这不是假设,这是 OLS 一阶条件的直接结果。你不需要"检验"它,它一定成立。

但如果有人混淆了残差和误差,可能会误以为:"残差和 X 不相关 → 说明 Cov(X, ε)=0 的假设被满足了 → 我的 OLS 是无偏的。"

这是完全错误的推理。残差和 X 在样本中不相关是数学必然,和误差是不是真的与 X 无关没有任何逻辑关系。Cov(X, ε) = 0 是一个关于真实误差的假设,不能用残差的样本性质来"验证"它——因为残差就是被"强制"与 X 正交的。

这个混淆是计量经济学中最危险的逻辑错误之一。

4.3 混淆的第二种危险:以为残差之间是独立的

在经典假设下,不同观测的误差 ε₁, ε₂, ..., εn 假设是相互独立的。但即使这个假设成立,残差之间也不独立

因为残差满足两个约束条件(在一元回归中):

i=1nε^i=0,i=1nXiε^i=0\sum_{i=1}^{n} \hat{\varepsilon}_i = 0, \quad \sum_{i=1}^{n} X_i \hat{\varepsilon}_i = 0

这意味着 — 如果你知道了前 n-2 个残差和 X 的取值,你就能准确无误地推算出最后两个残差。所以残差之间必然存在相关性——即使误差之间毫无关系。

所以你不能拿残差的样本相关性来"证明"误差无自相关——残差天然就有结构性的内部相关,和误差无关。

4.4 混淆的第三种危险:把残差的分布直接当成误差的分布

残差的分布误差的分布更集中——因为 OLS 已经"榨取"了样本中的部分变异去估计参数。在估计 β 的过程中,残差"牺牲"了 k 个自由度(k = 参数个数)。

换句话说,Var(ε^i)<Var(εi)=σ2\text{Var}(\hat{\varepsilon}_i) < \text{Var}(\varepsilon_i) = \sigma^2。残差的波动比误差的波动小——因为 OLS 拟合已经"跟"上了一定的变异。这就是为什么估算 σ² 时用的是 ε^i2nk\frac{\sum \hat{\varepsilon}_i^2}{n-k} 而不是 ε^i2n\frac{\sum \hat{\varepsilon}_i^2}{n}——后者的分母太大了,会系统性地低估误差的方差。

如果你混淆了这两者的方差,你会低估 σ²,进而低估标准误,得到虚假的过于乐观的显著性。


五、残差与误差的联系——残差是误差的"影子"

说了半天区别,但残差当然不是和误差毫无关系。它们之间的桥梁在于:

5.1 可以用残差来估计误差的方差

误差的方差 σ2=Var(εi)\sigma^2 = \text{Var}(\varepsilon_i) 是一个未知的总体参数。它的无偏估计量是:

σ^2=i=1nε^i2nk\hat{\sigma}^2 = \frac{\sum_{i=1}^{n} \hat{\varepsilon}_i^2}{n - k}

其中 k 是回归参数的个数(包括截距)。这就是残差平方和除以自由度——OLS 输出结果中的"RMSE"或"Root MSE"正是 σ^2\sqrt{\hat{\sigma}^2}

这个公式的重要性怎么强调都不过分。它是 OLS 标准误的来源:

se(β^1)=σ^2(XiXˉ)2\text{se}(\hat{\beta}_1) = \sqrt{\frac{\hat{\sigma}^2}{\sum (X_i - \bar{X})^2}}

没有残差,你算不出标准误。没有标准误,你没法做假设检验。 这就是残差和统计推断之间的生命线。

5.2 残差诊断的有效性:为什么透过残差看误差是合理的

尽管残差 ≠ 误差,但在模型设定正确的前提下,残差的行为应该"像"误差。如果误差真的是独立同方差的,那么残差(除了那几个已知的结构性差异之外)也应该看起来大致如此

所以,残差诊断的有效性依赖于一个"元假设"——你的模型大体上是正确的。 在这个前提下,残差的严重不正常(如严重的喇叭形、弯曲、强自相关)构成了对模型设定或误差假设的合理质疑。

反之,如果你已经知道模型设定可能有问题(比如遗漏了关键变量),那么残差诊断的结果本身也可能被误导——残差里可能混入了被遗漏变量和X之间的关系所导致的系统性模式。


六、总结:一表定乾坤

你想知道的是…… 你用来看的是…… 因为……
误差是否同方差? 残差 vs 拟合值图 如果误差同方差,残差也应该是均匀散布的
误差是否正态? 残差的 Q-Q 图 如果误差正态,残差应该也大致正态(在小样本中有偏差,但仍有参考价值)
误差是否有自相关? 残差的 ACF 图 如果误差无自相关,残差也不该有明显的自相关模式
误差的方差 σ2\sigma^2 是多少? ε^i2nk\frac{\sum \hat{\varepsilon}_i^2}{n-k} 这是 σ2\sigma^2 的无偏估计量

但记住——你不能用残差来"验证"Cov(X, ε)=0。 因为 Cov(X, ε̂)=0 是 OLS 自动保证的数学恒等式。这不是诊断,这是循环论证。


一句话收尾

"误差是你看不到的真相,残差是你手里的线索。你永远不能把线索等同于真相——但一个好的侦探,必须学会从线索中反推真相。计量经济学家的核心素养,就是在残差面前保持这种'既相信、又怀疑'的警觉。"


七、B站/公众号呈现建议

  • B站视频:核心视觉建议用"影子比喻"——画面中央是真实的总体回归线和误差(但显示为虚线/半透明,暗示不可见),旁边的样本数据点上有可见的残差线段(实线)。旁白:误差是你看不到的,残差是你唯一能看到的。两者的"自由度差异"可以用动画展示——从 n 个残差中,k 个自由度被"锁"在了参数估计中,剩下 n-k 个独立的信息。
  • 公众号:四维度对比表(所属世界/能否观测/自由度/与X的关系)建议做成信息图。三种混淆的危险建议各配一个"错误推理 → 正确推理"的对照卡。
  • 推荐标题
    • 主标题:《残差和误差只差一个字,一个天上一个地下》
    • 备选标题:《你跑回归看到的那个是残差——真正的误差你永远看不到》
  • 金句提炼

    "误差是你看不到的真相,残差是你手里的线索。你永远不能把线索等同于真相——但一个好的侦探,必须学会从线索中反推真相。"