计量小课:计量经济学基础
计量经济学计量小课

为什么最小二乘法只算出一个数,却可以说它是\"无偏\"\"有效\"的?

任何一个学过初级计量的人,都经历过这样一个认知时刻——

作者:计量科研导航站发布:2026-07-29★★

一、开篇:一个数字,哪来的期望和方差?

任何一个学过初级计量的人,都经历过这样一个认知时刻——

你跑了一个回归:

reg wage education

Stata 输出一个数字:β^1=0.08\hat{\beta}_1 = 0.08。教育年限的系数是 0.08。这是一个,就像 3.14 或 42 一样——一个确定的、具体的数。

然后课本告诉你:

  • OLS 估计量是无偏的:E[β^1]=β1\mathbb{E}[\hat{\beta}_1] = \beta_1
  • OLS 估计量是有效的:在所有线性无偏估计量中方差最小
  • OLS 估计量的方差Var(β^1)=σ2(XiXˉ)2\text{Var}(\hat{\beta}_1) = \frac{\sigma^2}{\sum (X_i - \bar{X})^2}

你坐在那里,脑子里有一个挥之不去的困惑:

等一下——β^1\hat{\beta}_1 是一个数,0.08。一个数怎么会有期望?一个数怎么会有方差?方差不是描述随机变量波动程度的吗?

这不是你理解有问题。这是你直觉太好了。你隐约感觉到,课本在说两件不一样的事情,但用的是同一个符号 β^1\hat{\beta}_1——有时候它是指"你根据一份样本算出来的那个具体数值",有时候它是指"那个计算公式本身"。而这两个东西有完全不同的性质。

这篇文章就是要解开这个困惑。它需要三个概念:总体回归函数 vs 样本回归函数、估计量 vs 估计值、以及无偏性的真实含义。

核心信息:OLS 估计量是一个随机变量——因为它是样本的函数,而样本是随机抽取的。你每次抽到的样本不同,算出来的 β^1\hat{\beta}_1 就不同。所谓"无偏",是说如果你反复抽取样本、每次算一个 β^1\hat{\beta}_1,这些 β^1\hat{\beta}_1 的平均值会趋向于真实的 β1\beta_1。你手里那个 0.08,只是这个随机变量的一次实现。


二、两个世界:总体回归函数 vs 样本回归函数

2.1 总体回归函数(PRF)——真实但不可见

在总体的世界里,变量之间的真实关系由**总体回归函数(Population Regression Function, PRF)**描述:

Yi=β0+β1Xi+εiY_i = \beta_0 + \beta_1 X_i + \varepsilon_i

这里 β0\beta_0β1\beta_1真实的、固定的、未知的参数。它们是总体中 X 和 Y 之间关系的本质——藏在世界运行的底层逻辑中,你永远无法直接看到。就像物理常数一样,万有引力常数 G 是一个固定的数值,你不可能通过任何单次测量获得它——你只能通过实验数据去估计它。

2.2 样本回归函数(SRF)——你能看到的

你能看到的,只是从总体中抽取的一个样本。基于这个样本,你用 OLS 公式算出了一条拟合直线:

Y^i=β^0+β^1Xi\hat{Y}_i = \hat{\beta}_0 + \hat{\beta}_1 X_i

这是样本回归函数(Sample Regression Function, SRF)β^0\hat{\beta}_0β^1\hat{\beta}_1 不是真正的参数——它们是基于这一份特定样本对真实参数的估计。

2.3 关键的一步:样本变了,β^1\hat{\beta}_1 也会变

现在设想一个思想实验——

你从同一个总体中抽取了另一份随机样本(样本量相同,但包含的个体不同)。你用 OLS 公式在这份新样本上跑回归。你会得到什么?

你会得到一个不同β^1\hat{\beta}_1。可能第一次是 0.08,第二次是 0.085,第三次是 0.076。

样本是随机的 → 基于样本算出来的 β^1\hat{\beta}_1 也是随机的。

这就是理解一切的关键。β^1\hat{\beta}_1 不是一个固定的数——它是样本的函数

β^1=f(sample)=i=1n(XiXˉ)(YiYˉ)i=1n(XiXˉ)2\hat{\beta}_1 = f(\text{sample}) = \frac{\sum_{i=1}^{n} (X_i - \bar{X})(Y_i - \bar{Y})}{\sum_{i=1}^{n} (X_i - \bar{X})^2}

正因为样本是随机抽取的,f(sample)f(\text{sample}) 的输出值也是随机的——它是一个随机变量。而随机变量,自然就有期望、有方差、有分布。

你手里那个 0.08,只是这个随机变量在某一份特定样本上的"一次实现(realization)"。


三、估计量 vs 估计值——一个被严重低估的区分

这个区分是整个计量经济学推断逻辑的基础,但在教学中往往被一笔带过。

  • 估计量(Estimator):一个公式或规则,告诉你如何从任何一份样本中计算出一个数值。它是一个随机变量,因为它将随机样本映射为一个数值。

    例:β^1=(XiXˉ)(YiYˉ)(XiXˉ)2\hat{\beta}_1 = \frac{\sum (X_i - \bar{X})(Y_i - \bar{Y})}{\sum (X_i - \bar{X})^2} 是 OLS 估计量。

  • 估计值(Estimate):将估计量公式应用在某一份特定样本上得到的具体数值。它是一个固定的数

    例:你用 CHFS 2019 的数据跑完回归后得到的 0.08,就是估计量在"CHFS 2019 样本"上的估计值。

课本上同一个符号 β^1\hat{\beta}_1 被用来指代这两种东西——这是造成认知混乱的根源。当课本写 E[β^1]=β1\mathbb{E}[\hat{\beta}_1] = \beta_1 时,β^1\hat{\beta}_1 指的是估计量(随机变量),不是估计值(固定数值)。


概念 是固定的还是随机的? 有期望和方差吗? 例子
真实参数 β1\beta_1 固定(未知常数) 没有——它是常数 教育对工资的"真实因果效应"
估计量 β^1\hat{\beta}_1 随机变量(样本的函数) 有! OLS 公式本身
估计值 β^1=0.08\hat{\beta}_1 = 0.08 固定(已经算出来了) 没有——它是一个具体的数字 用 CHFS 2019 数据跑出来的结果

四、无偏性到底在说什么?——不是"你的估计值没错"

现在我们可以精确地理解"无偏性":

E[β^1]=β1\mathbb{E}[\hat{\beta}_1] = \beta_1

这不是在说"你手上这个 0.08 等于真值"。 无偏性是一个关于**估计量(公式本身)的陈述,而不是关于估计值(具体的 0.08)**的陈述。

它的精确含义是:

如果你从总体中反复、无限次地抽取样本,每次抽 n 个观测,每次用 OLS 公式算出一个 β^1\hat{\beta}_1,那么这无限多个 β^1\hat{\beta}_1平均值等于真实的 β1\beta_1

用一句话说:OLS 估计量这个"公式"不会系统性地偏左或偏右——它瞄的是靶心。 虽然每一箭(每一个具体的估计值)可能偏左或偏右,但如果你射无限多箭,箭的落点的平均位置就是靶心。

"无偏"不保证你手中的具体估计值接近真值。 它只保证"如果我对你能反复抽样这件事给一个长期承诺,你不会被系统性地引向错误的方向"。你手里那一个具体的 0.08 离真值有多远——那是标准误和置信区间要回答的问题。


五、蒙特卡洛模拟——用眼睛"看见"随机性

没有什么比模拟更能直观展示"估计量为什么是随机变量"了。虽然这里不能跑代码,但你可以跟着我来一次"思维模拟":

设定真实世界:假设真实的总体回归函数是 Y=1+2X+εY = 1 + 2X + \varepsilon,其中 εN(0,1)\varepsilon \sim N(0,1)。所以真实的 β1=2\beta_1 = 2

步骤:

  1. 从总体中随机抽取 100 个观测值(n = 100),用 OLS 公式算出第一个 β^1\hat{\beta}_1

    • 得到:β^1=2.03\hat{\beta}_1 = 2.03
  2. 重新随机抽取 100 个观测值(第二个样本,和第一个不同),再算一次 OLS。

    • 得到:β^1=1.94\hat{\beta}_1 = 1.94
  3. 重复抽取 1000 次。每次都是独立的随机抽样,每次算出一个 β^1\hat{\beta}_1

  4. 现在你手上有了 1000 个 β^1\hat{\beta}_1 的值:2.03, 1.94, 2.07, 1.98, 2.01, ...

现在,把这 1000 个值画成一张直方图,你会看到什么?

你会看到它们密集地分布在 2 附近,形成一个近似正态分布的钟形曲线——中心落在 2。这 1000 个值的平均值大约是 2.001(非常接近 2)。

这就是无偏性在你眼前显现——不是"某一个 β^1\hat{\beta}_1 等于 2",而是"大量 β^1\hat{\beta}_1 的平均值等于 2"。而这 1000 个值本身的离散程度(即它们的标准差),就是 OLS 估计量的标准误——它衡量的是"每次抽样估计的波动有多大"。


六、有效性——为什么 OLS 是 BLUE?

理解了"估计量是随机变量"之后,**有效性(Efficiency)**就自然理解了。

OLS 估计量不是唯一的估计量——你也可以用别的公式从样本中算出一个斜率。比如,你可以连接第一个和最后一个数据点来估算斜率,也可以只用中位数回归。

有效性说的是:在所有线性无偏估计量中,OLS 估计量的方差是最小的。数学上,对于任何其他线性无偏估计量 β~1\tilde{\beta}_1

Var(β^1OLS)Var(β~1)\text{Var}(\hat{\beta}_1^{\text{OLS}}) \leq \text{Var}(\tilde{\beta}_1)

这就是高斯-马尔可夫定理(Gauss-Markov Theorem)——OLS 是BLUE(Best Linear Unbiased Estimator)

"最好"(Best)在这儿的意思不是最准确——而是"方差最小":即在所有无偏的线性估计方法中,OLS 给出的估计在抽样波动上是最小的。当然,这个结论依赖于几个关键条件成立——扰动项同方差且无自相关。


七、总结:从"一个数字"到"一个随机变量"的认知升级

阶段 你以为的 β^1\hat{\beta}_1 实际的 β^1\hat{\beta}_1
跑完回归 一个数:0.08 估计量在一次抽样中的实现值
讨论无偏性时 "0.08 是无偏的"(错误理解) "OLS 公式这个规则不会系统性偏左或偏右"(正确理解)
讨论方差时 "0.08 的方差是多少?"(问题本身不通) "用 OLS 公式反复抽样算出的 β^1\hat{\beta}_1 的方差是多少?"(正确问题)
讨论有效性时 无法理解 "在所有线性无偏估计的公式中,OLS 的公式算出的结果波动最小"

一句话收尾

"你手里那个 0.08 只是一个数字——它没有期望也没有方差。但产生这个数字的那个公式,因为每次面对不同的随机样本会给出不同的答案,所以它是一个随机变量。无偏性、有效性、方差——这些说的都是那个公式的性质,不是你这个具体数字的性质。理解了这一点,你才真正进入了计量经济学的推断逻辑。"


八、B站/公众号呈现建议

  • B站视频:建议用动画展示"反复抽样 → 得到 1000 个 β^1\hat{\beta}_1 → 形成正态分布"的过程。可以先用一个闪烁的点代表一次抽样,闪烁 1000 次后点在 2 附近聚集成钟形曲线。这是最直观的视觉冲击。
  • 公众号:三行概念对比表(真实参数 vs 估计量 vs 估计值)建议做成核心信息图。蒙特卡洛模拟的描述建议配一张"1000 个估计值的直方图"示意图。
  • 推荐标题
    • 主标题:《为什么回归只算出一个数,却可以说它"无偏""有效"?》
    • 备选标题:《那个 0.08 没有期望和方差——有期望和方差的,是产生它的那个公式》
  • 金句提炼

    "无偏不保证你手里的估计值接近真值——它只保证产生这个估计值的方法,不会系统性地出轨。"