为什么最小二乘法只算出一个数,却可以说它是\"无偏\"\"有效\"的?
任何一个学过初级计量的人,都经历过这样一个认知时刻——
一、开篇:一个数字,哪来的期望和方差?
任何一个学过初级计量的人,都经历过这样一个认知时刻——
你跑了一个回归:
reg wage educationStata 输出一个数字:。教育年限的系数是 0.08。这是一个数,就像 3.14 或 42 一样——一个确定的、具体的数。
然后课本告诉你:
- OLS 估计量是无偏的:
- OLS 估计量是有效的:在所有线性无偏估计量中方差最小
- OLS 估计量的方差是
你坐在那里,脑子里有一个挥之不去的困惑:
等一下—— 是一个数,0.08。一个数怎么会有期望?一个数怎么会有方差?方差不是描述随机变量波动程度的吗?
这不是你理解有问题。这是你直觉太好了。你隐约感觉到,课本在说两件不一样的事情,但用的是同一个符号 ——有时候它是指"你根据一份样本算出来的那个具体数值",有时候它是指"那个计算公式本身"。而这两个东西有完全不同的性质。
这篇文章就是要解开这个困惑。它需要三个概念:总体回归函数 vs 样本回归函数、估计量 vs 估计值、以及无偏性的真实含义。
核心信息:OLS 估计量是一个随机变量——因为它是样本的函数,而样本是随机抽取的。你每次抽到的样本不同,算出来的 就不同。所谓"无偏",是说如果你反复抽取样本、每次算一个 ,这些 的平均值会趋向于真实的 。你手里那个 0.08,只是这个随机变量的一次实现。
二、两个世界:总体回归函数 vs 样本回归函数
2.1 总体回归函数(PRF)——真实但不可见
在总体的世界里,变量之间的真实关系由**总体回归函数(Population Regression Function, PRF)**描述:
这里 和 是真实的、固定的、未知的参数。它们是总体中 X 和 Y 之间关系的本质——藏在世界运行的底层逻辑中,你永远无法直接看到。就像物理常数一样,万有引力常数 G 是一个固定的数值,你不可能通过任何单次测量获得它——你只能通过实验数据去估计它。
2.2 样本回归函数(SRF)——你能看到的
你能看到的,只是从总体中抽取的一个样本。基于这个样本,你用 OLS 公式算出了一条拟合直线:
这是样本回归函数(Sample Regression Function, SRF)。 和 不是真正的参数——它们是基于这一份特定样本对真实参数的估计。
2.3 关键的一步:样本变了, 也会变
现在设想一个思想实验——
你从同一个总体中抽取了另一份随机样本(样本量相同,但包含的个体不同)。你用 OLS 公式在这份新样本上跑回归。你会得到什么?
你会得到一个不同的 。可能第一次是 0.08,第二次是 0.085,第三次是 0.076。
样本是随机的 → 基于样本算出来的 也是随机的。
这就是理解一切的关键。 不是一个固定的数——它是样本的函数:
正因为样本是随机抽取的, 的输出值也是随机的——它是一个随机变量。而随机变量,自然就有期望、有方差、有分布。
你手里那个 0.08,只是这个随机变量在某一份特定样本上的"一次实现(realization)"。
三、估计量 vs 估计值——一个被严重低估的区分
这个区分是整个计量经济学推断逻辑的基础,但在教学中往往被一笔带过。
-
估计量(Estimator):一个公式或规则,告诉你如何从任何一份样本中计算出一个数值。它是一个随机变量,因为它将随机样本映射为一个数值。
例: 是 OLS 估计量。
-
估计值(Estimate):将估计量公式应用在某一份特定样本上得到的具体数值。它是一个固定的数。
例:你用 CHFS 2019 的数据跑完回归后得到的 0.08,就是估计量在"CHFS 2019 样本"上的估计值。
课本上同一个符号 被用来指代这两种东西——这是造成认知混乱的根源。当课本写 时, 指的是估计量(随机变量),不是估计值(固定数值)。
| 概念 | 是固定的还是随机的? | 有期望和方差吗? | 例子 |
|---|---|---|---|
| 真实参数 | 固定(未知常数) | 没有——它是常数 | 教育对工资的"真实因果效应" |
| 估计量 | 随机变量(样本的函数) | 有! | OLS 公式本身 |
| 估计值 | 固定(已经算出来了) | 没有——它是一个具体的数字 | 用 CHFS 2019 数据跑出来的结果 |
四、无偏性到底在说什么?——不是"你的估计值没错"
现在我们可以精确地理解"无偏性":
这不是在说"你手上这个 0.08 等于真值"。 无偏性是一个关于**估计量(公式本身)的陈述,而不是关于估计值(具体的 0.08)**的陈述。
它的精确含义是:
如果你从总体中反复、无限次地抽取样本,每次抽 n 个观测,每次用 OLS 公式算出一个 ,那么这无限多个 的平均值等于真实的 。
用一句话说:OLS 估计量这个"公式"不会系统性地偏左或偏右——它瞄的是靶心。 虽然每一箭(每一个具体的估计值)可能偏左或偏右,但如果你射无限多箭,箭的落点的平均位置就是靶心。
"无偏"不保证你手中的具体估计值接近真值。 它只保证"如果我对你能反复抽样这件事给一个长期承诺,你不会被系统性地引向错误的方向"。你手里那一个具体的 0.08 离真值有多远——那是标准误和置信区间要回答的问题。
五、蒙特卡洛模拟——用眼睛"看见"随机性
没有什么比模拟更能直观展示"估计量为什么是随机变量"了。虽然这里不能跑代码,但你可以跟着我来一次"思维模拟":
设定真实世界:假设真实的总体回归函数是 ,其中 。所以真实的 。
步骤:
-
从总体中随机抽取 100 个观测值(n = 100),用 OLS 公式算出第一个 。
- 得到:。
-
重新随机抽取 100 个观测值(第二个样本,和第一个不同),再算一次 OLS。
- 得到:。
-
重复抽取 1000 次。每次都是独立的随机抽样,每次算出一个 。
-
现在你手上有了 1000 个 的值:2.03, 1.94, 2.07, 1.98, 2.01, ...
现在,把这 1000 个值画成一张直方图,你会看到什么?
你会看到它们密集地分布在 2 附近,形成一个近似正态分布的钟形曲线——中心落在 2。这 1000 个值的平均值大约是 2.001(非常接近 2)。
这就是无偏性在你眼前显现——不是"某一个 等于 2",而是"大量 的平均值等于 2"。而这 1000 个值本身的离散程度(即它们的标准差),就是 OLS 估计量的标准误——它衡量的是"每次抽样估计的波动有多大"。
六、有效性——为什么 OLS 是 BLUE?
理解了"估计量是随机变量"之后,**有效性(Efficiency)**就自然理解了。
OLS 估计量不是唯一的估计量——你也可以用别的公式从样本中算出一个斜率。比如,你可以连接第一个和最后一个数据点来估算斜率,也可以只用中位数回归。
有效性说的是:在所有线性无偏估计量中,OLS 估计量的方差是最小的。数学上,对于任何其他线性无偏估计量 :
这就是高斯-马尔可夫定理(Gauss-Markov Theorem)——OLS 是BLUE(Best Linear Unbiased Estimator)。
"最好"(Best)在这儿的意思不是最准确——而是"方差最小":即在所有无偏的线性估计方法中,OLS 给出的估计在抽样波动上是最小的。当然,这个结论依赖于几个关键条件成立——扰动项同方差且无自相关。
七、总结:从"一个数字"到"一个随机变量"的认知升级
| 阶段 | 你以为的 | 实际的 |
|---|---|---|
| 跑完回归 | 一个数:0.08 | 估计量在一次抽样中的实现值 |
| 讨论无偏性时 | "0.08 是无偏的"(错误理解) | "OLS 公式这个规则不会系统性偏左或偏右"(正确理解) |
| 讨论方差时 | "0.08 的方差是多少?"(问题本身不通) | "用 OLS 公式反复抽样算出的 的方差是多少?"(正确问题) |
| 讨论有效性时 | 无法理解 | "在所有线性无偏估计的公式中,OLS 的公式算出的结果波动最小" |
一句话收尾:
"你手里那个 0.08 只是一个数字——它没有期望也没有方差。但产生这个数字的那个公式,因为每次面对不同的随机样本会给出不同的答案,所以它是一个随机变量。无偏性、有效性、方差——这些说的都是那个公式的性质,不是你这个具体数字的性质。理解了这一点,你才真正进入了计量经济学的推断逻辑。"
八、B站/公众号呈现建议
- B站视频:建议用动画展示"反复抽样 → 得到 1000 个 → 形成正态分布"的过程。可以先用一个闪烁的点代表一次抽样,闪烁 1000 次后点在 2 附近聚集成钟形曲线。这是最直观的视觉冲击。
- 公众号:三行概念对比表(真实参数 vs 估计量 vs 估计值)建议做成核心信息图。蒙特卡洛模拟的描述建议配一张"1000 个估计值的直方图"示意图。
- 推荐标题:
- 主标题:《为什么回归只算出一个数,却可以说它"无偏""有效"?》
- 备选标题:《那个 0.08 没有期望和方差——有期望和方差的,是产生它的那个公式》
- 金句提炼:
"无偏不保证你手里的估计值接近真值——它只保证产生这个估计值的方法,不会系统性地出轨。"