计量小课:计量经济学基础
计量经济学计量小课

回归系数、偏回归系数与相关系数之间有什么关系?

学计量的人,通常是在三个不同的时间点、从三个不同的方向,分别认识这三个概念的:

作者:计量科研导航站发布:2026-07-29★★

一、开篇:三个概念,一门亲戚

学计量的人,通常是在三个不同的时间点、从三个不同的方向,分别认识这三个概念的:

  • 学统计学时,先学了相关系数 r——衡量两个变量的线性关联强度,取值在 -1 到 1 之间。
  • 接着学了一元线性回归,认识了斜率系数 β̂₁——X 每变化一个单位,Y 平均变化多少。
  • 再往后学多元回归,又冒出了偏回归系数——"保持其他条件不变"时的那个 β̂₁。

这三个东西,在大部分课本里各讲各的,彼此之间的关系被埋在公式推导的夹缝里。但如果你把它们放在一起比较,会发现它们其实有紧密的数学亲缘关系。而且一旦看清这个关系,很多原先孤立的知识点——R²、标准误、多重共线性——会自己连通起来。

核心信息:一元回归系数是"经过尺度调整的相关系数"。多元回归的偏回归系数是"经过尺度调整的偏相关系数"。相关系数回答"关联多强",回归系数回答"变化多少"——它们之间只差一个标准差的比值。


二、一元回归系数:换个马甲的相关系数

2.1 从 OLS 推导开始

一元线性回归模型:

Yi=β0+β1Xi+εiY_i = \beta_0 + \beta_1 X_i + \varepsilon_i

OLS 最小化残差平方和,得到 β̂₁ 的表达式:

β^1=i=1n(XiXˉ)(YiYˉ)i=1n(XiXˉ)2=Cov(X,Y)Var(X)\hat{\beta}_1 = \frac{\sum_{i=1}^{n} (X_i - \bar{X})(Y_i - \bar{Y})}{\sum_{i=1}^{n} (X_i - \bar{X})^2} = \frac{\text{Cov}(X,Y)}{\text{Var}(X)}

2.2 关键的一步变形——把相关系数"提"出来

回忆相关系数的定义:

rXY=Cov(X,Y)sXsYr_{XY} = \frac{\text{Cov}(X,Y)}{s_X \cdot s_Y}

其中 sX=(XiXˉ)2n1s_X = \sqrt{\frac{\sum (X_i - \bar{X})^2}{n-1}} 是 X 的样本标准差,sYs_Y 同理。

现在,对 β̂₁ 的表达式做一次代数变形:

β^1=Cov(X,Y)Var(X)=Cov(X,Y)sXsYsYsX=rXYsYsX\hat{\beta}_1 = \frac{\text{Cov}(X,Y)}{\text{Var}(X)} = \frac{\text{Cov}(X,Y)}{s_X \cdot s_Y} \cdot \frac{s_Y}{s_X} = r_{XY} \cdot \frac{s_Y}{s_X}

这就是一元回归系数和相关系数之间的精确数学关系:

β^1=rXY×sYsX\boxed{\hat{\beta}_1 = r_{XY} \times \frac{s_Y}{s_X}}

回归系数 = 相关系数 × (Y 的标准差 / X 的标准差)。

2.3 这个公式说了什么?

它把 β̂₁ 拆成了两个因子的乘积:

  • rXY:纯粹的相关性——X 和 Y 的"共变程度",无量纲,取值在 [-1, 1] 之间。
  • sY / sX:纯粹的尺度调整——把"以 X 单位为基准"的变异速度,转换成"X 变化一个单位时 Y 变化多少"。

解释:

如果 rXY = 0.8,sX = 5,sY = 10,那么 β̂₁ = 0.8 ×(10/5)= 1.6。意思是:X 和 Y 关联很强(r = 0.8),同时 Y 的波动范围是 X 的两倍(sY/sX = 2),所以 X 每变化 1 个单位,Y 就要变化 1.6 个单位来"跟上"这么强且"尺度偏大"的共变。

一个直观结论:回归系数是被"放缩"过的相关系数。 放缩的比例取决于 X 和 Y 的相对离散程度。


2.4 验证一个特殊情况:标准化回归

如果你先把 X 和 Y 都标准化(减去均值,除以标准差),得到 Z_X 和 Z_Y(均值为 0,标准差为 1),那么:

  • sZX=1s_{Z_X} = 1sZY=1s_{Z_Y} = 1
  • 代入公式:β^1标准化=rXY×11=rXY\hat{\beta}_1^{标准化} = r_{XY} \times \frac{1}{1} = r_{XY}

标准化回归系数 = 相关系数。 两者在标准化回归中是完全等同的。这不是巧合——这正是相关系数定义的直接推论。


三、几何直觉——散点图中的"两条线"

理解 β̂₁ 和 rXY 的关系,还有一种更直观的方式:看散点图上的两条线

3.1 标准差线(SD Line)

在所有观测点上,如果 X 离均值偏离了 ksXk \cdot s_X 的距离,Y 就离均值偏离了 ksYk \cdot s_Y 的距离。连接所有这样的点,形成一条经过 (X̄, Ȳ) 的直线——标准差线,其斜率为:

SD线斜率=sYsX\text{SD线斜率} = \frac{s_Y}{s_X}

这条线不关心 X 和 Y 之间"实际上"有多大关联——它就是纯粹地把两个变量的离散程度"比"在了一起。

3.2 回归线(Regression Line)

OLS 回归线的斜率为 β^1\hat{\beta}_1,它和标准差线的关系就是乘以 rXY:

回归线斜率=rXY×SD线斜率\text{回归线斜率} = r_{XY} \times \text{SD线斜率}

如果 rXY = 1(完全正相关),回归线 = SD 线。X 的每个变化,Y 都精确地以"标准差比值"的幅度响应。

如果 rXY = 0(完全不相关),回归线是水平的——β̂₁ = 0。无论 X 怎么变,Y 的预测值都等于 Y 的均值。SD 线仍然倾得很高,但那是纯粹的"尺度幻象"——实际上 X 的变化对预测 Y 毫无帮助。

如果 rXY = 0.5(中等相关),回归线的斜率 = SD 线斜率的一半。X 变化时,Y 的预测变化只有"纯粹按标准差比例"预期的一半——因为 X 只解释了 Y 变异的一部分。

这就是回归线的直观含义:它把标准差线的斜率向零"压"回来,压多少取决于 X 和 Y 之间的相关性有多强。


四、多元回归的偏回归系数:偏相关系数的血亲

现在进入多元回归。模型中有两个自变量:

Y=β0+β1X1+β2X2+εY = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \varepsilon

你估计出来的 β̂₁ 被称为偏回归系数——"保持 X₂ 不变时,X₁ 变化一个单位对 Y 的影响"。

4.1 前文回顾:FWL 定理的三步操作

从 FWL 定理的角度(详见前文),β̂₁ 等价于以下"分步回归"的结果:

第一步:用 X₂ 去回归 X₁,取残差。这个残差记作 X~1\tilde{X}_1——它是 X₁ 中"不能被 X₂ 解释的部分"。

第二步:用 X₂ 去回归 Y,取残差。这个残差记作 Y~\tilde{Y}——它是 Y 中"不能被 X₂ 解释的部分"。

第三步:将 Y~\tilde{Y}X~1\tilde{X}_1 做简单一元回归。得到的斜率就是 β̂₁。

所以,β̂₁ 本质上衡量的是:"X₁ 和 Y 在各自都去除了 X₂ 的线性影响之后,剩余部分之间的关联强度"。

4.2 偏相关系数登场

上面这第三步——将 "净化"后的 Y"净化"后的 X₁ 做回归——这两个"净化"变量之间的简单相关系数,就是偏相关系数(Partial Correlation Coefficient),通常记作 rYX1X2r_{YX_1 \cdot X_2}

读法:"在控制(或说剔除)了 X₂ 之后,Y 和 X₁ 之间的偏相关系数。"

偏相关系数衡量的是:在去除了 X₂ 的线性影响之后,Y 和 X₁ 之间残余的"纯粹"相关性。

4.3 偏回归系数与偏相关系数的关系

既然 FWL 第三步是一个简单的 Y 对 X 的回归(而且用的是残差变量),那么前文的"一元回归系数 = 相关系数 × 标准差比"公式自然适用:

β^1=rYX1X2×sY~sX~1\hat{\beta}_1 = r_{YX_1 \cdot X_2} \times \frac{s_{\tilde{Y}}}{s_{\tilde{X}_1}}

其中:

  • sY~s_{\tilde{Y}} 是 Y 在去除了 X₂ 的线性影响之后残余变异的样本标准差。
  • sX~1s_{\tilde{X}_1} 是 X₁ 在去除了 X₂ 的线性影响之后残余变异的样本标准差。

偏回归系数和偏相关系数之间的关系,和一元回归系数与简单相关系数之间的关系,在结构上是完全一致的。 差别只在于:偏相关系数和偏回归系数都是在"净化"了控制变量的影响后,用残余变异来度量的。


五、一张表统一三种关系

概念 数学定义 与相关系数的关系 取值范围
相关系数 rXYr_{XY} Cov(X,Y)sXsY\frac{\text{Cov}(X,Y)}{s_X s_Y} 本身就是相关系数 [-1, 1]
一元回归系数 β^1\hat{\beta}_1 Cov(X,Y)Var(X)\frac{\text{Cov}(X,Y)}{\text{Var}(X)} rXY×sYsXr_{XY} \times \frac{s_Y}{s_X} 不受限——取决于 Y 和 X 的相对尺度
偏相关系数 rYX1X2r_{YX_1 \cdot X_2} Corr(Y~,X~1)\text{Corr}(\tilde{Y}, \tilde{X}_1),其中 Y~,X~1\tilde{Y}, \tilde{X}_1 是去除了 X₂ 影响的残差 本身就是(偏)相关系数 [-1, 1]
偏回归系数 β^1\hat{\beta}_1(多元) 由 FWL 定理得出 rYX1X2×sY~sX~1r_{YX_1 \cdot X_2} \times \frac{s_{\tilde{Y}}}{s_{\tilde{X}_1}} 不受限

六、这两个关系能帮你直接理解哪些现象?

6.1 线性回归的 R² 就是相关系数的平方(在一元回归中)

一元回归的 R² 被定义为"被 X 解释的 Y 的变异比例"。从上面 β̂₁ = rXY × (sY / sX) 的关系出发,可以推导出:

R2=rXY2R^2 = r_{XY}^2

在一元回归中,R² 就是简单相关系数的平方。这意味着——如果 X 和 Y 的相关系数是 0.6,那么无论你拿什么软件跑回归,R² 一定是 0.36。

6.2 什么时候 β̂₁ = 0?——两个完全不同的原因

从 β̂₁ = rXY × (sY / sX) 可以看出,β̂₁ = 0 只有两种可能:

  • rXY = 0:X 和 Y 完全不相关。OLS 正确地发现了这个事实。
  • sY = 0:Y 没有任何变异——所有观测的 Y 都相等。这时候你也不需要回归来分析"Y 的变化"。

任何其他情况——无论 sX 多大、sY 多小——只要 rXY ≠ 0,β̂₁ 就不会为零。

6.3 为什么多元回归中 β̂₁ 的符号可能和 r_ 相反?

考虑一个例子:

  • Y = 工资,X₁ = 教育年限,X₂ = 工作经验。
  • 在一元回归中,教育年限和工资正相关——r > 0。
  • 但加入工作经验后,偏回归系数变小甚至可能反转(在特殊情况下)——为什么?

从偏相关系数公式的角度:偏回归系数的符号 = 偏相关系数的符号。如果在"工作经验相同的人"这个子群体内,教育和工资实际上是负偏相关的(更极端的辛普森悖论场景),那么偏回归系数就是负的——尽管在整体上,教育和工资的简单相关系数是正的。

这就是"保持其他条件不变"的核心魔法——它让你看到的是"在控制X₂之后"的相关关系,而不再是"全样本混在一起"的原始相关关系。


七、总结

三层关系,帮你一次性打通三个概念:

  1. 一元回归系数 = 相关系数 × 标准差比。在标准化变量后,回归系数 = 相关系数。两者不是独立的概念,是同一个关联强度在"原始尺度"和"标准化尺度"之间的换算。
  2. 多元偏回归系数 = 偏相关系数 × 残差标准差比。这个结构和一元回归完全一致。因为 FWL 定理告诉我们,多元回归的 β̂₁ 本质上就是"净化后"的变量之间在做一元回归。
  3. 相关系数回答"多强",回归系数回答"变化多少"。 前者去掉了尺度,后者保留了尺度。在实证研究中,两者都值得报告——相关系数让你比较不同模型中关联的强度,回归系数让你直接解释现实含义。

一句话收尾

"你每次跑回归得到一个系数,你其实都在说两件事:一个关于'相关性'(符号和显著性),一个关于'变化量'(系数的大小)。这两件事之间只有一道墙——标准差的比值。拆掉这道墙,回归系数和相关系数就是一个东西。"


八、B站/公众号呈现建议

  • B站视频:核心动画建议分三步——① 展示散点图上的 SD 线和回归线,红色 SD 线倾角固定,蓝色回归线随 r 变化而向水平方向"塌缩";② 展示多元回归的"黑箱净化"过程——两个变量分别被去除 X₂ 的影响后,剩下残差再做散点图;③ 三个公式并列打出,用连接线强调它们之间的结构一致。
  • 公众号:一元回归的 β̂₁ = r × (sY/sX) 推导建议用步骤拆解的公式框呈现。偏相关和 FWL 的关联建议用流程图表示"净化→再回归"的三步。
  • 推荐标题
    • 主标题:《回归系数和相关系数到底什么关系?》
    • 备选标题:《回归系数就是换个尺子的相关系数——偏回归系数也一样》
  • 金句提炼

    "相关系数回答'多强',回归系数回答'变化多少'。两者之间只隔着一道墙——标准差的比值。"