计量小课:计量经济学基础
计量经济学计量小课

二值因变量——选 Logit 还是 Probit?面板数据中有什么特殊之处?

你跑了一个二值选择模型——研究\"企业是否出口\"。你先用了 Logit:

作者:计量科研导航站发布:2026-07-29★★

一、开篇:两个命令,几乎一模一样的输出——为什么还要纠结选哪一个?

你跑了一个二值选择模型——研究"企业是否出口"。你先用了 Logit:

logit exporter productivity size age

然后又用了 Probit:

probit exporter productivity size age

你看了一眼 AME:

* Logit 的 AME
margins, dydx(*) post
* → productivity 的 AME = 0.047
 
* Probit 的 AME
margins, dydx(*) post
* → productivity 的 AME = 0.046

差了 0.001——远小于标准误(0.012)。你意识到:在 AME 这个最核心的经济量上,Logit 和 Probit 给了几乎相同的答案。

然后你问了自己三个问题:

  1. 如果 AME 几乎一样——那 Logit 和 Probit 的区别到底在哪?为什么会有两个不同的模型?
  2. 期刊审稿人在什么情况下会在意你选了哪个?
  3. 如果你的数据是面板——同一个企业在不同年份被反复观测——选 Logit 还是 Probit 还是一样的吗?

第三个问题尤其重要——因为你正要处理的是面板二值选择模型,而你发现在面板中,Logit 和 Probit 的分岔比截面中更大:固定效应 Logit 存在且在小 T 时一致,固定效应 Probit 在小 T 时不一致。

核心信息:在截面二值选择中,Logit 和 Probit 的区别仅在于对潜变量误差的分布假设——Logit 假设 Logistic 分布(方差 π2/3\pi^2/3),Probit 假设正态分布(方差 1)。这个区别在 AME(平均边际效应)上几乎总是微不足道的——两个模型预测的概率通常在整个 X 的取值范围内相差不到 0.02,AME 的差异更远小于抽样误差。因此,截面中的选择逻辑主要是实用性的而非统计性的:Logit 提供了几率比(Odds Ratio)这一直觉工具,因此在经济学中比 Probit 更主流。两者真正的分岔在于面板数据中的固定效应模型:Logit 可以通过条件似然(Conditional Logit)消去个体异质性 uiu_i——产生一致的 β^\hat{\beta},即使 T 很小。Probit 没有这种条件似然的便利——FE Probit 在小 T 中存在偶发参数问题(Incidental Parameters Problem)β^\hat{\beta} 在 T 固定、N → ∞ 时不一致。因此,如果你需要面板固定效应来控制不随时间变化的个体异质性,Logit 是唯一在小 T 时一致的二值选择模型。但 FE Logit 带着它自己的代价:只有 Y 在时间上有变动的个体才被纳入估计("转换者"样本);系数解释从"个体间的比较"变成了"个体内部的变化";而且 AME 的估计比截面中更复杂——不能直接沿用截面的 margins 逻辑,因为 uiu_i 的分布可能和 X 相关,且通常被假定为不可知。


二、截面中 Logit 和 Probit 的核心区别——只有一个地方不同

2.1 共同的潜变量框架——分岔只在最后一步

Logit 和 Probit 共享完全相同的模型结构:

Yi=Xiβ+εiY_i^* = X_i \beta + \varepsilon_i

Yi={1如果 Yi>00如果 Yi0Y_i = \begin{cases} 1 & \text{如果 } Y_i^* > 0 \\ 0 & \text{如果 } Y_i^* \leq 0 \end{cases}

εi\varepsilon_i 的均值设为 0——因为任何非零的均值都会被吸收进截距项。εi\varepsilon_i 的方差被标准化为一个固定的值——因为 β\betaσε\sigma_\varepsilon 在潜变量框架中只以比值 β/σε\beta/\sigma_\varepsilon 的形式被识别,二者无法被分别估计。

分岔点εi\varepsilon_i 的分布假设。

  • ProbitεiN(0,1)\varepsilon_i \sim N(0, 1) —— 标准正态分布。
  • LogitεiLogistic(0,π2/3)\varepsilon_i \sim \text{Logistic}(0, \pi^2/3) —— Logistic 分布,方差为 π2/33.29\pi^2/3 \approx 3.29

这两个分布都对称、钟形、均值为零——它们在中心非常相似,但在尾部有差异:Logistic 分布的尾部比正态分布厚(衰减为 exe^{-|x|} 而非 ex2e^{-x^2})。

2.2 为什么 AME 几乎总是相同?

给定 Yi=Xiβ+εiY_i^* = X_i \beta + \varepsilon_i,观测到 Yi=1Y_i = 1 的概率是:

Pr(Yi=1Xi)=Pr(εi>Xiβ)=F(Xiβ)\Pr(Y_i = 1 \mid X_i) = \Pr(\varepsilon_i > -X_i \beta) = F(X_i \beta)

其中 F()F(\cdot)εi\varepsilon_i 的累积分布函数(CDF):

  • ProbitF(Xβ)=Φ(Xβ)F(X\beta) = \Phi(X\beta) —— 标准正态 CDF。
  • LogitF(Xβ)=11+exp(Xβ)F(X\beta) = \frac{1}{1 + \exp(-X\beta)} —— Logistic CDF。

关键事实:Φ()\Phi(\cdot)Logistic()\text{Logistic}(\cdot) 在整个实数轴上都极其接近。 在 Xβ ∈ [-2, +2] 范围内(覆盖了绝大多数观测的预测指数),两个函数的最大差异不到 0.02。差异仅在 Xβ → ±∞ 的尾部才稍微拉开——而大多数观测的 Xβ 都在这个核心区间内。

既然概率本身几乎相同——边际效应(f(Xβ)βf(X\beta) \cdot \beta)自然也几乎相同。这就是为什么 AME 对 Logit 和 Probit 的选择几乎不敏感。

2.3 那 β̂ 呢?——"1.6 法则"

Logit 的系数大约是 Probit 系数的 1.6—1.8 倍:

β^Logit1.6×β^Probit\hat{\beta}_{\text{Logit}} \approx 1.6 \times \hat{\beta}_{\text{Probit}}

为什么? 因为 Logit 的误差方差(π2/33.29\pi^2/3 \approx 3.29)大于 Probit 的误差方差(1)——而 β=Y/X\beta = \partial Y^*/\partial Xσε\sigma_\varepsilon 只以比值被识别。方差更大 → 系数需要在数值上更大,才能产生同等大小的概率效应。

但这不意味着你可以用"1.6 法则"来在模型之间精确转换系数——这只是一个近似,在 Xβ 远离 0 时近似会失效。 在 AME 的尺度上比较——不要在系数尺度上比较。这也是为什么永远不该在没有计算 AME 的情况下比较 Logit 和 Probit。

2.4 截面中选择 Logit 还是 Probit?——一个实用的决策框架

考虑因素 偏向 Logit 偏向 Probit
经济直觉 几率比(OR)有直接的经济解读 系数没有类似的直觉解读
学科传统 经济学主流(绝大多数实证用 Logit) 有些流行病学、社会学传统
稀有事件 厚尾 → 稀有事件的预测概率更分散 薄尾 → 稀有事件的预测概率集中在更接近 0 或 1 的区域
计算速度 更快的收敛(Logistic 的数学形式更简单) 略慢
内生二元变量的 IV 处理 可以用 ivprobit 或控制函数 控制函数方法在 Logit 的厚尾假设下更灵活
面板固定效应 可用(FE Logit / 条件 Logit) 不可用——不一致(FE Probit 在小 T 时不一致)

经济学中的经验法则:在截面数据中——用 Logit(然后用 AME)。在面板数据中,如果有固定效应——用 Logit(条件 Logit)。如果要用随机效应或 CRE(Correlated Random Effects)——Logit 或 Probit 在实践中相似,但遵循本领域的惯例。


三、面板数据中的二值选择——为什么事情变得复杂了?

3.1 面板二值选择的模型设定

在截面模型中,异质性被归入 εi\varepsilon_i。在面板中,你有了两个不可观测的成分:

Yit=Xitβ+ui+εitY_{it}^* = X_{it} \beta + u_i + \varepsilon_{it}

Yit=1 如果 Yit>0Y_{it} = 1 \text{ 如果 } Y_{it}^* > 0

  • uiu_i:个体 i 的不随时间变化的异质性(能力、文化、风险偏好……)。
  • εit\varepsilon_{it}:时变的误差。

面板二值模型的核心挑战uiu_i 和 X 之间的关系。如果 Cov(Xit,ui)0\text{Cov}(X_{it}, u_i) \neq 0(在观测数据中几乎总是如此),忽略 uiu_i 或假设它和 X 无关(RE)会导致不一致的估计。但处理 uiu_i 的方式——在二值面板中——和线性面板 FE(组内变换直接消去 uiu_i)截然不同。

3.2 偶发参数问题(Incidental Parameters Problem)——FE Probit 在小 T 中不一致

线性面板 FE 为什么有效?因为组内变换 YitYˉiY_{it} - \bar{Y}_i 消去了 uiu_i——uiu_i 不需要被直接估计。β 的估计量在 N → ∞、T 固定时是一致的。

在非线性模型中,组内变换不能消去 uiu_i——你必须直接估计每个个体的 uiu_i 在 FE Probit 中,你需要为每个个体 i 估计一个 uiu_i——即除了 β 的 K 个参数外,还额外增加了 N 个参数。

当 N → ∞ 且 T 固定时,参数总数(N + K)以和样本量(N × T)相同的速度增长。每个 uiu_i 只有 T 个观测来估计——T 固定的情况下,u^i\hat{u}_i 的估计是不一致的。这 N 个不一致的 u^i\hat{u}_i 污染了 β 的估计——使 β^\hat{\beta} 即使在 N → ∞ 时也不一致。这就是偶发参数问题

FE Probit 的偏误有多大? Monte Carlo 模拟表明,在 T = 5 时,FE Probit 的 β 偏误可以达到 40%—60%。即使 T = 20,偏误仍然在 10%—20% 左右。FE Probit 在短 T 的面板中是不可用的。

3.3 条件 Logit(Conditional Logit / FE Logit)——Logit 的救场

Logit 模型有一个 Probit 没有的特殊性质:在 Logit 中,tYit\sum_t Y_{it}(个体 i 在所有时期中 Y = 1 的次数)是 uiu_i 的充分统计量(Chamberlain, 1980)。

这意味着——你可以通过在 tYit\sum_t Y_{it} 这个总量上"条件化"——来消去 uiu_i,而不需要直接估计它。条件似然函数只依赖于 β,不依赖于 uiu_i——和线性面板 FE 的组内变换在概念上完全平行(都是通过一个数学操作消去 uiu_i 而非估计它)。

条件似然:Pr(Yi1,dots,YiTmidsumtYit,Xi,ui)=fracexp(sumtYitXitbeta)sumdinSiexp(sumtdtXitbeta)\text{条件似然:} \Pr(Y_{i1}, \\dots, Y_{iT} \\mid \\sum_t Y_{it}, X_i, u_i) = \\frac{\\exp(\\sum_t Y_{it} X_{it}\\beta)}{\\sum_{d \\in S_i} \\exp(\\sum_t d_t X_{it}\\beta)}

其中 SiS_i 是所有满足 tdt=tYit\sum_t d_t = \sum_t Y_{it} 的 0/1 序列 d 的集合——即所有可能排列 Y=1 和 Y=0 的时间点的方式,在保持总和不变的前提下。

直觉:条件 Logit 比较的不是"个体 A 和个体 B 之间谁的 Y 更可能是 1"——而是"对于同一个个体 i,在哪些时期 Y 更可能是 1(相对于其他时期)"。识别来自个体内部的 Y 的时间变异——和线性 FE 的"组内变异识别"完全对应。

* 条件 Logit(FE Logit)——只使用 Y 有时间变动的个体
xtlogit y x1 x2, fe
* 等价于
clogit y x1 x2, group(id)

条件 Logit 的三个关键代价

代价一:只有"转换者"被纳入。 如果一个个体的 Y 在所有时期都是 0 或都是 1(tYit=0\sum_t Y_{it} = 0 或 T),条件似然对该个体的贡献为 0——这些个体被自动丢弃。如果你的因变量的变动很少(如"是否上市""是否破产"——大多数企业在样本期内不变),你的估计样本可能严重萎缩。 在论文中,明确报告"进入 FE Logit 估计的样本量从 N 降到了 N_switcher"是必要的。

代价二:系数的解释变了。 截面 Logit 的系数反映的是个体之间 X 差异对应的几率差异。条件 Logit 的系数反映的是同一个个体在不同时期 X 变化对应的几率变化——这是"组内效应"(within-effect),不是"组间效应"(between-effect)。这和线性面板 FE 的系数解释一致——但在二值模型中,这种解释更容易被误解为截面的解释。

代价三:AME 在 FE Logit 中不再能直接计算。 在截面 Logit 中,你可以在样本中对所有个体的边际效应取平均——因为你不需要知道 uiu_i 的具体值,只需要用平均的预测概率来近似。但在 FE Logit 中,uiu_i 虽然被条件化消去了,如果你想要 AME,你需要 uiu_i 的值——而 FE Logit 不估计 uiu_i 直接在 FE Logit 后使用 margins 需要假设 ui=0u_i = 0——这不是一个好的假设。正确计算 FE Logit 中的 AME 需要额外的步骤(见下文 4.3 节)。


四、面板二值选择的实证策略——不止 FE Logit 一条路

4.1 策略地图——四种方法及其假设

方法 uiu_i 的处理 Cov(X,ui)\text{Cov}(X, u_i) 的假设 T 小时的可用性 Stata
Pooled Logit/Probit 忽略(假设 uiu_i 不存在) 隐含假设 ui=0u_i=0 ✅ 但假设不成立 logit, probit
RE Logit/Probit uiN(0,σu2)u_i \sim N(0, \sigma^2_u)uiXu_i \perp X 零相关——在观测数据中几乎不成立 ✅ 但假设不成立 xtlogit, re, xtprobit, re
FE Logit(条件 Logit) 条件化消去 任意相关 ✅ 在小 T 时一致 xtlogit, fe / clogit
CRE / Mundlak ui=Xˉiγ+viu_i = \bar{X}_i \gamma + v_i 允许通过个体均值相关 ✅(RE 框架,Mundlak 修正) xtprobit, re + Xˉi\bar{X}_i
FE Probit 每个 uiu_i 被估计 任意相关 ❌ 在小 T 时不一致 不推荐

4.2 策略 A:Pooled Logit——忽略面板结构

什么时候可以考虑?

  • 你的面板是"伪面板"——N 大但 T 极小(T = 2 或 3),且个体内 Y 的变异极少。
  • 你的核心解释变量本身在时间上几乎不变(如性别、种族、教育年限)——你在做的本来就不是一个面板识别。
  • 但即使在这些情况下,至少应该聚类标准误到个体层面——承认同一企业不同年份的观测不是独立的。

4.3 策略 B:FE Logit(条件 Logit)——控制 uiu_i 的最强方式

什么时候使用?

  • 你有关键的不随时间变化的混淆因素(uiu_i),且 Cov(X,ui)0\text{Cov}(X, u_i) \neq 0 在理论上是不可避免的。
  • 你的 Y 在足够多的个体中随时间变化(有足够的"转换者"来保证有效的样本量)。
  • 你关注的系数是 X 的组内效应——同一个体在不同时间上 X 的变化对 Y 的几率的影响。

在 FE Logit 后如何计算 AME?

这是一个实操中被广泛讨论但经常被忽视的问题。FE Logit 的条件似然不估计 uiu_i——因此你不能直接沿用截面 Logit 的 AME 计算(它需要预测概率,而预测概率需要 uiu_i)。有两种可行的方案:

方案一(不完美但常用):假设 ui=0u_i = 0 来计算预测概率——这会给出一个"典型个体"的边际效应近似。这种方式在量级上通常合理(因为 uiu_i 的分布在群体中是中心化的),但在个体层面不准确。可以在论文中注明"AME 基于 ui=0u_i = 0 的假设——应被理解为在样本中随机抽出的一个 ui=0u_i = 0 的个体的边际效应"。

方案二(更严谨):使用 CRE(Correlated Random Effects)方法——在 RE 框架下加入 Xˉi\bar{X}_i,估计出 σu2\sigma_u^2 的近似值,然后计算 AME,利用这个 σ^u2\hat{\sigma}_u^2Xˉi\bar{X}_i 的贡献来构建个体层面的预测。这个方案更复杂,但更诚实。

在实践中,许多实证论文选择在 FE Logit 之后报告几率比(OR)而非 AME——因为 OR 不需要 uiu_i 的估计(OR 仅依赖 β̂,β̂ 在条件 Logit 中是一致的)。这是一个务实的取舍:用 OR 来提供经济直觉,而不需要在 AME 上做不可靠的近似。

4.4 策略 C:CRE(Correlated Random Effects)——第三条路

Mundlak(1978)和 Chamberlain(1984)的 CRE 方法在二值选择面板中特别有价值——因为它允许 uiu_i 和 X 相关(通过个体均值 Xˉi\bar{X}_i),同时避免了偶发参数问题。

Yit=Xitβ+Xˉiγ+vi+εitY_{it}^* = X_{it} \beta + \bar{X}_i \gamma + v_i + \varepsilon_{it}

其中 viN(0,σv2)v_i \sim N(0, \sigma^2_v)εit\varepsilon_{it} 是 Logistic 或正态的。uiu_i 中与 X 线性相关的部分被 Xˉiγ\bar{X}_i \gamma 显式地吸收了——剩余的部分 viv_i 和 X 不相关(在 Mundlak 的假设下)。

CRE 相对于 FE Logit 的优势

  • 不丢弃"非转换者"——所有个体(包括 Y 始终为 0 或 1 的个体)都参与估计。样本量更大。
  • 不随时间变化的变量的系数可以被估计——Xˉi\bar{X}_i 进入了模型,不随时间变化的 X 的组间效应可以被纳入和估计。
  • AME 的计算更直接——你有一个 σv2\sigma_v^2 的估计,可以用来构建预测概率和边际效应,比 FE Logit 的 ui=0u_i = 0 近似更诚实。
* CRE Probit(Mundlak 方式)
bysort id: egen x1_mean = mean(x1)
bysort id: egen x2_mean = mean(x2)
xtprobit y x1 x2 x1_mean x2_mean, re
margins, dydx(*) predict(pu0)

CRE 的局限

  • 它只允许 uiu_i 和 X 之间线性相关——如果真实的相关是非线性的,CRE 不能完全处理。
  • Xˉi\bar{X}_i 对 T 小的面板是一个噪音较大的代理变量——可能削弱对 uiu_i 的控制的精确性。

4.5 策略 D:FE Probit——什么时候可以考虑?

答案:当 T 足够大时(T ≥ 15—20,且你的个体数量不太大)。 在 T 较大时,每个个体的 uiu_i 有了足够的信息来一致地估计——偶发参数问题的严重性随着 T 的增长而减弱。Monte Carlo 研究表明,在 T ≈ 20 时,FE Probit 的偏误通常可以接受(< 10%)。但在 T < 10 的微观面板中——这是绝大多数面板的 T 范围——FE Probit 不应该被用作主要识别策略。

如果审稿人要求在 T < 10 时使用 FE Probit——你应该解释偶发参数问题,并展示条件 Logit(FE Logit)作为稳健性检验。


五、面板中 Logit 和 Probit 的选择——一个重新校准的决策框架

5.1 从截面到面板——选择逻辑的根本转变

在截面中,Logit 和 Probit 的选择主要是"便利性"的——AME 相同,Logit 的几率比更直观,因此 Logit 胜出。

在面板中,选择逻辑转变成"可行性"的——因为你在短 T 中只有一个一致的面板 FE 二值模型:条件 Logit。

面板数据、需要控制 u_i、$\text{Cov}(X,u_i) \neq 0$:
│
├── T < 10(典型微观面板)
│   ├── Y 在足够多个体中随时间变化 → 条件 Logit(FE Logit)
│   │   ├── 关注组内效应 → 报告 OR(避免 AME 的 u_i 问题)
│   │   └── 需要 AME → 考虑 CRE 作为稳健性检验(提供 AME)
│   │
│   └── Y 在极少个体中随时间变化 → CRE(RE + Mundlak)
│       └── 使用所有个体,可估计 AME
│
└── T ≥ 15—20(宏观面板或长面板)
    ├── 条件 Logit 仍然可用且一致
    └── FE Probit 偏误可接受 → 可以考虑,但建议仍以 Logit 为主

5.2 面板中的解读和解释——和截面的三个关键区别

区别一:你的系数是"组内效应",不是"组间效应"。

在截面 Logit 中,β 反映的是"个体 A(高 X)vs 个体 B(低 X)在 Y 上的几率差异"。在 FE Logit(条件 Logit)中,β 反映的是"同一个体在 X 高的年份 vs X 低的年份的 Y 的几率差异"。这两个量在经济上通常不同——X 的截面变异可能来自长期的结构性差异,而 X 的时间变异来自短期的冲击或调整。在论文中明确你的系数是"within-effect"——它回答的是"当 X 在个体内部变化时,Y 的几率如何变化"——而不是"高 X 的个体比低 X 的个体更可能 Y=1"。

区别二:你的样本变了——从"所有个体"到"转换者"。

在 FE Logit 中,Y 始终为 0 或始终为 1 的个体被丢弃。你需要报告进入估计的样本量,并讨论这种样本选择是否可能导致外部有效性的局限——如果"转换者"在可观测特征上系统性地不同于"非转换者",外部有效性可能受损。在论文中展示两者的描述性统计对比,是规范的。

区别三:AME 不能直接套用截面逻辑。

在截面中,你可以合理地假设 uiu_i 被吸收进 εi\varepsilon_i——AME 在 margins 后直出。在面板 FE Logit 中,你不能——因为 uiu_i 虽然被消去,但没有被估计,也无法被假设为零。如果你的论文需要 AME(而不仅仅是 OR)——考虑 CRE 作为主模型或至少作为补充分析。


六、常见误区

6.1 误区一:"Logit 和 Probit 给不同的结论——我应该做检验来选一个"

在截面中,AME 几乎相同——不需要一个检验来选。如果你在同一个数据上跑 Logit 和 Probit 得到了实质性不同的 AME,问题不在模型选择——而在你的数据或模型设定可能出了问题(如完全分离、极度稀有的 Y、或模型误设)。Logit 和 Probit 的 AME 不一致本身就是一个诊断信号——不是"选哪个"的问题,是"我的模型在 Logit 和 Probit 假设下不稳定,为什么?"

6.2 误区二:"FE Logit 只用了转换者 → 有样本选择偏误 → 不能用"

这种样本缩减是条件似然的数学结果——它不影响内部有效性(你的 β 对于那些至少有过 Y 从 0 到 1 或从 1 到 0 的个体的子群体,仍然是一致的)。但它影响外部有效性——你的结论是否可以推广到所有个体?在论文中坦诚地讨论这一点,而非回避。

6.3 误区三:"FE Probit 在 Stata 里能跑 → 它应该是可用的"

Stata 的 xtprobit, fe 命令会运行——但它不能解决偶发参数问题。在小 T(T < 10)下,输出虽然出来了,但 β^\hat{\beta} 有系统性的偏误。Stata 能跑 ≠ 模型正确。 在短面板中,条件 Logit 是唯一一致的二值 FE 模型。

6.4 误区四:"我的面板 T = 5——我用 RE Logit,因为 Hausman 检验不显著"

在截面线性面板中,如果 Hausman 检验不显著 → RE 和 FE 无差异 → RE 更有效,可以用 RE。但在二值面板中:条件 Logit(FE)和 RE Logit 的比较并非如此简单——因为模型的结构不同(FE 的条件似然 ≠ 加上哑元的 RE Logit)。更重要的是,RE Logit 的假设 Cov(X,ui)=0\text{Cov}(X, u_i) = 0 在观测数据中的前提脆弱——即使在一些检验中不显著,理论上的论证通常不支持这个假设。 在二值面板中,使用 CRE(Mundlak-Chamberlain)来放松 RE 的假设,比依赖检验来在 RE 和 FE 之间切换更为规范。

6.5 误区五:"二值面板我就用线性概率模型(LPM)+ FE——反正方便"

LPM + FE 在二值面板中是一个被广泛接受的务实选择——尤其是在 N 很大、T 很小时。它没有偶发参数问题,AME 就是 OLS 系数,标准误容易集群。但 LPM 有它自己的问题(预测概率超出 [0,1]、边际效应假设恒定)。如果 Y 的发生率在 20%—80% 之间——LPM 通常表现得相当好。如果 Y 极稀有(< 5%)或极常见(> 95%)——非线性模型(Logit/Probit)可能给出更合理的预测和更可靠的边际效应。在论文中,如果使用 LPM + FE 作为基准,建议同时展示条件 Logit 作为稳健性——给审稿人一个看到你的结论在非线性设定下仍然成立的证据。


七、总结

Logit vs Probit + 面板二值选择——七条核心知识

  1. 截面中 Logit 和 Probit 的 AME 几乎相同。 唯一的区别是潜变量误差的分布假设——Logistic vs 正态。AME 的差异在绝大多数实证数据中远小于抽样误差。选择主要是实用性的——Logit 的 OR 有经济直觉优势。

  2. "1.6 法则"在系数层面——不要在系数层面比较。 Logit 系数 ≈ 1.6 × Probit 系数——因为方差标准化不同。在 AME 层面上比较——你几乎看不到差异。

  3. 面板中的分岔点——偶发参数问题。 在非线性 FE 模型中,你必须估计 N 个 uiu_i——在 T 固定时这些估计不一致,进而污染 β 的估计。Logit 是唯一一个可以通过条件似然消去 uiu_i 而不需要估计它的二值模型——这就是 FE Logit 在小 T 时唯一一致的原因。

  4. 条件 Logit = 只有"转换者"被使用 + 系数是组内效应 + AME 不能直出。 这是 FE Logit 的三个代价。在论文中明示它们——不隐藏样本缩减,不混淆组内效应和组间效应,不假装你可以不加条件地给出截面式的 AME。

  5. CRE(Mundlak-Chamberlain)是面板二值选择的"第三条路"。 它允许 uiu_i 和 X 相关(通过 Xˉi\bar{X}_i),保留所有个体,且 AME 的计算更直接。代价是需要假设 uiu_i 和 X 的相关是线性的。在许多实证情景中,CRE 作为主模型比 FE Logit 更灵活。

  6. LPM + FE 是一个被接受的务实基线。 当 Y 的发生率不太极端(20%—80%)且 N 大 T 小——LPM + FE 是简单、透明且审稿人通常认可的。用条件 Logit 作为稳健性检验来增强说服力。

  7. 在面板中,Logit 和 Probit 的选择从"便利性"变成了"可行性"。 截面中你可以随便选。面板中,如果你需要固定效应——Logit 是唯一一致的选项(在短 T 中)。这一事实应该主导你的模型选择——而非截面中的几率比 vs 系数解读的讨论。


一句话收尾

"在截面中,Logit 和 Probit 是一对双胞胎——你选谁都不会错,但 Logit 的几率比让它更会说话。在面板中,这对双胞胎分道扬镳——Logit 可以通过条件似然从偶发参数问题的旋涡中逃生,Probit 被留在旋涡里——在小 T 中它的 β 注定被 N 个不一致的 uiu_i 拖下水。所以你选 Logit——不是因为它的几率比更好讲,而是因为在短面板的不确定水域中,它是唯一一艘不会沉的船。但你要记住——这艘船上只有'转换者'、它讲的是'组内效应'的故事、而且你没法轻易地算出船上所有人的平均边际效应。面板中的二值选择就是这样——你用一个优势换来了新的制约。好的实证不是假装这些制约不存在——而是在制约下仍然清晰地告诉读者:在这个框架中,X 对 Y 的影响是什么、对谁、在什么前提下。"


八、B站/公众号呈现建议

  • B站视频:建议用"双胞胎的两种命运"作为核心视觉隐喻。开场:截面世界中——两个长得几乎一模一样的人(Logit 和 Probit)站在一个 S 形曲线旁边。一个人手里拿着"OR(几率比)"的牌子(Logit),另一个人手里什么都没有(Probit)。旁白:"在截面中,Logit 和 Probit 给出的 AME 几乎相同——它们是在同一个 S 形曲线背后站着的双胞胎。Logit 唯一的优势是——它手上有几率比这个工具,可以讲'可能性乘了多少倍'的故事。" 画面切换——进入面板世界,出现一个巨大的旋涡("偶发参数问题")。Probit 被旋涡卷入——标注"FE Probit 在小 T 中不一致"。Logit 抓住了条件似然的绳索,从旋涡中荡了出去。旁白:"在面板中,这对双胞胎的命运不同了。固定效应 Probit 需要估计 N 个 u_i——在 T 很小时,这些不一致的 u_i 把 β 也拖下了水。Logit 有条件似然这根绳子——它可以消去 u_i 而不需要直接估计它们,从而在短 T 中存活。" 第一幕"FE Logit 的三个代价":三个画面依次呈现——(1)一半的样本被丢弃(标注"只有转换者留下"),(2)系数的箭头上刻着"组内效应",(3)AME 按钮无法被按下(红色警告——"u_i 未估计,AME 需额外步骤")。旁白:"FE Logit 的逃生不是免费的——你的样本缩小了、你的系数解释从组间转向了组内、你的 AME 不能再像截面那样直接算出来。" 第二幕"CRE——第三条路":Mundlak 的身影出现——在 RE 模型中加入了每个人的 X 的个体均值(X̄_i)。uiu_i 中的内生部分被 X̄_i 吸收了。所有的个体(包括非转换者)都留在了模型中。AME 按钮现在可以按下了(绿色)。旁白:"Mundlak-Chamberlain 的 CRE 方法——你不需要在 FE 和 RE 之间二选一。你在 RE 中放入了个体均值来吸收内生性——保留了所有个体,恢复了 AME 的计算。代价是你假设了 u_i 和 X 的相关是线性的。没有完美的方案——但有一个你可以坦诚讨论其局限的方案。"

  • 公众号:截面中 Logit vs Probit 的对比表(分布假设、方差、系数关系、AME 差异、OR 可用性)做成信息图核心。面板中四种策略(Pooled、RE、FE Logit、CRE)的对比框架表做成核心参考卡。条件 Logit 的三个代价(转换者样本、组内效应、AME 困难)做成三张警示卡。CRE 的 Mundlak 方式配代码(xtprobit, re + X̄_i)做成代码模板卡。偶发参数问题的图示解释(N 个 u_i 需要被估计,T 固定时每个 u_i 只有 T 个观测 → 不一致)做成视觉解释卡。常见误区五则做成纠错卡。

  • 推荐标题

    • 主标题:《Logit 还是 Probit?——截面中几乎无关,面板中天差地别》
    • 备选标题:《条件 Logit、RE Logit、CRE——面板二值选择的三种策略》
    • 新媒体标题:《FE Probit 在短面板中是不一致的——为什么你的面板二值选择模型应该用 Logit?》
  • 金句提炼

    "截面中 Logit 和 Probit 是一对双胞胎——AME 几乎相同,选谁都行。Logit 的几率比是它口袋里多出的一把瑞士军刀——不是必需的,但好用。面板中这对双胞胎被偶发参数问题的旋涡分开了——Logit 有条件似然的绳索,Probit 被留在了旋涡里。"

    "条件 Logit 不是免费的午餐——你得到了 u_i 的一致性,但付出了三个代价:你的样本缩小到只剩'转换者',你的系数变成了组内效应,你不能再像截面那样轻易地算出 AME。好的实证不是假装这些代价不存在——而是在代价仍在的情况下,清晰地告诉读者结论在多大的范围内成立。"

    "CRE 是二值面板的第三条路——你在 RE 中放下个体均值,让它们去吸收 u_i 中的内生部分。你不是在假设 u_i 和 X 无关——你是在假设 u_i 和 X 的关系是线性的,并且可以用 X 的个体均值来捕捉。这个假设比 RE 弱,比 FE 的数学更灵活——但你需要承认它仍然是一个假设。"

    "偶发参数问题是非线性面板的一个幽灵——它不在线性 FE 中出现,因为组内变换让它无处可住。但在 Logit 和 Probit 中,你不能做组内变换——你必须直接面对 N 个 u_i。T 固定 → 每个 u_i 只有 T 个数据点 → u_i 的估计不一致 → 这 N 个不一致污染了 β 的估计。Logit 通过条件似然绕开它。Probit 没有这种数学的方便——在小 T 中,FE Probit 是不安全的。"