二值因变量——选 Logit 还是 Probit?面板数据中有什么特殊之处?
你跑了一个二值选择模型——研究\"企业是否出口\"。你先用了 Logit:
一、开篇:两个命令,几乎一模一样的输出——为什么还要纠结选哪一个?
你跑了一个二值选择模型——研究"企业是否出口"。你先用了 Logit:
logit exporter productivity size age然后又用了 Probit:
probit exporter productivity size age你看了一眼 AME:
* Logit 的 AME
margins, dydx(*) post
* → productivity 的 AME = 0.047
* Probit 的 AME
margins, dydx(*) post
* → productivity 的 AME = 0.046差了 0.001——远小于标准误(0.012)。你意识到:在 AME 这个最核心的经济量上,Logit 和 Probit 给了几乎相同的答案。
然后你问了自己三个问题:
- 如果 AME 几乎一样——那 Logit 和 Probit 的区别到底在哪?为什么会有两个不同的模型?
- 期刊审稿人在什么情况下会在意你选了哪个?
- 如果你的数据是面板——同一个企业在不同年份被反复观测——选 Logit 还是 Probit 还是一样的吗?
第三个问题尤其重要——因为你正要处理的是面板二值选择模型,而你发现在面板中,Logit 和 Probit 的分岔比截面中更大:固定效应 Logit 存在且在小 T 时一致,固定效应 Probit 在小 T 时不一致。
核心信息:在截面二值选择中,Logit 和 Probit 的区别仅在于对潜变量误差的分布假设——Logit 假设 Logistic 分布(方差 ),Probit 假设正态分布(方差 1)。这个区别在 AME(平均边际效应)上几乎总是微不足道的——两个模型预测的概率通常在整个 X 的取值范围内相差不到 0.02,AME 的差异更远小于抽样误差。因此,截面中的选择逻辑主要是实用性的而非统计性的:Logit 提供了几率比(Odds Ratio)这一直觉工具,因此在经济学中比 Probit 更主流。两者真正的分岔在于面板数据中的固定效应模型:Logit 可以通过条件似然(Conditional Logit)消去个体异质性 ——产生一致的 ,即使 T 很小。Probit 没有这种条件似然的便利——FE Probit 在小 T 中存在偶发参数问题(Incidental Parameters Problem), 在 T 固定、N → ∞ 时不一致。因此,如果你需要面板固定效应来控制不随时间变化的个体异质性,Logit 是唯一在小 T 时一致的二值选择模型。但 FE Logit 带着它自己的代价:只有 Y 在时间上有变动的个体才被纳入估计("转换者"样本);系数解释从"个体间的比较"变成了"个体内部的变化";而且 AME 的估计比截面中更复杂——不能直接沿用截面的 margins 逻辑,因为 的分布可能和 X 相关,且通常被假定为不可知。
二、截面中 Logit 和 Probit 的核心区别——只有一个地方不同
2.1 共同的潜变量框架——分岔只在最后一步
Logit 和 Probit 共享完全相同的模型结构:
的均值设为 0——因为任何非零的均值都会被吸收进截距项。 的方差被标准化为一个固定的值——因为 和 在潜变量框架中只以比值 的形式被识别,二者无法被分别估计。
分岔点: 的分布假设。
- Probit: —— 标准正态分布。
- Logit: —— Logistic 分布,方差为 。
这两个分布都对称、钟形、均值为零——它们在中心非常相似,但在尾部有差异:Logistic 分布的尾部比正态分布厚(衰减为 而非 )。
2.2 为什么 AME 几乎总是相同?
给定 ,观测到 的概率是:
其中 是 的累积分布函数(CDF):
- Probit: —— 标准正态 CDF。
- Logit: —— Logistic CDF。
关键事实: 和 在整个实数轴上都极其接近。 在 Xβ ∈ [-2, +2] 范围内(覆盖了绝大多数观测的预测指数),两个函数的最大差异不到 0.02。差异仅在 Xβ → ±∞ 的尾部才稍微拉开——而大多数观测的 Xβ 都在这个核心区间内。
既然概率本身几乎相同——边际效应()自然也几乎相同。这就是为什么 AME 对 Logit 和 Probit 的选择几乎不敏感。
2.3 那 β̂ 呢?——"1.6 法则"
Logit 的系数大约是 Probit 系数的 1.6—1.8 倍:
为什么? 因为 Logit 的误差方差()大于 Probit 的误差方差(1)——而 和 只以比值被识别。方差更大 → 系数需要在数值上更大,才能产生同等大小的概率效应。
但这不意味着你可以用"1.6 法则"来在模型之间精确转换系数——这只是一个近似,在 Xβ 远离 0 时近似会失效。 在 AME 的尺度上比较——不要在系数尺度上比较。这也是为什么永远不该在没有计算 AME 的情况下比较 Logit 和 Probit。
2.4 截面中选择 Logit 还是 Probit?——一个实用的决策框架
| 考虑因素 | 偏向 Logit | 偏向 Probit |
|---|---|---|
| 经济直觉 | 几率比(OR)有直接的经济解读 | 系数没有类似的直觉解读 |
| 学科传统 | 经济学主流(绝大多数实证用 Logit) | 有些流行病学、社会学传统 |
| 稀有事件 | 厚尾 → 稀有事件的预测概率更分散 | 薄尾 → 稀有事件的预测概率集中在更接近 0 或 1 的区域 |
| 计算速度 | 更快的收敛(Logistic 的数学形式更简单) | 略慢 |
| 内生二元变量的 IV 处理 | 可以用 ivprobit 或控制函数 |
控制函数方法在 Logit 的厚尾假设下更灵活 |
| 面板固定效应 | 可用(FE Logit / 条件 Logit) | 不可用——不一致(FE Probit 在小 T 时不一致) |
经济学中的经验法则:在截面数据中——用 Logit(然后用 AME)。在面板数据中,如果有固定效应——用 Logit(条件 Logit)。如果要用随机效应或 CRE(Correlated Random Effects)——Logit 或 Probit 在实践中相似,但遵循本领域的惯例。
三、面板数据中的二值选择——为什么事情变得复杂了?
3.1 面板二值选择的模型设定
在截面模型中,异质性被归入 。在面板中,你有了两个不可观测的成分:
- :个体 i 的不随时间变化的异质性(能力、文化、风险偏好……)。
- :时变的误差。
面板二值模型的核心挑战: 和 X 之间的关系。如果 (在观测数据中几乎总是如此),忽略 或假设它和 X 无关(RE)会导致不一致的估计。但处理 的方式——在二值面板中——和线性面板 FE(组内变换直接消去 )截然不同。
3.2 偶发参数问题(Incidental Parameters Problem)——FE Probit 在小 T 中不一致
线性面板 FE 为什么有效?因为组内变换 消去了 —— 不需要被直接估计。β 的估计量在 N → ∞、T 固定时是一致的。
在非线性模型中,组内变换不能消去 ——你必须直接估计每个个体的 。 在 FE Probit 中,你需要为每个个体 i 估计一个 ——即除了 β 的 K 个参数外,还额外增加了 N 个参数。
当 N → ∞ 且 T 固定时,参数总数(N + K)以和样本量(N × T)相同的速度增长。每个 只有 T 个观测来估计——T 固定的情况下, 的估计是不一致的。这 N 个不一致的 污染了 β 的估计——使 即使在 N → ∞ 时也不一致。这就是偶发参数问题。
FE Probit 的偏误有多大? Monte Carlo 模拟表明,在 T = 5 时,FE Probit 的 β 偏误可以达到 40%—60%。即使 T = 20,偏误仍然在 10%—20% 左右。FE Probit 在短 T 的面板中是不可用的。
3.3 条件 Logit(Conditional Logit / FE Logit)——Logit 的救场
Logit 模型有一个 Probit 没有的特殊性质:在 Logit 中,(个体 i 在所有时期中 Y = 1 的次数)是 的充分统计量(Chamberlain, 1980)。
这意味着——你可以通过在 这个总量上"条件化"——来消去 ,而不需要直接估计它。条件似然函数只依赖于 β,不依赖于 ——和线性面板 FE 的组内变换在概念上完全平行(都是通过一个数学操作消去 而非估计它)。
其中 是所有满足 的 0/1 序列 d 的集合——即所有可能排列 Y=1 和 Y=0 的时间点的方式,在保持总和不变的前提下。
直觉:条件 Logit 比较的不是"个体 A 和个体 B 之间谁的 Y 更可能是 1"——而是"对于同一个个体 i,在哪些时期 Y 更可能是 1(相对于其他时期)"。识别来自个体内部的 Y 的时间变异——和线性 FE 的"组内变异识别"完全对应。
* 条件 Logit(FE Logit)——只使用 Y 有时间变动的个体
xtlogit y x1 x2, fe
* 等价于
clogit y x1 x2, group(id)条件 Logit 的三个关键代价:
代价一:只有"转换者"被纳入。 如果一个个体的 Y 在所有时期都是 0 或都是 1( 或 T),条件似然对该个体的贡献为 0——这些个体被自动丢弃。如果你的因变量的变动很少(如"是否上市""是否破产"——大多数企业在样本期内不变),你的估计样本可能严重萎缩。 在论文中,明确报告"进入 FE Logit 估计的样本量从 N 降到了 N_switcher"是必要的。
代价二:系数的解释变了。 截面 Logit 的系数反映的是个体之间 X 差异对应的几率差异。条件 Logit 的系数反映的是同一个个体在不同时期 X 变化对应的几率变化——这是"组内效应"(within-effect),不是"组间效应"(between-effect)。这和线性面板 FE 的系数解释一致——但在二值模型中,这种解释更容易被误解为截面的解释。
代价三:AME 在 FE Logit 中不再能直接计算。 在截面 Logit 中,你可以在样本中对所有个体的边际效应取平均——因为你不需要知道 的具体值,只需要用平均的预测概率来近似。但在 FE Logit 中, 虽然被条件化消去了,如果你想要 AME,你需要 的值——而 FE Logit 不估计 。 直接在 FE Logit 后使用 margins 需要假设 ——这不是一个好的假设。正确计算 FE Logit 中的 AME 需要额外的步骤(见下文 4.3 节)。
四、面板二值选择的实证策略——不止 FE Logit 一条路
4.1 策略地图——四种方法及其假设
| 方法 | 的处理 | 的假设 | T 小时的可用性 | Stata |
|---|---|---|---|---|
| Pooled Logit/Probit | 忽略(假设 不存在) | 隐含假设 | ✅ 但假设不成立 | logit, probit |
| RE Logit/Probit | , | 零相关——在观测数据中几乎不成立 | ✅ 但假设不成立 | xtlogit, re, xtprobit, re |
| FE Logit(条件 Logit) | 条件化消去 | 任意相关 | ✅ 在小 T 时一致 | xtlogit, fe / clogit |
| CRE / Mundlak | 允许通过个体均值相关 | ✅(RE 框架,Mundlak 修正) | xtprobit, re + |
|
| FE Probit | 每个 被估计 | 任意相关 | ❌ 在小 T 时不一致 | 不推荐 |
4.2 策略 A:Pooled Logit——忽略面板结构
什么时候可以考虑?
- 你的面板是"伪面板"——N 大但 T 极小(T = 2 或 3),且个体内 Y 的变异极少。
- 你的核心解释变量本身在时间上几乎不变(如性别、种族、教育年限)——你在做的本来就不是一个面板识别。
- 但即使在这些情况下,至少应该聚类标准误到个体层面——承认同一企业不同年份的观测不是独立的。
4.3 策略 B:FE Logit(条件 Logit)——控制 的最强方式
什么时候使用?
- 你有关键的不随时间变化的混淆因素(),且 在理论上是不可避免的。
- 你的 Y 在足够多的个体中随时间变化(有足够的"转换者"来保证有效的样本量)。
- 你关注的系数是 X 的组内效应——同一个体在不同时间上 X 的变化对 Y 的几率的影响。
在 FE Logit 后如何计算 AME?
这是一个实操中被广泛讨论但经常被忽视的问题。FE Logit 的条件似然不估计 ——因此你不能直接沿用截面 Logit 的 AME 计算(它需要预测概率,而预测概率需要 )。有两种可行的方案:
方案一(不完美但常用):假设 来计算预测概率——这会给出一个"典型个体"的边际效应近似。这种方式在量级上通常合理(因为 的分布在群体中是中心化的),但在个体层面不准确。可以在论文中注明"AME 基于 的假设——应被理解为在样本中随机抽出的一个 的个体的边际效应"。
方案二(更严谨):使用 CRE(Correlated Random Effects)方法——在 RE 框架下加入 ,估计出 的近似值,然后计算 AME,利用这个 和 的贡献来构建个体层面的预测。这个方案更复杂,但更诚实。
在实践中,许多实证论文选择在 FE Logit 之后报告几率比(OR)而非 AME——因为 OR 不需要 的估计(OR 仅依赖 β̂,β̂ 在条件 Logit 中是一致的)。这是一个务实的取舍:用 OR 来提供经济直觉,而不需要在 AME 上做不可靠的近似。
4.4 策略 C:CRE(Correlated Random Effects)——第三条路
Mundlak(1978)和 Chamberlain(1984)的 CRE 方法在二值选择面板中特别有价值——因为它允许 和 X 相关(通过个体均值 ),同时避免了偶发参数问题。
其中 , 是 Logistic 或正态的。 中与 X 线性相关的部分被 显式地吸收了——剩余的部分 和 X 不相关(在 Mundlak 的假设下)。
CRE 相对于 FE Logit 的优势:
- 不丢弃"非转换者"——所有个体(包括 Y 始终为 0 或 1 的个体)都参与估计。样本量更大。
- 不随时间变化的变量的系数可以被估计—— 进入了模型,不随时间变化的 X 的组间效应可以被纳入和估计。
- AME 的计算更直接——你有一个 的估计,可以用来构建预测概率和边际效应,比 FE Logit 的 近似更诚实。
* CRE Probit(Mundlak 方式)
bysort id: egen x1_mean = mean(x1)
bysort id: egen x2_mean = mean(x2)
xtprobit y x1 x2 x1_mean x2_mean, re
margins, dydx(*) predict(pu0)CRE 的局限:
- 它只允许 和 X 之间线性相关——如果真实的相关是非线性的,CRE 不能完全处理。
- 对 T 小的面板是一个噪音较大的代理变量——可能削弱对 的控制的精确性。
4.5 策略 D:FE Probit——什么时候可以考虑?
答案:当 T 足够大时(T ≥ 15—20,且你的个体数量不太大)。 在 T 较大时,每个个体的 有了足够的信息来一致地估计——偶发参数问题的严重性随着 T 的增长而减弱。Monte Carlo 研究表明,在 T ≈ 20 时,FE Probit 的偏误通常可以接受(< 10%)。但在 T < 10 的微观面板中——这是绝大多数面板的 T 范围——FE Probit 不应该被用作主要识别策略。
如果审稿人要求在 T < 10 时使用 FE Probit——你应该解释偶发参数问题,并展示条件 Logit(FE Logit)作为稳健性检验。
五、面板中 Logit 和 Probit 的选择——一个重新校准的决策框架
5.1 从截面到面板——选择逻辑的根本转变
在截面中,Logit 和 Probit 的选择主要是"便利性"的——AME 相同,Logit 的几率比更直观,因此 Logit 胜出。
在面板中,选择逻辑转变成"可行性"的——因为你在短 T 中只有一个一致的面板 FE 二值模型:条件 Logit。
面板数据、需要控制 u_i、$\text{Cov}(X,u_i) \neq 0$:
│
├── T < 10(典型微观面板)
│ ├── Y 在足够多个体中随时间变化 → 条件 Logit(FE Logit)
│ │ ├── 关注组内效应 → 报告 OR(避免 AME 的 u_i 问题)
│ │ └── 需要 AME → 考虑 CRE 作为稳健性检验(提供 AME)
│ │
│ └── Y 在极少个体中随时间变化 → CRE(RE + Mundlak)
│ └── 使用所有个体,可估计 AME
│
└── T ≥ 15—20(宏观面板或长面板)
├── 条件 Logit 仍然可用且一致
└── FE Probit 偏误可接受 → 可以考虑,但建议仍以 Logit 为主
5.2 面板中的解读和解释——和截面的三个关键区别
区别一:你的系数是"组内效应",不是"组间效应"。
在截面 Logit 中,β 反映的是"个体 A(高 X)vs 个体 B(低 X)在 Y 上的几率差异"。在 FE Logit(条件 Logit)中,β 反映的是"同一个体在 X 高的年份 vs X 低的年份的 Y 的几率差异"。这两个量在经济上通常不同——X 的截面变异可能来自长期的结构性差异,而 X 的时间变异来自短期的冲击或调整。在论文中明确你的系数是"within-effect"——它回答的是"当 X 在个体内部变化时,Y 的几率如何变化"——而不是"高 X 的个体比低 X 的个体更可能 Y=1"。
区别二:你的样本变了——从"所有个体"到"转换者"。
在 FE Logit 中,Y 始终为 0 或始终为 1 的个体被丢弃。你需要报告进入估计的样本量,并讨论这种样本选择是否可能导致外部有效性的局限——如果"转换者"在可观测特征上系统性地不同于"非转换者",外部有效性可能受损。在论文中展示两者的描述性统计对比,是规范的。
区别三:AME 不能直接套用截面逻辑。
在截面中,你可以合理地假设 被吸收进 ——AME 在 margins 后直出。在面板 FE Logit 中,你不能——因为 虽然被消去,但没有被估计,也无法被假设为零。如果你的论文需要 AME(而不仅仅是 OR)——考虑 CRE 作为主模型或至少作为补充分析。
六、常见误区
6.1 误区一:"Logit 和 Probit 给不同的结论——我应该做检验来选一个"
在截面中,AME 几乎相同——不需要一个检验来选。如果你在同一个数据上跑 Logit 和 Probit 得到了实质性不同的 AME,问题不在模型选择——而在你的数据或模型设定可能出了问题(如完全分离、极度稀有的 Y、或模型误设)。Logit 和 Probit 的 AME 不一致本身就是一个诊断信号——不是"选哪个"的问题,是"我的模型在 Logit 和 Probit 假设下不稳定,为什么?"
6.2 误区二:"FE Logit 只用了转换者 → 有样本选择偏误 → 不能用"
这种样本缩减是条件似然的数学结果——它不影响内部有效性(你的 β 对于那些至少有过 Y 从 0 到 1 或从 1 到 0 的个体的子群体,仍然是一致的)。但它影响外部有效性——你的结论是否可以推广到所有个体?在论文中坦诚地讨论这一点,而非回避。
6.3 误区三:"FE Probit 在 Stata 里能跑 → 它应该是可用的"
Stata 的 xtprobit, fe 命令会运行——但它不能解决偶发参数问题。在小 T(T < 10)下,输出虽然出来了,但 有系统性的偏误。Stata 能跑 ≠ 模型正确。 在短面板中,条件 Logit 是唯一一致的二值 FE 模型。
6.4 误区四:"我的面板 T = 5——我用 RE Logit,因为 Hausman 检验不显著"
在截面线性面板中,如果 Hausman 检验不显著 → RE 和 FE 无差异 → RE 更有效,可以用 RE。但在二值面板中:条件 Logit(FE)和 RE Logit 的比较并非如此简单——因为模型的结构不同(FE 的条件似然 ≠ 加上哑元的 RE Logit)。更重要的是,RE Logit 的假设 在观测数据中的前提脆弱——即使在一些检验中不显著,理论上的论证通常不支持这个假设。 在二值面板中,使用 CRE(Mundlak-Chamberlain)来放松 RE 的假设,比依赖检验来在 RE 和 FE 之间切换更为规范。
6.5 误区五:"二值面板我就用线性概率模型(LPM)+ FE——反正方便"
LPM + FE 在二值面板中是一个被广泛接受的务实选择——尤其是在 N 很大、T 很小时。它没有偶发参数问题,AME 就是 OLS 系数,标准误容易集群。但 LPM 有它自己的问题(预测概率超出 [0,1]、边际效应假设恒定)。如果 Y 的发生率在 20%—80% 之间——LPM 通常表现得相当好。如果 Y 极稀有(< 5%)或极常见(> 95%)——非线性模型(Logit/Probit)可能给出更合理的预测和更可靠的边际效应。在论文中,如果使用 LPM + FE 作为基准,建议同时展示条件 Logit 作为稳健性——给审稿人一个看到你的结论在非线性设定下仍然成立的证据。
七、总结
Logit vs Probit + 面板二值选择——七条核心知识:
-
截面中 Logit 和 Probit 的 AME 几乎相同。 唯一的区别是潜变量误差的分布假设——Logistic vs 正态。AME 的差异在绝大多数实证数据中远小于抽样误差。选择主要是实用性的——Logit 的 OR 有经济直觉优势。
-
"1.6 法则"在系数层面——不要在系数层面比较。 Logit 系数 ≈ 1.6 × Probit 系数——因为方差标准化不同。在 AME 层面上比较——你几乎看不到差异。
-
面板中的分岔点——偶发参数问题。 在非线性 FE 模型中,你必须估计 N 个 ——在 T 固定时这些估计不一致,进而污染 β 的估计。Logit 是唯一一个可以通过条件似然消去 而不需要估计它的二值模型——这就是 FE Logit 在小 T 时唯一一致的原因。
-
条件 Logit = 只有"转换者"被使用 + 系数是组内效应 + AME 不能直出。 这是 FE Logit 的三个代价。在论文中明示它们——不隐藏样本缩减,不混淆组内效应和组间效应,不假装你可以不加条件地给出截面式的 AME。
-
CRE(Mundlak-Chamberlain)是面板二值选择的"第三条路"。 它允许 和 X 相关(通过 ),保留所有个体,且 AME 的计算更直接。代价是需要假设 和 X 的相关是线性的。在许多实证情景中,CRE 作为主模型比 FE Logit 更灵活。
-
LPM + FE 是一个被接受的务实基线。 当 Y 的发生率不太极端(20%—80%)且 N 大 T 小——LPM + FE 是简单、透明且审稿人通常认可的。用条件 Logit 作为稳健性检验来增强说服力。
-
在面板中,Logit 和 Probit 的选择从"便利性"变成了"可行性"。 截面中你可以随便选。面板中,如果你需要固定效应——Logit 是唯一一致的选项(在短 T 中)。这一事实应该主导你的模型选择——而非截面中的几率比 vs 系数解读的讨论。
一句话收尾:
"在截面中,Logit 和 Probit 是一对双胞胎——你选谁都不会错,但 Logit 的几率比让它更会说话。在面板中,这对双胞胎分道扬镳——Logit 可以通过条件似然从偶发参数问题的旋涡中逃生,Probit 被留在旋涡里——在小 T 中它的 β 注定被 N 个不一致的 拖下水。所以你选 Logit——不是因为它的几率比更好讲,而是因为在短面板的不确定水域中,它是唯一一艘不会沉的船。但你要记住——这艘船上只有'转换者'、它讲的是'组内效应'的故事、而且你没法轻易地算出船上所有人的平均边际效应。面板中的二值选择就是这样——你用一个优势换来了新的制约。好的实证不是假装这些制约不存在——而是在制约下仍然清晰地告诉读者:在这个框架中,X 对 Y 的影响是什么、对谁、在什么前提下。"
八、B站/公众号呈现建议
-
B站视频:建议用"双胞胎的两种命运"作为核心视觉隐喻。开场:截面世界中——两个长得几乎一模一样的人(Logit 和 Probit)站在一个 S 形曲线旁边。一个人手里拿着"OR(几率比)"的牌子(Logit),另一个人手里什么都没有(Probit)。旁白:"在截面中,Logit 和 Probit 给出的 AME 几乎相同——它们是在同一个 S 形曲线背后站着的双胞胎。Logit 唯一的优势是——它手上有几率比这个工具,可以讲'可能性乘了多少倍'的故事。" 画面切换——进入面板世界,出现一个巨大的旋涡("偶发参数问题")。Probit 被旋涡卷入——标注"FE Probit 在小 T 中不一致"。Logit 抓住了条件似然的绳索,从旋涡中荡了出去。旁白:"在面板中,这对双胞胎的命运不同了。固定效应 Probit 需要估计 N 个 u_i——在 T 很小时,这些不一致的 u_i 把 β 也拖下了水。Logit 有条件似然这根绳子——它可以消去 u_i 而不需要直接估计它们,从而在短 T 中存活。" 第一幕"FE Logit 的三个代价":三个画面依次呈现——(1)一半的样本被丢弃(标注"只有转换者留下"),(2)系数的箭头上刻着"组内效应",(3)AME 按钮无法被按下(红色警告——"u_i 未估计,AME 需额外步骤")。旁白:"FE Logit 的逃生不是免费的——你的样本缩小了、你的系数解释从组间转向了组内、你的 AME 不能再像截面那样直接算出来。" 第二幕"CRE——第三条路":Mundlak 的身影出现——在 RE 模型中加入了每个人的 X 的个体均值(X̄_i)。 中的内生部分被 X̄_i 吸收了。所有的个体(包括非转换者)都留在了模型中。AME 按钮现在可以按下了(绿色)。旁白:"Mundlak-Chamberlain 的 CRE 方法——你不需要在 FE 和 RE 之间二选一。你在 RE 中放入了个体均值来吸收内生性——保留了所有个体,恢复了 AME 的计算。代价是你假设了 u_i 和 X 的相关是线性的。没有完美的方案——但有一个你可以坦诚讨论其局限的方案。"
-
公众号:截面中 Logit vs Probit 的对比表(分布假设、方差、系数关系、AME 差异、OR 可用性)做成信息图核心。面板中四种策略(Pooled、RE、FE Logit、CRE)的对比框架表做成核心参考卡。条件 Logit 的三个代价(转换者样本、组内效应、AME 困难)做成三张警示卡。CRE 的 Mundlak 方式配代码(
xtprobit, re+ X̄_i)做成代码模板卡。偶发参数问题的图示解释(N 个 u_i 需要被估计,T 固定时每个 u_i 只有 T 个观测 → 不一致)做成视觉解释卡。常见误区五则做成纠错卡。 -
推荐标题:
- 主标题:《Logit 还是 Probit?——截面中几乎无关,面板中天差地别》
- 备选标题:《条件 Logit、RE Logit、CRE——面板二值选择的三种策略》
- 新媒体标题:《FE Probit 在短面板中是不一致的——为什么你的面板二值选择模型应该用 Logit?》
-
金句提炼:
"截面中 Logit 和 Probit 是一对双胞胎——AME 几乎相同,选谁都行。Logit 的几率比是它口袋里多出的一把瑞士军刀——不是必需的,但好用。面板中这对双胞胎被偶发参数问题的旋涡分开了——Logit 有条件似然的绳索,Probit 被留在了旋涡里。"
"条件 Logit 不是免费的午餐——你得到了 u_i 的一致性,但付出了三个代价:你的样本缩小到只剩'转换者',你的系数变成了组内效应,你不能再像截面那样轻易地算出 AME。好的实证不是假装这些代价不存在——而是在代价仍在的情况下,清晰地告诉读者结论在多大的范围内成立。"
"CRE 是二值面板的第三条路——你在 RE 中放下个体均值,让它们去吸收 u_i 中的内生部分。你不是在假设 u_i 和 X 无关——你是在假设 u_i 和 X 的关系是线性的,并且可以用 X 的个体均值来捕捉。这个假设比 RE 弱,比 FE 的数学更灵活——但你需要承认它仍然是一个假设。"
"偶发参数问题是非线性面板的一个幽灵——它不在线性 FE 中出现,因为组内变换让它无处可住。但在 Logit 和 Probit 中,你不能做组内变换——你必须直接面对 N 个 u_i。T 固定 → 每个 u_i 只有 T 个数据点 → u_i 的估计不一致 → 这 N 个不一致污染了 β 的估计。Logit 通过条件似然绕开它。Probit 没有这种数学的方便——在小 T 中,FE Probit 是不安全的。"