计量小课:计量经济学基础
计量经济学计量小课

当一个人在做实证研究的时候,他在做什么?

\"这个结论有实证支持吗?\"\"我们需要做实证研究。\"\"这篇论文是纯理论的,缺乏实证检验。\"

作者:计量科研导航站发布:2026-07-29★★

一、开篇:一个熟悉的陌生词

"这个结论有实证支持吗?""我们需要做实证研究。""这篇论文是纯理论的,缺乏实证检验。"

在学术讨论中,"实证研究"是一个高频词。但很少有人追问一句:当一个研究者说自己"在做实证研究"的时候,他到底在做什么?

打开Stata跑回归是做实证研究,实验室里让被试填问卷也是做实证研究,医院里给病人分组吃不同的药还是做实证研究——它们能是一回事吗?

这篇文章帮你厘清三件事:

  1. 实证研究和理论研究、思辨研究有什么本质不同?
  2. 同样是实证研究,心理学、经济学、医学的做法有什么差异?
  3. 经济学实证研究的完整步骤是什么?

二、三种研究范式:实证、理论与思辨

在谈具体的操作步骤之前,先要搞清楚实证研究在整个研究版图中的位置。

2.1 思辨研究:靠逻辑和洞察力

思辨研究(speculative research)是人类最古老的研究方式。它依赖研究者的内省、直觉和逻辑推演,不需要系统性地收集外部证据。

典型形态: 先秦诸子的政治哲学、亚当·斯密在《国富论》中对分工的论述(他并没有做数据分析,而是基于观察和推理)、大部分法学研究中对法理的阐释。

核心特征:

  • 数据不是必须的,推理的质量取决于洞察力和逻辑严密性。
  • 结论可能极有洞见,但无法被系统性地"证伪"。
  • 适合处理"应然"问题和概念分析,但在回答"实然"问题时力不从心。

2.2 理论研究:用模型建立"如果...就..."的逻辑链条

理论研究(theoretical research)构建形式化的框架来推导结论。在经济学的语境下,这通常意味着建立数学模型。

典型形态: 比如经济学中的市场均衡模型、物理学中的弦理论、博弈论中的均衡分析。

核心特征:

  • 关注"给定假设,必然推导出什么",不碰数据。
  • 产出的是可检验的假说,而不是最终结论。
  • 判断标准是逻辑自洽性,而不是与现实数据的吻合度。

2.3 实证研究:用系统化的外部证据回答问题

实证研究(empirical research)的独特之处在于:它要求研究者走出自己的大脑,去外部世界系统地收集和分析证据。

这里的"证据"可以是实验室的行为数据,可以是全国普查的统计数据,可以是访谈录音的文字稿,也可以是企业后台的用户点击日志——关键在于收集方式和分析方式都必须是系统化的、可复现的


一张表看懂三种范式

维度 思辨研究 理论研究 实证研究
核心输入 直觉、洞察、逻辑 假设、数学工具 系统化收集的外部数据
核心产出 观点、思想体系 定理、假说、模型 对假说的检验结果、效应估计
判断标准 逻辑是否自洽、论证是否有力 推导是否正确 证据是否可靠、结论能否复现
能否证伪 困难 假说可证伪,模型本身不可 可以,这也是它的核心追求
典型学科 哲学、法学、部分政治理论 理论物理、数学、理论经济学 医学、心理学、计量经济学

一句话概括:思辨研究说"我认为应该是这样",理论研究说"如果假设成立那就必然是那样",实证研究说"让我们看看实际情况到底是什么样"。


三、同一面旗帜,不同的仗法:三个学科的实证研究对比

同样自称"做实证",不同学科的操作方式和关注重点可能天差地别。这里选三个代表性学科来对比:心理学、经济学和医学。

3.1 心理学的实证研究:控制实验 + 方差分析

心理学的实证研究以实验室实验为主流范式。核心思路是:操纵一个变量,观察另一个变量的变化,然后检验这种变化是否超出了随机波动的范围。

典型步骤:

  1. 招募被试(通常是大一修心理学导论课的学生)
  2. 随机分配到实验组和控制组
  3. 操纵自变量(如让实验组看一段暴力视频,控制组看中性视频)
  4. 测量因变量(如攻击性量表得分)
  5. 用 t 检验或方差分析(ANOVA)检验组间差异

核心模型:

Yi=μ+τTi+εiY_i = \mu + \tau \cdot T_i + \varepsilon_i

其中 TiT_i 是处理指示变量(0或1),τ\tau 就是实验处理效应——这就是心理学实验最基础的统计模型。更复杂的设计会加入中介变量、调节变量,形成所谓"中介-调节分析"的框架。

核心关注点:

  • 内部效度:观察到的效应是不是真的是操纵引起的?
  • 随机化是否成功:实验组和控制组在基线特征上是否真的可比?
  • 效应量(effect size):效应在统计上显著还不够,有多大?

一个经典案例: 斯坦福监狱实验(Zimbardo, 1971)。随机分配学生扮演"狱警"和"囚犯",观察角色对行为的影响。这个实验完美展示了心理学实证研究的威力——通过随机化,把"角色是否影响行为"这个哲学问题变成了一个可操作的实证问题。当然,它的伦理问题和后续对内部效度的质疑也展示了这类研究的边界。


3.2 经济学的实证研究:观测数据 + 因果识别

经济学实证研究(即计量经济学)有一个根本性的困境:经济学家几乎不能做实验。

你不能随机给一群人涨工资、给另一群人降工资来估计劳动供给弹性;你不能随机让一个国家加入WTO、让另一个国家不加入来研究贸易自由化的影响。经济学家拿到的数据,几乎全部是观测数据——人们已经在生活中"自我选择"过了。

这就决定了经济学实证研究的核心命题:在不能随机化的情况下,如何识别因果关系?

典型步骤(我们称之为"因果推断五件套"):

  1. 提出一个可以用数据检验的经济问题
  2. 寻找一个识别策略——这通常是整篇论文最值钱的部分
  3. 用计量模型估计因果效应
  4. 做一系列稳健性检验来排除替代性解释
  5. 讨论估计结果的经济显著性

核心模型矩阵(研究设计优先于具体模型):

  • 工具变量(IV):找一个只通过影响X来影响Y的第三方变量。经典案例:安格里斯特用征兵抽签号码作为"是否服兵役"的工具变量,估计兵役对终身收入的影响。
  • 双重差分(DID):比较处理组和控制组在政策前后的变化差异。上一篇讲的Card & Krueger最低工资研究就是典范。
  • 断点回归(RDD):在某一个临界值附近,处理分配是"近乎随机"的。比如高考分数线上下几分的学生,能力几乎一样,但一个上了大学、一个没上——这构成了估计大学教育回报的绝佳机会。
  • 固定效应模型:控制不随时间变化的遗漏变量。比如研究"民主是否促进经济增长"时,控制国家固定效应可以吸收掉地理、文化等不变因素。

核心关注点:

  • 识别(identification):你的估计能不能被解释为因果关系?这是经济学的灵魂问题。一篇计量论文如果"识别不清",无论R²多高都是废纸。
  • 内生性:你的关键自变量是不是和扰动项相关?如果相关,OLS估计就是有偏且不一致的。
  • 经济显著性 vs 统计显著性:效应在统计上显著不等于在经济上重要。一个变量可能在 p < 0.001 的水平上显著,但系数只有 0.0001——这在经济意义上可能是微不足道的。

3.3 医学的实证研究:临床试验 + 证据等级

选择医学作为第三个对比学科,是因为它和经济学构成了一个绝妙的对立:医学能做随机对照试验(RCT),而经济学通常不能。

医学实证研究的核心范式——RCT:

  1. 招募符合条件的患者
  2. 随机分配到治疗组和对照组(这是关键差异!)
  3. 双盲(患者和医生都不知道谁在哪个组)
  4. 随访一段时间,测量预设的结局指标
  5. 用意向性分析(ITT)或符合方案分析(PP)来估计治疗效应

医学的证据等级体系(Evidence Hierarchy):

等级 证据类型 说明
最高 RCT的系统综述与Meta分析 多个RCT结果的定量汇总
单个高质量RCT 随机化消除混杂偏倚
队列研究 追踪两组人(暴露/未暴露)比较结局
病例-对照研究 从结局反推暴露因素
最低 病例报告、专家意见 缺乏对照组,证据力最弱

核心关注点:

  • 随机化和盲法是否严格:任何破坏随机化的操作都会让整个研究降级。
  • 临床显著性 vs 统计显著性:药物能降低血压2 mmHg,p < 0.001,统计学上完美——但在临床上这种幅度的降压有意义吗?
  • 外部效度:试验在高度筛选的"理想患者"身上做的,结果能推广到真实世界的多样化患者群体吗?

3.4 三学科关键差异对照表

维度 心理学 经济学 医学
典型数据来源 实验室行为数据 观测数据(调查、行政记录) RCT + 队列追踪
能否做随机实验 通常可以 极少能 可以,且是金标准
核心方法 t检验, ANOVA, 中介分析 IV, DID, RDD, 固定效应 RCT, 生存分析, Meta
核心挑战 生态效度(实验室→真实世界) 内生性(因果识别的难度) 外部效度(理想患者→真实患者)
"显著"的含义 效应量(Cohen's d等) 经济显著性(系数大小 + 现实含义) 临床显著性(对患者有无实际好处)
标志性研究 斯坦福监狱实验 Card & Krueger (1994) 弗拉明汉心脏研究
一句调侃 "大二学生的行为科学" "识别策略就是一切" "RCT or go home"

四、经济学实证研究的完整步骤清单

理解了跨学科的全景之后,我们把镜头收回来,聚焦到经济学实证研究的具体操作上。一个标准的经济学实证研究项目,通常按照以下七个步骤推进:

步骤一:提出经济问题

不是所有问题都是经济问题。 "中国的收入不平等在过去二十年发生了什么变化?"——这是一个经济问题。"教育能降低不平等吗?"——这才是一个可以用实证方法回答的因果问题。

好的实证问题通常满足三个标准:重要(值得回答)、可操作(有数据能回答)、有张力(直觉可能判断错误)。

步骤二:辨析经济变量

把抽象概念"翻译"成可测量的指标,这一步远比看起来的困难。

  • 你想研究"人力资本" → 是用受教育年限?还是用标准化考试成绩?还是用工作经验的年数?
  • 你想研究"健康" → 是用自评健康(主观)?还是BMI(客观但粗糙)?还是医疗支出(有选择性偏误)?
  • 你想研究"制度质量" → 是用世界银行的治理指数?还是用产权保护力度?还是用合同的司法执行效率?

变量的选择本身就暗含着理论立场。 选择不同的代理变量可能导致完全不同的实证结论,这就是为什么一个好的实证研究者会花大量时间论证"为什么我用这个指标来衡量这个概念"。

步骤三:建立计量经济模型

这是上一篇的核心内容,这里做简要回顾。计量模型本质上是一个假设的数学结构,它描述了因变量和自变量之间的数据生成过程:

Yi=β0+β1Xi+β2Zi+εiY_i = \beta_0 + \beta_1 X_i + \beta_2 Z_i + \varepsilon_i
  • YiY_i:你想解释的变量
  • XiX_i:你关心的关键自变量
  • ZiZ_i:控制变量(你承认它们影响Y,但不是你此刻的关注点)
  • εi\varepsilon_i:包含一切你没测到的、不知道的、无法测量的因素
  • β1\beta_1:你真正想估计的——X对Y的因果效应

步骤四:选择识别策略

这是经济学实证研究最独特的一步——在其他学科中,你很少看到"识别策略"这个词占据论文的核心位置。

识别策略回答的是这个问题:你凭什么说 β1\beta_1 是因果效应,而不只是相关关系?

常见的识别策略及其适用场景:

策略 适用场景 核心思想 经典案例
工具变量(IV) X是内生的,但你能找到一个外生的Z Z的变化 → X的变化 → Y的变化,用Z的变异来识别X的因果效应 征兵抽签 → 兵役 → 终生收入
双重差分(DID) 有一个政策冲击,且有不受影响的对照组 处理组的前后变化减去控制组的前后变化 = 政策效应 新泽西最低工资改革
断点回归(RDD) 处理的分配在某临界值处有一个跳跃 在临界值附近,处理近似随机分配 高考分数线 → 大学教育 → 收入
固定效应 你有面板数据,且遗漏变量不随时间变化 每个个体做自己的对照组 民主与经济增长的跨国面板分析

没有识别策略的回归,只是描述性统计加上了一些数字。

步骤五:估计模型参数

这是技术上最"简单"的一步——在现代统计软件的帮助下,你只要写一行代码:

reg ln_wage education experience exp_squared, robust

简单不等于不重要。在这一步你需要处理好:

  • 标准误的估计方式(异方差稳健标准误、聚类标准误、自举标准误)
  • 缺失数据的处理
  • 异常值的检测
  • 多重共线性的诊断

步骤六:检验统计显著性

统计显著性回答的是:我们观察到的效应,有多大的概率是纯粹由抽样误差导致的?

  • p < 0.05:如果真实效应为零,我们观察到当前结果(或更极端结果)的概率小于5%。
  • 95%置信区间:我们有95%的信心认为真实参数落在这个区间内。

关键提醒:统计显著性 ≠ 经济重要性。 在大样本下,即使一个微小到无意义的效应也可能统计显著。这就是为什么还需要最后一步。

步骤七:识别经济显著性

经济显著性回答的是另一个问题:这个效应在现实世界中重要吗?

比如,你估计出"每增加一年教育,工资上涨0.5%",这个效应可能统计显著(p < 0.01,样本够大),但在经济上——一个人多读一年书只多挣0.5%,这意味着教育投资几乎不划算。

判断经济显著性通常看:

  • 系数的大小本身(弹性、半弹性)
  • 与基准水平的比较(相对于平均工资,0.5%是什么概念?)
  • 与已有文献估计值的比较(其他研究用不同数据得到了什么?)
  • 反事实模拟(如果政策改变,总体经济会受到多大影响?)

五、总结:实证研究的灵魂——消除替代性解释

回头看三种学科、七步流程,你会发现所有实证研究的努力都在指向同一个方向:

系统性地排除替代性解释,让"X导致了Y"这个结论变得比任何替代叙事都更可信。

  • 心理学通过随机化来排除个体差异这个替代解释。
  • 经济学通过识别策略来排除反向因果、遗漏变量、自选择等替代解释。
  • 医学通过RCT + 双盲来排除安慰剂效应和评估者偏倚这些替代解释。

而所有的统计工具——t检验、回归、工具变量、方差分析、生存分析——本质上都是同一个事情的不同形式:在数据中分离出"信号的信号"。


六、最后:一张"做实证研究就是..."的地图

如果下次有人问你"做实证研究到底是在做什么",你可以给他这张地图:

做实证研究 = 提出一个可错的问题
            + 找到或生成能回答这个问题的数据
            + 选择一个能排除替代性解释的研究设计
            + 用统计模型估计你关心的效应
            + 区分"统计上显著"和"实际上重要"
            + 诚实地报告你的假设、局限和不确定性

而实证研究的终极美德,不是"证明自己是对的",而是——让你的结论可以被事实推翻。推翻的过程本身,就是科学的进步。


七、B站/公众号呈现建议

  • B站视频:建议在"三学科对比"部分用三个并排画面分别展示心理学实验室、经济学家看图表、医生做临床试验的视觉意象,然后在结束时合到一个画面上打出"消除替代性解释"。
  • 公众号:三个学科的对比表格适合做成信息图;七步流程建议做成纵向流程图,每步配一个图标。
  • 推荐标题(公众号/视频均可)
    • 主标题:《当一个人在做实证研究时,他在做什么?》
    • 备选标题:《心理学、经济学、医学——同一面"实证"旗帜下的三种仗法》
  • 金句提炼(适合封面卡/结尾定格):

    "实证研究的灵魂,不是证明自己是对的,而是让你的结论可以被事实推翻。"