当一个人在做实证研究的时候,他在做什么?
\"这个结论有实证支持吗?\"\"我们需要做实证研究。\"\"这篇论文是纯理论的,缺乏实证检验。\"
一、开篇:一个熟悉的陌生词
"这个结论有实证支持吗?""我们需要做实证研究。""这篇论文是纯理论的,缺乏实证检验。"
在学术讨论中,"实证研究"是一个高频词。但很少有人追问一句:当一个研究者说自己"在做实证研究"的时候,他到底在做什么?
打开Stata跑回归是做实证研究,实验室里让被试填问卷也是做实证研究,医院里给病人分组吃不同的药还是做实证研究——它们能是一回事吗?
这篇文章帮你厘清三件事:
- 实证研究和理论研究、思辨研究有什么本质不同?
- 同样是实证研究,心理学、经济学、医学的做法有什么差异?
- 经济学实证研究的完整步骤是什么?
二、三种研究范式:实证、理论与思辨
在谈具体的操作步骤之前,先要搞清楚实证研究在整个研究版图中的位置。
2.1 思辨研究:靠逻辑和洞察力
思辨研究(speculative research)是人类最古老的研究方式。它依赖研究者的内省、直觉和逻辑推演,不需要系统性地收集外部证据。
典型形态: 先秦诸子的政治哲学、亚当·斯密在《国富论》中对分工的论述(他并没有做数据分析,而是基于观察和推理)、大部分法学研究中对法理的阐释。
核心特征:
- 数据不是必须的,推理的质量取决于洞察力和逻辑严密性。
- 结论可能极有洞见,但无法被系统性地"证伪"。
- 适合处理"应然"问题和概念分析,但在回答"实然"问题时力不从心。
2.2 理论研究:用模型建立"如果...就..."的逻辑链条
理论研究(theoretical research)构建形式化的框架来推导结论。在经济学的语境下,这通常意味着建立数学模型。
典型形态: 比如经济学中的市场均衡模型、物理学中的弦理论、博弈论中的均衡分析。
核心特征:
- 关注"给定假设,必然推导出什么",不碰数据。
- 产出的是可检验的假说,而不是最终结论。
- 判断标准是逻辑自洽性,而不是与现实数据的吻合度。
2.3 实证研究:用系统化的外部证据回答问题
实证研究(empirical research)的独特之处在于:它要求研究者走出自己的大脑,去外部世界系统地收集和分析证据。
这里的"证据"可以是实验室的行为数据,可以是全国普查的统计数据,可以是访谈录音的文字稿,也可以是企业后台的用户点击日志——关键在于收集方式和分析方式都必须是系统化的、可复现的。
一张表看懂三种范式
| 维度 | 思辨研究 | 理论研究 | 实证研究 |
|---|---|---|---|
| 核心输入 | 直觉、洞察、逻辑 | 假设、数学工具 | 系统化收集的外部数据 |
| 核心产出 | 观点、思想体系 | 定理、假说、模型 | 对假说的检验结果、效应估计 |
| 判断标准 | 逻辑是否自洽、论证是否有力 | 推导是否正确 | 证据是否可靠、结论能否复现 |
| 能否证伪 | 困难 | 假说可证伪,模型本身不可 | 可以,这也是它的核心追求 |
| 典型学科 | 哲学、法学、部分政治理论 | 理论物理、数学、理论经济学 | 医学、心理学、计量经济学 |
一句话概括:思辨研究说"我认为应该是这样",理论研究说"如果假设成立那就必然是那样",实证研究说"让我们看看实际情况到底是什么样"。
三、同一面旗帜,不同的仗法:三个学科的实证研究对比
同样自称"做实证",不同学科的操作方式和关注重点可能天差地别。这里选三个代表性学科来对比:心理学、经济学和医学。
3.1 心理学的实证研究:控制实验 + 方差分析
心理学的实证研究以实验室实验为主流范式。核心思路是:操纵一个变量,观察另一个变量的变化,然后检验这种变化是否超出了随机波动的范围。
典型步骤:
- 招募被试(通常是大一修心理学导论课的学生)
- 随机分配到实验组和控制组
- 操纵自变量(如让实验组看一段暴力视频,控制组看中性视频)
- 测量因变量(如攻击性量表得分)
- 用 t 检验或方差分析(ANOVA)检验组间差异
核心模型:
其中 是处理指示变量(0或1), 就是实验处理效应——这就是心理学实验最基础的统计模型。更复杂的设计会加入中介变量、调节变量,形成所谓"中介-调节分析"的框架。
核心关注点:
- 内部效度:观察到的效应是不是真的是操纵引起的?
- 随机化是否成功:实验组和控制组在基线特征上是否真的可比?
- 效应量(effect size):效应在统计上显著还不够,有多大?
一个经典案例: 斯坦福监狱实验(Zimbardo, 1971)。随机分配学生扮演"狱警"和"囚犯",观察角色对行为的影响。这个实验完美展示了心理学实证研究的威力——通过随机化,把"角色是否影响行为"这个哲学问题变成了一个可操作的实证问题。当然,它的伦理问题和后续对内部效度的质疑也展示了这类研究的边界。
3.2 经济学的实证研究:观测数据 + 因果识别
经济学实证研究(即计量经济学)有一个根本性的困境:经济学家几乎不能做实验。
你不能随机给一群人涨工资、给另一群人降工资来估计劳动供给弹性;你不能随机让一个国家加入WTO、让另一个国家不加入来研究贸易自由化的影响。经济学家拿到的数据,几乎全部是观测数据——人们已经在生活中"自我选择"过了。
这就决定了经济学实证研究的核心命题:在不能随机化的情况下,如何识别因果关系?
典型步骤(我们称之为"因果推断五件套"):
- 提出一个可以用数据检验的经济问题
- 寻找一个识别策略——这通常是整篇论文最值钱的部分
- 用计量模型估计因果效应
- 做一系列稳健性检验来排除替代性解释
- 讨论估计结果的经济显著性
核心模型矩阵(研究设计优先于具体模型):
- 工具变量(IV):找一个只通过影响X来影响Y的第三方变量。经典案例:安格里斯特用征兵抽签号码作为"是否服兵役"的工具变量,估计兵役对终身收入的影响。
- 双重差分(DID):比较处理组和控制组在政策前后的变化差异。上一篇讲的Card & Krueger最低工资研究就是典范。
- 断点回归(RDD):在某一个临界值附近,处理分配是"近乎随机"的。比如高考分数线上下几分的学生,能力几乎一样,但一个上了大学、一个没上——这构成了估计大学教育回报的绝佳机会。
- 固定效应模型:控制不随时间变化的遗漏变量。比如研究"民主是否促进经济增长"时,控制国家固定效应可以吸收掉地理、文化等不变因素。
核心关注点:
- 识别(identification):你的估计能不能被解释为因果关系?这是经济学的灵魂问题。一篇计量论文如果"识别不清",无论R²多高都是废纸。
- 内生性:你的关键自变量是不是和扰动项相关?如果相关,OLS估计就是有偏且不一致的。
- 经济显著性 vs 统计显著性:效应在统计上显著不等于在经济上重要。一个变量可能在 p < 0.001 的水平上显著,但系数只有 0.0001——这在经济意义上可能是微不足道的。
3.3 医学的实证研究:临床试验 + 证据等级
选择医学作为第三个对比学科,是因为它和经济学构成了一个绝妙的对立:医学能做随机对照试验(RCT),而经济学通常不能。
医学实证研究的核心范式——RCT:
- 招募符合条件的患者
- 随机分配到治疗组和对照组(这是关键差异!)
- 双盲(患者和医生都不知道谁在哪个组)
- 随访一段时间,测量预设的结局指标
- 用意向性分析(ITT)或符合方案分析(PP)来估计治疗效应
医学的证据等级体系(Evidence Hierarchy):
| 等级 | 证据类型 | 说明 |
|---|---|---|
| 最高 | RCT的系统综述与Meta分析 | 多个RCT结果的定量汇总 |
| 高 | 单个高质量RCT | 随机化消除混杂偏倚 |
| 中 | 队列研究 | 追踪两组人(暴露/未暴露)比较结局 |
| 低 | 病例-对照研究 | 从结局反推暴露因素 |
| 最低 | 病例报告、专家意见 | 缺乏对照组,证据力最弱 |
核心关注点:
- 随机化和盲法是否严格:任何破坏随机化的操作都会让整个研究降级。
- 临床显著性 vs 统计显著性:药物能降低血压2 mmHg,p < 0.001,统计学上完美——但在临床上这种幅度的降压有意义吗?
- 外部效度:试验在高度筛选的"理想患者"身上做的,结果能推广到真实世界的多样化患者群体吗?
3.4 三学科关键差异对照表
| 维度 | 心理学 | 经济学 | 医学 |
|---|---|---|---|
| 典型数据来源 | 实验室行为数据 | 观测数据(调查、行政记录) | RCT + 队列追踪 |
| 能否做随机实验 | 通常可以 | 极少能 | 可以,且是金标准 |
| 核心方法 | t检验, ANOVA, 中介分析 | IV, DID, RDD, 固定效应 | RCT, 生存分析, Meta |
| 核心挑战 | 生态效度(实验室→真实世界) | 内生性(因果识别的难度) | 外部效度(理想患者→真实患者) |
| "显著"的含义 | 效应量(Cohen's d等) | 经济显著性(系数大小 + 现实含义) | 临床显著性(对患者有无实际好处) |
| 标志性研究 | 斯坦福监狱实验 | Card & Krueger (1994) | 弗拉明汉心脏研究 |
| 一句调侃 | "大二学生的行为科学" | "识别策略就是一切" | "RCT or go home" |
四、经济学实证研究的完整步骤清单
理解了跨学科的全景之后,我们把镜头收回来,聚焦到经济学实证研究的具体操作上。一个标准的经济学实证研究项目,通常按照以下七个步骤推进:
步骤一:提出经济问题
不是所有问题都是经济问题。 "中国的收入不平等在过去二十年发生了什么变化?"——这是一个经济问题。"教育能降低不平等吗?"——这才是一个可以用实证方法回答的因果问题。
好的实证问题通常满足三个标准:重要(值得回答)、可操作(有数据能回答)、有张力(直觉可能判断错误)。
步骤二:辨析经济变量
把抽象概念"翻译"成可测量的指标,这一步远比看起来的困难。
- 你想研究"人力资本" → 是用受教育年限?还是用标准化考试成绩?还是用工作经验的年数?
- 你想研究"健康" → 是用自评健康(主观)?还是BMI(客观但粗糙)?还是医疗支出(有选择性偏误)?
- 你想研究"制度质量" → 是用世界银行的治理指数?还是用产权保护力度?还是用合同的司法执行效率?
变量的选择本身就暗含着理论立场。 选择不同的代理变量可能导致完全不同的实证结论,这就是为什么一个好的实证研究者会花大量时间论证"为什么我用这个指标来衡量这个概念"。
步骤三:建立计量经济模型
这是上一篇的核心内容,这里做简要回顾。计量模型本质上是一个假设的数学结构,它描述了因变量和自变量之间的数据生成过程:
- :你想解释的变量
- :你关心的关键自变量
- :控制变量(你承认它们影响Y,但不是你此刻的关注点)
- :包含一切你没测到的、不知道的、无法测量的因素
- :你真正想估计的——X对Y的因果效应
步骤四:选择识别策略
这是经济学实证研究最独特的一步——在其他学科中,你很少看到"识别策略"这个词占据论文的核心位置。
识别策略回答的是这个问题:你凭什么说 是因果效应,而不只是相关关系?
常见的识别策略及其适用场景:
| 策略 | 适用场景 | 核心思想 | 经典案例 |
|---|---|---|---|
| 工具变量(IV) | X是内生的,但你能找到一个外生的Z | Z的变化 → X的变化 → Y的变化,用Z的变异来识别X的因果效应 | 征兵抽签 → 兵役 → 终生收入 |
| 双重差分(DID) | 有一个政策冲击,且有不受影响的对照组 | 处理组的前后变化减去控制组的前后变化 = 政策效应 | 新泽西最低工资改革 |
| 断点回归(RDD) | 处理的分配在某临界值处有一个跳跃 | 在临界值附近,处理近似随机分配 | 高考分数线 → 大学教育 → 收入 |
| 固定效应 | 你有面板数据,且遗漏变量不随时间变化 | 每个个体做自己的对照组 | 民主与经济增长的跨国面板分析 |
没有识别策略的回归,只是描述性统计加上了一些数字。
步骤五:估计模型参数
这是技术上最"简单"的一步——在现代统计软件的帮助下,你只要写一行代码:
reg ln_wage education experience exp_squared, robust但简单不等于不重要。在这一步你需要处理好:
- 标准误的估计方式(异方差稳健标准误、聚类标准误、自举标准误)
- 缺失数据的处理
- 异常值的检测
- 多重共线性的诊断
步骤六:检验统计显著性
统计显著性回答的是:我们观察到的效应,有多大的概率是纯粹由抽样误差导致的?
- p < 0.05:如果真实效应为零,我们观察到当前结果(或更极端结果)的概率小于5%。
- 95%置信区间:我们有95%的信心认为真实参数落在这个区间内。
关键提醒:统计显著性 ≠ 经济重要性。 在大样本下,即使一个微小到无意义的效应也可能统计显著。这就是为什么还需要最后一步。
步骤七:识别经济显著性
经济显著性回答的是另一个问题:这个效应在现实世界中重要吗?
比如,你估计出"每增加一年教育,工资上涨0.5%",这个效应可能统计显著(p < 0.01,样本够大),但在经济上——一个人多读一年书只多挣0.5%,这意味着教育投资几乎不划算。
判断经济显著性通常看:
- 系数的大小本身(弹性、半弹性)
- 与基准水平的比较(相对于平均工资,0.5%是什么概念?)
- 与已有文献估计值的比较(其他研究用不同数据得到了什么?)
- 反事实模拟(如果政策改变,总体经济会受到多大影响?)
五、总结:实证研究的灵魂——消除替代性解释
回头看三种学科、七步流程,你会发现所有实证研究的努力都在指向同一个方向:
系统性地排除替代性解释,让"X导致了Y"这个结论变得比任何替代叙事都更可信。
- 心理学通过随机化来排除个体差异这个替代解释。
- 经济学通过识别策略来排除反向因果、遗漏变量、自选择等替代解释。
- 医学通过RCT + 双盲来排除安慰剂效应和评估者偏倚这些替代解释。
而所有的统计工具——t检验、回归、工具变量、方差分析、生存分析——本质上都是同一个事情的不同形式:在数据中分离出"信号的信号"。
六、最后:一张"做实证研究就是..."的地图
如果下次有人问你"做实证研究到底是在做什么",你可以给他这张地图:
做实证研究 = 提出一个可错的问题
+ 找到或生成能回答这个问题的数据
+ 选择一个能排除替代性解释的研究设计
+ 用统计模型估计你关心的效应
+ 区分"统计上显著"和"实际上重要"
+ 诚实地报告你的假设、局限和不确定性
而实证研究的终极美德,不是"证明自己是对的",而是——让你的结论可以被事实推翻。推翻的过程本身,就是科学的进步。
七、B站/公众号呈现建议
- B站视频:建议在"三学科对比"部分用三个并排画面分别展示心理学实验室、经济学家看图表、医生做临床试验的视觉意象,然后在结束时合到一个画面上打出"消除替代性解释"。
- 公众号:三个学科的对比表格适合做成信息图;七步流程建议做成纵向流程图,每步配一个图标。
- 推荐标题(公众号/视频均可):
- 主标题:《当一个人在做实证研究时,他在做什么?》
- 备选标题:《心理学、经济学、医学——同一面"实证"旗帜下的三种仗法》
- 金句提炼(适合封面卡/结尾定格):
"实证研究的灵魂,不是证明自己是对的,而是让你的结论可以被事实推翻。"