当我们拿到一份数据,如何从抽样的视角审视它的代表性与合理性?
上过计量方法课的人,大概率都学过抽样——简单随机抽样、分层抽样、整群抽样、系统抽样、PPS抽样,每种方法的公式和特点都背过。考试的时候,你知道分层抽样能降低方差,知道整群抽样的设计效应怎么算。
一、开篇:学过的抽样理论,为什么一到用的时候就"失踪"了?
上过计量方法课的人,大概率都学过抽样——简单随机抽样、分层抽样、整群抽样、系统抽样、PPS抽样,每种方法的公式和特点都背过。考试的时候,你知道分层抽样能降低方差,知道整群抽样的设计效应怎么算。
但一到实战,这些知识仿佛消失了。
当你打开一份CFPS或CGSS的数据,当你读到一篇论文里写"本研究使用XX调查2018年的数据",当你自己收回来500份问卷——你会下意识地用抽样理论的框架去审视这些数据吗?
大部分人不会。大家更关心的是"因变量和自变量怎么定义""回归结果显不显著"。至于这份数据是怎么来的、样本能不能代表想研究的群体——说实话,很少有人认真追究。
这就是本文要解决的问题:帮你把抽样理论从"考完就忘的知识"变成"拿到数据就会用的一套审视工具"。
核心信息:数据质量的上限,在收集数据的那一刻就已经被决定了。后面所有的计量技巧,都是在已有条件下尽量逼近真相,而不是无中生有地创造信息。
二、审视数据出身:五个必须追问的核心问题
当你面对一份数据——无论是自己收集的还是从公开数据库下载的——下面五个问题构成了审视其代表性与合理性的基本框架。每追问一个问题,你都在排除一种可能导致整项研究站不住脚的风险。
问题一:目标总体是什么?抽样框覆盖了它吗?
这是最根本的问题。如果这里出了错,后面的所有分析都建立在一个错误的前提上。
目标总体(Target Population):你真正想研究的人群。比如,"中国18—60岁劳动年龄人口"。
抽样框(Sampling Frame):你实际能从中抽取样本的名单或范围。比如,"全国手机号段数据库"。
关键:抽样框 ≠ 目标总体。 两者之间的差距叫覆盖偏误(Coverage Bias),这是你拿到数据后要做的第一项诊断。
几个让你立刻警觉的例子:
- 你想研究"中国成年人的政治态度",但数据来自网络问卷。抽样框是"能上网且愿意填问卷的网民"——老年人、农村居民、低收入群体中的许多人被系统性遗漏。你的结论不代表"中国人",只代表"网民中愿意填问卷的那部分人"。
- 你想研究"中国企业的创新行为",但数据是A股上市公司。抽样框覆盖了多少企业?中国有几千万家企业,上市公司的数量不过几千家。中小微企业——它们可能用完全不同的方式做创新——根本不在你的视野之内。
- 你想研究"人类的风险偏好",用的数据来自心理学被试库,被试是某大学修心理学导论的本科生。抽样框是一个系的学生,目标总体是"人类"。这个差距有多大,《自然》和《科学》上已经争论了几十年。
你的操作:拿到数据后,第一步就是问——这份数据的抽样框是什么?我想研究的目标总体是什么?它们之间的差距在哪些维度上、对哪些群体是系统性的?如果你的结论在被遗漏的群体中可能不成立,这个方向是让效应更强还是更弱?
问题二:用的是什么抽样方法?它真的是"随机"的吗?
"随机抽样"这个词被滥用的程度,可能仅次于"显著"。
严格意义上的随机抽样:总体中每个个体被抽中的概率是已知且非零的。重点在"已知"——你知道每个个体被选中的概率。正因为你知道这个概率,你才可以用它来构造抽样权重,把样本还原成对总体的无偏估计。
几种常见的"假随机"场景,看到就要立刻警觉:
- 街头拦截访问:看似随机拦住路人,但实际上拦住谁取决于访问员的主观判断(更可能拦看起来友善的人),以及谁恰好那个时间经过那条街。每个个体的被抽中概率完全未知——这不是随机抽样。
- 朋友圈转发的网络问卷:填的人都是自愿的。"自愿"和"随机"恰恰是反义词——不感兴趣的人被抽中的概率是零。
- "我们随机选了三个班"——但"选"的过程究竟是随机抽签,还是"挑了几个方便的班级"?如果是后者,班级之间的系统性差异(不同老师、不同上课时间、不同生源背景)会和你的实验处理效应混在一起。
你的操作:如果是大型公开数据(CFPS、CGSS等),去读它的技术文档——这些调查都有详细的抽样设计说明。如果是自己收集的数据,诚实写出招募方式。不是随机抽样就别说"随机"。此外,即使数据是严谨的复杂多阶段抽样(如CFPS),你也不能简单地用reg命令默认的标准误——它假设的是简单随机抽样,而你的数据存在聚类和分层结构,标准误需要相应调整(如聚类标准误)。
问题三:样本结构与总体结构一致吗?
即使抽样框完美覆盖了目标总体、抽样方法是严格随机的,抽样误差仍然存在——抽1000个人和再抽1000个人,样本结构总有波动。
你需要回答的是:波动有多大?在某些关键维度上,样本是否已经系统地偏离了总体?
操作步骤很简单:
- 挑几个关键的基准变量——性别、年龄组、教育程度、城乡分布、地区。
- 从权威来源(普查公报、统计年鉴)找到这些变量在总体中的真实分布。
- 做一张"样本 vs 总体"的对比表。
一个模拟的例子——假设你用某份调查数据分析居民收入:
| 维度 | 样本分布 | 全国总体 | 偏差方向 |
|---|---|---|---|
| 城镇人口比例 | 72% | 64%(2020年普查) | 城镇过度代表 |
| 大学及以上学历 | 35% | 15%(2020年普查) | 高学历过度代表 |
| 60岁以上比例 | 8% | 19%(2020年普查) | 老年人严重代表不足 |
如果你发现样本在城镇和高学历人群上过度代表——而这两类人的收入恰好系统性地偏高——那么你用样本算出的"平均收入"就会显著高于全国真实水平。
但要注意:你不需要样本在每个维度上都完美匹配总体(这在有限样本下不可能做到)。你真正需要判断的是——偏差的维度,是否和你研究的核心变量系统性地相关?
如果你的研究问题是"教育回报率",样本的年龄分布偏一点可能影响不大;但如果样本的教育程度分布严重偏离总体(高学历者过多),你估计的教育回报率就会有问题——因为样本中缺乏足够的低教育人群来做有效对比。
问题四:谁没有回答?——非响应偏误
这个问题在实证研究中被严重低估。
你抽了1000个人,最终只有600人回答了你的问题。那另外400人呢?
如果"不回应的人"和"回应的人"在所有相关特征上是一样的——那非响应只是降低了样本量,不影响估计的无偏性。
但现实几乎从不如此。
- 收入调查:极高和极低收入者都比中等收入者更不愿意回应。前者出于隐私保护,后者出于对"官方调查"的疏离和不信任。
- 健康调查:最不健康的人可能因为"反正没救了"不愿参与,也可能因为"终于有人关心我了"更愿意参与——偏误方向不确定,但一定存在。
- 企业调查:经营最差的企业往往不回复问卷。你看到的"企业平均利润率"是偏向表现较好的那一半的。
你的操作:如果数据附带了响应率信息,报告它。如果数据有追踪设计(如面板数据的上一轮信息),你可以比较"本轮拒访者"和"本轮回应者"在上一轮的可观测特征——这至少能给你一个偏误方向的线索。如果什么都没有,至少在讨论部分说清楚:"非响应机制未知。如果非响应与X特征相关,我们的估计可能朝Y方向偏误。"
问题五:数据有抽样权重吗?你用对了吗?
很多大型调查(CFPS、CGSS、CHFS、美国CPS等)都提供抽样权重(Sampling Weights)。但大量使用者在拿到数据后直接开始描述统计和回归分析,完全忽略了权重变量的存在。
为什么会有权重? 因为复杂抽样设计不是简单的"每人平等概率被抽中"。某些群体(如少数民族、特定省份)会被以更高概率抽取(确保子群体分析的样本量),不同层可能使用不同的抽样比,事后还会根据已知人口特征进行非响应校正——所有这些操作的结果都凝结在"抽样权重"这个变量里。
用不用权重?两条原则:
- 在做描述性统计时——估计均值、比例、总数——必须使用权重。 不用,你的估计就是有偏的。
- 在做回归分析时——学界有争论。如果模型设定正确(正确刻画了数据生成过程),加权和不加权的系数估计在大样本下应该一致。实践中最安全的做法是:报告加权和未加权两组结果,作为稳健性检验。
三、实证数据中反复出现的五类典型问题
上面五个问题是拿到数据后的"体检项目"。下面这五类问题,是实证研究中反复出现的"常见病"。你翻开任意一期经济学期刊,至少有一两篇文章在对付它们中的某一个。
类型一:方便样本——数据的便利性以不可知的方式影响结论
典型表现:
- 研究"企业社会责任对绩效的影响",用的是沪深300成分股——理由不是"A股最具代表性",而是"这个数据最好下载"。
- 研究"社会信任的决定因素",用的是某大学500名学生的问卷——理由是"发问卷方便"。
- 行为经济学实验的被试全部是本校同系同级的学生。
问题本质:方便样本最令人不安的,不是"我知道它有偏",而是我不知道偏的方向和大小。沪深300企业不仅规模大,而且受资本市场关注度高,它们披露社会责任信息的动机和一家中小企业完全不同。你用这类企业得出的结论,在多大程度上能在"企业"这个总体中成立?你没法回答——因为你的样本根本没包含那些"不方便获取数据"的企业。
应对思路:
- 把"方便样本"本身作为结论适用范围的上限。只说"在沪深300成分股中发现了……",不说"中国企业……"。
- 如果可能,找一个在关键特征上和你样本有重叠的公开数据库做外部验证。
类型二:覆盖偏误——不是样本有偏,而是整个抽样框就漏了关键群体
典型表现:
- 用手机号段做抽样框——遗漏了不使用手机的人(通常是最贫困和最年长的群体)。
- 用大众点评评论数据研究"餐厅服务质量"——抽样框是"愿意在网上写评价的人",他们会因为极度满意或极度不满而更有动力写评论。普通食客的体验没有被记录。
- 用LinkedIn简历分析"职业流动"——抽样框是"在LinkedIn上有档案的白领专业人士",蓝领工人不存在于这个数据中。
问题本质:覆盖偏误比"样本有偏"更根本——样本有偏可以通过权重一定程度上调整,但抽样框压根没覆盖到的群体,是永远无法通过加权补回来的。你在分析中看到的任何模式,都只对抽样框内的群体成立。
应对思路:
- 明确的定义"研究总体"为抽样框所覆盖的群体,而非目标总体。
- 讨论被排除群体和你的研究问题的相关度。如果能找到关于被排除群体的外部汇总统计(如普查数据),至少用一个简短的段落描述一下"被遗漏的人长什么样"。
类型三:幸存者偏差——你看到的,恰好是没被淘汰的
这是最广为人知的数据陷阱,但在实证研究中依然无处不在。
三个经典场景:
- 研究"家族企业的经营绩效"——你从数据库里提取了2020年存续的家族企业,但那些在这之前破产或退出的,你一个都看不到。结论"家族企业平均盈利能力不错"是乐观的幻象。
- 研究"创业成功的因素"——你采访了50位成功企业家,总结出共同特征(冒险精神、读了某本书、坚持早起等)。但5000位失败者可能也读了同一本书,只是他们没机会出现在你的访谈名单上。
- 用基金数据库研究"基金业绩持续性"——表现太差被清盘的基金已经不在数据库中了。你看到的基金样本整体业绩是向上偏误的。
问题本质:幸存者偏差的狡猾之处在于——你只能看到"幸存之后"的世界,而淘汰过程本身就是非随机的。 某些特征的个体会被系统性地从这个世界上"删除",你根本无法从剩余样本中重建关于这些特征的完整画面。
应对思路:
- 最优解:使用包含完整进出记录的数据库(如包含已退市企业的工商注册数据库)。
- 次优解:在讨论中分析——如果淘汰过程让"某类个体"更可能消失,那么你的估计是被高估还是被低估了?给出方向性的判断。
- 稳健性检验:用样本中不同"存续时长"的子群体分别跑回归,看效应是否随存续时间的增加而发生系统性的变化。
类型四:自选择——人们不是随机出现在他们所在的位置上的
经典案例:你想评估"职业培训对工资的影响"。拿到一份数据,里面有参加过政府培训项目的人,也有没参加过的。直接比较工资——发现参加过培训的人工资反而更低。
能下结论说"培训有害"吗?不能。因为参加培训的,恰恰是本来就在劳动力市场上找工作困难的人。参加培训这件事不是随机的,而是自选择的。
三种典型的自选择方向:
- 正选择:能力强的人更可能上大学、参加培训、搬到机会多的城市——你观测到的"上过大学的人收入高"中,至少有一部分是能力效应而非教育效应。
- 负选择:最困难的人群更可能接受补贴、参与扶贫项目——你观测到的"参与项目者收入更低"不是项目有害,而是贫困者更可能参与项目。
- 两极分化:对某事特别关心或特别抵触的人都更可能回应你的问卷——极端意见在样本中被放大了。
应对思路:
- 如果是自己设计数据收集,在邀约阶段就记录所有被邀约者的基本信息(年龄、性别、地理位置等),哪怕他们最终拒绝参与。你可以比较"接受者"和"拒绝者"在可观测维度上是否有系统性差异。
- 如果是分析二手数据,在讨论部分坦率分析自选择可能导致的偏误方向和影响程度。
类型五:稀有事件与小样本——大样本理论帮不了你
典型表现:
- 研究"战争爆发的经济原因"——历史上国际战争就几十场,样本量天生受限。
- 研究"独角兽企业的特征"——全球独角兽几百家,而你要加5个控制变量。
- 研究"银行贷款违约"——违约的终归是少数。
问题本质:大家学的大部分计量方法(OLS的渐近正态性、MLE的渐近性质、t检验和F检验)都建立在大样本理论上。当样本量只有几十个——或者更致命的是,你的因变量中"事件发生"的观测只有十几个——这些渐近理论不再提供可靠指导。一个单一的杠杆点就能把整个回归系数的符号拉反。
应对思路:
- 选择专门为稀有事件或小样本设计的方法:King & Zeng的稀有事件Logit、Firth的惩罚似然估计、精确Logistic回归。
- 削减模型复杂度:样本只有几十个,就一个一个地加控制变量,而不是跑"全口径"的饱和模型。
- 坦诚:置信区间很宽本身就是信息——它告诉读者"我们对效应的大小实际上非常不确定"。
四、面对不同数据问题,如何讨论局限性并弥补?
识别出问题只是第一步。真正区分好的实证研究和一般实证研究的地方在于——你怎么处理和讨论这些问题。
4.1 讨论局限性的三个层次
最低层次——笼统道歉式:"本研究样本量有限,可能存在抽样偏差。"
这种写法几乎等于什么都没说。审稿人和读者无法判断:(1)偏差具体在哪个方向上?(2)偏差严重到什么程度?(3)偏差是否足以推翻你的核心结论?
中间层次——具体诊断式:"样本中城镇人口占比72%,高于全国64%的水平。由于城镇人口平均收入较高,我们估计的全国平均收入可能上偏约X%。"
指出了具体维度和大致方向,但缺少进一步的量化分析。
较高层次——量化评估式:"样本中城镇人口过度代表。我们使用了抽样权重进行校正,校正后平均收入的估计值从不加权时的XX元变为加权后的YY元,降幅约为Z%。这一变化不影响本文关于教育回报率的核心结论(详见附表A的加权回归结果)。如果非响应的城镇人口与回应者在不可观测维度上存在差异,我们的估计可能仍然上偏——但幅度预计不超过[具体范围],不影响定性结论。"
这才是有效的局限性讨论——它不仅指出了问题,还量化了问题可能的影响,并用证据(而非修辞)论证了核心结论在问题存在的情况下依然可信。
4.2 弥补策略工具箱
| 问题类型 | 可用的弥补方法 | 适用前提 |
|---|---|---|
| 样本结构偏离总体 | 事后分层加权(Raking/Calibration) | 需要知道总体在某些维度上的真实分布 |
| 非响应偏误 | 赫克曼两阶段模型(Heckman Selection Model) | 需要一个影响响应但不直接影响核心结果的排他变量(变量很难找,这是主要局限) |
| 选择性进入/退出 | 逆概率加权(IPW, Inverse Probability Weighting) | 需要可观测的预测变量 |
| 小样本推断 | 自举标准误(Bootstrap SE) 或 精确检验(Exact Test) | 一般要求样本量≥30 |
| 稀有事件 | 稀有事件Logit(King & Zeng)、Firth惩罚似然 | Logit/Probit框架 |
| 缺失数据 | 多重插补(Multiple Imputation) | 缺失机制至少是随机缺失(MAR) |
重要提醒:以上所有统计弥补方法都建立在额外的假定之上,而这些假定本身通常无法用数据验证。赫克曼模型假定存在着排他变量,加权方法假定可忽略性(ignorability),插补方法假定随机缺失。你使用这些方法,不是在说"问题已经解决了",而是在说——"如果读者愿意接受特定假定,那么在这个假定下,偏误可以被控制在一定范围之内。"
4.3 最有力的一招:稳健性检验
当你无法用统计方法完美弥补一个数据问题时,最有力的论证策略是:展示即使数据存在这个问题,你的核心结论也不受影响。
几个最常用的稳健性策略:
- 子样本分析:如果你担心某类极端观测值驱动了全部结果,把它们删掉重跑。结果不变?审稿人放下一大半心。
- 改变变量定义:如果"失业"的定义变化后结论不变,说明你的结论对测量方式不敏感。
- 加权 vs 未加权双报告:如果核心系数方向一致、显著性接近,说明抽样设计不太可能驱动你的结论。
- 边界分析(Bounding):假设最坏情况——非响应者的特征等于你样本中最极端的那部分人——你估计的效应区间有多宽?在最坏情况下,正负方向是否反转?
- 安慰剂检验:如果你的结论是"某政策提高了某地就业",那么在政策尚未实施的年份("伪处理时间")或未受影响的地区("伪处理组"),你不能看到"效应"。如果看到了,说明你的结果可能反映的不是政策本身的作用,而是数据的某种固有模式。
稳健性检验的灵魂不是"我做了很多检验",而是"我能说清楚:如果我的数据在某些维度上有问题,我的结论在多大程度上仍然成立"。
五、总结:一份可以贴在显示器上的审视清单
在你下一次打开Stata/R/Python准备跑回归之前,先用下面七个问题过一遍你的数据:
| 问题 | 对应的风险 | 你的操作 |
|---|---|---|
| ① 数据从哪个抽样框中来的?和目标总体的差距在哪? | 覆盖偏误 | 界定研究总体,讨论被遗漏群体的特征 |
| ② 抽样方法是什么?真的是随机吗? | 未知选择概率 | 诚实描述抽样方式;复杂抽样需调整标准误 |
| ③ 样本结构和总体结构一致吗? | 某些维度存在系统性偏差 | 做"样本-总体结构对比表",判断偏差是否与核心变量相关 |
| ④ 非响应率是多少?谁没有回答? | 自选择偏误 | 比较响应者/非响应者的可观测特征,讨论偏误方向 |
| ⑤ 数据附带了抽样权重吗?我用了吗? | 描述统计有偏 | 描述统计必须加权;回归加权和不加权双报告 |
| ⑥ 是否存在幸存者偏差? | 样本中只保留了"没被淘汰"的个体 | 检查数据库是否包含退出者;讨论淘汰过程对估计的方向性影响 |
| ⑦ 关键子群体的样本量足够吗? | 小样本下的不可靠推断 | 降模型复杂度,换用精确检验或Bootstrap |
最后的提醒:
做实证的人,很容易把所有注意力放在"怎么跑出显著的结果"上。但从数据质量的角度看,一个你可能不想面对但必须面对的事实是——
一个使用了工具变量、双重差分、断点回归、5组稳健性检验的"方法论全武装"回归,如果基于的是一个覆盖严重不完备、非响应率超50%且非响应机制完全未知的样本,那么所有令人眼花缭乱的方法都只是在精雕细琢一座沙子做的城堡。
反过来,一份抽样设计严谨、权重信息齐全、响应率可追踪、样本结构与总体有清晰对比的数据——哪怕只跑了最简单的OLS——其结论的可信度也可能远高于前者。
数据来源决定了你的起点。方法技巧只能让你尽量逼近那个起点的上限——它无法让你突破这个上限。
六、内容切分建议:适合拆成 3 期系列内容
本文涵盖的内容较多——从五个审视问题到五类典型数据问题,再到弥补策略工具箱。如果做成单期视频(或单篇公众号推送),信息密度过高,观众容易中途走神。建议拆成 3 期系列内容,每期聚焦一个核心任务,各自独立但前后呼应。
第一期:你的数据能代表谁?——抽样视角下的三个核心追问
核心主题:拿到数据后的第一轮审视——从"数据能代表谁"这个根本问题上手。
涵盖内容:
- 目标总体 vs 抽样框(覆盖偏误)
- 抽样方法是否真的是随机抽样(假随机的三种常见场景)
- 样本结构与总体结构的对比("样本-总体对比表"的制作和解读)
设计理由: 这三问构成了审视数据出身的"第一道防线"。它们回答的是同一个大问题——"这份数据的结论,到底能推广到哪个群体?" 这个问题是所有后续讨论的基础,逻辑上必须最先讲。而且这三个问题之间有自然的递进关系:你首先得知道你想要的总体是谁(总体→抽样框),然后看抽样方法是否有效(抽样框→样本),最后检验样本是否真的代表了总体(样本→总体对比)。
建议时长:视频 12—15 分钟;公众号 3000—4000 字。
结尾钩子(引导观众看下一期):"不过,即使抽样方法没问题,你的数据里还有一些隐藏更深的问题——有人没回答你的问卷,有些企业和个人已经从你的数据中'消失'了。这些问题怎么发现、怎么处理?我们下期聊。"
第二期:数据里的"沉默者"和"消失者"——非响应、幸存者偏差与自选择
核心主题:三种被动形成的系统性数据偏误——不是抽样设计的问题,而是"不回答的人"和"已经被淘汰的人"在数据中留下的空洞。
涵盖内容:
- 问题四:非响应偏误(谁没有回答?他们和回答的人有什么不同?)
- 类型三:幸存者偏差(你看到的,恰好是没被淘汰的)
- 类型四:自选择(人们不是随机出现在他们所在的位置上的)
- 三种偏误的应对思路
设计理由: 这三类问题的本质是同一个——数据中被观测到的个体和被遗漏的个体之间存在系统性的而非随机的差异。 把它们放在一起讲,能让观众/读者意识到:数据的问题不只是"抽样没抽好",很多时候是"有些人就是不会出现在你的数据里,而他们的缺席是有规律的"。这个认知转变,是从"背抽样公式"到"真正理解数据"的关键一步。
建议时长:视频 15—18 分钟;公众号 3500—4500 字。
结尾钩子(引导观众看下一期):"好了,现在你已经知道怎么看数据的'病'了。但光会诊断还不够——问题找到了,怎么补救?怎么在论文里写一段让人信服的局限性讨论?下期我们聊弥补策略。"
第三期:找到问题之后怎么办?——局限性讨论、弥补策略与稳健性检验
核心主题:从"诊断"到"治疗"——怎么把数据问题转化为令人信服的学术讨论。
涵盖内容:
- 问题五:抽样权重的正确使用(描述统计必须加权,回归加权/未加权双报告)
- 类型五:稀有事件与小样本(及对应的专门方法)
- 局限性讨论的三个层次(笼统道歉 → 具体诊断 → 量化评估)
- 弥补策略工具箱(事后分层加权、赫克曼模型、IPW、多重插补等)及其适用前提
- 最有力的一招:稳健性检验策略(子样本分析、改变变量定义、边界分析、安慰剂检验)
- 最终审视清单(七个问题汇总表)
设计理由: 这一期是系列收尾,承担两个功能。一是把前面两期中"悬而未决"的应对方案(如抽样权重、稳健性检验)集中讲清。二是给观众一个"学完就能用"的清单——看完三期,你以后拿到任何一份数据,都能从七个问题出发快速审视它的代表性与合理性。清单放在最后一期的结尾,既是总结,也是"工具包"——观众可以截图保存。
建议时长:视频 18—20 分钟;公众号 4000—5000 字。
三期结构一览
| 期数 | 主题 | 核心问题 | 观众收获 |
|---|---|---|---|
| 第一期 | 你的数据能代表谁? | 总体 vs 抽样框、抽样方法是否随机、样本结构是否匹配总体 | 能用三个问题快速判断数据的"出身" |
| 第二期 | 数据里的沉默者和消失者 | 非响应、幸存者偏差、自选择 | 能识别数据中"看不见的偏误" |
| 第三期 | 找到问题后怎么办? | 权重使用、弥补策略、局限性讨论写法、稳健性检验 | 能从诊断到治疗,写出让人信服的局限性段落 |
如果只能做一期(备选方案)
如果条件限制只能做成一期长视频或一篇长文,建议按以下比例分配内容:
- 五个审视问题(30%篇幅):重点讲问题一(覆盖偏误)和问题三(样本 vs 总体对比),这两个是最容易被忽视但影响最大的。
- 五类典型问题(40%篇幅):重点讲幸存者偏差和自选择,它们是实证研究中最常见且对结论影响最隐蔽的。
- 弥补策略与稳健性(30%篇幅):重点讲抽样权重和稳健性检验的核心逻辑,不做方法展开。