计量小课:计量经济学基础
计量经济学计量小课

数据分类那么多,我们都要学吗?学了有什么用?

初学计量的人,第一波冲击往往来自数据的分类方式。

作者:计量科研导航站发布:2026-07-29★★

一、开篇:数据不就是数字吗?

初学计量的人,第一波冲击往往来自数据的分类方式

老师在讲台上熟练地列举:定量数据、定性数据、横截面数据、时间序列、面板数据、实验数据、观测数据、平衡面板、非平衡面板……

你坐在下面,脑子里只有一个问题:这些分类到底有什么用?不都是数字吗?往里扔回归不行吗?

不行。而且"往里扔回归"恰恰是初学者最常见的错误来源。

数据的类型,决定了你能用什么模型、能回答什么问题、能得出什么结论。 选错模型,不是精度问题——而是整个分析框架都不成立。

这篇文章沿着三条最主要的分类线索,帮你建立数据的"分类地图",让你以后拿到一份新数据,第一时间就能判断:这是什么数据?它适合做什么?有什么坑?

核心信息:数据分类不是分类学游戏——每一种分类维度,都对应着一种分析策略的选择。


二、第一条分类线索:按变量的测量尺度——定量、定性与定序

这是最基础的分类,也是所有数据分析的起点。

2.1 三种类型的定义与例子

定量数据(Quantitative Data):变量的取值本身就是数字,而且数字之间的差距有实际含义。

  • 连续型:工资(元)、GDP(亿元)、身高(cm)、温度(℃)
  • 离散型:子女数量(个)、专利数量(件)、公司成立年限(年)

定量数据的核心特征:你可以对它做算术。 100元是50元的两倍,这个运算有意义。

定性数据(Qualitative Data):变量的取值是类别,数字只是标签,不能做算术。统计上通常称为分类数据(Categorical Data)

  • 性别(男/女——编码为0/1,但0+1或0×1毫无意义)
  • 婚姻状态(未婚/已婚/离异/丧偶)
  • 行业分类(制造业/服务业/农业/……)
  • 地区(东部/中部/西部/东北)

定性数据的核心特征:你只能比较"是不是一样",不能比较"谁比谁大"。

定序数据(Ordinal Data):介于两者之间。取值有顺序、能比大小,但差距没有数值意义。

  • 教育程度(小学 < 初中 < 高中 < 大学 < 研究生——但"大学减高中"不等于"研究生减大学")
  • 满意度评分(非常不满意/不满意/一般/满意/非常满意——"满意"和"非常满意"的差距,不等于"不满意"和"一般"的差距)
  • 比赛中你可以给这场表现打 1-5 分

定序数据的核心特征:你可以排序,但不能算差距。 把定序变量直接当连续变量放进回归,是初学者最容易犯的错误之一。

2.2 为什么要区分它们?——三个实战理由

理由一:决定你用什么模型。

因变量类型 适用的基本模型
连续定量变量 OLS(普通最小二乘法)
0/1 二值变量(定性) Logit / Probit(二值选择模型)
多类别变量(定性) 多项 Logit(Multinomial Logit)
定序变量 定序 Logit / Probit(Ordered Logit/Probit)
计数变量(离散定量) 泊松回归 / 负二项回归

把0/1变量用OLS跑——你得到的预测值可能是-0.3或1.2,这在逻辑上说不通。本科计量课上,"Y是二值变量为什么不能用OLS"通常是最先讲的内容之一。

理由二:决定你怎么解释系数。

同样是"X增加1单位,Y变化多少"这个问题:

  • 连续因变量 + OLSβ1\beta_1 = X增加1单位,Y平均变化 β1\beta_1 单位。直觉清晰。
  • Logit模型:系数本身不能直接解释。你需要计算边际效应(marginal effect)几率比(odds ratio)——这是初学者最容易懵的地方。
  • 定序Logit模型:系数告诉你"X增加1单位,进入更高一类的几率对数变化多少"——解释门槛更高。

理由三:决定你能否做某些操作。

  • 对定性变量求均值?没有意义。("性别的平均值"是什么?)
  • 对定序变量求标准差?数学上能算,但含义不清。("满意度的标准差为0.8"——这是什么?)
  • 把定序变量当作连续变量放入回归?在很多场合是通行做法(如用受教育年限代表教育程度),但你必须意识到你在做什么、假定了什么——你实际上假定了"从小学到初中的跳跃"和"从高中到大学的跳跃"在效应上是相等的。这个假定一旦不成立,你的估计就可能出错。

一句话:变量的测量尺度,是选择模型和解释结果的第一道门槛。走错这道门,后面的路都是歪的。


三、第二条分类线索:按数据的时空结构——横截面、时间序列、面板与混合截面

这条分类线索和"数据是怎么收集的"直接相关,它决定了你能不能用某些模型、以及你主要回答的是什么类型的问题。

3.1 四种类型的定义

横截面数据(Cross-Sectional Data):在同一个时点(或近似同一时点)上,对多个个体进行观测得到的数据。

  • 典型例子:2020年第七次全国人口普查数据——在同一年里调查了全国所有人。
  • 在经济学中:中国家庭追踪调查(CFPS)的某一轮数据、某一年上市公司的年报数据、某次问卷调查的全部回收样本,都是横截面数据。

关键提醒——"同一时点"往往是一个近似: 在实际操作中,横截面数据的"同一时点"通常是被忽略微观时间差异后近似出来的。比如CFPS某一轮调查的入户访谈可能从当年1月持续到次年3月,跨越了十几个月份。但在分析中,我们通常把这些数据当作"同一时点"来处理——因为十几个月的差异相对于我们要研究的问题(如教育对收入的长期影响)来说,可以忽略不计。

但要注意:如果调查时间跨度内发生了重大事件(如疫情期间的调查跨越了封控前后),这种"近似"就可能出问题。不同受访者在不同时间接受访谈,他们的回答可能反映了截然不同的外部环境——而你在建模时却假设他们在"同一时点"。

时间序列数据(Time-Series Data):对同一个主体,在多个时点上进行重复观测。

  • 典型例子:中国1990—2023年每年的GDP数据、某只股票每天的收盘价、某城市每月的CPI指数。
  • 核心特征:只有一个观测主体(或一个加总后的经济体),但观测了很长时间。

面板数据(Panel Data):横截面和时间序列的交集——对多个个体,在多个时点上进行追踪观测。也叫纵向数据(Longitudinal Data)

  • 典型例子:CFPS追踪同一批家庭每两年回访一次,形成了"多个家庭 × 多轮调查"的结构。中国工业企业数据库追踪同一批企业多年,也是面板数据。
  • 核心特征:同样的个体被反复观测,你在时间维度上掌握了每个人的变化轨迹。

混合截面数据(Pooled Cross-Sectional Data)最容易和面板数据搞混的类型。 它也是"多个时点 × 多个个体",但——每次抽的是不同的样本,同一个体不会被追踪。

  • 典型例子:中国综合社会调查(CGSS)每年做一次,但每年抽的都是不同的受访者。你无法追踪"同一个人"在2015年和2020年的变化。
  • 与面板数据的核心区别:面板数据追踪的是同一批个体,混合截面每次抽的是不同个体

3.2 一张表区分四种结构

数据类型 个体维度 时间维度 是否追踪同一样本 典型例子
横截面 多个 一个时点(近似) 不适用 某年人口普查
时间序列 一个 多个时点 不适用 历年GDP
面板数据 多个 多个时点 CFPS追踪调查
混合截面 多个 多个时点 ,每次独立抽样 CGSS年度调查

3.3 为什么要区分它们?——每个类型能回答的问题不同

横截面数据主要能回答:个体之间的差异。

你发现"受教育高的人工资更高"——这是在横截面上比较不同的人。但你无法回答"一个人如果多读一年书,他的工资会涨多少"——因为你看不到同一个人的变化。你看到的只是"高教育的人工资高",这可能是因为教育提高了他们的生产力,也可能是因为能力更强的人本来就倾向于读更多书——这在横截面上无法区分。

时间序列数据主要能回答:一个变量随时间的变化规律。

GDP增长率、通胀率、失业率的走势分析——这些都是时间序列的经典应用。但时间序列的无能为力之处在于:你不能用单个主体的时间序列来研究个体之间的异质性。 你看到的是中国整体的GDP增长,看不到"为什么广东增长比东北快"——因为数据已经加总了。

面板数据能回答的问题最多——这也是它成为现代实证研究主流数据结构的原因。

因为面板数据同时有个体间差异个体内的时序变化,它能做的事远多于前两者:

  • 控制个体固定效应:每个个体做自己的对照组。你能控制掉所有不随时间变化的遗漏变量——比如能力、性格、家庭背景、文化传统。这是面板数据最强大的武器。
  • 研究动态调整过程:从冲击到响应需要多长时间?工资对政策变化的反应是即刻的还是渐进的?
  • 区分年龄效应、世代效应和时期效应——这在纯横截面或纯时间序列中几乎无法做到。

混合截面数据介于横截面和面板之间。 它比纯横截面多了一个"时间维度",允许你比较不同时期的总体特征(如"2010年和2020年居民收入分布的对比");但它做不到面板数据的"个体内追踪"——因为你每次抽的是不同的人。不过,混合截面也有它的独特优势:你可以加入时间虚拟变量来控制宏观趋势,或者在政策评估中利用"不同时点的不同个体"来构建对照组。

3.4 容易忽略的要点

(1)横截面中的"微观时间差异"问题。

如前所述,横截面数据的"同一时点"通常是近似出来的。在数据描述中你应该注明调查的具体时间跨度,并在稳健性检验中考虑:如果我只用前三个月的数据,结果还成立吗?

(2)面板数据的" attrition(样本流失)"问题。

面板数据追踪同一批人,但人会搬家、会拒访、会死亡。如果你发现"流失的人"和"留下的人"在关键特征上系统性地不同(比如低收入者更容易流失),那么你的估计就可能出现选择性偏误。

(3)混合截面不能替代面板。

初学者常犯的错误是:拿CGSS 2015和CGSS 2020的数据,当面板数据跑固定效应模型。但CGSS每次抽的是不同的人——你没有追踪到个体的变化,固定效应模型根本无从谈起。混合截面只能当"带时间维度的横截面"来用,不能当面板来用。

(4)时间序列的"非平稳性"问题。

如果两个变量都随时间向上走(比如GDP和电话保有量都在增长),它们的回归可能看起来非常显著——但这只是时间趋势的虚假相关,不是真实的因果关系。时间序列分析中必须首先做平稳性检验,这在横截面分析中是完全不需要的。


四、第三条分类线索:按数据的生成过程——实验数据与观测数据

这条分类线索直接决定了你能不能、好不好做因果推断

4.1 两者的定义与区别

实验数据(Experimental Data):研究者主动操纵某个处理(treatment),然后随机分配被试到处理组和控制组,在控制条件下记录结果。

  • 核心要素:操纵 + 随机化 + 控制
  • 典型来源:医学RCT、心理学实验室实验、发展经济学中的田野实验(field experiment)、A/B测试

观测数据(Observational Data):研究者不干预数据的生成过程,只是收集和记录已经发生或自然发生的事实。

  • 核心特征:你在事情发生之后才去观测它
  • 典型来源:调查数据、行政记录、上市公司年报、卫星遥感数据、社交媒体数据

4.2 为什么这个区分至关重要?

用一个例子来感受:

你想研究"上大学是否提高收入"。

  • 如果有实验数据:你随机抽一群人,随机分配一半去上大学、一半不上,等他们毕业了比较工资。因为随机化,两组人在能力、家庭背景、动机上都是可比的——工资差异只有一种解释:上没上大学。
  • 如果你只有观测数据:你拿到的是一群已经上完大学和工作的人的数据。上大学的人在能力、家庭背景、学习动机上和没上大学的人系统性地不同——他们本来就更可能拿高工资,不管上不上大学。你观测到的工资差异,不全是教育的因果效应

这个逻辑区分就是整个因果推断领域的起点。

4.3 观测数据的核心问题清单

核心问题一:选择偏误(Selection Bias)——"人们不是随机出现在他们所在的位置上的。"

高收入地区的人更健康——是因为高收入改善了健康,还是因为健康的人更容易获得高收入? 上培训班的人工资更高——是因为培训有效,还是因为上进的人既会报培训班、又本来就会拿高工资?

在观测数据中,你永远需要问自己:这些个体为什么会处于他们现在所处的状态?这个"为什么"里是否包含了会影响结果的系统性因素?

核心问题二:反向因果(Reverse Causality)——"你看到的相关,方向可能与你假设的相反。"

你发现"警察越多的地方犯罪率越高"——是警察导致了犯罪,还是犯罪高的地方派驻了更多警察? 你发现"使用社交媒体的时长和抑郁程度正相关"——是社交媒体导致抑郁,还是抑郁的人更倾向于长时间刷手机?

在横截面观测数据中,反向因果和正向因果看起来一模一样——你拿同一个相关系数,两个故事都讲得通。

核心问题三:遗漏变量(Omitted Variable Bias)——"你没有测到的因素可能在驱动一切。"

冰淇淋销量和溺水死亡人数高度正相关——这是因为吃冰淇淋会导致溺水吗?不,是因为天气热——天热→吃冰淇淋,天热→游泳→溺水。如果你没有测"气温",你就会把冰淇淋和溺水之间的相关错误地解读为因果。

核心问题四:测量误差(Measurement Error)——"你测到的不等于你想要的。"

用"自报身高"代替"实际身高"——大家倾向于往高报一点。 用"企业报告的利润"代替"真实利润"——有避税动机的企业会低报。

当关键自变量存在测量误差时,经典的结果是:OLS估计会向零衰减(attenuation bias)——你低估了真实的效应。这件事最可怕的地方在于:许多实证研究因为数据的局限必然存在测量误差,但研究者可能并没有意识到它如何影响了自己的结论。

4.4 实验数据就一定完美吗?

不是。实验数据也有自己的问题:

  • 外部效度:实验室里的发现能推广到真实世界吗?
  • 霍桑效应:被试知道自己在被观察,行为会改变。
  • 遵从问题:随机分配了,但有人不按分配来(不遵从)——这时需要工具变量来估计"依从者平均处理效应(LATE)"。
  • 伦理限制:不是所有问题都能用实验来回答。你不能随机让一组人吸烟、一组人不吸烟,等20年看谁得肺癌。

实验数据的核心优势在于内部效度(你可以确信X导致了Y),但外部效度(结论能推广多远)需要额外的论证。观测数据的核心弱点在于内部效度(你难以干净地识别因果关系),但优势在于外部效度——你研究的就是真实世界中正在发生的事情。


五、额外的重要分类——四组不能漏掉的概念

除了上面三条主线,还有几组数据分类概念在实际研究中反复出现,值得单列一节。

5.1 按分析层级:微观数据 vs 宏观数据

微观数据(Micro Data):观测单位是个体——个人、家庭、企业、学校。每条记录代表一个具体的微观决策单位。

宏观数据(Macro Data):观测单位是加总后的经济体或区域——国家、省份、行业。每条记录代表一个加总水平上的统计量。

为什么重要?

这两个层级的数据之间有一个著名的陷阱:生态学谬误(Ecological Fallacy)——用宏观层面的相关关系来推论微观层面的个体行为。

经典案例:在省级层面,你发现"外来人口比例越高的省份,本地居民的工资越高"。但这不代表"一个本地居民如果接触到更多外来人口,他自己的工资就会涨"——省级相关关系反映的可能是"外来人口倾向于迁入经济更好、工资更高的省份",而不是个体层面的因果关系。

反过来也有陷阱:原子谬误(Atomistic Fallacy)——用微观个体的行为直接推论宏观现象。个人的节俭在个体的层面是美德,在宏观层面可能导致"节俭悖论"——所有人都节俭,总需求崩塌。

5.2 按面板完整性:平衡面板 vs 非平衡面板

平衡面板(Balanced Panel):每个个体在每个时期都有观测值。像一个完整的矩形——N个个体 × T个时期,一个空都没有。

非平衡面板(Unbalanced Panel):有些个体在某些时期缺失。企业成立之前没数据,企业破产之后也没数据,受访者某一年拒访了——这都是非平衡。

为什么重要?

  • 非平衡面板更普遍——现实世界的数据几乎都是非平衡的。
  • 但非平衡可能引入选择性偏误:如果"消失的观测"不是随机的——比如坏企业在面板中提前消失(破产),你只对幸存企业做分析,会高估平均表现(幸存者偏差)。
  • 大多数面板数据模型的软件实现(如Stata的xtreg)自动处理非平衡面板,但不会自动处理导致非平衡的选择性问题——这个需要你自己判断和论证。

5.3 按数据来源:一手数据 vs 二手数据

一手数据(Primary Data):研究者自己设计工具、自己收集的数据。你设计问卷、你招募被试、你做实验——数据是"你的"。

二手数据(Secondary Data):别人收集的、你拿来用的数据。你用CFPS、用CGSS、用上市公司年报、用卫星数据——数据是"借来的"。

为什么重要?

  • 一手数据:你可以精确地测量你想要的变量。缺点是成本极高,样本量通常有限,外部效度需要额外论证。
  • 二手数据:样本量大、覆盖范围广、成本低,很多还是公开的。但变量定义不是你定的——你想研究"社会资本",数据库里没有直接叫"社会资本"的变量,你只能用"是否参加社区活动""邻里信任程度"等代理变量来凑。这种"用可用的变量去逼近你想要的概念"的操作,几乎贯穿了所有使用二手数据的实证研究。
  • 判断标准:阅读一篇使用二手数据的实证论文时,你应该特别注意作者如何论证"这个代理变量真的代表了我说的那个概念"。这不是啰嗦——这是二手数据研究的核心说服力所在。

5.4 按数据结构:长格式 vs 宽格式

这是数据处理层面的分类,但每个做实证的人都绕不开。

宽格式(Wide Format):每个个体一行,不同时期的变量横向展开。

ID   income_2018   income_2019   income_2020
1    50000         52000         55000
2    38000         40000         .

长格式(Long Format):每个个体—时期组合一行。

ID   year   income
1    2018   50000
1    2019   52000
1    2020   55000
2    2018   38000
2    2019   40000

为什么重要?

  • 大多数计量软件(Stata, R, Python的statsmodels)的回归命令默认要求长格式(面板格式)。
  • 从宽格式转换为长格式(reshape long / pivot_longer)是数据清洗中最高频的操作之一。
  • 人类阅读习惯偏好宽格式,统计软件偏好长格式——你得在这两者之间熟练转换。虽然不是理论问题,但搞不清宽转长的时间可能比理解模型的本质还要多——这是实证研究的日常。

六、总结:分类地图 + 实战心法

拿到一份新数据时,该问自己的四个问题:

问题1:每个变量属于哪种测量尺度?(定量/定性/定序)
      → 决定我能用什么模型、怎么解释系数

问题2:数据在时空上是什么结构?(横截面/时间序列/面板/混合截面)
      → 决定我能回答什么类型的问题、能否控制不可观测因素

问题3:数据是怎么生成的?(实验/观测)
      → 决定我离因果推断有多远、需要花多大力气排除替代性解释

问题4:数据有什么隐含的局限?(层级、缺失模式、来源、格式)
      → 决定我需要对哪些潜在的偏误保持警觉

三条信息

这些分类不需要背,但需要"认得"。

下次你打开一篇论文的数据描述部分,看到"we use a balanced panel of 2,345 firms from 2010 to 2020",你马上就应该意识到:平衡面板 → 可能存在幸存者偏差,企业数据 → 观测数据 → 因果识别需要说服力,面板结构 → 可以用固定效应控制不随时间变化的遗漏变量。

分类的价值不在分类本身,而在于它告诉你能做什么、不能做什么。

当你知道了自己的数据是"观测性横截面定性因变量数据"的那一刻,你已经排除了80%的不适用方法,知道自己必须面对选择偏误的挑战,也知道自己需要用Logit而非OLS——这就是分类的意义。它不是给数据贴标签,而是帮你在进入操作之前先看清地形

学数据分类的终极回报,不是你记住了多少个分类名词——而是以后你看到一个"R² = 0.98"的研究结论时,能下意识地问一句:

"这个数据是什么类型的?这个模型和方法匹配吗?那个高R²,是因为模型真的好,还是因为时间序列的两个变量恰好在同一条趋势线上?"

这种本能,就是数据分类知识融进血液之后的样子。


七、B站/公众号呈现建议

  • B站视频:四条分类线索(测量尺度、时空结构、数据生成过程、其他补充)建议用"四条路进同一座城"的动画比喻,每条线索展开时配具体的案例画面(如"定量vs定性"用秤和标签本做视觉联想)。
  • 公众号:表格较多(共4张对照表),建议做成统一配色的信息图系列;代码块(宽格式→长格式转换)建议用手写体风格呈现,降低"代码恐惧感"。
  • 推荐标题
    • 主标题:《数据分类那么多,我们都要学吗?》
    • 备选标题:《拿到数据第一件事不是跑回归——而是搞清楚它是什么数据》
  • 金句提炼(适合封面卡/结尾定格):

    "数据的类型,决定了你能用什么模型、能回答什么问题、能得出什么结论。选错模型,不是精度问题——是整个分析框架都不成立。"