计量小课:计量经济学基础
计量经济学计量小课

描述性统计表格——该放哪些变量?展示什么特征值?用原始还是变换后的变量?

你的实证论文里,第一张表通常是\"描述性统计\"(Descriptive Statistics / Summary Statistics)。你放上了因变量、核心自变量、几个控制变量,跑了一行 summarize,把输出粘成了表格。你可能觉...

作者:计量科研导航站发布:2026-07-29★★

一、开篇:Table 1 是你论文中读者看到的第一张表——但你可能从没认真想过它

你的实证论文里,第一张表通常是"描述性统计"(Descriptive Statistics / Summary Statistics)。你放上了因变量、核心自变量、几个控制变量,跑了一行 summarize,把输出粘成了表格。你可能觉得这只是"格式上的要求"——没有什么实质内容,审稿人只会扫一眼,不需要花太多心思。

然后你收到了审稿意见:

"Table 1 中变量 X 的最小值是 −3.2,但该变量在理论上不应为负——请解释。"

"因变量的标准差是均值的 15 倍——数据是否存在严重右偏?如是,作者是否考虑了使用对数化或其他变换?"

"Table 1 展示了 12 个变量,但变量 Y(中介变量)和变量 Z(调节变量)不在其中——请加入。"

"描述性统计表的样本量是 N = 4,567,但回归表的样本量是 N = 3,021——两者之间超过 1,500 个观测的差异需要解释。"

你愣住了——原来 Table 1 不只是格式上的要求。它是一张"数据体检报告",是审稿人和读者判断你的数据是否合理、分析是否可信的第一道关卡。

**核心信息:描述性统计表是一张用最少的空间传达关于你的数据的最多关键信息的表格。它的目的不是"列出一些均值和标准差"——而是(1)让读者了解你的样本的基本特征和变量的分布范围,(2)帮助你和审稿人发现数据中可能存在的问题(异常值、编码错误、分布偏态、样本选择等),(3)为你的模型设定(如是否取对数、是否缩尾)提供事前的事实依据,(4)交代你在后续回归中使用的估计样本的基本面。关于放什么变量:因变量和核心自变量必须在其中,所有在后续回归中使用的控制变量也应该在其中——审稿人需要通过描述性统计来判断你的控制变量是否有足够的变异来识别效应、是否存在共线性的迹象。中介变量和调节变量——如果在你的主要分析中使用,应在描述性统计中出现;如果只是辅助性分析,可以在附录中放置。关于放什么特征值:观测数 N、均值、标准差、最小值、最大值是最小必要集。对于偏态变量,加入中位数或 p25/p75。关于原始变量还是变换后的变量:展示你在回归中实际使用的版本——如果你的回归中用 ln(income),描述性统计表里应该放 ln(income),不是原始 income。你可以在附录中额外放置原始变量的统计。关于审稿人最常质疑的问题:N 在变量之间不一致、最小值/最大值不可理喻、标准差远大于均值(严重右偏)、二元变量均值接近 0 或 1(缺乏变异)、缩尾后的变量仍然展现出异常的极值、以及描述性统计表与回归表的样本量差异过大——这些是审稿人在 Table 1 上检查的六个重点。"


二、描述性统计表应该放哪些变量?

2.1 必放:因变量 + 核心自变量 + 所有控制变量

这三个层次的变量,为什么必须出现在描述性统计表中:

  • 因变量(Dependent Variable):读者需要知道你的 Y 的均值、范围和分布——这是理解你结果"量级"的基线。如果你的因变量的均值是 0.08,而你的回归系数是 0.02——读者知道 X 的效应大约相当于 Y 均值的 25%。
  • 核心自变量(Key Independent Variable):审稿人需要评估你的核心 X 是否有足够的变异(标准差是否够大、range 是否足够宽)、是否存在异常极值(max 是否是 min 的 10,000 倍)。
  • 控制变量(Control Variables):审稿人需要评估你的控制变量是否是"真实的变量"——如果某个控制变量的标准差接近零(几乎没有变异),它实际上为常数,不应在回归中。同时,如果某个控制变量的均值或范围和核心 X 高度接近 → 共线性的可能。

原则:如果你在回归中用了这个变量——它应该在描述性统计表中出现。变量从描述性统计到回归之间不应有"隐形"的增删。

2.2 中介变量和调节变量——放还是不放?

中介变量(Mediator):如果中介变量是"从 X 到 Y 的因果机制"的一部分——在标准的"X → M → Y"结构中,M 是分析的核心。M 应该出现在描述性统计表中,因为它帮助读者理解"这个机制变量在样本中的分布和变异"——这直接影响你对中介效应的解释。

调节变量(Moderator):如果交互项在你的主要分析中使用——调节变量本身应在描述性统计中出现。交互项(X×WX \times W)本身通常不在描述性统计表中(它是一个构造的量,没有独立的描述意义),但 W 本身需要出现。

实践建议

  • 如果中介/调节分析是你论文的核心(如"本文的目的是研究 X 通过 M 影响 Y 的机制")→ M 和 W 在描述性统计的主表中出现。
  • 如果中介/调节只是稳健性检验或补充分析 → M 和 W 在附录中出现,主表中可以省略。

2.3 不需要放在描述性统计表中的变量

  • 固定效应哑变量(个体 FE、年份 FE、行业 FE):不需要报告 5000 个个体的均值。
  • 交互项:不需要——交互项的统计量可以从组成部分推导。
  • 工具变量:如果是"排他性工具变量"(如出生季度、政策冲击),应该在描述性统计表中出现——因为审稿人需要看到 IV 的变异和分布。如果是"技术性 IV"(如滞后值、行业均值 IV),可以在论文的"IV 有效性"一节中的专门表格展示。

2.4 一个实用的检查清单

你的 Table 1 中是否包含了:
□ 所有在回归中使用的因变量(包括不同设定的 Y)?
□ 核心自变量(所有关键 X)?
□ 所有控制变量?
□ 中介变量(如果在主要分析中使用)?
□ 调节变量(如果在主要分析中使用)?
□ 工具变量(如果使用 IV)?
□ 样本限制变量(如"仅城市样本""仅 A 股上市公司"的筛选变量)?

三、展现什么特征值?——最小必要集和扩展集

3.1 最小必要集——N、均值、标准差、最小值、最大值

这是每个描述性统计表必须包含的五项——审稿人用这五项来做数据的第一次"体检":

统计量 回答的问题 警报信号(数据可能有问题)
N(观测数) 这个变量的有效样本有多大? N 在不同变量间不一致且差异大 → 缺失值问题
均值(Mean) 这个变量的"中心"在哪? 均值接近 min 或接近 max → 天花板/地板效应
标准差(Std. Dev.) 这个变量在样本中变异多大? SD 远大于 Mean(> 3×)→ 严重右偏,应考虑对数化
最小值(Min) 有不可思议的低值吗? Min < 0 而理论上不能为负 → 数据编码错误
最大值(Max) 有不可思议的高值吗? Max / Mean > 100 → 极端异常值,应考虑缩尾
* Stata 一行输出这五个量
summarize y x1 x2 x3

3.2 扩展集——中位数、p25、p75、偏度

对于以下类型的变量,最小必要集不够——你需要加入额外的特征值:

何时加入中位数(p50)

  • 当均值和中位数差异巨大时(如均值 = 50,中位数 = 8)→ 数据严重右偏,均值被极值拉高了。
  • 审稿人看出 SD >> Mean 时——中位数可以展示"典型个体"的真实中心位置,不受极值影响。

何时加入 p25 和 p75

  • 当你使用了分组分析时(如"高教育组 vs 低教育组")——展示教育年限的 p25 和 p75 帮助读者理解你分组切点的含义。
  • 当你将连续变量分组为二元变量时——展示 p25 和 p75 让读者看到分组前后变异的变化。
summarize y x1 x2, detail   // 包含 p25, p50, p75, 偏度, 峰度

3.3 按组分类的描述性统计——"表 1 的分组版本"

在差异分析(DID)、随机对照实验(RCT)或任何有"处理组 vs 对照组"的论文中,描述性统计应该展示分组后的统计量——并在右端加入"差异检验"(t 检验或标准化差异)。

                处理组          对照组          差异
                均值 (SD)       均值 (SD)       p 值 / 标准化差异
DV              0.34 (0.18)    0.31 (0.17)    0.04
X               12.3 (4.1)     12.1 (4.0)     0.52
...

目的:展示处理组和对照组在处理前的可观测特征上是否"平衡"。如果两组在处理前的特征差异很大 → 你的 DID 或匹配的"平行趋势"或"条件独立性"假设在可观测层面上已经存疑。

3.4 面板数据的描述性统计——"整体、组间、组内"

对于面板数据,一个更精细的做法是分解变异的来源:

                整体 SD         组间 SD         组内 SD
DV              0.35            0.28            0.19
X               12.3            10.8            5.2
* 面板变异分解
xtsum y x1 x2

目的:展示 X 的变异主要来自个体之间还是个体内部——这对理解 FE 模型(只用组内变异)的识别来源至关重要。如果组内 SD 极小 → FE 的识别可能很弱。


四、原始变量还是变换后的变量?

4.1 基本原则:展示你在回归中实际使用的变量

如果回归中用的是对数形式——描述性统计表中应该放对数形式:

* 如果回归中用的是 ln_wage
gen ln_wage = ln(wage)
* 描述性统计中展示 ln_wage,不是 wage

原因:读者需要看到的是"进入回归模型的变量"的分布——而不是一个未被模型直接使用的、原始尺度的变量的分布。如果你在回归中用了 ln(income)\ln(\text{income}),但 Table 1 展示的是 income——读者无法从 income 的均值和标准差推断 ln(income)\ln(\text{income}) 的分布特征。

4.2 什么时候可以两列都放?

在某些论文中,描述性统计会同时展示原始变量和变换后的变量——如:

变量              N      原始均值 (SD)    变换后均值 (SD)
收入            4500    85000 (120000)   11.2 (0.9) [ln(收入)]

适用场景

  • 你的读者群习惯在原始单位中理解变量(如"收入 8.5 万元")。
  • 对数变换后的系数解读需要回到原始尺度(β\beta 在 ln-ln 中是弹性——读者需要和原始均值对照)。

4.3 缩尾后的变量——展示缩尾后的版本

如果你做了缩尾(Winsorization),描述性统计表应展示缩尾后的变量——因为这是进入回归的版本。你可以在描述性统计的注脚中加一行说明,或在论文的"数据"一节中写明:

"所有连续变量在 1% 和 99% 分位数处进行缩尾处理。Table 1 报告缩尾后变量的描述性统计。"

* 缩尾后展示
winsor2 x, replace cuts(1 99)
summarize x

不要展示缩尾前的值和缩尾后的值在同一个 Table 1 中混合——读者会困惑哪个版本被用在了回归中。

4.4 标准化变量——展示标准化后的版本

如果你的回归使用了标准化变量(z-score),描述性统计的均值 ≈ 0,SD ≈ 1——读者可能无法直观理解"一个标准差的效应"。在这类论文中,有些作者选择同时展示标准化和原始版本的描述性统计——或至少提供原始变量的均值和标准差(在注脚或附录中),让读者可以将标准化的结果翻译回原始尺度。


五、描述性统计表的目的——在进入回归之前,你的数据讲了什么?

5.1 目的之一:让读者看你的样本——"你研究的是谁?"

描述性统计给了读者一个"样本的快照"——不必读完整篇论文的方法和数据部分,读者可以从 Table 1 中迅速了解:

  • 你的样本的平均受教育年限是 9.2 年 → 你的样本可能集中于低教育水平的群体。
  • 你的因变量(是否创业)的均值是 0.07 → 只有 7% 的人创业,这是一个稀有事件——你后面的 Logit 回归可能面临稀有事件偏误。
  • 你的企业样本中,R&D 支出的均值是 0、中位数是 0 → 超过一半的企业没有研发——这是一个在零处堆积的角点解。

这些信息在回归中不会自动浮现——但审稿人需要它们来理解你的结果。

5.2 目的之二:暴露数据问题——"你在跑回归之前做了功课吗?"

这是描述性统计最被低估的功能:它是一张数据质量的事前诊断表。

在跑回归之前,你应该已经通过检查 Table 1 中的这些信号来判断数据是否需要清洗、变换或调整:

  • Min 和 Max 是否在理论合理的范围内?
  • 标准差是否远大于均值?
  • 二元变量的均值是否接近 0 或 1?
  • N 是否在变量之间一致?

如果这些问题在回归跑完之后才被发现——审稿人会认为你"没有检查数据就跑了回归"——这比你承认"数据有局限"更严重。

5.3 目的之三:为后续的模型选择提供事实依据

"你为什么对这个变量取了对数?"——因为 Table 1 中 SD >> Mean(严重右偏),对数化是标准的处理。

"你为什么缩尾了?"——因为 Table 1 中 Max / Mean > 100,存在极端异常值。

Table 1 是你的模型设定的"事前事实依据"的前半部分——你在描述性统计中发现了问题,在模型设定中处理了它。 这在审稿人面前构成了一个逻辑闭环:问题 → 发现 → 处理 → 结果稳健。


六、出现什么问题需要检查数据?——描述性统计的七个红色警报

6.1 警报一:N 在不同变量之间差异显著

如果在 Table 1 中,某些变量的 N 远小于其他变量(如 N 从 5000 降到 2000 再降到 800)→ 缺失值在扩散。你需要检查:

  • 缺失是随机的吗?还是某些类型的个体更可能缺失?
  • 如果你的最终回归样本是 N = 800,而核心变量的完整样本是 N = 5000 → 审稿人会要求你解释为什么 84% 的观测被丢弃了,以及这种样本选择是否会影响你的结论的外部有效性。
  • 在论文中展示"样本构建过程"——从原始数据到估计样本的每一步删减和原因——是回应这个疑问的标准方式。

6.2 警报二:最小值或最大值在理论上不可理喻

  • 年龄的 Min = −3 或 Max = 210 → 数据中有编码错误或异常值。
  • 企业规模的 Min = 0 → 所有企业至少有一个员工,不可能为零。
  • 收入的 Min = −50000(在税前数据中)→ 可能是自雇亏损,需要明确标注并确认其合理性。

审稿人看到不可理喻的 min 或 max 会要求你解释或修正——在提交之前自己先检查。

6.3 警报三:标准差 >> 均值(严重右偏)

SD > 3 × Mean → 数据分布严重右偏——极少数的极大值拉高了标准差。考虑:

  • 对数化(ln(y) 或 ln(y+1))。
  • 缩尾(Winsorization)。
  • 或在回归中使用中位数回归进行稳健性检验。

6.4 警报四:二元变量的均值接近边界

  • 因变量(是否出口)均值 = 0.02 → 只有 2% 的企业出口。你的 Logit 模型面临的"事件发生率极低"问题——需要讨论(稀有事件偏误、Firth Logit、或使用 LPM)。
  • 因变量均值 = 0.98 → 只有 2% 的企业不出口——同样的问题。

6.5 警报五:标准差极小(缺乏变异)

  • 某个控制变量的 SD = 0.01,均值 = 3.5 → 这个变量在样本中几乎不变。为什么它被作为控制变量?它的系数无法被可靠地估计(共线性或缺乏变异)。

6.6 警报六:关键变量的均值在缩尾前后差距极大

  • 如果你的描述性统计表展示的是缩尾后的变量,但缩尾前该变量的 Max = 50000(缩尾后的 Max = 120) → 说明原始数据中有非常极端的异常值。缩尾的阈值选择是否合理(1% 和 99%?还是 0.5% 和 99.5%?)——审稿人可能会问。

6.7 警报七:分组描述性统计中的差异检验大面积显著

  • 如果你的处理组和对照组在 15 个处理前的特征中,有 12 个的差异检验 p < 0.05 → 你的处理不是"如同随机"的——处理组和对照组在可观测特征上已经不同了,不可观测特征也很可能不同。这是 DID 或匹配分析的巨大红旗。

七、审稿人最常对 Table 1 提出的六类质疑

7.1 质疑一:"描述性统计表缺少关键变量"

"Table 1 展示了核心自变量和控制变量,但中众变量 M 尽管在后续的中众分析中使用,未出现在描述性统计中。请加入。"

回应:将 M 和 W 加入 Table 1(如果它们是主要分析的一部分)或附录(如果它们是稳健性检验)。

7.2 质疑二:"描述性统计表的样本量和回归表的样本量不一致——差异巨大且未被解释"

"Table 1 的 N = 8,234,但 Table 2(基准回归)的 N = 4,567。两者之间超过 3,600 个观测的差异需要被追踪和解释。"

回应:在论文中构建"样本选择流程表"——从原始数据到估计样本,每一步:(1)原始观测数 →(2)删除缺失关键变量的观测 →(3)删除不符合样本限制条件的观测 →(4)最终估计样本。每一步给出 N 和删除原因。审稿人不需要猜你的样本变异的原因——他们需要你呈现完整的链。

7.3 质疑三:"最小值/最大值在理论上不合理"

"企业年龄(firm age)的最小值是 −5。请解释为什么存在在成立年份之前就出现在样本中的企业。"

回应:检查原始数据——可能是编码错误(年份格式错误导致计算年龄时出现负数)、可能是数据录入错误、也可能是某些行业(如并购后的企业存续期计算)的特殊情况。无论原因是什么——需要修正或解释。如果无法修正——在论文中坦诚地标注这个异常,并展示排除这些异常观测后结论是否变化。

7.4 质疑四:"关键变量严重右偏但未做变换——为什么?"

"核心自变量 R&D 支出的标准差是均值的 20 倍——数据存在严重右偏。为什么作者选择在水平值上而不是在 log 尺度上建模?"

回应:如果有理由在水平值上建模(如理论要求的模型设定、水平值的系数具有特定的经济解读、或在稳健性检验中 log 尺度的结果类似),在论文中明确说明。如果没有理由——考虑替换为对数化的设定,或至少在对数尺度上展示稳健性。

7.5 质疑五:"二元变量的均值极低——事件发生率不足以支撑非线性模型"

"因变量(是否获得专利)的均值是 0.008。在这个事件发生率下,Logit 模型可能存在稀有事件偏误。作者是否考虑使用 Firth Logit 或线性概率模型作为替代?"

回应:在这种情况下,审稿人通常希望你至少讨论稀有事件偏误的可能性——即使你的主模型不变,在稳健性检验中使用 Firth Logit 或 LPM 来展示结论是稳健的,通常会解决这个质疑。

7.6 质疑六:"描述性统计表展示的是原始变量,但回归中使用的是变换后的变量"

"Table 1 中变量 income 的均值是 85,000,但回归中使用的变量是 ln(income)。读者无法从 Table 1 了解 ln(income) 的分布——Table 1 应报告进入回归的版本。"

回应:将 Table 1 中的 income 替换为 ln(income),或同时展示两者。这是极容易修正的——但也是审稿人反复提出的,因为它暗示了作者在数据准备和回归设定之间的脱节。


八、常见误区

8.1 误区一:"描述性统计就是 summarise 的输出粘过去"

描述性统计不是机械操作——它是一张"体检报告"。在你把 summarize 的输出粘成表格之前,你应该自己先读一遍——检查 N、min、max、mean、sd 中是否有任何一个数字让你皱眉。如果你自己都不读——审稿人会替你读,而且他们的结论通常是"作者似乎没有仔细检查数据"。

8.2 误区二:"N 在变量之间不同——没问题,因为 Stata 自动处理了缺失值"

是的,Stata 自动处理缺失值——但审稿人需要知道 N 为什么不同、差异有多大、差异是否可能影响结果。如果 N 的差异很小(如 5000 vs 4800)→ 可以仅在注脚中注明。如果 N 的差异很大(如 5000 vs 2000 vs 800)→ 需要在正文中解释。

8.3 误区三:"描述性统计表应该尽可能简洁——少放一些变量和统计量"

简洁是好的——但"不包含关键信息"不是简洁,是遗漏。一份好的描述性统计表在信息上是完整的——在展示上是精炼的。 用最少的空间传达最多的关键信息。额外的不太重要的细节可以放在附录。

8.4 误区四:"变形的变量(如交互项、平方项)需要在描述性统计中展示"

交互项和平方项不传达独立的信息——它们是从组成部分构建的。读者不需要知道 X² 的均值和标准差——它们可以从 X 的均值和标准差中推导。描述性统计表应展示构建项之前的基础变量。

8.5 误区五:"描述性统计在回归之后写也行——反正只是格式要求"

描述性统计应该是你做实证分析的第一个实质性操作——在你跑第一个回归之前。通过检查描述性统计,你会发现数据的问题、判断是否需要取对数或缩尾、判断二元变量是否有足够的变异。如果你在回归全部跑完之后才看描述性统计——你可能已经在一个有问题的数据上跑了几十个回归,需要返工。


九、总结

描述性统计表的七条核心知识

  1. 必放的变量:因变量、核心自变量、所有在回归中使用的控制变量。中介变量、调节变量和工具变量如果在主要分析中使用 → 自然放;如果在附录中使用 → 在附录中放。交互项和固定效应哑变量 → 不需要放。

  2. 最小必要特征值:N、均值、标准差、最小值、最大值。对于偏态变量 → 加入中位数和 p25/p75。面板数据 → xtsum 展示组间和组内变异。

  3. 展示进入回归的版本——如果你的回归用 ln(y),Table 1 用 ln(y),不是 y。原始版本如需展示 → 附录。

  4. 描述性统计的三重目的:(a)让读者看你的样本,(b)暴露数据问题(在回归之前),(c)为模型设定提供事前事实依据。

  5. 七个数据红色警报:N 不一致、min/max 不可理喻、SD >> Mean、二元变量均值接近边界、SD 极小(缺乏变异)、缩尾前后差距极大、分组差异检验大面积显著。

  6. 审稿人的六类经典质疑:缺失关键变量、N 不一致未被解释、min/max 理论上不可能、严重偏态未变换、稀有事件、变量版本不匹配。六类都是可以事先预防的——在提交之前,把自己当成审稿人,看完一遍你的 Table 1。

  7. Table 1 应该是你的第一项操作,不是最后一项。 在跑回归之前做描述性统计——用它来检查你的数据质量——然后才进入回归分析。顺序反了,你的工作可能会在审稿阶段返工。


一句话收尾

"Table 1 是你论文的'门面'——但它的功能不是装饰。它是你的数据的体检报告:均值是数据的体温,标准差是数据的呼吸,min 和 max 是数据的血压——每一项都有一个正常范围。N 在变量之间的不一致是在告诉你'有人掉队了——他们是谁?'。SD >> Mean 是在告诉你'长尾里有极端值——我能容忍吗?'。Binary 变量的 mean 接近 0 是在告诉你'事件太稀有——我的模型能应对吗?'。好的描述性统计表在你跑回归之前就已经开始提问了。坏的描述性统计表只是你从 Stata 粘贴到 LaTeX 的一串数字,等审稿人替你读——然后等他们替你提问。你不是在'交格式作业'——你是在告诉审稿人和读者'我认识我的数据,我认识它的边界和局限,我带着认识进入了我的回归分析'。"


十、B站/公众号呈现建议

  • B站视频:建议用"体检报告"作为核心视觉隐喻。开场:一个医生(研究者)拿着一张体检报告(Table 1),面对一个病人(数据集)。医生指着报告上的数字:"体温(均值)正常。心率(标准差)有点偏快——你的变量在右偏。血压 min/max——最低值在正常范围之外,你的数据里有编码错误需要查。" 旁白:"Table 1 不是格式作业——它是你数据的体检报告。每个统计量都是你的数据的一个生命体征。均值、标准差、min、max——它们回答的不是'变量叫什么'——而是'这个数据健康吗'。好的研究者在跑第一个回归之前,已经把体检报告读了一遍。坏的研究者在审稿人替她读时才第一次发现问题。" 第一幕"六个审稿人的经典质疑":六个信封依次被打开——每个信封里是一个审稿人的疑问:① "Table 1 为什么没有中介变量?" ② "N 为什么在 Table 1 和 Table 2 之间少了 3000 个观测?" ③ "收入最小值为什么是 −500?" ④ "SD 是 Mean 的 20 倍——为什么不取对数?" ⑤ "二元因变量均值 0.008——Logit 在这种稀有事件下可靠吗?" ⑥ "Table 1 展示的是收入,回归里用的是 ln(收入)——为什么不一致?" 旁白:"六类质疑——都是你可以在提交之前自己发现和修正的。审稿人不是你的校对员——他们期望你已经在 Table 1 里做了数据的第一步工作。" 第二幕"什么放什么不放":画面展示一张 Table 1 表格——左侧是"必放列"(因变量、核心 X、控制变量——绿色),中间是"可放列"(中介变量、调节变量——淡绿色——根据是否在主要分析中决定),右侧是"不需放列"(哑变量、交互项、平方项——淡红色——排除)。标注:"Table 1 应该展示的是——在回归中使用的、有独立经济和统计含义的基础变量。不是所有的变量都需要出现在这第一张表里。"

  • 公众号:描述性统计表的最小必要特征值(N、Mean、SD、Min、Max)配"每个统计量在审稿人眼中的含义"做成信息图核心。七个数据红色警报做成体检信号卡——每个警报配一个"应该检查什么"的行动建议。审稿人的六类经典质疑做成"预防卡"——在提交之前对照这张卡检查你的 Table 1。变量层次决定表(必放、可放、不需放)做成三层决策参考卡——对新手尤其有用。原始 vs 变换后的变量的放置规则做成对比卡。分组描述性统计的模板(处理组 vs 对照组 + 差异检验)做成模板卡。

  • 推荐标题

    • 主标题:《描述性统计表——你的数据的第一张体检报告》
    • 备选标题:《Table 1 应该放哪些变量、展示什么特征值?——描述性统计的最小必要知识》
    • 新媒体标题:《审稿人看你的 Table 1 时,在看什么?——六个你可以在提交前预防的问题》
  • 金句提炼

    "Table 1 不是 Stata 的 summarize 指令粘贴过来的结果——它是你认识自己数据的第一步。均值告诉你你的样本的'中心'在哪,标准差告诉你你的变量在样本中的'呼吸范围'有多大,min 和 max 告诉你你的数据的边界在哪。审稿人会看这四个数字——你更应该先看。"

    "SD >> Mean——你的数据在长尾里喘息。审稿人看到这个,会问你为什么不取对数。Binary 均值接近 0 或 1——你的二元变量几乎不变。审稿人会问你事件太稀有的情况下你的非线性模型是否还可靠。这些不是你跑完回归才去想的问题——你在 Table 1 的时候就应该开始想了。"

    "描述性统计表是你论文中读者看到的第一张表——也是审稿人第一个检查的地方。N 不一致、min/max 不可理喻、变量版本和回归不匹配——这些是审稿人第三秒就能发现的问题。你用三分钟提前发现并修正它们——可以省下三轮审稿。"

    "Table 1 的变量应该是你回归中实际使用的变量。回归用 ln(income),Table 1 展示 income——审稿人第一反应:'作者可能没注意——也可能数据准备和回归分析不连贯。' 这种质疑是可以完全避免的——把 Table 1 和回归中的变量名、形式和定义对齐。对齐,就不会被问。"