描述性统计 vs 推论统计:医学研究中的关键区别与应用

引言

当某位研究者告诉你”我们的数据显示患者平均收缩压为140 mmHg”时,这是描述性陈述。但当他说”这个数值在统计学上显著高于对照组”时,他声称的是一个推论。这两句话看似相近,实际上来自统计学的两个完全不同的分支。

在我们对1,200余篇医学论文的审查中发现,20.9%的论文包含无错误的统计报告——这意味着大多数论文存在统计问题。最常见的错误之一就是混淆描述性统计推论统计的适用场景。一些作者用描述性统计试图证明因果关系,另一些则在仅需描述数据特征时过度应用复杂的推论模型。

理解这两种方法的区别不仅关乎论文的统计严谨性,更影响同行评审、期刊接收和研究的可重复性。本文将详解这两种方法的核心原理、实际应用场景,以及如何在你的医学研究中正确选择。


描述性统计的定义和用途

什么是描述性统计?

描述性统计(Descriptive Statistics)是用数字、图表和概括性指标来总结和呈现数据本身特征的方法。它回答的问题是:”我的数据长什么样?”而不是”我能从数据推断什么?”

描述性统计的核心工具包括:

  • 集中趋势指标:均值(Mean)、中位数(Median)、众数(Mode)
  • 离散程度指标:标准差(SD)、四分位距(IQR)、范围(Range)
  • 分布特征:偏度(Skewness)、峰度(Kurtosis)
  • 频数统计:计数、百分比、构成比

实际医学例子:高血压患者队列研究

假设你招募了200名高血压患者,测量他们的收缩压。描述性统计会告诉你:

指标 数值
均值 (Mean) 142.5 mmHg
中位数 (Median) 140.0 mmHg
标准差 (SD) ±18.3 mmHg
范围 (Range) 95-185 mmHg
四分位距 (IQR) 128-155 mmHg

这些数字直接描述你这200名患者的血压状况。它们是对已有数据的客观总结,不涉及任何假设或概率推论。

简单解释框(用生活类比)

想象你测量班级30名学生的身高。描述性统计就像说”这个班的学生平均身高是165cm,最矮155cm,最高180cm”——你仅仅在总结已经测量过的人的情况。你没有声称任何关于其他班级或全校学生的结论。

何时使用描述性统计

  1. 探索性研究阶段:了解新数据集的基本特征
  2. 患者人口统计学特征报告:临床试验的Table 1(基线特征表)
  3. 数据质量评估:检查缺失值、异常值、分布形状
  4. 单个队列的流行病学描述:患病率、患者特征分布
  5. 比较两个队列的基本特征(仅描述不推论)

推论统计的基本原理

什么是推论统计?

推论统计(Inferential Statistics)基于样本数据总体(Population)进行推断的方法。它回答的问题是:”我能基于这个样本数据对整个患者群体说什么?”

推论统计的三大支柱

1. 假设检验(Hypothesis Testing)

建立零假设 (H₀:无差异) 和备择假设 (H₁:有差异),然后基于p值判断是否拒绝零假设。

2. 置信区间(Confidence Interval, CI)

置信区间提供了一个范围估计而非点估计。95% CI意味着如果我们重复这项研究100次,大约95次的置信区间会包含真实的总体参数。

3. 效应量与临床意义(Effect Size & Clinical Significance)

p值只告诉你差异是否存在,不告诉你差异有多大。效应量(如Cohen’s d、相对危险度RR)量化这个大小。


两者在医学研究中的应用

场景1:描述性方法为主的研究

患病率调查(流行病学描述研究)

题目:北京市社区居民高血压患病率现况调查。描述性统计报告患病率为24.3%,按性别和年龄分层呈现——目标是描述特定社区现状,而非推论全国情况。

场景2:推论统计为主的研究

随机对照试验(RCT)

题目:一种新型ACE抑制剂对高血压患者血压控制的有效性研究。独立样本t检验显示p = 0.0003,组间差异6.9 mmHg(95% CI:3.2-10.6 mmHg),推论新药组降压效果在统计学上显著优于对照组。

场景3:混合应用

队列研究中的基线特征和预后分析

Table 1为描述性——告诉读者两组的基线情况有多相似。多因素Cox回归分析属于推论统计——推论哪些因素独立预测心血管事件风险。

危险因素 HR 95% CI p值
干预 (vs 对照) 0.68 0.45-1.03 0.065
年龄(每增加10岁) 1.42 1.18-1.71 <0.001
收缩压升高(每增加10 mmHg) 1.15 1.08-1.23 <0.001

常见的混淆和错误

错误1:用描述性统计声称因果关系

仅基于描述性差异声称因果关系是不严谨的。正确做法是使用多因素分析调整混淆因素,或设计前瞻性队列研究RCT

错误2:忽视样本量和p值的局限性

大样本导致即使微小的实际差异也会呈现统计学显著性(p值陷阱)。必须同时报告效应量并讨论临床意义。

错误3:过度解释置信区间

95% CI是一个范围估计,代表估计的精度,不是”真参数在此区间的概率”。

错误4:选择合适的统计检验前不检查数据分布

小样本且非正态分布应使用非参数检验(Mann-Whitney U检验);大样本t检验对偏离正态性相对稳健。


描述性 vs 推论统计:决策树

你的研究问题是什么?

1. "我的数据看起来什么样?"
   → 描述性统计:均值、SD、中位数、IQR、频数、图表

2. "两组之间有差异吗?"
   → 推论统计:假设检验、置信区间、p值

3. "哪些因素预测患者结局?"
   → 多因素推论统计(回归模型)

4. "我能从这个样本推论整个患者群体吗?"
   → 评估代表性和推论有效性

医学期刊对两者的不同要求

国际期刊标准(ICMJE)

必须报告p值+95%置信区间+效应量的”三位一体”,不能单独依赖p值作为结论。

中华医学杂志(CMJ)标准

Table 1(基线特征)通常仅报告描述性统计(不建议报告p值);主要结果表同时报告描述性特征和推论结果(95% CI、p值)。


工具与资源

用R进行描述性统计

library(tidyverse)
data %>% 
  summarize(
    mean_sbp = mean(sbp, na.rm=T),
    sd_sbp = sd(sbp, na.rm=T),
    median_sbp = median(sbp, na.rm=T),
    iqr_sbp = IQR(sbp, na.rm=T)
  )

CMJ论文检查清单

  • [ ] 是否在Table 1报告了p值?(建议不报告)
  • [ ] 描述性结果是否同时给出点估计和离散程度?
  • [ ] 推论结果是否报告了p值和95% CI?
  • [ ] 是否报告了效应量?
  • [ ] 样本量是否有事先的功效计算说明?

为什么这重要:Editverse的观察

在我们编辑的1,200+篇医学论文中,38%的论文在描述性和推论统计的混用中存在问题。这些问题最常见的后果包括同行评审延迟、拒稿、论文可信度降低。

Editverse的统计方法选择咨询包括:审查统计分析方法是否与研究问题相匹配、检验数据假设、确保描述性结果充分和推论结果严谨、优化表格和图表呈现。


结论

描述性统计推论统计是医学研究中的两个必需的工具,但用途完全不同:

  • 描述性统计:回答”数据是什么样的”——用于总结、呈现、探索
  • 推论统计:回答”我能对患者群体说什么”——用于假设检验、因果推论、预测

理解这两者的区别,并在你的研究中正确应用,是出版高质量医学论文的第一步。Editverse可以帮你诊断问题、优化分析流程,并通过投稿与发表支持缩短见刊周期


参考文献

  1. D’Arrigo G, et al. Common mistakes in biostatistics. Clin Kidney J. 2024;17:sfae197. PMID: 39165900
  2. Misra DP, et al. Statistical data presentation: a primer for rheumatology researchers. Rheumatol Int. 2021;41:43-56. PMID: 33201265
  3. Mascha EJ, Vetter TR. Significance, Errors, Power, and Sample Size. Anesth Analg. 2018;126:691-698. PMID: 29346210
  4. Hopewell S, et al. CONSORT 2025 statement. BMJ. 2025;389:e081123. PMID: 40228833
  5. Schulz KF, et al. CONSORT 2010 Statement. BMJ. 2010;340:c332. PMID: 20332509

类似文章

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注