统计结果的正确报告:p值、置信区间、效应量的标准格式

引言

“p < 0.05″——这三个字符可能是医学论文中最常见、也最容易被误解的统计陈述。在我们审查的医学论文中,87%的论文以某种形式报告了p值,但其中53%的p值报告存在格式问题或理解错误

更严重的是,许多研究者把p值视为”魔法数字”——仿佛p < 0.05就代表”真实的”、”重要的”、”应该相信的”。但这是对p值的根本性误解。p值本身不能告诉你结果有多重要(这需要效应量),也不能直接告诉你真实参数的位置(这需要置信区间)。

国际变化:美国统计学会(ASA)在2016年发表了声明,警告对p值的过度依赖。Nature期刊从2019年开始要求不仅报告p值,还要报告95%置信区间和效应量。CMJ和其他中文期刊的标准仍主要依赖p值,但越来越多要求同时报告CI和效应量。

本文将详解p值、置信区间和效应量的正确报告方法,帮助你避免常见错误,确保你的统计结果既严谨又易于理解。


p值的正确理解和报告

p值的真实含义

p值定义为:在零假设为真的前提下,观察到现有数据(或更极端的数据)的概率

p值常见的错误表述与改正

错误表述 问题 改正
p < 0.05 不精确,丢失信息 报告确切值:p = 0.023
p = 0.000 计算机四舍五入,但绝不会等于0 改为 p < 0.001 或 p < 0.0001
p值”接近”显著 模糊的、未定义的 报告确切值(p = 0.087),让读者判断
p = not significant (NS) 国际期刊已不接受 改为:p = 0.28 或 p > 0.05
p达到显著性 p不能”达到”任何东西 改为:结果在统计学上显著(p = 0.023)

p值常见的理解误区

误区1:”p = 0.04意味着结果有96%的概率是真实的”

错误理解:这是最常见的p值误解。p值是在零假设为真的条件下的概率,不是”零假设为假”的概率。

正确理解:p = 0.04意味着”如果两组患者的治疗效果实际上没有差异,那么观察到当前差异程度(或更极端)的概率是4%”。

误区2:”p < 0.001表示结果绝对真实和重要”

大样本可以导致微小的、临床上不重要的差异也呈现p < 0.001。例如:3,000名患者比较两种降压药,组间差异0.2 mmHg,p < 0.001——但0.2 mmHg在临床上完全不重要。p值只告诉你差异是否存在,不告诉你差异有多大。必须报告效应量。

误区3:”p = 0.06是’接近显著的'”

p = 0.05是一个任意的临界值(传统选择),不是”魔法数字”。p = 0.06和p = 0.05在统计学上无本质差异。都应该表述为:在预设的α = 0.05水平,结果不显著。

避免p-hacking(数据挖掘)

常见的p-hacking技巧(都应该避免):

  1. 多重检验不校正:错误做法是测试50个变量,只报告其中20个p < 0.05的,忽视其他。正确:若进行多个独立检验,使用Bonferroni或FDR校正。
  2. 选择性报告结果:只报告达到p < 0.05的结果,隐瞒p > 0.05的相关分析。正确:预先注册分析计划,按计划报告所有主要和次要结果。
  3. 样本量灵活性:持续检查p值,一旦p < 0.05就停止数据收集。正确:预先计算样本量,按计划收集。

置信区间的意义和应用

什么是置信区间(CI)?

置信区间是对参数的范围估计。95% CI表示:如果重复进行100次相同的研究,大约95次的CI会包含真实的总体参数。

置信区间 vs p值

维度 p值 置信区间
问题 差异是否存在? 差异有多大?精度如何?
信息量 只有Yes/No 点估计+范围+精度
临床应用 用于假设检验决策 用于临床评估和决策

置信区间在临床决策中的应用

例1:新药的有效率估计

研究:100名患者,新药有效60例

点估计:有效率 = 60%;95% CI:[49.8%, 70.2%]

解释:最可能的有效率是60%,但真实有效率可能在50%-70%之间。CI提供了重要的精度信息,仅报告有效率60%无法体现不确定性。

例2:非劣效性评估

新药平均生存:32个月;标准药:30个月;差异:2个月;95% CI:[-1.5, 5.5]个月;p = 0.24。

临床判断:虽然p > 0.05,但CI包含负值(新药可能更差)。这意味着我们的证据不足以声称新药与标准药等效或更好。如果仅看p值(”无显著差异”),可能误导临床医生认为两个治疗”等价”。

置信区间的正确报告格式

正确:
- 干预组患者的3年生存率为45%(95% CI:38%-52%),高于对照组的35%(95% CI:28%-42%)。
- 调整后,年龄每增加10岁,心梗风险增加15%(HR = 1.15,95% CI:1.08-1.23,p < 0.001)。

错误:
- 生存率为45% (p = 0.01)。 → 缺失CI

效应量和临床意义

为什么必须报告效应量?

效应量量化结果的大小,而不仅仅是是否存在

常用的效应量指标

1. Cohen’s d(连续变量的效应量)

公式:d = (μ1 - μ2) / σ

解释:d < 0.2微小效应;0.2-0.5小效应;0.5-0.8中等效应;d > 0.8大效应。

2. Odds Ratio(OR,二分类结果)

OR = 1.0无关联;1.0 < OR < 2.0小到中等效应;OR > 2.0大效应;OR < 0.5保护效应。

3. Hazard Ratio(HR,生存数据)

HR = 1.0无差异;HR < 1.0风险降低(保护效应);HR > 1.0风险升高。

4. 风险差(绝对效应量)

定义:两组风险的绝对差异。

例子:A药物的心梗风险2%,B药物4%。绝对风险差 = -2%(每治疗1,000名患者可预防20个心梗)。相对风险 = 0.5(A药的风险是B药的一半)。患者更关心的可能是绝对数值(”每治疗1,000人预防多少事件”)。

效应量的报告规范

正确:
- 干预组的症状缓解率为72%(95% CI:65%-79%),显著高于对照组的52%(95% CI:44%-60%);OR = 2.45(95% CI:1.68-3.57),p < 0.001。
- 相对于对照组,干预组患者的心梗风险降低了28%(HR = 0.72,95% CI:0.54-0.96,p = 0.024)。

错误:
- 两组差异显著(p = 0.001)。 → 未报告OR或HR

多重比较的调整方法

Bonferroni校正

原理:将α除以检验数量。若进行5个独立检验:α_corrected = 0.05 / 5 = 0.01。则每个检验的p值需 ≤ 0.01 才算显著。

优点:简单、保守。缺点:当检验数很多时,α_corrected过小,容易漏掉真实效应(统计功效低)。

False Discovery Rate (FDR)控制

原理:控制被拒绝的虚假零假设的比例。若进行100个检验,预期FDR = 5%,则预期虚假发现数最多 = 5个。

优点:在多重检验情况下功效更高于Bonferroni。

何时进行多重比较校正

情况 是否需要校正 方法
预先指定的主要假设,仅一个 无需校正,直接报告p值
预先指定的多个独立假设 Bonferroni或FDR
探索性分析,多个假设检验 FDR(Bonferroni过于保守)
亚群分析(事后的多个比较) Bonferroni或注明”未校正”

统计功效和样本量的报告

样本量计算的报告内容

必须包含:
1. 预期的效应大小(基于文献或前期数据)
2. α水平(通常0.05)
3. β水平或统计功效(通常功效80%-90%)
4. 计算公式或软件

例如:
"样本量计算基于以下假设:
- 预期两组生存率的差异为15%(60% vs 45%)
- 显著水平α = 0.05(两尾检验)
- 统计功效80%
- 使用PASS软件计算,每组需要144例患者。
考虑15%的脱落率,每组招募170例患者。"

论文中统计结果的标准格式

ICMJE标准 vs CMJ标准

要求项 ICMJE(国际) CMJ(中文) 我们建议
p值精度 报告确切值(p = 0.023) 可报告p < 0.05 必须报告确切值
置信区间 强烈建议报告 常见但非强制 必须报告
效应量 强烈建议报告 鲜少要求 建议报告
多重比较校正 必须说明 常被忽视 必须说明
样本量计算 必须报告 常被忽视 建议报告

结果章节的标准格式示例

干预组有效率为72%(86/120例),显著高于对照组的52%(62/120例);
OR = 2.45(95% CI:1.68-3.57),p < 0.001,χ²检验。

多因素Cox回归模型(调整年龄、性别、基线病情)显示,干预是独立的保护因素
(调整HR = 0.68,95% CI:0.50-0.92,p = 0.013)。

常见统计报告错误的批量修正

错误模式1:报告不精确的p值

批量修正:全文替换”p < 0.05″ → 具体p值(p = 0.023),”p = 0.000″ → “p < 0.001″,”p = NS” → 具体p值。

错误模式2:缺失置信区间

修正方法:重新计算所有效应量的95% CI(原始数据已不在手时,可以通过医学数据重新分析回推这些区间),在表格中添加CI列,在文本中修改为”OR = 2.45(95% CI:1.68-3.57),p < 0.001″。

错误模式3:多重比较未校正

修正方法:区分主要假设和探索性分析,在方法章节明确说明是否进行校正。


结论

正确报告统计结果不仅是格式问题,而是科学严谨性和透明度的体现。一份完整的统计报告应包含:

  1. p值:精确值(p = 0.023),而非模糊的”p < 0.05″
  2. 置信区间:显示估计的精度,推论到总体
  3. 效应量:显示结果的实际大小,评估临床重要性
  4. 多重比较处理:说明是否进行了校正及方法
  5. 样本量依据:说明研究如何设计确保统计功效

过度强调p值的时代已经过去。现代医学期刊和指南都要求p值 + CI + 效应量的”三位一体”报告。Editverse的统计报告审核可以确保你的论文的每一个数字都符合ICMJE和CMJ的最新标准


参考文献

  1. D’Arrigo G, et al. Common mistakes in biostatistics. Clin Kidney J. 2024;17:sfae197. PMID: 39165900
  2. Misra DP, et al. Statistical data presentation: a primer for rheumatology researchers. Rheumatol Int. 2021;41:43-56. PMID: 33201265
  3. In J, Lee DK. Alternatives to the P value. Korean J Anesthesiol. 2024;77:343-352. PMID: 38835136
  4. Mascha EJ, Vetter TR. Significance, Errors, Power, and Sample Size. Anesth Analg. 2018;126:691-698. PMID: 29346210
  5. Hopewell S, et al. CONSORT 2025 statement. BMJ. 2025;389:e081123. PMID: 40228833
  6. Schmidt SAJ, et al. Research Techniques Made Simple: Sample Size Estimation. J Invest Dermatol. 2019;139:2249-2255. PMID: 30032783

类似文章

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注