统计结果的正确报告:p值、置信区间、效应量的标准格式
引言
“p < 0.05″——这三个字符可能是医学论文中最常见、也最容易被误解的统计陈述。在我们审查的医学论文中,87%的论文以某种形式报告了p值,但其中53%的p值报告存在格式问题或理解错误。
更严重的是,许多研究者把p值视为”魔法数字”——仿佛p < 0.05就代表”真实的”、”重要的”、”应该相信的”。但这是对p值的根本性误解。p值本身不能告诉你结果有多重要(这需要效应量),也不能直接告诉你真实参数的位置(这需要置信区间)。
国际变化:美国统计学会(ASA)在2016年发表了声明,警告对p值的过度依赖。Nature期刊从2019年开始要求不仅报告p值,还要报告95%置信区间和效应量。CMJ和其他中文期刊的标准仍主要依赖p值,但越来越多要求同时报告CI和效应量。
本文将详解p值、置信区间和效应量的正确报告方法,帮助你避免常见错误,确保你的统计结果既严谨又易于理解。
p值的正确理解和报告
p值的真实含义
p值定义为:在零假设为真的前提下,观察到现有数据(或更极端的数据)的概率。
p值常见的错误表述与改正
| 错误表述 | 问题 | 改正 |
|---|---|---|
| p < 0.05 | 不精确,丢失信息 | 报告确切值:p = 0.023 |
| p = 0.000 | 计算机四舍五入,但绝不会等于0 | 改为 p < 0.001 或 p < 0.0001 |
| p值”接近”显著 | 模糊的、未定义的 | 报告确切值(p = 0.087),让读者判断 |
| p = not significant (NS) | 国际期刊已不接受 | 改为:p = 0.28 或 p > 0.05 |
| p达到显著性 | p不能”达到”任何东西 | 改为:结果在统计学上显著(p = 0.023) |
p值常见的理解误区
误区1:”p = 0.04意味着结果有96%的概率是真实的”
错误理解:这是最常见的p值误解。p值是在零假设为真的条件下的概率,不是”零假设为假”的概率。
正确理解:p = 0.04意味着”如果两组患者的治疗效果实际上没有差异,那么观察到当前差异程度(或更极端)的概率是4%”。
误区2:”p < 0.001表示结果绝对真实和重要”
大样本可以导致微小的、临床上不重要的差异也呈现p < 0.001。例如:3,000名患者比较两种降压药,组间差异0.2 mmHg,p < 0.001——但0.2 mmHg在临床上完全不重要。p值只告诉你差异是否存在,不告诉你差异有多大。必须报告效应量。
误区3:”p = 0.06是’接近显著的'”
p = 0.05是一个任意的临界值(传统选择),不是”魔法数字”。p = 0.06和p = 0.05在统计学上无本质差异。都应该表述为:在预设的α = 0.05水平,结果不显著。
避免p-hacking(数据挖掘)
常见的p-hacking技巧(都应该避免):
- 多重检验不校正:错误做法是测试50个变量,只报告其中20个p < 0.05的,忽视其他。正确:若进行多个独立检验,使用Bonferroni或FDR校正。
- 选择性报告结果:只报告达到p < 0.05的结果,隐瞒p > 0.05的相关分析。正确:预先注册分析计划,按计划报告所有主要和次要结果。
- 样本量灵活性:持续检查p值,一旦p < 0.05就停止数据收集。正确:预先计算样本量,按计划收集。
置信区间的意义和应用
什么是置信区间(CI)?
置信区间是对参数的范围估计。95% CI表示:如果重复进行100次相同的研究,大约95次的CI会包含真实的总体参数。
置信区间 vs p值
| 维度 | p值 | 置信区间 |
|---|---|---|
| 问题 | 差异是否存在? | 差异有多大?精度如何? |
| 信息量 | 只有Yes/No | 点估计+范围+精度 |
| 临床应用 | 用于假设检验决策 | 用于临床评估和决策 |
置信区间在临床决策中的应用
例1:新药的有效率估计
研究:100名患者,新药有效60例
点估计:有效率 = 60%;95% CI:[49.8%, 70.2%]
解释:最可能的有效率是60%,但真实有效率可能在50%-70%之间。CI提供了重要的精度信息,仅报告有效率60%无法体现不确定性。
例2:非劣效性评估
新药平均生存:32个月;标准药:30个月;差异:2个月;95% CI:[-1.5, 5.5]个月;p = 0.24。
临床判断:虽然p > 0.05,但CI包含负值(新药可能更差)。这意味着我们的证据不足以声称新药与标准药等效或更好。如果仅看p值(”无显著差异”),可能误导临床医生认为两个治疗”等价”。
置信区间的正确报告格式
正确:
- 干预组患者的3年生存率为45%(95% CI:38%-52%),高于对照组的35%(95% CI:28%-42%)。
- 调整后,年龄每增加10岁,心梗风险增加15%(HR = 1.15,95% CI:1.08-1.23,p < 0.001)。
错误:
- 生存率为45% (p = 0.01)。 → 缺失CI
效应量和临床意义
为什么必须报告效应量?
效应量量化结果的大小,而不仅仅是是否存在。
常用的效应量指标
1. Cohen’s d(连续变量的效应量)
公式:d = (μ1 - μ2) / σ
解释:d < 0.2微小效应;0.2-0.5小效应;0.5-0.8中等效应;d > 0.8大效应。
2. Odds Ratio(OR,二分类结果)
OR = 1.0无关联;1.0 < OR < 2.0小到中等效应;OR > 2.0大效应;OR < 0.5保护效应。
3. Hazard Ratio(HR,生存数据)
HR = 1.0无差异;HR < 1.0风险降低(保护效应);HR > 1.0风险升高。
4. 风险差(绝对效应量)
定义:两组风险的绝对差异。
例子:A药物的心梗风险2%,B药物4%。绝对风险差 = -2%(每治疗1,000名患者可预防20个心梗)。相对风险 = 0.5(A药的风险是B药的一半)。患者更关心的可能是绝对数值(”每治疗1,000人预防多少事件”)。
效应量的报告规范
正确:
- 干预组的症状缓解率为72%(95% CI:65%-79%),显著高于对照组的52%(95% CI:44%-60%);OR = 2.45(95% CI:1.68-3.57),p < 0.001。
- 相对于对照组,干预组患者的心梗风险降低了28%(HR = 0.72,95% CI:0.54-0.96,p = 0.024)。
错误:
- 两组差异显著(p = 0.001)。 → 未报告OR或HR
多重比较的调整方法
Bonferroni校正
原理:将α除以检验数量。若进行5个独立检验:α_corrected = 0.05 / 5 = 0.01。则每个检验的p值需 ≤ 0.01 才算显著。
优点:简单、保守。缺点:当检验数很多时,α_corrected过小,容易漏掉真实效应(统计功效低)。
False Discovery Rate (FDR)控制
原理:控制被拒绝的虚假零假设的比例。若进行100个检验,预期FDR = 5%,则预期虚假发现数最多 = 5个。
优点:在多重检验情况下功效更高于Bonferroni。
何时进行多重比较校正
| 情况 | 是否需要校正 | 方法 |
|---|---|---|
| 预先指定的主要假设,仅一个 | 否 | 无需校正,直接报告p值 |
| 预先指定的多个独立假设 | 是 | Bonferroni或FDR |
| 探索性分析,多个假设检验 | 是 | FDR(Bonferroni过于保守) |
| 亚群分析(事后的多个比较) | 是 | Bonferroni或注明”未校正” |
统计功效和样本量的报告
样本量计算的报告内容
必须包含:
1. 预期的效应大小(基于文献或前期数据)
2. α水平(通常0.05)
3. β水平或统计功效(通常功效80%-90%)
4. 计算公式或软件
例如:
"样本量计算基于以下假设:
- 预期两组生存率的差异为15%(60% vs 45%)
- 显著水平α = 0.05(两尾检验)
- 统计功效80%
- 使用PASS软件计算,每组需要144例患者。
考虑15%的脱落率,每组招募170例患者。"
论文中统计结果的标准格式
ICMJE标准 vs CMJ标准
| 要求项 | ICMJE(国际) | CMJ(中文) | 我们建议 |
|---|---|---|---|
| p值精度 | 报告确切值(p = 0.023) | 可报告p < 0.05 | 必须报告确切值 |
| 置信区间 | 强烈建议报告 | 常见但非强制 | 必须报告 |
| 效应量 | 强烈建议报告 | 鲜少要求 | 建议报告 |
| 多重比较校正 | 必须说明 | 常被忽视 | 必须说明 |
| 样本量计算 | 必须报告 | 常被忽视 | 建议报告 |
结果章节的标准格式示例
干预组有效率为72%(86/120例),显著高于对照组的52%(62/120例);
OR = 2.45(95% CI:1.68-3.57),p < 0.001,χ²检验。
多因素Cox回归模型(调整年龄、性别、基线病情)显示,干预是独立的保护因素
(调整HR = 0.68,95% CI:0.50-0.92,p = 0.013)。
常见统计报告错误的批量修正
错误模式1:报告不精确的p值
批量修正:全文替换”p < 0.05″ → 具体p值(p = 0.023),”p = 0.000″ → “p < 0.001″,”p = NS” → 具体p值。
错误模式2:缺失置信区间
修正方法:重新计算所有效应量的95% CI(原始数据已不在手时,可以通过医学数据重新分析回推这些区间),在表格中添加CI列,在文本中修改为”OR = 2.45(95% CI:1.68-3.57),p < 0.001″。
错误模式3:多重比较未校正
修正方法:区分主要假设和探索性分析,在方法章节明确说明是否进行校正。
结论
正确报告统计结果不仅是格式问题,而是科学严谨性和透明度的体现。一份完整的统计报告应包含:
- p值:精确值(p = 0.023),而非模糊的”p < 0.05″
- 置信区间:显示估计的精度,推论到总体
- 效应量:显示结果的实际大小,评估临床重要性
- 多重比较处理:说明是否进行了校正及方法
- 样本量依据:说明研究如何设计确保统计功效
过度强调p值的时代已经过去。现代医学期刊和指南都要求p值 + CI + 效应量的”三位一体”报告。Editverse的统计报告审核可以确保你的论文的每一个数字都符合ICMJE和CMJ的最新标准。
参考文献
- D’Arrigo G, et al. Common mistakes in biostatistics. Clin Kidney J. 2024;17:sfae197. PMID: 39165900
- Misra DP, et al. Statistical data presentation: a primer for rheumatology researchers. Rheumatol Int. 2021;41:43-56. PMID: 33201265
- In J, Lee DK. Alternatives to the P value. Korean J Anesthesiol. 2024;77:343-352. PMID: 38835136
- Mascha EJ, Vetter TR. Significance, Errors, Power, and Sample Size. Anesth Analg. 2018;126:691-698. PMID: 29346210
- Hopewell S, et al. CONSORT 2025 statement. BMJ. 2025;389:e081123. PMID: 40228833
- Schmidt SAJ, et al. Research Techniques Made Simple: Sample Size Estimation. J Invest Dermatol. 2019;139:2249-2255. PMID: 30032783