假设检验与P值:医学研究者最常见的6个误解
假设检验与P值:医学研究者最常见的6个误解
文章要点:P值是医学研究中最被滥用的统计概念之一。美国统计学会2016年发布声明,明确指出P值的六大常见误用,随后Nature等顶级期刊相继呼吁”超越统计显著性”。本文系统梳理P值的正确含义与六大误解,帮助研究者正确解读和报告统计结果。
假设检验的基本逻辑框架
在理解P值之前,需要先理解假设检验的逻辑框架:
研究者提出一个科学假说(例如”新药可以降低血压”),然后构建它的零假设H₀(”新药对血压没有影响”)和备择假设H₁(”新药对血压有影响”)。收集数据后,计算在H₀为真的前提下,观察到当前或更极端结果的概率,这个概率就是P值。
当P值低于预设的显著性水平α(通常为0.05),我们”拒绝H₀”,即结论为”在α=0.05的显著性水平下,观察到的差异有统计学意义”。当P>0.05,我们”不拒绝H₀”(注意:不是”接受H₀”)。
误解一:P值是”H₀为真的概率”
最常见的P值误解:认为P=0.03意味着”零假设有3%的概率是真的”或”零假设有97%的概率是假的”。
正确含义:P值是在零假设为真的前提下,获得当前或更极端观察结果的概率。P=0.03意味着:如果零假设是真的,我们有3%的概率会看到这么极端或更极端的结果。这是一个条件概率P(data|H₀),而非H₀本身的概率P(H₀|data)。
误解二:P值反映了效应的大小
P<0.001的结果比P=0.04的结果更"显著",但这不意味着效应更大或更有临床价值。P值受样本量影响极大。
示例:两项RCT研究同一种降压药,A研究n=50,B研究n=5000。A研究可能得到P=0.07(血压降低8mmHg),B研究可能得到P<0.0001(血压降低2mmHg)。B研究的P值更"显著",但A研究的效应(8mmHg)在临床上更有意义。P值不等于效应大小。
正确做法:始终报告效应量(均值差、OR、RR、HR等)及其95%置信区间,而非仅报告P值。效应量才是判断研究结果临床价值的正确指标。
简单来说:P值告诉你”数据是否足够极端以至于可以拒绝零假设”,不告诉你”效应有多大”。大样本研究的小差异也可以有很小的P值。
误解三:统计显著性等于临床意义
“P<0.05"的结果不一定有临床价值;"P>0.05″的结果也不一定没有临床价值。
典型情形一:统计显著但临床无意义——一项纳入10万人的大型RCT发现新型抗高血压药比安慰剂多降低血压1mmHg(P<0.0001)。虽然P值极小,但1mmHg的血压差异在临床上几乎没有治疗意义。
典型情形二:统计不显著但临床相关——一项纳入30名患者的小样本研究发现新型化疗方案使肿瘤缓解率提高了15%(P=0.12)。P>0.05导致”统计不显著”,但15%的缓解率提升在肿瘤学中可能非常有临床价值,小样本统计效力不足可能是无法达到显著性的原因。
误解四:P=0.049和P=0.051的本质区别
以α=0.05为界将结论分为”显著”和”不显著”,制造了一个人为的二元对立。P=0.049和P=0.051之间在科学上几乎没有任何实质性差别,但很多研究者(和编辑)会因为这0.002的差距给出完全不同的结论。
这种”P值门槛”思维的危险在于:它导致了大量的”P值操纵”(p-hacking)——研究者通过不断调整分析方法直到P<0.05,或者选择性报告P<0.05的分析结果。2016年发表在Science的研究显示,大量心理学和医学研究无法被重复,部分原因正是这种统计实践。
更好的做法:报告精确的P值(如P=0.049而非P<0.05),并将统计结论与效应量和临床判断结合,而非仅以0.05为界。
误解五:P>0.05意味着”无效应”或”两组相同”
P>0.05意味着”在当前数据下无法拒绝零假设”,不等于”零假设是真的”或”两组之间没有差异”。
P>0.05可能有三种情况:(1)真的没有效应;(2)有效应但样本量不足以检测到(统计效力不足);(3)效应方向与假设相反。区分这三种情况需要结合置信区间分析。如果95%CI包含了零,且CI的上限也排除了任何临床有意义的效应大小,才能谨慎地说明”没有临床意义的效应”。
误解六:P值可以”证明”因果关系
P<0.05只能说明在当前数据下排除了随机的可能性,不能证明A导致了B。相关性(统计上的关联)和因果性(一方导致另一方)之间的鸿沟不能靠P值弥合,而需要研究设计(如RCT或严谨的准实验设计)来支撑因果推断。
在观察性研究(如队列研究、横断面研究)中,即使P值极小,也只能得出”关联”的结论,而非”因果”。讨论部分将相关结果解读为因果证据,是医学论文被退稿的常见原因之一。
| 误解 | 错误表述 | 正确表述 |
|---|---|---|
| P值即H₀概率 | “P=0.03,零假设有97%概率是假的” | “在零假设成立的前提下,观察到当前结果的概率为3%” |
| P值=效应大小 | “P<0.001,效应非常显著" | “均值差为X,95%CI为[Y, Z],差异具有统计学意义(P<0.001)" |
| 统计=临床意义 | “P<0.05,因此该药物有临床价值" | “统计上显著(P=0.03),效应大小(差异=2mmHg)是否达到临床有意义的最小差异(MCID)需要进一步讨论” |
| P>0.05=无效应 | “P=0.12,两组之间没有差异” | “未能在当前样本量下发现统计显著的差异(P=0.12),但95%CI(-2.1~12.3)不能排除临床有意义的效应” |
置信区间:比P值更丰富的信息
95%置信区间(CI)提供了比P值更多的信息:效应量的估计、精度和统计显著性(若CI不包含零,则P<0.05)。顶级期刊(JAMA、NEJM、Lancet)目前普遍要求在P值旁边同时报告置信区间,有些期刊甚至建议以CI作为主要报告指标,减少对P值的依赖。
解读95%CI时注意:CI的宽窄反映了精度(CI越窄,估计越精确);CI是否包含零(对于差值、均值差)或1(对于OR/RR)决定了统计显著性;但CI所展示的效应范围才是临床意义判断的基础。
简单来说:P值是一个开关(显著/不显著),置信区间是一把尺子(效应有多大、精度如何)。两者结合才能完整回答”这个发现有多重要”。
与Editverse合作:统计结果的规范表达
Editverse的统计编辑服务可以协助研究者审查统计结果的表达方式,确保P值、效应量和置信区间的报告符合目标期刊的统计指南要求,并避免常见的P值误解表述。
欢迎访问 Editverse统计分析支持页面。
结论
P值是统计工具箱中最被误解的工具之一。正确理解P值的含义——它是在零假设为真时观察到当前结果的概率,而非零假设错误的概率,也非效应大小的度量——是进行规范统计分析和科学写作的基础。在现代医学研究中,建议将P值与效应量和置信区间一起报告,并在讨论中区分统计显著性和临床意义,这是达到高影响力期刊统计报告标准的必要实践。
参考文献
- Greenland S et al. Statistical tests, P values, confidence intervals, and power: a guide to misinterpretations. Eur J Epidemiol. 2017;31:337-350. PMID: 27209009
- El Tecle NE et al. Misinterpretations of Null Hypothesis Significance Testing Results Near the P-Value Threshold in the Neurosurgical Literature. World Neurosurg. 2022;158:e347-e356. PMID: 34915206
- Manda PR et al. Misinterpretations of Significance Testing Results Near the P-Value Threshold in the Urologic Literature. Cureus. 2023;15:e41556. PMID: 37559843
- Boscardin CK et al. How to Use and Report on p-values. Perspect Med Educ. 2024;13:302-309. PMID: 38680196
- Habibzadeh F. The P Value: What It Is and What It Is Not. J Korean Med Sci. 2025;40:e321. PMID: 41250654
- Carr JR, Smith SE. Research and Scholarly Methods: Testing the Null Hypothesis. J Am Coll Clin Pharm. 2026;9:e70167. PMID: 42009483
- van Rijn MH et al. Statistical significance versus clinical relevance. Nephrol Dial Transplant. 2017;32:423-428. PMID: 28064161
- Sharma H. Statistical significance or clinical significance? A researcher’s dilemma for appropriate interpretation of research results. Saudi J Anaesth. 2021;15:431-434. PMID: 34658732
- Zaniletti I et al. P-Values and Power in Orthopedic Research: Myths and Reality. J Arthroplasty. 2022;37:2529-2535. PMID: 36162927
- Anderson SF. Misinterpreting p: The discrepancy between p values and the probability the null hypothesis is true. Psychol Methods. 2021;26:335-358. PMID: 31829657
- Smith RJ. The continuing misuse of null hypothesis significance testing in biological anthropology. Am J Phys Anthropol. 2018;166:236-245. PMID: 29345299
- Lee DK. Alternatives to P value: confidence interval and effect size. Korean J Anesthesiol. 2022;69:555-562. PMID: 27924194
- Greenland S. Null misinterpretation in statistical testing and its impact on health risk assessment. Prev Med. 2012;55:145-147. PMID: 21871481