在科学研究中,长期以来一直将 p 值和统计学显著性作为评价结果的基本标准。然而,统计学显著性仅说明观察到的差异是否由偶然因素形成;它并不提供关于这种差异有多大或有多重要的信息。正是在这一点上,效应量(effect size)的概念发挥了作用。效应量是一个定量指标,以标准化形式表示一个变量对另一个变量的影响程度或两组之间差异的大小。
统计学显著性与效应量的区别
统计学显著性检验对样本量(n)极其敏感。当样本量非常大时,即使是实际上没有任何对应意义或价值的极小差异,也可能得出 p < 0.05 的统计学显著结果(后文将通过情景进行说明)。效应量使研究人员能够回答这个问题:“我发现的差异对现实世界有多重要?” 如今,许多权威医学期刊不仅要求报告 p 值,还要求报告效应量和置信区间(confidence interval)。
效应量的类型
效应量的计算根据所进行的统计分析类型而异。它基本上分为三大类:
- 差异测量(d 家族):以标准差为单位表示两组平均值之间的差异。最常见的是 Cohen’s d 系数。如果 Cohen’s d 值为 0.5,则意味着实验组的平均值比对照组高出半个标准差。
- 关系测量(r 家族):表示变量之间关系的强度。皮尔逊相关系数(r)和解释变异比例 r 平方属于这一组。
- 比例测量:特别是在医学和流行病学中使用的 优势比(OR) 和 风险比(RR) 等数值。
虽然这些数值并非死板的规则,但“小”或“大”的概念会根据研究领域(例如教育、心理学或外科)而改变。为了评估相关的效应量,应首先在相关领域确定主要假设,并根据预测的分析决定效应量。
应用实例
场景 1: 考虑一家制药公司对一种新型止痛药的研究。在 10,000 人的样本中,新药使疼痛在 100 分制中多减轻了 2 分,且 p < 0.001。从统计学上讲,结果是显著的。但如果计算 Cohen’s d,得出的值极低,如 0.05,则说明这种差异在临床上没有意义,该药在实践中并不优于旧药。
场景 2: 在研究某种教育方法对学生成绩的影响时,由于组数较少(n=30),p 值可能为 0.08(不显著)。但如果效应量 d=0.70(大效应),研究人员就会意识到这种方法潜在非常有效,只是由于样本量不足而未能达到显著性水平。这种情况表明该研究应在更大的群体中重复进行。
场景 3: 考虑一家制药公司在服用抗高血压药物的患者中进行的一项 10,000 人的研究。假设使用药物 A(常规)和药物 B(新药)的样本在治疗后收缩压值之间的差异仅为 2 mmHg(例如:132 mmHg 对比 130 mmHg),并记录到了统计学显著差异(p = 0.03)。尽管结果在统计学上是显著的,但根据这些结果,能否得出新药在现实生活中具有显著影响并值得上市的结论?答案是否定的。总之,在样本量非常大的研究中,即使是微小的差异也能产生统计学显著的结果,而这些差异在日常生活中的适用性及其对研究公司的意义直接与“效应量”概念相关。 在本例中,可能存在较低的效应量(d)。
功效分析与效应量的关系
效应量在研究规划阶段(前瞻性功效分析)具有至关重要的意义。研究人员在开始研究之前,必须确定想要捕捉多大的效应,并计算出为了以 80% 或 90% 的功效检测到该效应需要多少受试者。预期的效应量越小,所需的样本量就会呈几何倍数增加。
结论
效应量是让我们理解科学发现实际价值的桥梁。仅关注 p 值可能会在科学文献中导致“显著性错觉”。研究人员报告标准化的效应量,既为元分析研究提供了数据,也使知识能够以累积的方式得到正确评价。
参考文献
- Cohen, J. (1988). Statistical Power Analysis for the Behavioral Sciences (2nd ed.). Routledge. https://doi.org/10.4324/9780203771587
- Sullivan GM, Feinn R. Using Effect Size-or Why the P Value Is Not Enough. J Grad Med Educ. 2012 Sep;4(3):279-82. https://doi.org/10.4300/jgme-d-12-00156.1 PMID: 23997866; PMCID: PMC3444174.
- Sawilowsky, S. S. (2009). New effect size rules of thumb. Journal of Modern Applied Statistical Methods, 8(2), 597 – 599.