引言Introduction
临床研究里,很多“阴性结果”未必真没差异,常见原因是样本量不足、检验力不够、统计设计不匹配。如果效能分析做错,结果再漂亮也可能不可信。

1. 先搞清楚,什么是统计效能分析
1.1 检验力、α和β分别代表什么
统计效能分析,核心是看研究有没有足够能力检出真实差异。检验力,也叫把握度,通常写作 1-β。 它表示当真实存在差异时,研究能检出来的概率。
- α,是假阳性错误概率,常用 0.05。
- β,是假阴性错误概率。
- 检验力越高,越不容易漏掉真实差异。
在临床研究中,检验力一般建议设为 0.8 或 0.9。
如果低于 0.75,研究结论就容易被质疑。
1.2 为什么编辑和审稿人总问效能
因为统计效能直接关系到结果可信度。样本太少,哪怕存在真实疗效,也可能因为波动太大而检不出来。
这类问题在临床中很常见,尤其是单中心、小样本、随访时间短的研究。
从研究设计角度看,效能不是事后补救项,而是立题时就要定好的参数。
一旦前期没设好,后面再做复杂统计,也很难完全弥补。
2. 样本量为什么决定检验力
2.1 样本量越大,越容易看见真实差异
样本量是效能分析的基础。简单说,研究对象越多,抽样误差越小,结果越稳定。
这也是为什么很多阴性试验并不是真的“无效”,而是“没检出来”。
在其他条件不变时,样本量增加,检验力会上升。
这是临床统计中最重要的基本关系之一。
2.2 影响样本量的4个核心因素
样本量不是随便拍脑袋定的。它通常由下面几个因素共同决定:
- 检验水准α。 α越小,样本量越大。
- 检验力1-β。 目标检验力越高,样本量越大。
- 效应量或差值δ。 差异越小,越难检出,样本量越大。
- 总体变异度。 标准差越大,样本量越大。
其中,差值δ往往来自预实验、既往文献或专业判断。
不是越大越好,也不是越小越好,要看真实临床意义。
2.3 双侧检验和单侧检验的差别
在同样α水平下,双侧检验所需样本量通常大于单侧检验。
原因很直接。双侧检验把错误风险分散到两端,检出难度更高。
临床研究里,除非有明确单向假设,否则通常优先采用双侧检验。
这更稳妥,也更容易被期刊接受。
3. 不同研究目的,数据集和统计思路不一样
3.1 有效性试验、优效试验和非劣效试验
临床研究不是只有“有没有差异”这一种问题。不同目的,对应不同分析集和统计策略。
- 优效性试验。 证明A药优于B药。
- 非劣效试验。 证明A药不比B药差太多。
- 等效性试验。 证明两者差异在可接受范围内。
研究目的不同,样本量计算和结局解释方式都会变。
如果目的设错,后面的统计方法也会跟着偏。
3.2 ITT、PP和全分析集怎么选
RCT中常见的数据集包括 ITT、PP 和全分析集。
它们的选择,和研究目的密切相关。
- 优效性试验 常偏向 ITT 或全分析集,结果更保守。
- 非劣效或等效试验 更强调 PP 分析,避免疗效被稀释。
原因很明确。
优效试验怕夸大疗效,非劣效试验怕低估真实效果。
在临床研究里,通常建议同时查看 ITT 和 PP 结果。
如果两者一致,结论更稳。
4. 临床研究里常见的样本量计算思路
4.1 率、均数和生存结局,算法不同
临床中不是所有结局都能用同一套公式。
常见的有三类:
- 率的比较。 如治愈率、复发率、阳性率。
- 均数的比较。 如血压、评分、实验室指标。
- 生存资料。 如PFS、OS、复发时间。
结局指标不同,样本量公式就不同。
这是新手最容易混淆的地方。
4.2 生存资料常看HR
在肿瘤和预后研究中,HR 是高频指标。
它反映的是两个组在某个时间段内风险的相对大小。
如果研究终点是生存结局,样本量通常不能只看事件数,还要考虑:
- 入组时间
- 随访时间
- 脱落率
- 事件发生率
这也是为什么生存资料的样本量计算比一般率差比较更复杂。
不是简单把总例数凑够就行。
4.3 预实验和文献参数很关键
很多研究会依赖预实验或既往文献来定参数。
这是合理的,但前提是来源可靠、定义一致、终点一致。
常见做法包括:
- 用既往研究的事件率或均数作为参考
- 用预实验估计标准差
- 用临床可接受的最小差异作为δ
- 预留 5%到20% 的失访或脱落
参数来源越清楚,样本量越可信。
5. 统计效能分析中最常见的误区
5.1 把“有差异”误解成“有临床意义”
统计学显著,不等于临床有意义。
一个差异即使P值小,也可能临床价值有限。
反过来,临床上很重要的差异,也可能因为样本量不足而没达到统计学显著。
这就是统计效能不足带来的典型风险。
5.2 只看P值,不看效能
P值只能说明在原假设成立时,观察到当前结果的概率。
它不能直接告诉你研究有没有足够能力发现差异。
所以,论文里最好同时说明:
- 样本量估算依据
- 目标检验力
- α水平
- 主要效应量
- 失访率设定
没有效能说明的研究,方法学说服力会明显下降。
5.3 把回归分析当成万能补丁
当随机分组不给力,或者协变量较多时,研究者常想靠回归分析“补救”。
但回归不能代替前期设计。
它能做的是:
- 调整混杂因素
- 识别影响因素
- 发现交互作用
它不能做的是:
- 让严重不足的样本量凭空变得充分
- 让设计缺陷自动消失
设计优先于修正,永远是临床统计的底线。
6. 临床研究中如何实际开展效能分析
6.1 先定问题,再定指标
正确顺序应该是:
- 明确研究目的
- 选择主要终点
- 确定结局类型
- 选择统计方法
- 设定α和检验力
- 估计样本量
不要先算样本量,再倒推研究问题。
这是最常见的反向操作错误。
6.2 按研究类型选择分析方法
如果你的结局不同,方法也不同。常见搭配如下:
- 两组率比较,常用卡方检验或率差分析
- 两组均数比较,常用t检验
- 多组均数比较,常用方差分析
- 非正态或等级资料,常用非参数检验
- 时间结局,常用KM法、Cox回归
方法选错,样本量计算也会跟着错。
6.3 用软件计算,更稳妥
临床研究中,PASS 是常见的样本量计算软件。
它适合做较复杂的设计,比如:
- 优效性试验
- 非劣效试验
- 生存分析
- 多因素模型
- 分层设计
对医学生和研究者来说,软件能减少手算误差。
但前提是参数输入正确。
7. 写论文时,效能分析应该怎么呈现
7.1 方法学部分要写清楚
建议至少写明:
- 研究类型
- 主要终点
- α水平
- 检验力
- 样本量计算依据
- 失访率或脱落率预估
- 使用的软件或方法
这样写,审稿人一眼能看懂。
也更符合 E-E-A-T 对专业性和可信度的要求。
7.2 结果部分要对应解释
如果实际样本量和计划样本量有偏差,要说明原因。
比如:
- 入组困难
- 随访中断
- 终点事件不足
- 排除标准过严
解释必须真实、简洁、可验证。
不要用模糊措辞带过。
7.3 解螺旋可以帮你把统计方案做规范
很多临床研究问题,不是不会算,而是不知道该先定什么、后定什么。
如果你在样本量估算、效能分析、终点选择、统计方法匹配上需要更系统的支持,解螺旋可以提供更贴近临床研究场景的方案设计与数据分析思路。
这样能减少前期设计失误,也能提高投稿时的方法学完整度。
总结Conclusion
临床研究统计效能分析,核心不是单纯算一个数字,而是把研究目的、效应量、α、β、样本量和统计方法 统一起来。
样本量决定能不能看见差异,检验力决定能不能可信地看见差异。
对医学生、医生和科研人员来说,真正重要的不是“算得快”,而是“设得对、写得清、解释得住”。
如果你正在准备课题设计、论文投稿或伦理申报,建议尽早把样本量和效能分析纳入方案。
这一步做扎实,后面的统计和结论才更稳。想让临床研究少走弯路,可以进一步了解解螺旋的专业支持。

- 引言Introduction
- 1. 先搞清楚,什么是统计效能分析
- 2. 样本量为什么决定检验力
- 3. 不同研究目的,数据集和统计思路不一样
- 4. 临床研究里常见的样本量计算思路
- 5. 统计效能分析中最常见的误区
- 6. 临床研究中如何实际开展效能分析
- 7. 写论文时,效能分析应该怎么呈现
- 总结Conclusion






