引言Introduction
系统评价不等于高质量证据。很多研究者做完 meta 分析后,仍会被审稿人追问:你纳入的证据到底有多可信,结论能否直接用于临床决策 。GRADE 正是回答这个问题的核心工具。

1. GRADE为什么成为系统评价的标配
1.1 系统评价解决“汇总”,GRADE解决“可信度”
系统评价的价值,在于把零散研究整合起来。但“整合”不等于“可采信”。同样是 meta 分析,若纳入研究偏倚高、异质性大,结论仍可能不稳。
GRADE的核心作用,是对每个结局的证据质量进行分级。 它不是看文章写得是否漂亮,而是评估结论能否支撑临床决策。常见分级为,高、中、低、极低四档。
对医学生和科研人员来说,这一步非常关键。因为系统评价的最终价值,不在于统计显著性,而在于证据能否转化为指南、临床路径和真实决策 。
1.2 GRADE与传统证据金字塔的关系
传统证据金字塔强调研究设计类型。RCT 通常高于队列研究,系统评价通常高于原始研究。但在实际应用中,“研究设计高”不等于“该结局证据一定高” 。
GRADE更细。它按“结局”来评估,而不是按整篇文章一刀切。比如一篇系统评价可能有 11 个结局,其中 5 个 high,6 个 moderate。这样的结果说明,研究总体质量不错,但不同结局的可信度并不完全相同。
这也是为什么系统评价作者不能只报 pooled effect。还要给出每个结局的证据等级。否则,读者无法判断哪些结论更稳,哪些只是暂时成立。
2. GRADE在系统评价中的关键应用
2.1 先定结局,再谈证据等级
GRADE评估必须建立在清晰的 PICO 和预设结局上。先定义主结局,再定义次结局。否则,后续分级会变成“挑着看”。
建议在系统评价方案阶段就完成结局框架。 包括:
- 临床获益结局,如死亡率、复发率、缓解率。
- 安全性结局,如不良事件、停药率。
- 过程结局,如住院时间、实验室指标变化。
这样做的好处是,后续纳入研究时能更准确判断证据质量。尤其在临床研究中,最有决策价值的结局,通常比单纯的替代指标更值得优先分级 。
2.2 证据等级影响“能不能用、怎么用”
GRADE并不是学术装饰。它直接影响结论表达方式。
- High ,通常可以作为较强推荐依据。
- Moderate ,可考虑采信,但仍需保留一定谨慎。
- Low / Very low ,一般不建议直接用于强结论。
这意味着,系统评价作者不能只写“有效”或“无效”。而要写清楚:“该结论基于高质量证据”还是“该结论仅来自低质量证据” 。
对于临床医生而言,这种区分尤其重要。一个统计学显著的结果,如果证据等级很低,实际应用仍可能风险较大。反过来,一个效应量不算很大但证据等级高的结论,往往更值得纳入实践。
2.3 GRADE适合写进论文哪些部分
在系统评价论文里,GRADE通常出现在以下位置:
- 方法学部分,说明证据分级标准。
- 结果部分,报告每个结局的证据等级。
- 讨论部分,解释降级原因与临床意义。
- Summary of Findings 表,集中展示证据质量、效应量和绝对效应。
Summary of Findings 表是最容易被审稿人关注的部分。 它直接体现作者是否真正理解 GRADE,而不是只会跑统计软件。
3. GRADE评估的四个核心难点
3.1 偏倚风险的判断,最容易出现主观差异
GRADE的降级因素之一,是研究偏倚风险高。但问题在于,很多纳入研究并不是“明显错误”,而是“部分信息不足”。
比如:
- 随机序列生成不清楚。
- 分配隐藏不明确。
- 盲法实施不充分。
- 失访比例较高。
这些问题会让不同研究者得出不同判断。同一篇系统评价,不同团队给出的 GRADE 结果可能不完全一致。 这不是错误,而是方法学上的常见难点。
解决思路是,优先使用标准化工具,如 Cochrane RoB 工具,并在团队内先统一判定规则。必要时由两名研究者独立评估,再通过讨论达成一致。
3.2 异质性大,不等于一定要降级,但必须解释
系统评价中最常见的问题之一,就是异质性。I² 高,说明研究结果差异较大。但这并不自动等于证据无效。
要判断的是:
- 异质性是否来自人群不同。
- 干预措施是否不一致。
- 结局定义是否不同。
- 研究设计是否存在系统差异。
如果异质性有明确来源,可以通过亚组分析、敏感性分析或随机效应模型进行解释。只有当异质性严重且无法解释时,才更支持降级。
这也是很多作者容易犯的错误。看到 I² 高就机械降级,或者看到 I² 低就盲目高估证据质量,都会影响结论准确性。
3.3 间接性问题,常被忽视却很关键
间接性指的是,研究证据与真实临床问题之间是否存在偏差。比如:
- 研究人群不是目标人群。
- 干预方案与临床实践不同。
- 结局指标只是替代终点。
- 随访时间太短,不能反映长期获益。
间接性是系统评价最容易被低估的风险。 很多 meta 分析表面上样本量很大,但如果纳入的是不完全匹配的研究,结论外推性就有限。
尤其在临床决策中,医生关心的往往不是“研究里有效”,而是“在我的患者身上是否有效”。这正是 GRADE 评价的实际价值。
3.4 发表偏倚与小样本效应,常让证据虚高
如果阳性研究更容易发表,而阴性研究沉默,系统评价就可能高估真实效应。尤其当纳入研究数量少、样本量小、漏斗图不对称时,发表偏倚风险更值得警惕。
系统评价不能只看 pooled OR、RR 或 MD,还要看证据来源是否完整。 当研究数量少于 10 项时,很多发表偏倚检验本身就不稳定,不能过度解读。
这时更需要作者在讨论中诚实说明局限,而不是把统计结果包装成确定结论。
4. 写好GRADE结果,离不开规范的方法学表达
4.1 不同结局,分级可以不同
一个系统评价往往包含多个结局。不能用“整体高质量”概括全部。
更规范的写法是:
- 主要临床结局:high。
- 安全性结局:moderate。
- 次要替代终点:low。
- 长期结局:very low。
这类分层表达,最符合 E-E-A-T 中的专业性和可信度要求。 它说明作者知道证据不是一体化的,而是有层次、有边界的。
4.2 降级理由要写具体,不能只写一句“证据较低”
审稿人最反感的是笼统表达。比如“由于异质性和偏倚,证据质量下降”。这种写法太泛。
更好的方式是明确说明:
- 降级 1 级,因为纳入研究多数未报告分配隐藏。
- 降级 1 级,因为 I² 超过 60%,且亚组分析无法解释。
- 降级 1 级,因为结局为替代指标,临床意义有限。
写清楚理由,才算真正完成 GRADE 评估。
4.3 证据等级要和结论强度匹配
这是很多论文最容易出问题的地方。证据等级明明只有 low,却在结论中写成“推荐使用”。这种写法很容易被质疑。
更稳妥的表述包括:
- “现有证据提示可能获益,但质量有限。”
- “该结论仍需更多高质量 RCT 验证。”
- “目前证据不足以支持强推荐。”
对于要冲击高质量期刊的研究,证据等级与结论强度必须一致。 这也是影响期刊引证指标和论文被引用可信度的重要基础。高被引论文通常不是“说得最满”的论文,而是“证据链最稳”的论文。
5. 研究者如何提高系统评价中的GRADE质量
5.1 从方案阶段就预设分级逻辑
在开始检索前,就应该明确:
- 主结局是什么。
- 哪些结局最重要。
- 哪些因素会导致降级。
- 哪些结局不适合强结论。
这样,系统评价不会在结果出来后才“补解释”,而是从设计上就具备一致性。
5.2 团队协作比单人判断更可靠
GRADE不是单纯的软件操作。它需要方法学判断。建议至少两名研究者独立完成证据分级,再进行一致性讨论。
如果团队中有临床专家、方法学专家和统计人员共同参与,结果会更稳。临床判断、统计判断和证据判断,三者缺一不可。
5.3 用工具提升规范性
常用工具包括:
- Cochrane 风险偏倚评估工具。
- GRADEpro。
- Summary of Findings 表模板。
这些工具不能替代判断,但可以减少遗漏,提升可重复性。对初学者来说,工具的价值不只是“画图”,更是帮助建立标准化思维。
总结Conclusion
GRADE 的价值,不在于把系统评价“做得更复杂”,而在于把证据“说得更清楚”。它帮助研究者回答三个关键问题。证据有多强,能否用于临床,局限在哪里。 对医学生、医生和科研人员来说,真正重要的不是得到一个漂亮的合并效应,而是得到一个可解释、可应用、可被审稿人信任的结论。
如果你正在准备系统评价、meta 分析或证据分级报告,建议尽早建立规范方法框架。想进一步提升论文质量、规范证据表达,并让研究更符合顶级期刊的审稿逻辑,可以了解解螺旋 的系统化研究支持与写作训练。

- 引言Introduction
- 1. GRADE为什么成为系统评价的标配
- 2. GRADE在系统评价中的关键应用
- 3. GRADE评估的四个核心难点
- 4. 写好GRADE结果,离不开规范的方法学表达
- 5. 研究者如何提高系统评价中的GRADE质量
- 总结Conclusion






