GRADE 근거수준 평가체계 (GRADE (Grading of Recommendations, Assessment, Development and Evaluations) Framework)
쉽게 풀면
같은 질문에 대해서도 연구마다 근거의 신뢰도는 천차만별입니다. GRADE는 이 근거의 질을 매우 낮음부터 높음까지 체계적인 기준(연구 설계, 비뚤림 위험, 비일관성, 비직접성, 부정확성, 출판 편향 등)에 따라 평가하는 국제 표준 틀입니다. 무작위 임상시험은 원칙적으로 높은 등급에서 시작하고 관찰연구는 낮은 등급에서 시작하되, 각 항목의 문제점에 따라 등급이 오르내립니다. 이렇게 평가된 근거 수준은 진료지침에서 강력히 권고함 또는 약하게 권고함 같은 권고 강도를 결정하는 근거로 사용됩니다.
왜 중요한가
메타분석이나 체계적 문헌고찰은 여러 개별 연구를 종합하지만, 그 결과가 얼마나 믿을 만한지는 별도로 평가해야 합니다. GRADE 평가체계는 비뚤림 위험, 비일관성, 비직접성, 비정밀성, 출판 편향이라는 다섯 가지 하향 요인을 체계적으로 점검함으로써, 종합된 근거의 신뢰도를 투명하고 재현 가능하게 제시할 수 있게 합니다. 이 때문에 코크란 리뷰를 비롯한 국제 체계적 문헌고찰과 임상진료지침 개발에서 사실상 표준으로 자리 잡았습니다.
논문에서는 이렇게 쓰입니다
국제 표준 방법에 따라 근거의 신뢰도와 권고의 강도를 체계적으로 등급화했다는 뜻이다.
관찰연구는 원칙적으로 낮은 등급에서 출발하지만, 결과가 매우 뚜렷할 경우 등급을 올릴 수 있다는 GRADE의 상향 요인이 적용된 사례다.
GRADE 평가체계를 실제로 적용할 때 흔히 쓰이는 도구와 산출물을 언급한 문장이다.
조금 더 깊게 보면
GRADE 평가는 개별 연구가 아니라 특정 결과지표(outcome)별로 근거 전체를 평가하는 것이 특징입니다. 즉 같은 중재라도 사망률에 대한 근거수준과 부작용 발생률에 대한 근거수준이 다르게 매겨질 수 있습니다. 무작위 임상시험은 비뚤림 위험이나 비일관성이 발견될 때마다 등급이 한 단계씩 내려가고, 관찰연구는 반대로 효과 크기가 매우 크거나 용량-반응 관계가 뚜렷할 때 등급이 올라갈 수 있습니다. 이렇게 평가된 결과는 흔히 요약근거표(Summary of Findings table) 형태로 정리되어 진료지침의 부록이나 별표로 제시됩니다.
주의할 점
GRADE 등급은 개별 연구의 질뿐 아니라 근거 전체의 일관성과 적용 가능성까지 종합적으로 고려한 판단이므로, 개별 연구 하나의 질만으로 전체 등급을 추정해서는 안 된다.