유전자 세트 농축 분석 (gene set enrichment analysis)
한 줄 정의: 미리 정의된 유전자 묶음이 발현 차이 순위의 한쪽 끝에 몰려 있는지를 검정하는 분석법입니다.
쉽게 풀면
두 조건을 비교하면 유전자마다 발현이 얼마나 오르거나 내렸는지 순위를 매길 수 있습니다. GSEA는 '시냅스 유전자들', '염증 유전자들'처럼 미리 정해진 묶음이 이 순위의 위쪽이나 아래쪽에 몰려 있는지 봅니다. 개별 유전자의 변화는 작아도, 한 묶음 전체가 같은 방향으로 조금씩 움직이는 경향을 잡아낼 수 있습니다.
왜 중요한가
유의한 차이 유전자를 몇 개만 골라 보는 방식보다 경로 수준의 미묘하지만 일관된 변화를 포착하기 좋습니다. 그래서 전사체 결과를 생물학적 기능으로 해석하는 표준 단계로 널리 쓰입니다.
논문에서는 이렇게 쓰입니다
"GSEA 결과 한 군에서는 시냅스 유전자 세트가 하향 조절되었고, 다른 군에서는 정반대로 상향 조절되었다."
두 모델 군에서 시냅스 관련 유전자 전체가 반대 방향으로 움직였다는 경로 수준 결과입니다.
조금 더 깊게 보면
먼저 모든 유전자를 조건 간 차이 통계량으로 줄 세운 뒤, 목록을 따라 내려가며 해당 세트의 유전자를 만나면 점수를 올리고 아니면 내리는 방식으로 농축 점수를 계산합니다. 유의성은 샘플 표지나 유전자를 무작위로 섞어 만든 분포와 비교해 평가하며, 여러 세트를 동시에 검정하므로 거짓발견율 보정을 함께 보고합니다. 차이 유전자 목록만 넣는 과대표현 분석과 달리 임계값을 정할 필요가 없다는 점이 특징입니다.
주의할 점
세트에 포함된 유전자들이 서로 겹치는 경우가 많아, 비슷한 세트들이 한꺼번에 유의하게 나오는 것을 독립적인 여러 발견으로 해석하면 안 됩니다. 결과는 사용한 유전자 세트 데이터베이스와 순위 기준에 따라 달라집니다.