Fst 통계량 (Fst statistic)

생물학
한 줄 정의: 전체 유전적 변이 중 하위 집단 간의 차이로 설명되는 비율을 나타내어 집단 간 유전적 분화 정도를 측정하는 지표.

쉽게 풀면

Fst 통계량은 서로 다른 두 집단이 유전적으로 얼마나 다른지를 0에서 1 사이의 숫자로 나타낸 것입니다. 값이 0에 가까우면 두 집단이 유전적으로 거의 구분되지 않는다는 뜻이고, 1에 가까우면 두 집단이 완전히 다른 유전자 조합을 가지고 있다는 뜻입니다. 인구집단 간 비교나 아종 구분 연구에서 널리 사용되는 대표적인 분화 지표입니다.

왜 중요한가

Fst 통계량은 집단 간 유전적 분화 정도를 하나의 숫자로 요약해주기 때문에, 집단유전학과 진화생물학 전반에서 집단 구조를 파악하는 가장 기본적인 도구로 쓰입니다. 어느 지역 집단이 서로 얼마나 격리되어 있는지, 아종이나 종 분화가 진행 중인지를 판단하는 근거가 되며, 보전생물학에서는 멸종위기종의 개체군 관리 단위를 나누는 데도 활용됩니다. 또한 게놈 전체에서 Fst 값이 유독 높게 나타나는 구간을 찾아 자연선택의 흔적을 추정하는 연구에도 널리 사용됩니다.

논문에서는 이렇게 쓰입니다

"두 지역 개체군 사이의 Fst 값은 0.02로 낮게 나타나 유전적 분화가 미미함을 시사했다."

두 개체군 간 유전적 차이가 크지 않다는 것을 Fst 값으로 정량적으로 제시한 예문이다.

"멸종위기 어류 세 집단 간 쌍별 Fst 값을 산출한 결과, 서식지가 단절된 상류 집단이 나머지 집단과 뚜렷하게 분화되어 있음이 확인되었다."

보전생물학 연구에서는 서식지 단절이 개체군 간 유전적 분화로 이어졌는지를 확인하는 데 Fst 값을 활용하며, 이는 보전 우선순위를 정하는 근거 자료로 쓰입니다.

"게놈 전역에서 Fst 값을 슬라이딩 윈도우 방식으로 계산한 결과, 특정 염색체 구간에서 이상치에 해당하는 높은 값이 관찰되어 선택압이 작용했을 가능성을 시사하였다."

집단유전체학 연구에서는 게놈 전체를 구간별로 나누어 Fst 값을 계산함으로써, 평균보다 유독 분화가 심한 구간을 찾아 자연선택의 흔적을 탐색하는 데 활용합니다.

조금 더 깊게 보면

Fst는 원래 라이트(Wright)가 제안한 집단 내 근친교배 계수를 확장한 F-통계량 체계의 하나로, 실제 계산 방식에는 웨어와 코커햄(Weir and Cockerham) 추정량처럼 표본 크기의 편향을 보정한 방법이 흔히 쓰입니다. Fst 값은 표본으로 뽑은 개체 수나 분석에 사용한 유전 마커(단일염기다형성 등)의 수에 따라 추정치가 달라질 수 있어, 신뢰구간이나 부트스트랩 검정을 함께 제시하는 것이 일반적입니다. 또한 게놈 전역의 Fst 값이 이상치를 보이는 구간을 찾는 방법은 이상치가 반드시 선택의 결과임을 보장하지는 않으므로, 다른 분석과 함께 교차 검증하는 경우가 많습니다.

주의할 점

Fst 값은 표본 크기와 사용된 마커 수에 따라 추정치가 달라질 수 있어 해석 시 신뢰구간을 함께 고려해야 한다.

관련 용어