서열 상동성 검색 (BLAST sequence similarity search)
쉽게 풀면
새로 얻은 DNA나 단백질 서열이 무엇인지 알아보려면 이미 알려진 서열들과 비교해야 합니다. 서열 상동성 검색은 거대한 서열 데이터베이스를 뒤져 비슷한 부분을 가진 서열들을 찾아 유사도 순으로 보여주는 도구입니다. 전체를 정확히 맞추는 대신 짧은 단어 단위로 먼저 걸러낸 뒤 그 주변만 정밀하게 정렬하기 때문에 매우 빠릅니다. 유전자 기능 추정, 종 동정, 클로닝 결과 확인 등 거의 모든 분자생물학 실험의 출발점에서 쓰입니다.
왜 중요한가
서열 정보를 의미 있는 정보로 바꾸는 첫 단계가 바로 비슷한 서열 찾기입니다. 이 도구 덕분에 실험을 하지 않고도 유전자의 정체와 기능을 1차로 추정할 수 있게 되었고, 유전체 시대의 연구 방식 자체가 바뀌었습니다. 검색 결과의 통계 지표는 유사성이 우연인지 아닌지를 판단하는 기준이 됩니다.
논문에서는 이렇게 쓰입니다
데이터베이스에서 비슷한 서열을 찾아 새 유전자의 정체와 기능을 1차로 추정했다는 뜻입니다.
조금 더 깊게 보면
결과에서 중요한 지표는 우연히 그 정도 점수가 나올 것으로 기대되는 정렬의 수를 뜻하는 기댓값과, 일치율, 정렬 길이입니다. 기댓값이 작을수록 우연일 가능성이 낮으며, 데이터베이스 크기가 커지면 같은 점수라도 기댓값이 올라간다는 점을 이해해야 합니다. 뉴클레오타이드끼리, 단백질끼리, 또는 번역해 비교하는 등 목적에 따라 여러 검색 방식이 있으며, 먼 관계를 찾으려면 단백질 수준 비교가 유리합니다. 반복서열이나 낮은 복잡도 구간은 의미 없는 유사성을 만들기 쉬워 여과 옵션으로 걸러냅니다.
주의할 점
유사도가 높다고 기능이 같다고 단정할 수 없으며, 특히 짧은 영역만 일치하는 경우에는 해석에 주의해야 합니다. 이 검색은 국소적으로 비슷한 구간을 찾는 것이어서, 여러 서열을 나란히 놓고 전체를 비교하는 다중서열정렬과는 목적이 다릅니다.