페이지랭크 (PageRank)
한 줄 정의: 많은 링크를, 특히 중요한 곳에서 받은 노드일수록 중요하다고 점수를 매기는 알고리즘입니다.
쉽게 풀면
웹페이지의 중요도를 링크로 재는 방법입니다. 단순히 링크를 많이 받은 쪽이 좋다고 하면 링크를 대량으로 만들어 속일 수 있으니, 중요한 페이지가 준 링크에 더 큰 가치를 둡니다. 결국 중요도가 링크를 타고 서로에게 흘러가는 순환 구조가 되고, 이 흐름이 안정되는 값을 계산해 점수로 씁니다.
왜 중요한가
검색 결과 순위를 매기는 기준으로 구글의 출발점이 되었고, 링크 구조만으로 품질을 추정할 수 있음을 보여 준 사례입니다. 오늘날에는 웹을 넘어 인용 네트워크에서 영향력 있는 논문 찾기, 단백질 상호작용망 분석, 추천 시스템의 개인화 순위 등에 널리 응용됩니다. 그래프 중심성 지표의 대표격으로 교과서에 실립니다.
논문에서는 이렇게 쓰입니다
"인용 네트워크에 감쇠 계수 0.85의 페이지랭크를 적용하여 피인용 수만으로는 드러나지 않는 영향력 있는 논문을 식별하였다."
단순 인용 횟수 대신 인용해 준 논문의 중요도까지 반영해 순위를 매겼다는 뜻입니다.
조금 더 깊게 보면
웹을 무작위로 돌아다니는 서퍼 모형으로 정의되며, 각 단계에서 확률 d로 현재 페이지의 링크 하나를 따라가고 확률 1−d로 임의의 페이지로 순간이동합니다. 이 순간이동 항이 나가는 링크가 없는 막다른 페이지 문제를 해결하고 마르코프 연쇄를 기약·비주기적으로 만들어 유일한 정상분포의 존재를 보장합니다. 계산은 보통 거듭제곱 반복으로 하며, 순간이동 확률을 특정 노드 집합에 몰아 주면 개인화 페이지랭크가 됩니다.
주의할 점
링크의 방향과 가중치를 반영한다는 점에서 단순한 연결 차수 중심성과는 다릅니다. 링크 농장처럼 구조를 인위적으로 조작하는 공격에 완전히 면역은 아니어서, 실제 검색 엔진은 이 점수 하나만으로 순위를 정하지 않습니다.