웹크롤러 (Web Crawler)

문헌정보학
한 줄 정의: 웹페이지의 하이퍼링크를 자동으로 따라가며 웹상의 콘텐츠를 체계적으로 수집하는 소프트웨어 프로그램으로, 검색엔진의 색인 구축과 웹아카이빙 기관의 자료 수집에 핵심적으로 활용된다.

쉽게 풀면

인터넷 웹페이지를 자동으로 돌아다니면서 링크를 따라가며 내용을 긁어모으는 프로그램이다.

논문에서는 이렇게 쓰입니다

본 기관은 국내 도메인의 웹사이트를 대상으로 심층크롤링을 수행하는 웹크롤러를 자체 개발하여 웹아카이빙에 활용하고 있다.

국내 도메인을 대상으로 한 자체 개발 웹크롤러가 웹아카이빙 사업에 사용되는 사례를 설명하는 문장이다.

주의할 점

웹크롤러는 robots.txt 배제 규약을 준수하도록 설계되는 것이 일반적이지만, 이로 인해 일부 콘텐츠가 수집되지 못할 수 있다는 한계가 있다.

관련 용어