잠재디리클레할당 (Latent Dirichlet Allocation (LDA))
한 줄 정의: 각 문헌이 여러 잠재적 토픽의 혼합으로 생성되고, 각 토픽은 다시 특정 단어들의 확률분포로 구성된다는 생성적 확률모형에 기반하여 대규모 문헌집단으로부터 토픽을 추출하는 대표적인 토픽모델링 알고리즘이다.
쉽게 풀면
문서 하나하나가 여러 주제를 섞어서 만들어졌다고 가정하고, 그 숨은 주제들과 각 주제를 이루는 단어들을 확률적으로 찾아내는 계산 방법이다.
논문에서는 이렇게 쓰입니다
본 연구는 잠재디리클레할당 모형의 토픽 수를 5부터 30까지 변화시키며 최적의 토픽 수를 혼란도(perplexity) 지표로 결정하였다.
LDA 모형 적용 시 최적 토픽 수를 결정하는 통계적 절차를 설명하는 문장이다.
주의할 점
LDA로 추출된 토픽은 통계적 단어 분포에 불과하므로, 그 토픽에 인문학적으로 의미 있는 이름을 붙이는 해석 작업은 연구자의 판단에 의존한다.