한 시점의 토픽은 사진이고, 여러 시점의 토픽은 영화다.
무엇이 문제인가
토픽모델링을 한 번 돌리고 그 결과를 그대로 보고서에 옮기는 경우를 종종 본다. 하지만 데이터가 여러 해에 걸쳐 쌓인 것이라면, 특정 시점에서 찍은 토픽 구성이 전체 기간을 대표한다고 보기는 어렵다. 정적인 토픽모델 하나로 전체 기간을 요약하면 그 안에서 어떤 토픽이 언제 떠오르고 언제 가라앉았는지는 사라지고 평균만 남는다. 시간이 흐르며 담론이 달라지는 데이터를 다룬다면, 사진 한 장이 아니라 영화처럼 흐름을 봐야 한다.
어떻게 하는가
DTM, 즉 Dynamic Topic Model은 전체 기간을 시기 구간으로 나눈 뒤 구간별로 토픽 비중이 어떻게 달라지는지를 추적하는 방법이다. 여기서 핵심은 구간을 나누는 기준이다. 연도 단위로 자르든 특정 사건 전후로 나누든, 그 기준은 분석을 시작하기 전에 미리 정의해야 하고 본문에도 왜 그렇게 나눴는지를 명시해야 한다. 구간을 정하고 나면 각 구간에서 토픽별 비중을 계산하고, 그 비중이 구간을 넘어가면서 어떻게 오르내리는지를 본다. 이 과정에서 어떤 토픽은 초반에 컸다가 뒤로 갈수록 줄어들고, 어떤 토픽은 거의 없다가 후반에 갑자기 커지는 패턴이 드러난다. 이런 특정 토픽의 부상과 쇠퇴는 그 자체로 후속 연구가 다뤄야 할 연구 갭을 도출하는 근거가 된다.
심사위원이라면 여기를 본다
시기 구간을 나눈 기준이 자의적으로 보이면 심사위원은 왜 이렇게 나눴는가를 묻는다. 연도별로 나눴다면 왜 그 연도 단위인지, 사건 전후로 나눴다면 그 사건이 왜 분기점인지를 답할 수 있어야 한다. 이 기준을 결과를 보고 나서 사후적으로 맞춘 것이라면 답변이 궁색해진다. 구간을 정하는 근거를 분석 이전에 세우고 그 근거를 본문에 먼저 밝혀두는 순서가 필요하다.
마치며
DTM은 한 시점의 토픽 구성이 아니라 여러 시점을 가로지르는 토픽의 오르내림을 보여주는 방법이며, 그 오르내림을 읽어내려면 시기 구간을 나누는 기준을 미리 정하고 그 이유를 본문에 밝혀야 한다.
텍스트마이닝 분석 설계가 필요하다면 텍스트마이닝 분석 페이지에서 진행 방식을 확인할 수 있다. 방법론 노하우는 뉴스레터 「강의실의 AI」 구독 시 받아볼 수 있다.