무슨 연구인가

문서 더미에서 '무슨 이야기들이 오갔나'를 자동으로 찾아주는 게 토픽모델링이에요. 그런데 재료(텍스트)를 다듬는 손질(전처리)을 어떻게 하느냐에 따라 같은 도구도 전혀 다른 결과를 낸다는 걸, 이 연구가 두 알고리즘을 나란히 놓고 확인했습니다.

🔬 어떻게 분석했나

  • ① 먼저 같은 텍스트를 준비하고, 불필요한 부분을 걷어내는 '전처리'를 다르게 적용해봤어요 — 전처리란 요리 전 재료를 씻고 껍질 벗기는 손질에 해당합니다.
  • ② 이 텍스트를 두 가지 주제 추출기에 넣었어요. 하나는 LDA — 여러 문서에서 자주 짝지어 나오는 단어들을 모아 '이건 아마 이런 주제'라고 확률로 묶어주는 방식이고,
  • ③ 다른 하나는 NMF — 단어와 문서의 커다란 표를 두 개의 작은 표로 쪼개서 숨은 주제를 끌어내는 수학적 방식이에요.
  • ④ 여기에 TF-IDF라는 가중치를 씌웠어요 — 아무 글에나 다 나오는 흔한 단어의 힘을 빼고, 특정 주제에서만 튀는 단어를 도드라지게 만드는 장치입니다.
  • ⑤ 마지막으로 뽑힌 주제가 얼마나 '말이 되는지'를 일관성(coherence) 점수로 채점했습니다.

📊 무엇을 찾았나

TF-IDF를 붙인 NMF가 일관성 0.5750으로, LDA의 0.4345보다 한참 앞섰어요. 재료 손질과 도구 선택만 바꿔도 주제의 선명도가 눈에 띄게 달라진 셈이죠.

💡 내 연구에 가져갈 것

토픽모델링 결과가 흐릿하면 알고리즘부터 갈아타기 전에 전처리와 TF-IDF 적용부터 점검해 보세요.

📄 논문 정보

Evaluating the Impact of Preprocessing Technique on Topic Modelling `Performance
Bello Muriana, Ogba Paul
British Journal of Contemporary Research · 2026-09-10 · 🔓 오픈액세스
원문 보기 ↗

이 글은 연구 소개를 위한 해설이며, 논문 원문의 저작권은 저자와 출판사에 있습니다. 원문은 위 링크(DOI)에서 확인하실 수 있습니다. 권리자께서 요청하시면 바로 내리겠습니다.