무슨 연구인가
뉴스나 리뷰 수천 건에서 '무슨 이야기들이 오가는지'를 사람이 일일이 읽지 않고 자동으로 뽑아내는 기술이 토픽모델링입니다. 그동안은 주로 영어·한국어에서 쓰였는데, 이 연구는 자료가 훨씬 적은 네팔어에 최신 기법 BERTopic을 적용해봤어요.
🔬 어떻게 분석했나
- ① 먼저 네팔어 글을 컴퓨터가 알아들을 '숫자 좌표'로 바꿨어요(임베딩) — 뜻이 비슷한 문장일수록 가까운 자리에 놓이게 하는 기술이라, 컴퓨터가 '의미'를 거리로 계산할 수 있게 됩니다. 여기선 여러 언어를 함께 배운 다국어 모델을 썼어요.
- ② 가까이 모인 글들을 한 덩어리로 묶었어요(군집화) — 비슷한 이야기끼리 자동으로 뭉치게 하는 단계입니다.
- ③ 각 덩어리에서 자주 튀어나오는 대표 단어를 뽑아 '이 무리는 이런 주제구나'라고 이름표를 붙였어요. 이 전 과정을 한 번에 해주는 도구가 BERTopic입니다.
- ④ 잘 나눴는지 두 가지 자로 채점했어요 — 한 주제 안 단어들이 실제로 잘 어울리는지(응집도), 그리고 주제들끼리 서로 안 겹치고 다양한지(다양성).
📊 무엇을 찾았나
응집도 0.58, 다양성 0.85가 나왔어요. 다양성 0.85는 뽑아낸 주제 10개 중 8~9개는 서로 확실히 다른 이야기였다는 뜻이라, 네팔어처럼 자료 적은 언어에서도 꽤 쓸 만하다는 신호입니다.
💡 내 연구에 가져갈 것
영어 아닌 언어로 토픽 뽑을 땐 다국어 임베딩 모델부터 골라보세요 — LDA보다 짧은 문장·적은 데이터에 강합니다.
📄 논문 정보
Topic Modeling for Nepali Text
Hari Lal Chalise, Bikash Balami, Nawaraj Paudel
National College of Computer Studies Research Journal · 2026-09-10
원문 보기 ↗
이 글은 연구 소개를 위한 해설이며, 논문 원문의 저작권은 저자와 출판사에 있습니다. 원문은 위 링크(DOI)에서 확인하실 수 있습니다. 권리자께서 요청하시면 바로 내리겠습니다.