무슨 연구인가
어떤 분야의 지식을 컴퓨터가 쓰기 좋게 정리해 둔 '개념 지도'가 있다고 해봅시다. 문제는 세상 개념이 계속 바뀐다는 거예요. 이 연구는 새로 쏟아지는 글에서 '이 개념도 지도에 넣어야겠다' 싶은 후보를 자동으로 찾아주는 방법을 만들고, 그 과정에서 흥미로운 사실 하나를 발견했습니다.
🔬 어떻게 분석했나
- ① 먼저 글을 깨끗하게 다듬었어요(전처리) — 특수문자·불필요한 조각을 걷어내 컴퓨터가 읽기 좋게 만드는 청소 작업입니다.
- ② 사람 두 명이 문장마다 '이건 무슨 주제' 하고 손으로 이름표를 붙였어요. 그리고 Kappa 지수로 두 사람 판단이 얼마나 맞아떨어지는지 점검했습니다 — 우연히 같아진 게 아니라 진짜로 합의된 라벨인지 걸러내는 장치예요.
- ③ 어떤 단어가 중요한지 점수를 매기는 방식을 다섯 가지(IDF·엔트로피 등) 놓고 비교했어요. 이 계산법들은 '어디서나 나오는 흔한 단어'는 깎아내리고 '그 분야에서만 튀는 핵심어'는 띄워 주는 역할을 합니다.
- ④ 마지막으로 LSA·NMF·LDA·BTM 네 가지 토픽모델을 돌렸어요. 넷 다 '자주 같이 등장하는 단어끼리 묶어 숨은 주제를 찾아내는' 도구인데, 계산 원리가 조금씩 달라 결과도 달라집니다. 문장 분류는 SVM이라는 분류기가 맡아 98%를 맞혔어요.
📊 무엇을 찾았나
단어 중요도는 IDF 방식이 가장 균형이 좋았고(F점수 67%), 문장 분류 정확도는 98%까지 올라갔습니다. 그런데 반전은 여기 있어요 — '주제 일관성 점수(코히런스)'로는 LDA가 1등이었지만, 사람 전문가가 실제로 보니 NMF가 더 쓸모 있고 다양한 개념을 만들어냈습니다. 시험 점수 1등이 실무 1등은 아니었던 셈이죠.
💡 내 연구에 가져갈 것
토픽모델 고를 때 코히런스 점수만 보고 결정하지 마세요. 눈으로 주제를 직접 읽어보는 검증을 꼭 곁들여야 합니다.
📄 논문 정보
Ontological Learning Through Topic Modeling: Identifying Conceptual Candidates for Enriching a Leadership Domain Ontology
Carlos Mauricio Zuluaga-Ramírez, Manuela Gómez-Suta, Manuela Idárraga-Grajales, Carolina Gómez-Carrillo, Julio Cesar Chavarro-Porras, Sandra Estrada-Mejía, José Soto-Mejía
Information · 2026-09-23
원문 보기 ↗
이 글은 연구 소개를 위한 해설이며, 논문 원문의 저작권은 저자와 출판사에 있습니다. 원문은 위 링크(DOI)에서 확인하실 수 있습니다. 권리자께서 요청하시면 바로 내리겠습니다.