무슨 연구인가

사람이 '이건 물리학, 저건 의학' 하고 정답 라벨을 붙여주지 않아도, 컴퓨터가 문서들을 '비슷한 것끼리' 알아서 모으게 하는 방법을 시험한 연구입니다. 도서관 사서 없이 책들이 제 책장을 스스로 찾아가는 셈이죠.

🔬 어떻게 분석했나

  • ① 알바니아어 과학 문헌 1,150만 단어(문단 약 7만 4,500개)를 모았어요. 정답 주제 라벨은 일부러 붙이지 않았습니다 — 컴퓨터가 얼마나 스스로 잘 나누는지 보려고요.
  • ② 문장을 숫자 좌표로 바꿨어요(Sentence-BERT 임베딩) — 뜻이 비슷한 문장일수록 가까운 위치에 놓이게 하는 기술이라, 컴퓨터가 '의미'를 거리로 계산할 수 있게 됩니다.
  • ③ 좌표가 수백 차원이라 사람도 컴퓨터도 다루기 벅차서 UMAP으로 압축했어요 — 큰 지도를 가까운 곳은 가깝게 유지한 채 작은 지도로 줄여주는 도구입니다.
  • ④ HDBSCAN으로 자동 군집을 만들었어요 — 점들이 빽빽하게 모인 곳을 한 덩어리로 묶고, 어디에도 안 붙는 점은 '기타'로 남겨두는 기법이라, 몇 개 그룹으로 나눌지 미리 정하지 않아도 됩니다.
  • ⑤ 문서를 통째로 넣는 방식과, 초록·서론·결론만 뽑아 넣는 '핵심 부위' 방식을 나란히 비교했어요.

📊 무엇을 찾았나

핵심 부위(초록·서론·결론)만 넣은 쪽이 더 깔끔한 7개 군집을 만들었어요. 군집이 얼마나 잘 갈렸는지 보는 점수(실루엣)가 0.72로 높게 나왔는데, 1에 가까울수록 잘 나뉜 겁니다. 이렇게 만든 그룹이 실제 학문 분야와도 통계적으로 뚜렷하게 맞아떨어졌어요.

💡 내 연구에 가져갈 것

긴 문서를 통째로 넣기보다 초록·결론 같은 핵심 부위만 넣어보세요. 군더더기가 줄어 군집 결과가 훨씬 선명해집니다.

📄 논문 정보

Uncovering Latent Scientific Structures in Albanian Texts Using Transformer-Based Clustering
Leona Rexhaj, Luela Prifti
WSEAS TRANSACTIONS ON COMPUTER RESEARCH · 2026-09-18 · 🔓 오픈액세스
원문 보기 ↗

이 글은 연구 소개를 위한 해설이며, 논문 원문의 저작권은 저자와 출판사에 있습니다. 원문은 위 링크(DOI)에서 확인하실 수 있습니다. 권리자께서 요청하시면 바로 내리겠습니다.