무슨 연구인가

어떤 분야의 개념 체계(온톨로지)를 만들려면 보통 전문가들이 며칠씩 머리를 맞대고 용어를 하나하나 뽑아야 해요. 이 연구는 그 고된 초안 작업을 AI에게 맡겨봤습니다. '고독'과 '노년초월(나이 들며 삶을 초연하게 바라보는 심리)'을 다룬 심리학 책 두 권을 재료로, 숨어 있는 핵심 개념들을 자동으로 캐내는 실험이에요.

🔬 어떻게 분석했나

  • ① 책 두 권의 텍스트를 통째로 BERTopic에 넣었어요 — BERTopic은 문장을 '의미 좌표(임베딩)'로 바꾼 뒤, 가까이 모인 것끼리 묶어 '숨은 주제'를 자동으로 찾아내는 도구입니다. 사람이 목차를 짜주지 않아도 컴퓨터가 스스로 주제를 발견하죠.
  • ② 똑같은 데이터를 두 방식으로 돌려 비교했어요. 하나는 아무것도 안 건드린 '기본 설정', 다른 하나는 명사·동사 같은 품사만 골라내고 두세 단어 묶음(n-gram)을 다듬은 '커스텀 전처리'. 재료 손질을 다르게 하면 결과가 어떻게 달라지는지 본 겁니다.
  • ③ 처음엔 토픽이 우수수 쏟아졌어요(고독 244개, 노년초월 172개). 이걸 전문가가 검토해 각각 30여 개의 알짜 주제로 추렸습니다.
  • ④ 서로 다른 두 책의 주제를 하나로 합치려고, 각 토픽의 이름표·키워드를 다시 임베딩으로 바꿔 '의미가 얼마나 가까운지(코사인 유사도)'로 짝을 맞췄어요. 비슷한 개념끼리 다리를 놓아준 셈이죠.

📊 무엇을 찾았나

커스텀 전처리는 더 잘게 쪼갠 도메인 특화 주제를, 기본 설정은 더 넓고 라벨이 깔끔한 주제를 뽑았어요 — 정밀함과 포괄성을 맞바꾸는 관계였죠. 최종적으로 AI가 온톨로지 후보 용어 90개(고독 52개·노년초월 38개)를 만들어냈습니다. 사람이 몇 주 걸릴 초안을 반나절 만에 뽑아준 셈이에요.

💡 내 연구에 가져갈 것

토픽 개수엔 정답이 없어요. 전처리(품사 필터·n-gram)만 바꿔도 같은 데이터가 32개도, 46개도 됩니다. 그러니 '몇 개 나왔나'보다 '어떻게 전처리했나'를 먼저 기록해두세요.

📄 논문 정보

Utilizing BERTopic modeling for concept discovery in the domain of gerotranscendence and solitude
B. Damayanthi Jesudas, Finn Wilson, Rachel A. Mavrovich, Sean Kindya, Feng-Yu Yeh, Sam Smith, Jeremy Ravenel, Jie Zheng, Yongqun He, Hollen N. Reischer, Julie C. Bowker, John Beverley, William D. Duncan
Journal of Biomedical Semantics · 2026-09-01 · 🔓 오픈액세스
원문 보기 ↗

이 글은 연구 소개를 위한 해설이며, 논문 원문의 저작권은 저자와 출판사에 있습니다. 원문은 위 링크(DOI)에서 확인하실 수 있습니다. 권리자께서 요청하시면 바로 내리겠습니다.