무슨 연구인가
한국어 리뷰만 분석해도 벅찬데, 힌디어처럼 영어와 마구 섞어 쓰고 문자까지 다른 언어라면 어떨까요? 이 연구팀은 힌디어·이탈리아어 텍스트를 가지고 'AI가 외국어 속마음까지 읽게 만드는' 파이프라인을 만들었습니다.
🔬 어떻게 분석했나
- ① 데이터 모으기 — 힌디어·이탈리아어로 된 소셜미디어 글, 고객 리뷰, 뉴스 기사를 모았어요. 일부러 성격이 다른 세 종류를 섞어서, 어떤 글에서든 통하는지 시험한 거죠.
- ② 글 청소하기(전처리) — 요리 전 재료 손질 단계예요. 힌디어는 '힌디+영어 짬뽕 표기'를 정리하고, 이탈리아어는 사투리·줄임말을 표준형으로 다듬었습니다. 이 손질을 대충 하면 뒤 단계가 다 망가져요.
- ③ 글을 숫자 좌표로 바꾸기(임베딩) — 문장 하나하나를 지도 위 점으로 찍는 기술이에요. 뜻이 비슷한 문장일수록 가까운 위치에 놓여서, 컴퓨터가 '의미'를 거리로 계산할 수 있게 됩니다. BERT라는 AI가 이 지도를 그려요.
- ④ 주제 자동으로 묶기(BERTopic) — 지도 위에 모여 있는 점 무리를 찾아 '이 무리는 배송 불만, 저 무리는 가격 얘기' 식으로 이름을 붙입니다. 쉽게 말해 '비슷한 글끼리 알아서 묶어주는 AI 사서'죠.
- ⑤ 감정 판별하기(감성분석) — 각 글이 긍정인지 부정인지 분류기로 채점했어요. 마지막으로 옛날 방식(LDA·SVM 등)과 나란히 세워 성적을 비교했습니다.
📊 무엇을 찾았나
주제를 묶는 솜씨가 옛 방식(LDA)보다 50% 이상 좋아졌고, 감정 맞히기는 10문제 중 9문제를 맞히는 수준(정확도 0.89~0.91)이었습니다.
💡 내 연구에 가져갈 것
외국어(특히 혼합 표기) 데이터를 다룰 일이 있다면, LDA보다 BERTopic부터 검토해보세요.
📄 논문 정보
Transformer-Based Topic Modeling and Sentiment Analysis for Multilingual Text Data
Sunita Basalingayya, T. John Peter
Journal of Intelligent Decision Making and Information Science · 2026-07-14 · 🔓 오픈액세스
원문 보기 ↗
이 글은 연구 소개를 위한 해설이며, 논문 원문의 저작권은 저자와 출판사에 있습니다. 원문은 위 링크(DOI)에서 확인하실 수 있습니다. 권리자께서 요청하시면 바로 내리겠습니다.