무슨 연구인가
상품 리뷰 분석이라고 하면 보통 별점과 감정을 떠올리시죠. 좋다·나쁘다를 가려내는 일이요. 그런데 이 연구는 방향을 살짝 틀었습니다. 소비자가 그 물건을 '무엇을 하는 데' 썼는지를 리뷰에서 뽑아내려고 한 거예요.
🔬 어떻게 분석했나
- ① 아마존 상품 리뷰 6만 건을 모아 사람이 직접 꼬리표를 붙였어요 — 달리기·걷기·등산·수영·등반, 그리고 판단이 안 되면 '알 수 없음'까지 여섯 갈래입니다. 기계에게 정답지를 만들어주는 단계라, 이 품이 사실 제일 많이 듭니다.
- ② 품질을 점검하고 지저분한 데이터를 걷어내 50,843건을 최종 학습·평가용으로 남겼어요. 6만에서 5만으로 줄어든 1만 건이 곧 '못 쓸 데이터'였던 셈입니다.
- ③ 먼저 CNN으로 분류해봤어요 — CNN은 문장을 훑으면서 '이런 단어 조합이 나오면 이 뜻'이라는 국소적인 패턴을 잡아내는 신경망입니다. 돋보기로 문장 여기저기를 훑는 방식이라고 보시면 돼요.
- ④ 이어 LSTM을 썼습니다 — 이건 단어를 순서대로 읽으면서 앞에 나온 내용을 기억해두는 신경망이에요. 돋보기가 아니라 처음부터 끝까지 읽어내려가는 독자에 가깝습니다. 둘을 합친 LSTM-CNN 하이브리드도 함께 시험했고요.
- ⑤ 마지막으로 DistilBERT를 투입했어요 — 방대한 글로 미리 언어를 익혀둔 BERT를 가볍게 압축한 모델입니다. 언어 감각을 미리 갖춘 상태로 시작하니 적은 데이터로도 잘한다는 게 강점이죠.
- ⑥ 그리고 랜덤 시드를 바꿔가며 여러 번 돌렸습니다. 한 번 잘 나온 게 우연인지 실력인지 가려내는 절차예요.
📊 무엇을 찾았나
전체 데이터에서는 여섯 모델이 도토리 키재기였습니다. 활동을 설명하는 말이 서로 겹치고 애매했기 때문이에요. 다만 키워드로 한 번 걸러낸 데이터에서는 LSTM-CNN-GloVe 하이브리드가 가장 좋았고, DistilBERT-CNN도 만만치 않았습니다.
💡 내 연구에 가져갈 것
모델을 갈아끼우기 전에 라벨 정의부터 의심해보세요. 모든 모델이 비슷하게 못한다면 범인은 대개 모델이 아니라 애매한 분류 기준입니다.
📄 논문 정보
Activity Classification in E-Commerce Product Reviews Using Deep Learning and Transformer Models
Tinashe Wamambo, Arooj Fatima, Bethwel Kiplagat, Mahdi Maktab Dar Oghaz, Cristina Luca
Informatics · 2026-07-23 · 🔓 오픈액세스
원문 보기 ↗
이 글은 연구 소개를 위한 해설이며, 논문 원문의 저작권은 저자와 출판사에 있습니다. 원문은 위 링크(DOI)에서 확인하실 수 있습니다. 권리자께서 요청하시면 바로 내리겠습니다.