심사 대상은 불용어 몇 개를 지웠는지가 아니라 어떤 기준으로 사전을 만들었는지다.
무엇이 문제인가
연구방법 챕터에 "불용어를 제거했다"라는 한 줄만 적어 놓는 경우를 자주 본다. 이 문장만으로는 어떤 단어를 왜 불용어로 판단했는지, 사전을 몇 개 만들었는지, 그 사전이 누구나 다시 만들 수 있는 기준으로 구성됐는지 전혀 알 수 없다. 전처리는 원본 텍스트를 분석 가능한 형태로 바꾸는 여러 단계를 거치는데, 이 단계들을 뭉뚱그려 한 문장으로 처리하면 같은 데이터로 다른 연구자가 분석을 재현했을 때 전혀 다른 결과가 나올 수 있다. 재현 불가능한 전처리는 그 뒤에 이어지는 토픽모델링이나 네트워크 분석의 신뢰도까지 함께 흔든다.
어떻게 하는가
전처리는 표준적으로 다섯 단계로 나눠 진행한다. 먼저 노이즈 제거 단계에서는 특수문자, URL, 이모티콘처럼 분석에 의미가 없는 요소를 걷어낸다. 다음은 도메인 불용어 제거로, 일반 불용어 사전만으로는 걸러지지 않는 해당 분야 특유의 상투어나 의미 없는 반복 표현을 별도 사전으로 만들어 제거한다. 세 번째는 한국어 형태소 분석으로, 형태소 분석기를 통해 명사·동사 등 의미 단위를 추출한다. 네 번째는 영어 표제어 추출(lemmatization) 단계로, 동일한 단어의 활용형을 하나의 기본형으로 통일한다. 마지막은 유사어 통합으로, 표기만 다르고 의미가 같은 단어들을 하나의 대표어로 묶는다. 이 다섯 단계 전체에서 중요한 것은 각 단계에서 사용한 불용어 사전, 복합명사 사전, 유사어 사전을 그 규모(몇 개 항목으로 구성됐는지)와 대표 예시 몇 개를 함께 논문에 공개하는 것이다. 또한 각 단계를 거칠 때마다 남은 문서 수나 단어 수가 어떻게 줄어드는지를 흐름도 형태로 정리해 연구방법 챕터에 인용하면, 전처리 과정 전체가 하나의 검증 가능한 절차로 제시된다.
심사위원이라면 여기를 본다
심사위원 입장에서 가장 먼저 확인하는 것은 사전의 규모와 구축 기준, 그리고 대표 예시다. "불용어를 제거했다"라고만 쓰고 사전 규모나 구축 기준, 예시 단어가 하나도 제시되지 않으면, 같은 데이터로 같은 절차를 반복했을 때 같은 결과가 나올지 확인할 방법이 없다는 이유로 재현 불가능 판정을 받는다. 사전을 몇 개의 단어로 구성했는지, 어떤 기준으로 그 단어들을 골랐는지, 대표적으로 어떤 단어가 포함됐는지를 본문이나 부록에 구체적으로 밝혀야 이 지적을 피할 수 있다.
마치며
전처리는 다섯 단계(노이즈 제거, 도메인 불용어, 한국어 형태소 분석, 영어 표제어 추출, 유사어 통합)로 나눠 진행하고, 각 단계에서 쓴 사전의 규모와 기준, 예시를 공개하며 단계별 건수 변화를 흐름도로 문서화해야 재현 가능한 절차로 인정받는다.
텍스트마이닝 분석 설계가 필요하다면 텍스트마이닝 분석 페이지에서 진행 방식을 확인할 수 있다. 방법론 노하우는 뉴스레터 「강의실의 AI」 구독 시 받아볼 수 있다.