신조어와 고유명사 앞에서 형태소 분석기는 자주 틀린다.

무엇이 문제인가

연구방법 챕터에서 "형태소 분석을 실시했다"라는 문장 하나로 전처리를 끝내는 경우를 자주 본다. 그러나 규칙·사전 기반 형태소 분석기는 사전에 등재되지 않은 신조어, 여러 단어가 결합된 복합명사, 또는 고유명사 앞에서 쉽게 오분석을 일으킨다. 분석 대상 텍스트가 최근 온라인 담론이나 특정 분야의 전문 용어를 포함할수록 이런 오분석의 비중은 커진다. 이 한계를 먼저 인정하지 않고 형태소 분석 결과를 그대로 분석에 투입하면, 애초에 존재하지 않는 단어가 핵심어로 집계되거나 하나의 개념이 여러 조각으로 쪼개져 집계되는 문제가 뒤따른다.

어떻게 하는가

이 한계를 다루는 방법은 오분석을 사후에 찾아 보정하는 것이다. 먼저 형태소 분석 결과를 검토해 신조어·복합명사·고유명사가 잘못 쪼개진 사례를 수집하고, 이를 바로잡기 위한 복합명사 사전을 별도로 구축한다. 이때 중요한 것은 이 사전을 몇 개의 항목으로 구성했는지 그 규모를 논문에 명시하는 것이다. 사전 규모를 밝히지 않으면 보정이 어느 정도로 이뤄졌는지, 다른 연구자가 같은 절차를 재현할 수 있는지 확인할 길이 없다. 또한 어떤 형태소 분석기를 사용했는지, 그 분석기의 버전이 무엇인지도 함께 명시해야 한다. 형태소 분석기는 버전에 따라 사전과 분석 규칙이 달라지므로, 분석기명과 버전을 밝히지 않으면 같은 텍스트를 같은 도구로 다시 분석해도 다른 결과가 나올 수 있다.

심사위원이라면 여기를 본다

심사위원이 전처리 챕터에서 가장 먼저 확인하는 것은 분석기명과 버전이 명시돼 있는지, 그리고 신조어·복합명사 처리를 어떻게 했는지에 대한 언급이 있는지다. 이 두 가지 중 하나라도 빠져 있으면 분석의 정밀도를 신뢰할 수 없다는 지적을 받는다. 분석기와 버전을 밝히지 않은 채 결과만 제시하면 재현성 문제로, 신조어 처리를 언급하지 않으면 오분석을 방치했다는 지적으로 이어진다. 두 가지를 모두 본문에 명시해야 이 지적을 피할 수 있다.

마치며

형태소 분석기는 신조어·복합명사·고유명사 앞에서 오분석을 일으킨다는 한계를 먼저 인정하고, 복합명사 사전을 구축해 그 규모를 밝히며 분석기명과 버전을 함께 명시해야 재현 가능한 절차로 인정받는다.

텍스트마이닝 분석 설계가 필요하다면 텍스트마이닝 분석 페이지에서 진행 방식을 확인할 수 있다. 방법론 노하우는 뉴스레터 「강의실의 AI」 구독 시 받아볼 수 있다.