Blog

현장에서 나온 글

텍스트마이닝 분석 노트와 강의실의 AI 실전기를 씁니다. 기억이 아니라 실제 분석·수업에서 나온 이야기만.

텍스트마이닝

메타데이터를 분석에 넣는다 - 구조적 토픽모델(STM)

리뷰에 별점이, 논문에 연도가 붙어 있다면 그 정보를 버릴 이유가 없다. STM으로 메타데이터를 토픽 추정에 결합하는 법.

2026년 09월 24일
텍스트마이닝

시간에 따라 토픽이 어떻게 변하는가 - DTM

한 시점의 토픽은 사진이고 여러 시점의 토픽은 영화다. DTM으로 토픽의 부상과 쇠퇴를 추적하는 법.

2026년 09월 21일
텍스트마이닝

BERTopic과 LDA, 무엇을 언제 쓰나

최신 기법이 늘 정답은 아니다. 토픽모델링 기법 선택은 데이터 크기와 연구 목적으로 정당화해야 한다.

2026년 09월 17일
텍스트마이닝

CONCOR와 Louvain, 언제 무엇으로 군집하나

같은 동시출현 네트워크도 어떤 방법으로 묶느냐에 따라 군집이 달라진다. 방법을 밝히지 않으면 그 그림은 재현할 수 없다.

2026년 09월 14일
텍스트마이닝

네트워크 중심성 5가지, 각각 다른 질문에 답한다

연결이 많은 단어와 길목을 쥔 단어는 다르다. 중심성 지표 하나만 보고 핵심 키워드를 단정하면 해석이 얕아진다.

2026년 09월 10일
텍스트마이닝

동시출현 네트워크, 임계값을 잘못 잡으면 모두가 1등이 된다

네트워크를 그렸는데 모든 노드의 연결중심성이 1.000으로 똑같다면 임계값이 틀린 것이다. 데이터 규모에 맞는 동시출현 임계값 설정법을 정리했다.

2026년 09월 07일
텍스트마이닝

단순 빈도가 못 보는 것을 TF-IDF는 본다

빈도표만으로 핵심어를 뽑으면 하다·있다·되다가 1등이 된다. TF-IDF로 흔한 어휘의 가중치를 낮추고 특징 어휘를 드러내는 절차와 파라미터를 정리했다.

2026년 09월 03일
텍스트마이닝

LDA 토픽 수 K는 감이 아니라 곡선으로 정한다

LDA 토픽모델링에서 토픽 수 K를 정하는 절차를 정리했다. Coherence Score 탐색 구간과 표준 하이퍼파라미터, 곡선 최고점으로 K를 방어하는 방법을 다룬다.

2026년 08월 27일
텍스트마이닝

무엇이 반응을 얻는가 — AI 크리에이터 채널 게시물 95건 성과분석

AI 크리에이터 채널 게시물 95건을 참여점수로 정량화하고 니치 상위 인기글 276건과 대조해, 주제·스타일·형식 레버 각각의 성과 기여를 데이터로 규명한 사례. 성과 진단부터 콘텐츠 필러 설계까지 이어지는 성장 로드맵을 함께 제안했다.

2026년 08월 24일
텍스트마이닝

새 데이터를 만드는 대신 이미 있는 목소리부터 듣는다 — 관광객 UGC 정책제안서 설계

다국어 관광객 UGC(리뷰·SNS·앱 평점)를 텍스트마이닝과 속성기반 감성분석(ABSA)으로 읽어 정책 제안서로 설계한 사례. 거점 3곳·6개월 파일럿에서 전역 확산까지의 단계적 추진안을 담았다.

2026년 08월 20일
텍스트마이닝

PPT 한 개가 70분 강의 영상이 되는 자동 제작 파이프라인

완성된 강의 PPT 한 개를 넣으면 약 70분 분량의 한국어 강의 영상을, 커리큘럼 명세를 넣으면 15주차 강의 교안 PPT를 자동 생성하는 두 개의 파이프라인을 구축한 사례.

2026년 08월 17일
텍스트마이닝

토픽 수는 감이 아니라 곡선으로 정한다 — 텍스트마이닝 표준 파이프라인 쇼케이스

LDA 토픽 수(K)를 Coherence Score 곡선으로 데이터 기반 결정하고, 키워드 네트워크를 연결·매개 중심성·PageRank·커뮤니티 탐지로 다차원 분해하는 5단계 표준 파이프라인 데모.

2026년 08월 13일
텍스트마이닝

인용 하나를 원문 줄번호로 방어하다 — 인용검증과 심사의견 Revision 대응

본문 인용을 원문 PDF 줄번호와 1:1 대조하고, 심사 코멘트를 번호화해 point-by-point Response Letter로 대응한 SSCI·등재지 공통 파이프라인 사례.

2026년 08월 11일
텍스트마이닝

구전 의도까지 7개 잠재변수, PLS-SEM 매개효과를 부트스트랩 5,000회로 검증하다

소셜미디어 고객참여 구조모형을 PLS-SEM으로 추정하고, 부트스트랩 5,000회 편의보정 신뢰구간과 VAF로 매개효과를 검증해 투고본까지 완성한 통계분석 지원 사례.

2026년 08월 07일
텍스트마이닝

관광거리 리뷰 4,175건, 부정 리뷰의 80%는 3개 영역에 몰려 있었다

역사관광 중심 지자체의 구도심 관광거리 리뷰를 토픽모델링과 IPA·JTBD로 분석해, 정책 우선순위를 데이터로 도출한 공공 UX 진단 사례.

2026년 08월 03일
텍스트마이닝

종이 기록이 못 재는 것 — 실어증 이름대기 검사앱과 통계분석

반응 여부만 수기로 남기던 이름대기 검사를, 밀리초 단위 반응시간 자동 계측 웹앱으로 바꾸고 임상 데이터를 다층 통계로 분석한 사례.

2026년 07월 30일
텍스트마이닝

나한상 사진 526점, 멀티모달 AI로 도상 유형을 자동 분류하면

보수 전·후 사진의 번호 체계가 달라 수작업 매칭이 어려웠던 불교 나한상 526점. Claude Vision API로 6축 관찰표를 자동 생성하고 임베딩 군집화로 도상 유형과 보수 전후 쌍을 함께 찾아낸 사례.

2026년 07월 23일
텍스트마이닝

8만 건을 모으기 전에 "이 수치는 어떻게 나왔나"부터 설계한다

네이버 블로그·카페, 유튜브, 멜론, 글로우픽처럼 API 구조가 제각각인 플랫폼에서 8만여 레코드를 안정적으로 수집한 파이프라인. 재현 가능성을 처음부터 설계에 넣었다.

2026년 07월 20일
텍스트마이닝

AI와 함께 하는 연구자의 일상

AI를 활용한 연구와 교육은 효율과 정확성을 모두 잡을 수 있는 방법입니다.

2026년 07월 18일
텍스트마이닝

애착외상 논문 280편, 5개 시기로 쪼개면 담론의 중심이 이동한다

20여 년간 쌓인 연구를 하나의 스냅샷으로만 보면 "지금 무엇이 뜨고 있는가"를 놓친다. 애착외상 국내 논문 280편을 키워드 네트워크와 DTM으로 이중 추적한 사례.

2026년 07월 16일
텍스트마이닝

리뷰 크롤링부터 KCI 게재까지 — 분석이 심사를 통과한 STM 풀사이클

데이터 수집부터 학술지 게재까지 전 과정을 한 사람이 수행한 연구 프로젝트. 방문객 리뷰를 구조적 토픽모델(STM)로 분석해 실제 심사를 통과한 풀사이클 사례.

2026년 07월 13일
텍스트마이닝

카페 리뷰 2,471건을 서비스스케이프 이론으로 해부하면 우선순위가 보인다

설문으로는 포착하기 어려운 고객의 자발적 발화를 근거로 삼기 위해, 프랜차이즈 카페 리뷰를 토픽모델링과 감성분석으로 구조화한 서비스스케이프 이론 검증 사례.

2026년 07월 09일
텍스트마이닝

차 문화 온라인 담론 9년, DTM으로 짚은 전환점

2017~2025년 9년간 네이버 블로그·카페·유튜브 담론을 시계열로 추적해, "차를 마신다"는 담론이 음용에서 공간·체험·미학으로 옮겨간 과정을 DTM과 네트워크 분석으로 규명한 사례.

2026년 07월 06일
강의실의 AI

"'제 점수 왜 이래요' 메일이 사라졌다 — 성적 조회 사이트 자동 생성기"

기말이 끝나면 쏟아지던 성적 문의 메일. 엑셀 성적표를 넣으면 학생별 조회 사이트가 통째로 생성되게 만들었더니, 메일이 사라지고 이의신청의 질이 달라졌습니다.

2026년 07월 06일
텍스트마이닝

논문 269편으로 20년 연구 지형을 그리면 '연구 갭'이 보인다

서론에서 "이 주제가 왜 지금 필요한가"를 주장하려면 선행연구 지형을 수치로 보여줄 근거가 필요하다. 양육스트레스 연구 269편을 텍스트마이닝으로 정리해 연구 갭을 찾아낸 사례.

2026년 07월 05일
텍스트마이닝

이차전지 소재 산업 AX 담론, 언론·학계·기술 트랙은 같은 이야기를 하고 있는가

언론이 말하는 AX, 학계가 연구하는 AX, 실제 R&D로 이어지는 AX가 같은 담론인지 세 데이터 소스를 교차 검증한 비교 텍스트마이닝 사례.

2026년 07월 04일
텍스트마이닝

심사위원은 텍스트마이닝 논문에서 이 일곱 가지를 먼저 본다

매년 수십 편을 심사하며 확인한 사실 — 거절되는 논문은 분석이 부족해서가 아니라, 결정의 근거가 없어서 떨어진다. 심사위원이 실제로 순서대로 확인하는 일곱 지점.

2026년 07월 04일
텍스트마이닝

앱 리뷰 수천 건의 끝은 '불만 목록'이 아니라 '수리 우선순위'다

별점 평균만으로는 '무엇을 먼저 고쳐야 하는가'에 답할 수 없다. 서로 다른 업종의 앱 리뷰를 텍스트마이닝으로 개선 우선순위 좌표로 바꾼 UX 진단 사례.

2026년 07월 04일
텍스트마이닝

댓글 78,412건에서 '청년 무기력'을 읽어내는 법

설문이 못 잡는 자발적 발화에서 이론을 조작화해 측정하고, 그 결과를 심사가 통과되는 언어로 서술하는 것 — 심사위원 관점의 텍스트마이닝이란 무엇인가.

2026년 07월 01일
강의실의 AI

서술형 채점, 루브릭을 고정하고 분포를 강제하라

AI에 "이거 채점해줘"라고만 던지면 잣대가 흔들린다. 잣대를 한 번 고정해 두는 프롬프트 한 덩이 — 뉴스레터 「강의실의 AI」 창간호에서.

2026년 06월 25일