텍스트마이닝
Textmining
비정형 텍스트 데이터에서 자연어 처리로 유용한 정보를 추출하는 기법.
공식 정의
수집된 비구조화 텍스트¹ 데이터에 자연어 처리 기술을 활용하여 유용한 정보를 추출하고 가공하는 데이터마이닝 기법.
상세 설명
데이터 전처리²와 형태소 분석³ 과정을 거쳐 텍스트 속에 숨겨진 패턴을 탐지하고 새로운 정보를 발견하는 지식 발견의 과정으로, 비정형 데이터를 정형화하며 TF-IDF⁴ 알고리즘으로 핵심어의 중요도를 계산하거나 감성 분석, 네트워크 분석, 텍스트 분류 등을 통해 데이터 내의 개념 분포와 계층을 파악한다. 분석 결과는 워드 클라우드 등으로 시각화되어 탐색적 데이터 분석⁵을 돕고 트렌드 분석, 정책, 사회 이슈 분석, 실시간 온라인 사건 감지 등 다양한 분야에서 인사이트를 제공하며 미래 예측과 전략 수립의 근거로 활용된다. 각주 1. 비구조화 텍스트(unstructured text): 일정한 형식 없이 자유롭게 작성된 블로그 글, 댓글, 이메일 등의 데이터이다. 2. 데이터 전처리(data preprocessing): 본격적인 분석 전에 오타 수정, 특수문자 제거 등 데이터를 정제하는 작업이다. 3. 형태소 분석(morphological analysis): 문장의 뜻을 가진 최소 단위(명사, 동사 등)로 분리해 사용된 단어를 파악하는 기초 단계이다. 4. TF-IDF(term frequency-inverse document frequency): 특정 문서에서 단어의 중요도를 계산하는 방식으로, 빈출 조사 등을 제외하고 문서의 핵심어를 추출하는 데 활용된다. 5. 탐색적 데이터 분석(exploratory data analysis): 분석 초기 단계에 데이터를 시각화하거나 검토하면서 전반적인 특징과 패턴을 파악하는 과정이다.
활용 예시
수천 개의 리뷰 글에서 자주 언급되는 키워드와 감정을 자동으로 뽑아낼 때 사용한다.
동일어
- 텍스트 데이터 마이닝
유의어
- 콘텐츠 분석
- 비정형 데이터 분석