텍스트에서 단어별 등장 횟수를 집계·정렬 · 총 단어수/고유 단어수 표시 · 브라우저에서 바로 처리
총 단어수
0
고유 단어수
0
문자수(공백제외)
0
#단어횟수비율
텍스트를 입력하면 결과가 표시됩니다.

단어 빈도 통계가 세어 주는 것

긴 글을 붙여넣으면 어떤 단어가 몇 번 나왔는지 세어 많이 쓰인 순서대로 표를 만들어 줍니다. 표에는 순위, 단어, 등장 횟수, 전체에서 차지하는 비율이 나오고 단어 아래에 가장 많이 나온 단어를 기준으로 한 가로 막대가 함께 그려져서 분포가 한눈에 들어옵니다. 위쪽에는 총 단어수, 서로 다른 단어의 개수인 고유 단어수, 공백을 뺀 문자수 세 가지 요약 수치가 표시됩니다.

단어를 자르는 기준은 글자와 숫자가 이어진 덩어리입니다. 유니코드 문자 속성을 쓰기 때문에 한글과 영문은 물론 일본어나 키릴 문자가 섞여 있어도 함께 집계되고, 공백과 문장부호는 경계로만 쓰이고 단어에서는 빠집니다. 밑줄은 단어의 일부로 봐서 user_name 같은 식별자가 통째로 세어집니다. 한국어 형태소 분석은 하지 않으므로 학교와 학교에와 학교를은 서로 다른 세 단어로 잡힙니다. 조사가 붙는 한국어 특성상 이 점을 감안하고 결과를 읽어야 해요.

옵션은 두 개입니다. 대소문자 무시는 기본으로 켜져 있고, 켜져 있으면 Apple과 apple을 같은 단어로 합칩니다. 코드나 고유명사를 구분해서 보고 싶으면 끄세요. 한 글자 단어 제외는 조사, 관사, 단독으로 남은 알파벳 같은 소음을 걷어낼 때 씁니다. 표는 화면에 상위 500개까지만 그리지만 CSV 복사는 걸러진 단어 전부를 담습니다.

사용 방법

  1. 분석할 텍스트 칸에 원고나 기사, 회의록을 붙여넣습니다. 붙여넣는 즉시 집계가 끝나고 표가 채워집니다.
  2. 필요하면 대소문자 무시와 한 글자 단어 제외 체크박스를 조절합니다. 체크를 바꾸면 표가 바로 다시 계산됩니다.
  3. 표 복사 버튼을 누르면 순위·단어·횟수 세 칸짜리 CSV가 클립보드에 담깁니다. 엑셀에 붙여넣어 정렬하거나 차트를 만들 수 있어요.
  4. 다른 글을 분석하려면 지우기를 눌러 입력을 비우고 새로 붙여넣습니다.

궁금한 사항 있으신가요?