텍스트에서 단어별 등장 횟수를 집계·정렬 · 총 단어수/고유 단어수 표시 · 브라우저에서 바로 처리
총 단어수
0
고유 단어수
0
문자수(공백제외)
0
#
단어
횟수
비율
텍스트를 입력하면 결과가 표시됩니다.
단어 빈도 통계가 세어 주는 것
긴 글을 붙여넣으면 어떤 단어가 몇 번 나왔는지 세어 많이 쓰인 순서대로 표를 만들어 줍니다. 표에는 순위, 단어, 등장 횟수, 전체에서 차지하는 비율이 나오고 단어 아래에 가장 많이 나온 단어를 기준으로 한 가로 막대가 함께 그려져서 분포가 한눈에 들어옵니다. 위쪽에는 총 단어수, 서로 다른 단어의 개수인 고유 단어수, 공백을 뺀 문자수 세 가지 요약 수치가 표시됩니다.
단어를 자르는 기준은 글자와 숫자가 이어진 덩어리입니다. 유니코드 문자 속성을 쓰기 때문에 한글과 영문은 물론 일본어나 키릴 문자가 섞여 있어도 함께 집계되고, 공백과 문장부호는 경계로만 쓰이고 단어에서는 빠집니다. 밑줄은 단어의 일부로 봐서 user_name 같은 식별자가 통째로 세어집니다. 한국어 형태소 분석은 하지 않으므로 학교와 학교에와 학교를은 서로 다른 세 단어로 잡힙니다. 조사가 붙는 한국어 특성상 이 점을 감안하고 결과를 읽어야 해요.
옵션은 두 개입니다. 대소문자 무시는 기본으로 켜져 있고, 켜져 있으면 Apple과 apple을 같은 단어로 합칩니다. 코드나 고유명사를 구분해서 보고 싶으면 끄세요. 한 글자 단어 제외는 조사, 관사, 단독으로 남은 알파벳 같은 소음을 걷어낼 때 씁니다. 표는 화면에 상위 500개까지만 그리지만 CSV 복사는 걸러진 단어 전부를 담습니다.
사용 방법
분석할 텍스트 칸에 원고나 기사, 회의록을 붙여넣습니다. 붙여넣는 즉시 집계가 끝나고 표가 채워집니다.
필요하면 대소문자 무시와 한 글자 단어 제외 체크박스를 조절합니다. 체크를 바꾸면 표가 바로 다시 계산됩니다.
표 복사 버튼을 누르면 순위·단어·횟수 세 칸짜리 CSV가 클립보드에 담깁니다. 엑셀에 붙여넣어 정렬하거나 차트를 만들 수 있어요.
다른 글을 분석하려면 지우기를 눌러 입력을 비우고 새로 붙여넣습니다.
궁금한 사항 있으신가요?
A형태소 분석기를 붙이지 않아서 지금은 합쳐지지 않습니다. 회의와 회의를은 별개 단어로 잡히니, 어간 단위 빈도가 필요하면 CSV로 내보낸 뒤 스프레드시트에서 묶어 보시는 편이 정확합니다.
A화면에는 상위 500개까지만 그립니다. 그보다 많으면 표 맨 아래에 전체 몇 개 중 500개만 표시했다는 줄이 붙습니다. 복사 버튼으로 받는 CSV에는 500개 제한 없이 전부 들어갑니다.
A원고 분량을 가늠할 때 공백 제외 기준을 요구하는 곳이 많아서 그 기준으로 맞췄습니다. 줄바꿈과 탭도 공백으로 보고 빼므로, 공백을 포함한 전체 길이가 필요하면 글자 수 세기 도구를 쓰시는 편이 낫습니다.
A횟수가 같으면 단어를 사전 순으로 정렬합니다. 그래서 같은 글을 다시 분석해도 표의 줄 순서가 매번 똑같이 나옵니다.
A하이픈, 점, 골뱅이는 단어 경계로 처리해서 잘립니다. e-mail은 e와 mail 두 단어가 되고 이메일 주소는 아이디와 도메인 조각으로 흩어집니다. 밑줄만 예외적으로 단어 안에 남습니다.
A걸러낸 뒤 남은 총 단어수가 분모입니다. 한 글자 단어 제외를 켜면 분모 자체가 줄어들기 때문에 같은 단어라도 비율 숫자가 올라갑니다.
A복사 버튼은 클립보드에 텍스트를 넣는 방식이라 파일 인코딩 문제와는 무관합니다. 엑셀 셀에 그대로 붙여넣은 뒤 텍스트 나누기로 쉼표를 구분하면 깨지지 않아요. 메모장에 저장할 때는 UTF-8을 선택하세요.
A올라가지 않습니다. 단어를 자르고 세는 계산이 전부 브라우저 안에서 일어나고 통신이 발생하지 않으므로, 공개되지 않은 원고나 사내 문서를 붙여넣어도 밖으로 나가지 않습니다.