단어 빈도 분석기 (텍스트 빈도수 세기)
어떤 단어가 몇 번 나오는지 빈도순으로 셉니다
입력한 글은 브라우저 밖으로 나가지 않습니다.
빈도
단어 빈도표가 여기에 표시됩니다.
‘몇 개’가 아니라 ‘무엇이 자주’
글자수 세기가 답하는 질문은 “이 글이 몇 글자인가”입니다. 이 도구가 답하는 질문은 다릅니다 — “이 글에서 어떤 단어를 얼마나 자주 썼는가”. 합계가 아니라 분포를 봅니다.
이게 왜 쓸모 있을까요. 글을 쓰다 보면 자기도 모르게 같은 단어를 반복합니다. “그리고”로 문장을 잇고, “중요하다”를 다섯 번 쓰고, “사실”을 습관처럼 붙입니다. 눈으로는 잘 안 보이는데, 빈도표로 세워 놓으면 한눈에 드러납니다. 과하게 쓴 단어를 동의어로 바꾸면 글이 훨씬 다양해집니다. SEO 관점에서는 반대로, 핵심 키워드가 충분히 등장하는지 확인하는 데 씁니다.
한국어의 한계: 조사가 붙어 있다
정직하게 밝힐 부분이 있습니다. 이 도구는 형태소 분석을 하지 않습니다.영어는 띄어쓰기가 곧 단어 경계라 “apple”을 세면 그만이지만, 한국어는 조사가 단어에 달라붙습니다.
"사과를 먹었다. 사과가 맛있다. 사과 하나 더."
이 도구의 집계:
사과를 1
사과가 1
사과 1 ← 사람은 '사과' 3번으로 보지만, 기계는 3개 단어로정확한 어휘 빈도를 내려면 조사를 떼어내는 형태소 분석기가 필요한데, 그건 사전과 규칙이 담긴 무거운 도구입니다. 이 도구는 그 대신 공백·문장부호로 끊은 토큰의 빈도를 셉니다. 영어·코드처럼 띄어쓰기가 단어를 나누는 텍스트에서는 정확하고, 한국어에서는 ‘대략의 경향’으로 읽으시면 됩니다.
불용어와 최소 길이
빈도를 그냥 세면 상위권은 대개 시시합니다 — the, is, and, 혹은 ‘그’, ‘수’, ‘것’. 이런 불용어는 어느 글에나 많이 나오지만 그 글이 무엇에 관한지는 말해 주지 않습니다. ‘불용어 제거’를 켜면 이런 단어를 빼고 내용어만 남깁니다.
‘최소 길이’도 같은 목적입니다. 한 글자짜리 토큰(a, 및, 또)을 걸러 의미 있는 단어에 집중합니다. 다만 한국어 불용어는 조사가 붙어 있어 홀로 서는 것만 걸러지니, 이 필터가 만능은 아닙니다.
이럴 때 씁니다
- 글 다듬기 — 반복해서 쓴 단어를 찾아 동의어로 바꿉니다.
- 키워드 점검 — 블로그 글에서 핵심어가 충분히·과하지 않게 나오는지 봅니다.
- 문서 요약 감 — 처음 보는 긴 글의 상위 빈도어만 봐도 주제가 잡힙니다.
- 코드·로그 분석 — 식별자·에러 메시지의 빈도로 패턴을 찾습니다(여기선 한국어 문제도 없습니다).
정리하면
- 분포를 봅니다. 총 개수가 아니라 어떤 단어가 얼마나 자주인지.
- 한국어는 대략의 경향. 형태소 분석이 아니라 토큰 빈도라, 조사가 붙은 채로 세집니다.
- 불용어·최소 길이로 잡음을 줄이세요. 그래야 내용어가 보입니다.
자주 묻는 질문
- 글자수 세기와 뭐가 다른가요?
- 글자수 세기는 '총 몇 글자, 몇 단어'인지 합계를 냅니다. 이 도구는 '어떤 단어가 몇 번' 나오는지 단어별로 순위를 매깁니다. 글에서 무의식적으로 반복한 표현을 찾거나, 문서의 핵심어를 뽑을 때 씁니다. 목적이 다른 도구입니다.
- 한국어 빈도가 좀 부정확해 보여요.
- 이 도구는 형태소 분석을 하지 않기 때문입니다. 한국어는 조사가 단어에 붙어서, '사과'·'사과를'·'사과가'가 서로 다른 단어로 세집니다. 공백과 문장부호로 끊은 '토큰'의 빈도라고 이해하시면 됩니다. 조사까지 분리한 정확한 어휘 빈도는 형태소 분석기가 필요합니다. 영어처럼 띄어쓰기가 곧 단어 경계인 언어에서는 정확합니다.
- 불용어(stopword)가 뭔가요?
- the·is·and 나 '그·이·수·것'처럼 자주 나오지만 의미가 옅어, 빈도 상위를 차지해도 쓸모없는 단어입니다. '불용어 제거'를 켜면 이런 단어를 빼고 의미 있는 단어만 셉니다. 다만 한국어는 조사가 붙어 있어 홀로 쓰이는 것만 걸러지니, 완벽하지는 않습니다.
- 대소문자는 어떻게 처리되나요?
- '대소문자 무시'를 켜면 Apple·apple·APPLE 을 한 단어로 셉니다. 이때 화면에는 처음 등장한 형태(Apple)를 대표로 보여 줍니다. 코드나 고유명사를 구분해 세야 하면 이 옵션을 끄세요.
- 비율(%)은 무엇을 기준으로 하나요?
- 집계에 포함된 전체 토큰 수 대비, 그 단어가 차지하는 비율입니다. 최소 길이·불용어로 걸러낸 뒤의 전체가 기준이라, 걸러진 단어는 분모에서도 빠집니다.
- 입력한 글이 서버로 전송되나요?
- 아닙니다. 분석은 전부 브라우저 안에서 끝나고, 입력한 글은 어디로도 전송되거나 저장되지 않습니다.