지프의 법칙(Zipf's Law)이란? 언어에 숨겨진 놀라운 통계 법칙
부스트키워드 팀
검색 데이터로 키워드의 검색량, 트렌드, 검색 의도를 파악하고 마케팅 의사결정을 돕는 도구 부스트키워드를 만듭니다.
한국어든 영어든, 아무 책이나 신문 기사를 펼쳐서 어떤 단어가 몇 번 등장하는지 세어보면 신기한 규칙이 나타납니다. 조사나 흔한 단어 몇 개가 전체 단어 사용량의 대부분을 차지하고, 그 뒤로는 갑자기 등장 횟수가 뚝뚝 떨어지는 패턴입니다. 이 현상을 수학적으로 정리한 것이 바로 지프의 법칙(Zipf's Law)입니다. 언어학에서 출발했지만 검색엔진 설계에도 실질적으로 활용되는 이 법칙을, 예제와 함께 알아봅니다.
아무 책이나 펼쳐도 나타나는 신기한 규칙
가장 많이 쓰이는 단어와 그다음 단어의 빈도 차이
영어로 쓰인 긴 글을 놓고 각 단어가 몇 번 등장하는지 세어보면, 언제나 "the"라는 단어가 압도적으로 가장 많이 등장합니다. 그런데 흥미로운 점은 두 번째로 많이 등장하는 단어("of" 등)의 등장 횟수가 "the"의 등장 횟수와 비교해 거의 절반 수준에 그친다는 것입니다. 세 번째로 많이 등장하는 단어는 다시 그 3분의 1 수준입니다. 이런 패턴은 한국어를 비롯한 다른 언어에서도 형태는 다르지만 유사하게 나타납니다.
언어학자 조지 지프가 발견한 패턴
이 규칙성을 처음 체계적으로 정리한 사람이 언어학자 조지 지프(George Zipf)입니다. 그는 여러 언어의 텍스트를 분석하면서, 단어의 등장 순위와 등장 빈도 사이에 일정한 수학적 관계가 성립한다는 사실을 발견했고, 이 관계는 그의 이름을 따 지프의 법칙으로 불리게 되었습니다.
지프의 법칙이란 무엇인가
순위(Rank)와 빈도(Frequency)의 반비례 관계
지프의 법칙을 한 문장으로 요약하면, "단어의 등장 빈도는 그 단어의 등장 순위에 반비례한다"는 것입니다. 즉 가장 많이 등장하는 단어(1등)의 빈도를 기준으로 했을 때, 2등 단어는 대략 그 절반, 3등 단어는 대략 그 3분의 1, 10등 단어는 대략 그 10분의 1 수준의 빈도로 등장한다는 규칙입니다.
"1등 단어는 2등 단어보다 2배, 3등 단어보다 3배 더 자주 등장한다"
다시 말해 등장 순위와 등장 빈도를 곱하면, 순위와 상관없이 거의 일정한 값이 나온다는 것이 지프의 법칙의 핵심입니다. 1등 단어의 빈도가 100번이라면, 지프의 법칙에 따라 2등 단어는 대략 50번, 3등 단어는 대략 33번, 4등 단어는 대략 25번 정도 등장할 것이라고 예측할 수 있습니다.
간단한 예제로 확인하는 지프의 법칙
짧은 글 하나를 놓고 단어 순위 매겨보기
간단한 예로, 다음과 같은 가상의 짧은 뉴스 기사에서 단어 등장 횟수를 세었다고 가정해봅시다.
- 1위: "그리고" (48회)
- 2위: "제주도" (25회)
- 3위: "관광객" (16회)
- 4위: "증가" (12회)
- 5위: "지난해" (10회)
순위 × 빈도가 거의 일정하게 나오는 것 확인하기
각 순위와 빈도를 곱해보면, 1위는 48×1=48, 2위는 25×2=50, 3위는 16×3=48, 4위는 12×4=48, 5위는 10×5=50으로, 순위가 올라가도 곱한 값이 48~50 사이에서 거의 일정하게 유지되는 것을 확인할 수 있습니다. 실제 텍스트는 이보다 훨씬 복잡하고 완벽하게 들어맞지는 않지만, 대체로 이와 비슷한 패턴을 보인다는 것이 지프의 법칙이 말하는 바입니다.
왜 이런 패턴이 나타날까
소수의 단어가 언어 사용의 대부분을 차지하는 이유
이런 패턴이 나타나는 근본적인 이유는, 언어를 사용할 때 조사나 접속사, 매우 흔한 서술어처럼 문장을 구성하는 데 반드시 필요한 소수의 단어를 반복적으로 사용할 수밖에 없기 때문입니다. 반면 특정 주제나 상황에만 등장하는 단어들은 그 수가 매우 많지만, 하나하나의 등장 횟수는 매우 적습니다. 즉 아주 적은 수의 단어가 전체 사용량의 상당 부분을 차지하고, 나머지 수많은 단어들은 어쩌다 한 번씩만 등장하는 구조를 이룹니다.
다양한 언어, 심지어 다른 분야에서도 나타나는 보편성
흥미롭게도 이러한 패턴은 언어에만 국한되지 않습니다. 도시별 인구 순위(가장 인구가 많은 도시와 그다음 도시 사이의 격차), 웹사이트별 방문자 수 순위, 특정 상품의 판매량 순위 등 여러 분야에서도 이와 비슷한 분포가 관찰됩니다. 이 때문에 지프의 법칙은 언어학을 넘어 정보 이론, 사회 현상을 설명하는 데에도 종종 인용되는 개념입니다.
지프의 법칙이 정보 검색(IR)에서 중요한 이유
불용어(Stopword) 처리와의 관계
지프의 법칙은 정보 검색 시스템을 설계할 때 실질적인 도움을 줍니다. 극소수의 단어가 전체 텍스트에서 지나치게 자주 등장한다는 사실은, 이런 단어들이 검색어의 핵심 의미를 구별하는 데 거의 도움이 되지 않는다는 뜻이기도 합니다. 그래서 많은 검색 시스템은 지프의 법칙에서 상위권을 차지하는 극히 흔한 단어들을 '불용어'로 지정해 색인 대상에서 제외하거나 검색 시 가중치를 낮추는 방식으로 처리합니다.
색인 크기와 저장 공간을 예측하는 데 활용되는 방식
또한 지프의 법칙은 문서 집합의 크기가 커질 때 전체 고유 단어 수나 색인의 크기가 어떻게 늘어날지를 대략적으로 예측하는 데에도 활용됩니다. 대부분의 단어가 극히 드물게 등장한다는 성질을 미리 알고 있으면, 검색엔진을 설계하는 단계에서 저장 공간과 처리 속도를 좀 더 효율적으로 계획할 수 있습니다.
정리하며
지프의 법칙은 "소수의 단어가 언어 사용의 대부분을 차지하고, 나머지 대다수 단어는 극히 드물게 등장한다"는 단순하지만 강력한 통계적 패턴을 보여줍니다. 이 법칙은 언어 자체의 흥미로운 특성을 설명해줄 뿐 아니라, 실제로 검색엔진이 불필요한 단어를 걸러내고 방대한 데이터를 효율적으로 처리하도록 설계하는 데에도 실질적인 근거가 되고 있습니다.
Q.지프의 법칙은 모든 언어에 똑같이 적용되나요?
Q.지프의 법칙은 언어 외에 다른 분야에도 적용되나요?
Q.지프의 법칙과 검색엔진 최적화(SEO)는 관련이 있나요?
Written by

부스트키워드 팀
검색 데이터로 키워드의 검색량, 트렌드, 검색 의도를 파악하고 마케팅 의사결정을 돕는 도구 부스트키워드를 만듭니다.
