검색 결과 평가지표, Precision·Recall - 부스트키워드 블로그 커버 이미지
검색엔진 원리
2026년 9월 18일

검색 결과가 정확한지 어떻게 평가할까? Precision과 Recall 완벽 이해

부스트키워드 팀

부스트키워드 팀

검색 데이터로 키워드의 검색량, 트렌드, 검색 의도를 파악하고 마케팅 의사결정을 돕는 도구 부스트키워드를 만듭니다.


"이 검색엔진의 정확도는 99%입니다"라는 말을 들으면 왠지 믿음직스럽게 느껴집니다. 하지만 이 말만으로는 실제 성능을 제대로 알 수 없는 경우가 많습니다. 검색 결과나 스팸 필터, AI 모델의 성능을 제대로 평가하려면 정밀도(Precision)재현율(Recall)이라는 두 가지 지표를 함께 살펴봐야 합니다. 이 글에서는 두 지표가 각각 무엇을 의미하고, 왜 둘 다 중요한지를 예제와 함께 알아봅니다.

"정확도가 99%"라는 말이 항상 좋은 뜻은 아니다

단순 정확도(Accuracy)만으로 판단하면 생기는 착각

정확도는 "전체 판단 중 맞게 판단한 비율"을 의미합니다. 언뜻 합리적인 지표처럼 보이지만, 특정 상황에서는 이 숫자가 완전히 착각을 불러일으킬 수 있습니다.

희귀한 것을 찾는 문제일수록 정확도가 무의미해지는 이유

예를 들어 10,000통의 메일 중 스팸이 단 100통뿐이라고 가정해봅시다. 만약 어떤 필터가 게으르게도 모든 메일을 무조건 "정상"이라고 판단해버린다면 어떻게 될까요? 이 필터는 정상 메일 9,900통은 모두 맞혔고, 스팸 100통만 틀렸으므로 전체 정확도는 무려 99%가 됩니다. 하지만 이 필터는 스팸을 단 한 통도 걸러내지 못했으므로, 사실상 아무 쓸모가 없는 필터입니다. 이렇게 찾아야 할 대상이 전체 중 일부에 불과한 상황에서는, 단순 정확도만으로는 진짜 성능을 제대로 평가할 수 없습니다.

검색 결과를 평가하는 네 가지 경우의 수

진짜 양성, 가짜 양성, 진짜 음성, 가짜 음성 쉽게 이해하기

이 문제를 더 정밀하게 들여다보기 위해, 판단 결과를 다음 네 가지 경우로 나누어 살펴봅니다.

  • 진짜 양성 (True Positive): 실제로 관련 있는 것을, 관련 있다고 올바르게 찾아낸 경우
  • 가짜 양성 (False Positive): 실제로는 관련 없는 것을, 관련 있다고 잘못 찾아낸 경우
  • 진짜 음성 (True Negative): 실제로 관련 없는 것을, 관련 없다고 올바르게 걸러낸 경우
  • 가짜 음성 (False Negative): 실제로는 관련 있는 것을, 관련 없다고 놓쳐버린 경우

검색·스팸 필터·질병 진단에 똑같이 적용되는 틀

이 네 가지 틀은 검색 결과뿐 아니라 스팸 필터링, 질병 진단, 이상 거래 탐지 등 "찾아야 할 대상이 있는지 없는지를 판단하는" 거의 모든 문제에 동일하게 적용할 수 있습니다. 예를 들어 스팸 필터의 경우, 진짜 스팸을 스팸으로 걸러내면 진짜 양성, 정상 메일을 스팸으로 착각해서 걸러내면 가짜 양성이 됩니다.

정밀도(Precision)란 무엇인가

"검색 결과로 보여준 것 중 진짜 관련 있는 것의 비율"

정밀도는 "관련 있다고 판단해서 실제로 내놓은 결과들 중, 정말로 관련 있는 것이 얼마나 되는가"를 나타냅니다. 검색으로 예를 들면, 검색엔진이 화면에 보여준 결과들 중 실제로 사용자가 원했던 결과가 차지하는 비율입니다.

정밀도가 낮으면 벌어지는 일

정밀도가 낮다는 것은, 검색 결과 화면에 관련 없는 엉뚱한 내용이 많이 섞여 있다는 뜻입니다. 사용자는 결과를 하나하나 확인하며 필요 없는 정보를 걸러내야 하는 번거로움을 겪게 됩니다.

재현율(Recall)이란 무엇인가

"진짜 관련 있는 것들 중 실제로 찾아낸 것의 비율"

재현율은 정밀도와 반대되는 관점을 봅니다. "전체 데이터 중 실제로 관련 있는 것이 얼마나 있었는데, 그중 몇 개나 찾아냈는가"를 나타냅니다. 검색으로 예를 들면, 전체 문서 중 사용자가 원했던 관련 문서가 총 몇 개 있었는지를 기준으로, 검색엔진이 그중 몇 개를 실제로 찾아 보여주었는지를 나타내는 지표입니다.

재현율이 낮으면 벌어지는 일

재현율이 낮다는 것은, 실제로는 관련 있는 유용한 정보가 존재하는데도 검색 결과에 나타나지 않았다는 뜻입니다. 사용자는 자신이 원하는 정보가 분명히 어딘가에 있는데도 찾지 못하는 답답함을 겪게 됩니다.

간단한 예제로 직접 계산해보는 Precision과 Recall

검색 결과 10개 중 실제 정답이 몇 개인지 확인하는 예시

"제주도 흑돼지 맛집"이라는 검색어에 대해, 전체 데이터베이스 안에 실제로 관련 있는 문서가 총 8개 존재한다고 가정해봅시다. 어떤 검색엔진이 이 검색어에 대해 10개의 결과를 화면에 보여주었는데, 이 10개 중 6개는 실제로 관련 있는 문서였고 나머지 4개는 관련 없는 문서였습니다.

Precision과 Recall을 각각 계산하고 비교하기

이 경우 정밀도는 "보여준 10개 결과 중 실제 관련 있던 6개"이므로 6/10, 즉 60%가 됩니다. 재현율은 "전체 관련 문서 8개 중 실제로 찾아낸 6개"이므로 6/8, 즉 75%가 됩니다.

만약 이 검색엔진이 결과를 10개가 아니라 30개까지 훨씬 더 많이 보여줘서, 그 안에 관련 문서 8개를 모두 포함시켰다고 해봅시다. 이 경우 재현율은 8/8로 100%까지 오르지만, 30개 중 관련 있는 문서는 여전히 8개뿐이므로 정밀도는 8/30, 약 27%로 오히려 크게 떨어지게 됩니다. 이 예시는 결과를 많이 보여줄수록 재현율은 높아지지만 정밀도는 낮아질 수 있다는 사실을 잘 보여줍니다.

왜 두 지표는 항상 트레이드오프 관계일까

결과를 많이 보여줄수록 재현율은 오르지만 정밀도는 내려가는 이유

극단적으로 생각해보면 이 관계가 더 명확해집니다. 검색엔진이 데이터베이스에 있는 모든 문서를 결과로 보여준다면, 관련 있는 문서를 하나도 빠짐없이 포함하게 되므로 재현율은 항상 100%가 됩니다. 하지만 관련 없는 문서까지 전부 다 섞여 있으므로 정밀도는 매우 낮아집니다. 반대로 아주 확실하게 관련 있다고 판단되는 딱 한 개의 결과만 보여준다면, 그 결과가 맞을 경우 정밀도는 100%에 가까워지지만, 나머지 관련 문서들은 모두 놓치게 되므로 재현율은 크게 낮아집니다. 이처럼 두 지표는 한쪽을 높이면 다른 한쪽이 낮아지는 경향을 보이는 경우가 많아, 트레이드오프 관계에 있다고 표현합니다.

상황에 따라 무엇을 더 우선해야 할까

그래서 어떤 지표를 더 중요하게 볼지는 상황에 따라 달라집니다. 스팸 필터의 경우, 정상 메일을 실수로 스팸함에 보내버리는 것(정밀도가 낮아지는 상황)은 사용자에게 중요한 메일을 놓치게 만드는 심각한 문제이므로, 일반적으로 정밀도를 더 중요하게 여기는 경향이 있습니다. 반면 질병 진단처럼 "혹시라도 있는 환자를 놓치면 안 되는" 상황에서는, 다소 정밀도가 떨어지더라도 재현율을 높여 의심되는 사례를 최대한 놓치지 않는 쪽을 더 중요하게 여기는 경우가 많습니다.

두 지표를 한 번에 보는 방법: F1 스코어

정밀도와 재현율 중 하나만 보고 성능을 판단하면 오해가 생길 수 있으므로, 두 지표를 함께 고려한 하나의 숫자로 종합해서 보여주는 지표가 있습니다. 바로 F1 스코어입니다. F1 스코어는 정밀도와 재현율 두 값을 함께 반영해서 계산하며, 두 지표 중 어느 한쪽이 지나치게 낮으면 전체 점수도 함께 낮아지도록 설계되어 있습니다. 이 때문에 정밀도와 재현율이 균형 있게 좋은 모델일수록 F1 스코어가 높게 나오며, 여러 검색·분류 시스템의 성능을 하나의 숫자로 비교할 때 널리 활용됩니다.

정리하며

단순히 "정확도가 몇 퍼센트"라는 숫자 하나만으로는 검색이나 분류 시스템의 진짜 성능을 온전히 파악하기 어렵습니다. 정밀도는 "내놓은 결과가 얼마나 믿을 만한가"를, 재현율은 "찾아야 할 것을 얼마나 놓치지 않았는가"를 각각 보여주는 서로 다른 관점의 지표입니다. 두 지표가 트레이드오프 관계에 있다는 점을 이해하면, 어떤 검색엔진이나 AI 모델을 평가할 때 어느 지표에 더 무게를 두어야 하는지를 상황에 맞게 판단할 수 있게 됩니다.

Q.Precision과 Recall 중 어느 것이 더 중요한가요?

A.정해진 정답은 없으며, 다루는 문제의 성격에 따라 다릅니다. 잘못된 결과를 보여주는 것이 특히 부담스러운 상황(스팸 필터 등)에서는 정밀도가, 놓치는 것이 특히 위험한 상황(질병 진단, 이상 거래 탐지 등)에서는 재현율이 더 중요하게 다뤄지는 경우가 많습니다.

Q.검색엔진은 실제로 이 지표들을 어떻게 활용하나요?

A.검색엔진 개발팀은 새로운 알고리즘이나 순위 산정 방식을 적용하기 전, 미리 준비된 평가용 검색어와 정답 문서 집합을 기준으로 정밀도와 재현율(그리고 이를 응용한 다양한 지표)을 계산해 이전 방식보다 성능이 개선되었는지를 검증한 뒤 실제 서비스에 반영합니다.

Q.F1 스코어 외에 다른 평가 방법도 있나요?

A.검색 결과처럼 순위가 중요한 문제에서는 상위에 노출된 결과가 얼마나 정확한지를 별도로 평가하는 지표나, 여러 검색어에 대한 성능을 평균 내어 종합적으로 비교하는 지표 등 다양한 평가 방법이 함께 사용됩니다. 문제의 성격에 따라 가장 적절한 평가 지표를 선택하는 것이 중요합니다.

Written by

부스트키워드 팀

부스트키워드 팀

검색 데이터로 키워드의 검색량, 트렌드, 검색 의도를 파악하고 마케팅 의사결정을 돕는 도구 부스트키워드를 만듭니다.