정밀도와 재현율 Precision and Recall
Precision · Recall · 정밀도 · 재현율
정밀도는 양성으로 예측한 항목의 적중 비율이고 재현율은 실제 양성 가운데 찾아낸 비율이다.
개념과 원리
섹션 제목: “개념과 원리”개요와 핵심 정의
섹션 제목: “개요와 핵심 정의”정밀도는 양성으로 예측한 항목의 적중 비율이고 재현율은 실제 양성 가운데 찾아낸 비율이다.
두 지표는 같은 혼동행렬에서 계산되지만 서로 다른 실패 비용을 본다. 거짓 양성을 줄이는 것이 중요하면 정밀도를, 놓치는 양성을 줄이는 것이 중요하면 재현율을 우선한다.
배경과 설명 범위
섹션 제목: “배경과 설명 범위”이진 분류의 정의를 출발점으로 다중 클래스·다중 레이블에서의 평균 방식과 검색·생성 평가에서의 해석까지 다룬다. 지표 이름만 제시하지 않고 양성 클래스, 임계값, 평균 방식을 함께 기록해야 한다.
외부 백과는 표제어의 일반적 범위와 역사적 용례를 대조하는 데 사용했다. 본문은 백과 문장을 복제하지 않고 아래 1차 자료·공식 문서와 내부 개념 관계를 기준으로 다시 구성했다.
작동 원리
섹션 제목: “작동 원리”정밀도는 TP/(TP+FP), 재현율은 TP/(TP+FN)으로 계산한다. 모델 점수의 판정 임계값을 바꾸면 양성 예측 수가 달라져 두 값이 함께 변하므로 정밀도-재현율 곡선으로 여러 임계값을 비교한다.
평가 지표 및 정확도를 먼저 보면 입력과 출력의 위치를 구분하기 쉽다.
구성 요소와 처리 흐름
섹션 제목: “구성 요소와 처리 흐름”평가에는 정답 레이블, 모델 점수 또는 예측, 양성 클래스 정의, 임계값이 필요하다. 다중 클래스에서는 클래스별 값을 계산한 뒤 macro·micro·weighted 방식 중 목적에 맞는 집계를 선택한다.
구현을 비교할 때는 입력 형식, 기본값, 실패 조건, 출력 스키마와 관측 가능한 상태를 함께 기록한다. 같은 이름의 기능도 라이브러리와 서비스에 따라 경계와 기본 동작이 다를 수 있다.
활용과 검증
섹션 제목: “활용과 검증”활용 분야와 선택 기준
섹션 제목: “활용 분야와 선택 기준”스팸 차단, 질병 선별, 검색 결과, 안전 위반 탐지처럼 거짓 양성과 거짓 음성의 비용이 다른 문제에 사용한다. 운영 임계값은 단일 최고 점수가 아니라 허용 가능한 실패 비용과 처리 용량을 기준으로 정한다.
양성 비율이 낮으면 정확도가 높아도 유용한 모델이 아닐 수 있으므로 정밀도와 재현율을 함께 본다. 두 값을 하나로 요약해야 할 때 F 점수를 쓰되 가중치와 평균 방식을 공개한다.
한계와 흔한 오해
섹션 제목: “한계와 흔한 오해”데이터의 양성 비율, 레이블 품질, 표본 추출 방식이 바뀌면 같은 모델의 값도 달라진다. 특히 테스트셋에서 임계값을 반복 조정하면 평가 결과가 낙관적으로 편향된다.
집단별 성능 차이를 전체 평균이 가릴 수 있으므로 중요한 하위 집단과 오류 유형을 분리한다. 분모가 0인 경우의 처리 규칙도 구현마다 다를 수 있어 명시해야 한다.
관련 개념과의 구분
섹션 제목: “관련 개념과의 구분”- 정확도: 정확도는 전체 예측 중 맞은 비율이라 클래스 불균형에서 소수 양성의 실패를 가릴 수 있다.
- 평가 지표: 평가 지표는 측정값의 상위 개념이고 정밀도와 재현율은 분류 오류를 보는 구체적 지표다.
- 관측성: 관측성은 운영 중 입력과 오류 변화를 추적하며 정밀도·재현율 저하의 원인을 찾는 데 필요한 기록을 제공한다.
구체적 적용 예시
섹션 제목: “구체적 적용 예시”실제 위험 문서가 20개인 100개 자료에서 모델이 10개를 위험으로 표시했고 그중 8개가 맞았다면 정밀도는 8/10=0.8이다. 실제 위험 20개 중 8개를 찾았으므로 재현율은 8/20=0.4다. 이 결과는 경보의 신뢰도는 높지만 많은 위험을 놓친다는 뜻이다.
이 예시를 재현할 때는 성공 사례만 고르지 않고 실패하기 쉬운 입력을 먼저 목록화한다. 실행 전 기대 결과와 허용 오차를 적고, 실행 뒤에는 결과뿐 아니라 중간 상태와 선택 이유를 보존한다. 이렇게 하면 정밀도와 재현율 자체의 한계와 데이터·주변 시스템에서 생긴 문제를 분리해 수정할 수 있다.
실무 적용과 검증 절차
섹션 제목: “실무 적용과 검증 절차”- 목적과 경계 정의: 정밀도와 재현율이 해결해야 할 문제와 하지 않아야 할 행동을 한 문장씩 적는다.
- 입력·출력 명세: 입력 형식, 단위, shape 또는 스키마와 기대 출력을 고정한다.
- 기준선 비교: 가장 단순한 방법과 품질·지연·비용·안전 지표를 같은 자료에서 비교한다.
- 실패 조건 시험: 혼동행렬의 네 값을 직접 확인하고 임계값별 곡선, 클래스별 결과, 신뢰구간을 함께 검토한다.
- 버전과 근거 보존: 데이터·코드·모델·문서 버전과 판단 근거를 연결해 변경 뒤 같은 시험을 반복한다.
- 운영 통제: 권한, 예산, 중단·롤백 조건과 사람 검토가 필요한 지점을 지정한다.
운영 기록 템플릿
섹션 제목: “운영 기록 템플릿”- 선택 근거: 정밀도와 재현율을 사용한 이유와 사용하지 않은 대안을 함께 적는다.
- 재현 조건: 입력 자료의 시점과 범위, 코드·모델·라이브러리 버전, 핵심 파라미터와 실행 환경을 기록한다.
- 품질 기준: 평균값 하나만 남기지 않고 성공 조건, 허용할 수 없는 실패, 하위 집단과 경계 사례의 결과를 분리한다.
- 변경 감지: 데이터 분포, 인터페이스, 권한, 비용 또는 정책이 바뀌면 기존 결론을 자동 승계하지 않고 같은 평가를 반복한다.
- 관련 검토: accuracy, observability, llm-as-a-judge 문서의 역할과 경계를 함께 확인해 인접 단계의 오류를 정밀도와 재현율의 문제로 잘못 진단하지 않는다.
- 종료 판단: 개선 폭이 기준선의 복잡도와 운영 위험을 상쇄하지 못하면 더 단순한 방법으로 돌아간다.
학습 체크
섹션 제목: “학습 체크”- 정밀도와 재현율의 입력과 출력 또는 적용 대상을 한 문장으로 설명할 수 있는가?
- 정확도와 관측성의 차이를 실제 사례로 구분할 수 있는가?
- 이 문서의 실패 조건을 평가 자료와 운영 로그에서 확인할 수 있는가?
문서 관계
섹션 제목: “문서 관계”선행 개념
섹션 제목: “선행 개념”관련 문서
섹션 제목: “관련 문서”이 문서를 가리키는 문서
섹션 제목: “이 문서를 가리키는 문서”나머지 91개 문서 보기
- 과제 완료율
- 관측성
- 근거 충실도
- 기대 보정 오차
- 능력 벤치마크
- 답변 관련성
- 데이터 주석
- 도구 사용 평가
- 동적 벤치마크
- 로그 손실
- 루브릭 기반 심사
- 리더보드
- 리커트 척도
- 맹검 평가
- 모델 드리프트 모니터링
- 모델 텔레메트리
- 문맥 관련성
- 벤치마크 데이터셋
- 벤치마크 모음
- 벤치마크 타당도
- 벤치마크 포화
- 부트스트랩 신뢰구간
- 브라이어 점수
- 비용 모니터링
- 사용자 피드백 수집
- 생성 평가
- 승률
- 시뮬레이션 기반 평가
- 심사 모델
- 심사 모델 메타평가
- 심사 모델 보정
- 심사 모델 앙상블
- 심사 모델 합의도
- 심사 위치 편향
- 쌍대 비교
- 쌍대 LLM 심사
- 안전 벤치마크
- 에이전트 평가
- 완전 일치
- 인간 평가
- 인용 정확성
- 자기 선호 편향
- 자동 평가자
- 장황성 편향
- 재현 가능한 평가
- 전문가 평가
- 정밀도-재현율 곡선
- 정성 평가
- 정확도
- 종단간 성공률
- 주석 판정
- 주석자 편향
- 주석자 피로
- 주석자 합의도
- 지연 시간 모니터링
- 참조 기반 평가
- 참조 없는 평가
- 충실성
- 크라우드소싱 평가
- 토큰 사용량 모니터링
- 통계적 유의성
- 특이도
- 평가 루브릭
- 평가 불확실성
- 평가 지표
- 평가 표본추출
- 평가자 간 신뢰도
- 프로덕션 평가
- 프롬프트 추적
- 혼동 행렬
- 회귀 테스트형 평가
- 효과 크기
- BEIR 벤치마크
- BERTScore
- BIG-bench
- BLEU 점수
- F1 점수
- GPQA
- HELM 벤치마크
- HumanEval
- ImageNet
- LLM 심사자
- METEOR 점수
- MLPerf
- MMLU
- MTEB
- Pass@K
- RAG 평가
- ROC 곡선
- ROUGE 점수
- SWE-bench
이 문서를 포함하는 코스
섹션 제목: “이 문서를 포함하는 코스”참고와 다음 학습
섹션 제목: “참고와 다음 학습”참고 문헌
섹션 제목: “참고 문헌”- Holistic Evaluation of Language Models — paper
- Scikit-learn: Metrics and scoring — documentation
- Precision and recall — Wikipedia — encyclopedia
코스에서 계속 읽기
섹션 제목: “코스에서 계속 읽기”- 신뢰할 수 있는 AI: 다음 문서 — LLM 심사자
