콘텐츠로 이동

평가 지표 실험실

참음성(TN), 거짓양성(FP), 거짓음성(FN), 참양성(TP)을 입력하면 이진 분류의 핵심 지표를 같은 기준으로 계산한다. 분모가 0인 지표는 0으로 바꾸지 않고 계산 불가로 표시하며, 실제 클래스 비율이 4배 이상 차이 나면 클래스 불균형을 알린다.

혼동행렬 입력

같은 평가 데이터와 같은 분류 임곗값에서 집계한 네 값을 입력한다.

예시 혼동행렬을 계산할 수 있다.

정확도는 전체 표본 중 올바른 예측의 비율, 정밀도는 양성 예측 중 실제 양성의 비율, 재현율은 실제 양성 중 찾아낸 비율, 특이도는 실제 음성 중 올바르게 거른 비율이다. F1 점수는 정밀도와 재현율의 조화 평균이다. 모든 값은 입력한 하나의 혼동행렬에서 계산한다.

분류 임곗값은 현재 혼동행렬이 만들어진 기준을 기록하는 선택 입력이다. 표본별 예측 점수 분포가 없으면 다른 임곗값에서 TN·FP·FN·TP가 어떻게 바뀌는지 알 수 없으므로, 이 도구는 새 지표를 수치로 추정하지 않고 일반적인 변화 방향만 설명한다.

계산식과 용어는 scikit-learn 모델 평가 문서의 이진 분류 지표 정의와 AI Learning Wiki의 관련 백과 문서를 기준으로 한다. 계산 버전은 classification-metrics-v1이다.

입력값과 결과는 브라우저 안에서만 처리하며 외부 서버로 전송하거나 저장하지 않는다. 공유 주소에는 혼동행렬의 정수 값과 선택한 임곗값만 포함된다.

지표가 높다는 사실만으로 실제 사용 환경에서 모델이 안전하거나 유용하다고 단정할 수 없다. 오탐과 미탐의 비용, 클래스 분포, 평가 데이터의 대표성, 확률 보정과 임곗값 선택 근거를 함께 검토해야 한다. 다중 클래스 문제는 클래스별 일대나머지 혼동행렬이나 거시·미시 평균을 별도로 계산해야 한다.