RAG 평가 실험실
검색 증강 생성(RAG)의 답변 품질을 이해하려면 생성 모델만이 아니라 검색 단계에서 올바른 근거가 어느 순위에 들어왔는지 측정해야 한다. 이 실험실은 같은 정답 판정에 대해 초기 검색과 재순위화 결과를 나란히 계산한다.
예시 2개 질의의 검색 전·재순위화 후 결과를 비교할 수 있다.
계산 결과
검색·재순위화 품질 비교
- 질의 수
- -
- 평가 K
- -
- 재순위화 종합
- -
해석 주의
평균 지표
| 지표 | 검색 전 | 재순위화 후 | 변화 | 해석 |
|---|
질의별 내역
| 질의 | 실행 | P@K | R@K | RR | nDCG@K | 중복률 | 근거 포함률 |
|---|
계산 가정
공식 버전: rag-ranking-metrics-v2 · 확인일: 2026-08-30
입력 계약
섹션 제목: “입력 계약”JSON은 질의마다 queryId, relevant, before, after를 가진 배열이다. relevant 문서에는 1 이상의 관련성 등급을 둘 수 있고 검색 결과에는 hasEvidence로 실제 근거 포함 여부를 표시할 수 있다. CSV는 query_id,document_id,relevance,before_rank,after_rank,has_evidence 열을 사용한다.
관련성 등급이 없으면 관련 문서를 등급 1로 계산한다. 같은 문서가 여러 번 검색되면 첫 항목만 적중으로 세고 이후 항목은 중복률에 포함한다. 질의별 지표를 계산한 뒤 모든 질의에 같은 가중치를 주는 매크로 평균을 보고한다.
지표 해석
섹션 제목: “지표 해석”- Precision@K는 상위 K칸 중 서로 다른 관련 문서가 차지한 비율이다.
- Recall@K는 전체 정답 관련 문서 중 상위 K에서 찾은 비율이다.
- MRR은 첫 관련 문서 순위의 역수를 질의별로 평균한다.
- nDCG@K는 등급형 관련성과 순위 할인을 함께 반영한다.
- 중복률은 상위 K 안에서 이미 나온 문서가 다시 나온 비율이다. 낮을수록 좋다.
- 근거 포함률은 상위 K 결과 중 근거 포함 표시가 있는 문서의 비율이다.
재순위화 전후의 숫자가 달라도 통계적 유의성이나 최종 답변의 사실성을 자동으로 보증하지 않는다. 대표 질의 표본, 정답 판정 일관성, 인용 정확성과 답변 충실도를 별도로 검토해야 한다. 계산 공식은 rag-ranking-metrics-v2, 확인일은 2026-08-30이다.
관련 문서
섹션 제목: “관련 문서”개인정보와 내보내기
섹션 제목: “개인정보와 내보내기”파일과 텍스트는 브라우저 안에서만 읽고 외부 API를 호출하지 않는다. 브라우저 멈춤을 막기 위해 입력 파일과 붙여넣은 데이터는 UTF-8 기준 5MB 이하로 제한한다. 결과는 JSON 또는 CSV로 내려받을 수 있다. 실제 사용자 질의나 비공개 문서 ID를 평가할 때는 내보낸 파일의 저장·공유 범위를 별도로 관리해야 한다.
