KorQuAD Korean Question Answering Dataset
한국어 질의응답 데이터셋 · KorQuAD 벤치마크
KorQuAD는 한국어 위키 문서를 읽고 질문의 답이 되는 문자열 범위를 찾도록 만든 한국어 기계독해 데이터셋과 평가 체계다.
개념과 원리
섹션 제목: “개념과 원리”추출형 한국어 기계독해
섹션 제목: “추출형 한국어 기계독해”KorQuAD 1.0은 한국어 위키백과 문단을 바탕으로 사람이 작성한 질문과 문맥 안의 답 범위를 제공한다. 모델은 자유롭게 지식을 생성하는 대신 주어진 문서에서 연속 문자열의 시작과 끝을 찾는다. 2.0 계열은 전체 웹 문서와 표·목록·HTML 구조, 더 긴 답을 포함해 문단 수준 평가보다 실제 웹 문서 처리에 가까운 어려움을 추가한다.
자료 계약과 범위를 고정할 때에는 문서 스냅샷·질문·복수 답 문자열·문자 오프셋과 HTML 렌더링 텍스트의 정렬을 예제 계약으로 둔다. 이 항목을 명시하지 않으면 KorQuAD 결과가 달라져도 데이터·전처리·모델 중 어느 변화가 원인인지 재현할 수 없다. 원문과 파생값, 자동 판단과 사람 결정을 구분해 저장하고 기준 날짜와 적용 범위를 함께 기록한다.
문맥 인코딩과 범위 예측
섹션 제목: “문맥 인코딩과 범위 예측”질문과 문서를 토큰화해 함께 인코딩하고 각 토큰이 답의 시작·끝일 확률을 예측한다. 토큰 범위는 원문 문자 오프셋으로 되돌려 정답 문자열과 비교한다. 긴 문서는 창으로 나누거나 검색 단계를 추가해야 하며 표·목록에서는 HTML 구조와 화면 텍스트의 정렬을 보존해야 한다.
처리 흐름은 입력 수집, 전제 검사, 핵심 변환, 결과 복원과 검증으로 나눈다. 이 문서에서는 특히 질문·문맥 토큰에서 답 시작·끝을 예측하고 긴 문서 창 선택·검색과 reader 단계를 분리한다. 각 단계의 입력·출력 자료형과 실패 상태를 남기면 KorQuAD 구현을 바꾸더라도 같은 사례에서 최초 차이가 생긴 위치를 찾을 수 있다.
EM·F1과 전처리
섹션 제목: “EM·F1과 전처리”Exact Match는 정규화한 예측과 정답 문자열이 완전히 같은지 보고, token F1은 겹치는 단위를 측정한다. 한국어에서는 띄어쓰기·조사·토큰화 정규화가 점수에 직접 영향을 주므로 공식 평가 스크립트를 사용한다. 긴 문서에서는 답 포함 창의 상한, 검색 성공률과 읽기 모델 성능을 분리해 보고해야 한다.
평가표에서는 공식 EM·token F1과 질문 유형·답 길이·표·목록별 결과, 검색 회수율을 별도로 측정한다. 평균값 하나로 결론 내리지 않고 정상·경계·실패 사례와 하위 집단을 나누며, 데이터 버전·토크나이저·모델·실행 설정을 고정한다. 차이가 작을 때에는 반복 실행과 신뢰구간으로 우연한 변동인지 확인한다.
문서 단서와 일반화 한계
섹션 제목: “문서 단서와 일반화 한계”모델은 질문·문서의 표면 단어 중복에 의존하고 복수 문장 추론, 표 구조와 답이 없는 질문에 실패할 수 있다. 공개 위키 문서가 사전학습에 포함되었을 가능성이 있고, 오래된 스냅샷의 사실을 최신 지식으로 해석해서는 안 된다. 높은 추출 점수는 문서 밖 질문, 답 근거 설명과 환각 방지를 보장하지 않는다.
안전한 실패 경계를 만들기 위해 복수 표현 정답, 답 없음, 표면 중복 의존과 공개 위키 사전학습 오염을 오류 범주로 구분한다. 결과가 자연스럽게 보이거나 오류 없이 반환됐다는 이유만으로 정확성·공정성·개인정보 보호까지 확보됐다고 해석하지 않는다. 피해가 크거나 근거가 부족한 사례는 자동 보정하지 않고 보류·사람 검토로 보낸다.
활용과 검증
섹션 제목: “활용과 검증”데이터셋 사용 계약
섹션 제목: “데이터셋 사용 계약”공식 분할과 라이선스를 확인하고 같은 문서의 유사 문단이 훈련·시험에 교차하지 않는지 점검한다. 토크나이저·정규화·창 길이·stride와 답 없는 사례 처리 규칙을 기록한다. 실제 RAG 시스템에서는 KorQuAD 읽기 점수와 별도로 검색 재현율, 인용 정확성, 답 보류와 최신 사내 문서 성능을 평가한다.
운영 환경에서는 실제 RAG에서는 권한 필터·인용·최신 문서와 보류를 추가하고 토크나이저·창 길이·stride를 버전 관리한다. 기준선을 먼저 저장하고 제한된 트래픽에서 변경 효과를 관측한 뒤 확대한다. 데이터·표준·모델·코드 중 하나가 바뀌면 같은 회귀 세트를 다시 실행하고, 개선 폭이 추가 비용과 잔여 위험을 상쇄하지 못하면 롤백한다.
KLUE MRC와 생성형 QA
섹션 제목: “KLUE MRC와 생성형 QA”KorQuAD는 한국어 기계독해에 집중한 데이터셋이고 KLUE는 MRC를 포함한 여덟 과제 평가군이다. 생성형 QA는 답이 원문 연속 범위가 아닐 수 있어 EM·token F1만으로 평가하기 어렵다. 벤치마크 오염 문서는 공개 문서·질문이 학습 데이터와 겹칠 때 점수를 해석하는 방법을 다룬다.
학습 확인에서는 토큰·문자 답 범위를 표현하고 oracle reader는 높은데 전체 QA가 낮을 때의 진단 순서를 설명한다. 정의를 외우는 데서 멈추지 않고 입력·처리·출력, 비교 기준과 중단 조건을 사례로 제시해야 한다. 관련 문서와의 차이를 설명하고 한 번의 성공 사례를 전체 한국어·다국어 입력으로 일반화하지 않는 이유까지 답할 수 있어야 한다. 답안에는 사용한 근거의 날짜와 적용 범위, 정상·경계·실패 반례, 사람이 다시 검토할 조건과 결과를 재현하는 데 필요한 설정을 함께 적는다.
문서 관계
섹션 제목: “문서 관계”선행 개념
섹션 제목: “선행 개념”관련 문서
섹션 제목: “관련 문서”이 문서를 가리키는 문서
섹션 제목: “이 문서를 가리키는 문서”이 문서를 포함하는 코스
섹션 제목: “이 문서를 포함하는 코스”참고와 다음 학습
섹션 제목: “참고와 다음 학습”참고 문헌
섹션 제목: “참고 문헌”- KorQuAD1.0: Korean QA Dataset for Machine Reading Comprehension - paper
- KorQuAD 공식 데이터셋 사이트 - documentation
- KorQuAD 2.0: Korean QA Dataset for Web Document Machine Comprehension - paper
코스에서 계속 읽기
섹션 제목: “코스에서 계속 읽기”- 한국어·다국어 AI: 다음 문서 — KMMLU
