평가·관측성·벤치마크
모델과 시스템의 품질을 측정하는 방법 분야의 검토 완료 백과 문서다.
ㄱ
- 개별 채점 평가 설계개별 채점 평가 설계는 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- 개별 LLM 심사개별 LLM 심사은 평가 모델이 한 응답을 독립적으로 보고 절대 등급이나 수치 점수를 부여하는 방식이다.
- 검색 평가검색 평가는 질의에 대해 관련 문서가 결과 목록의 적절한 위치에 나타나는지를 측정하는 과정이다.
- 견고성 평가 그리드견고성 평가 그리드는 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- 계획 평가계획 평가는 목표를 달성하기 위해 만든 행동 순서가 타당하고 효율적이며 제약을 지키는지를 측정한다.
- 곡선 아래 면적성능 곡선 아래의 면적을 하나의 수로 요약한 값이며 어떤 곡선과 적분 규칙을 사용했는지 함께 명시해야 한다.
- 골든 세트 거버넌스골든 세트 거버넌스는 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- 과제 벤치마크과제 벤치마크는 번역·분류·코드 생성처럼 명시된 한 과제의 성능을 비교하기 위한 데이터와 채점 규칙이다.
- 과제 완료율과제 완료율은 할당된 작업 중 명시한 완료 조건에 도달한 작업의 비율이다.
- 관측성로그·메트릭·추적 정보로 시스템 내부 상태와 실패 원인을 이해할 수 있는 정도다.
- 근거 충실도근거 충실도는 시스템 출력이 주어진 자료나 관측 가능한 사실에 기반하고 근거 밖 내용을 단정하지 않는 성질이다.
- 기대 보정 오차기대 보정 오차(ECE)는 비슷한 신뢰도의 예측을 구간으로 묶고 각 구간의 평균 신뢰도와 실제 정확도 차이를 가중 평균한 값이다.
ㄴ
- 능력 벤치마크능력 벤치마크는 지식, 추론, 계획처럼 여러 과제에 걸친 상위 능력을 조작적으로 정의해 측정하는 평가다.
ㄷ
- 다국어 평가 프로토콜다국어 평가 프로토콜은 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- 답변 관련성답변 관련성은 생성된 답이 사용자의 질문 의도와 필요한 정보에 얼마나 직접 대응하는지를 나타낸다.
- 데이터 주석데이터 주석은 원시 데이터에 범주, 경계, 관계, 선호나 설명을 부여해 학습·평가에 사용할 참조 정보를 만드는 과정이다.
- 도구 사용 평가도구 사용 평가는 에이전트가 적절한 도구를 선택하고 올바른 인수로 호출하며 결과와 오류를 정확히 처리하는지를 측정한다.
- 도메인 전문가 평가도메인 전문가 평가는 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- 동적 벤치마크동적 벤치마크는 모델 성능과 실패 양상에 맞추어 평가 사례를 지속적으로 수집·갱신하는 벤치마크다.
ㄹ
- 로그 손실모델이 실제 클래스에 부여한 확률의 음의 로그를 평균한 확률적 분류 손실이다.
- 루브릭 기반 심사루브릭 기반 심사은 명시된 평가 차원, 등급 설명과 감점 조건에 따라 후보 응답을 채점하는 방식이다.
- 루브릭 신뢰도루브릭 신뢰도는 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- 리더보드리더보드는 동일한 평가 규칙으로 측정한 모델이나 시스템의 성능을 순위와 함께 공개하는 표다.
- 리커트 척도리커트 척도는 응답자가 진술에 대한 동의나 평가 정도를 순서가 있는 여러 범주 중 하나로 표시하는 척도다.
ㅁ
- 맹검 평가맹검 평가는 평가자가 후보의 제작자·모델명·실험 조건 중 판단에 불필요한 정보를 모른 채 결과를 판정하는 절차다.
- 모델 드리프트 모니터링모델 드리프트 모니터링은 운영 입력, 예측과 성능의 통계적 관계가 기준 기간에서 변하는지 지속 확인하는 과정이다.
- 모델 텔레메트리모델 텔레메트리는 운영 중 모델 요청, 출력, 자원 사용과 품질 신호를 관찰 가능하도록 수집한 로그·지표·추적 데이터다.
- 모델 평가정해진 데이터·기준·절차로 모델이나 시스템의 품질과 위험을 측정하는 과정이다.
- 문맥 관련성문맥 관련성은 검색해 제공한 구절이 질의와 답변 작성에 필요한 정보를 얼마나 포함하는지를 나타낸다.
ㅂ
- 반사실 평가반사실 평가는 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- 벤치마크여러 모델이나 시스템을 비교하기 위해 고정한 과제·데이터·평가 지표의 묶음이다.
- 벤치마크 갱신 정책벤치마크 갱신 정책은 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- 벤치마크 데이터셋벤치마크 데이터셋은 모델이나 방법을 같은 입력과 정답 기준에서 비교하도록 고정한 평가용 데이터 모음이다.
- 벤치마크 모음벤치마크 모음은 여러 과제·데이터셋·지표를 하나의 평가 프로토콜로 묶어 시스템의 다양한 능력을 측정하는 구성이다.
- 벤치마크 타당도벤치마크 타당도는 평가 점수가 측정하려는 실제 능력이나 사용 목표를 얼마나 제대로 대표하는지를 뜻한다.
- 벤치마크 폐기벤치마크 폐기는 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- 벤치마크 포화벤치마크 포화는 많은 시스템이 평가 상한에 가까워져 점수 차이가 실제 능력 차이를 충분히 구분하지 못하는 상태다.
- 부트스트랩 신뢰구간부트스트랩 신뢰구간은 관측 표본을 복원 추출해 통계량의 경험적 표집분포를 만들고 그 분위수 등으로 구한 불확실성 구간이다.
- 브라이어 점수브라이어 점수는 확률 예측과 실제 이진 결과 사이의 제곱 오차 평균으로 확률 예측의 정확성을 평가한다.
- 비용 모니터링비용 모니터링은 AI 서비스의 사용량과 가격을 지속 결합해 실제 지출, 단위 비용과 예산 소진을 관찰하는 활동이다.
ㅅ
- 사용자 피드백 수집사용자 피드백 수집은 실제 이용자가 AI 결과의 유용성·정확성·안전성에 제공한 명시적·암묵적 신호를 구조화해 기록하는 과정이다.
- 생성 평가생성 평가는 모델 출력의 정확성, 관련성, 유창성, 다양성, 안전성과 과제 제약 준수를 측정하는 과정이다.
- 순차 평가순차 평가는 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- 쉐도 평가쉐도 평가는 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- 슬라이스 기반 릴리스 게이트슬라이스 기반 릴리스 게이트는 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- 승률승률은 두 모델이나 방법을 쌍대 비교했을 때 한쪽이 더 낫다고 판정된 비율이다.
- 시뮬레이션 기반 평가시뮬레이션 기반 평가는 실제 환경을 모사한 상태 전이와 사용자·도구 모델 안에서 AI 시스템의 행동을 반복 시험하는 방법이다.
- 심사 모델심사 모델은 하나 이상의 후보 응답을 평가 기준에 따라 채점하거나 비교하도록 지시된 언어 모델이다.
- 심사 모델 메타평가심사 모델 메타평가는 자동 판정자 자체의 정확성, 일관성, 편향과 강건성을 평가하는 절차다.
- 심사 모델 보정심사 모델 보정은 판정 모델이 내는 점수나 확률이 실제 품질 수준 또는 사람 판단 빈도와 맞도록 조정하는 과정이다.
- 심사 모델 앙상블심사 모델 앙상블은 서로 다른 판정 모델이나 판정 설정의 결과를 결합해 단일 판정자의 변동과 편향을 줄이는 방법이다.
- 심사 모델 합의도심사 모델 합의도는 여러 판정자 또는 반복 판정이 같은 항목에 얼마나 일관된 등급이나 선호를 부여하는지 나타내는 성질이다.
- 심사 위치 편향심사 위치 편향은 내용이 같아도 후보가 제시된 순서나 좌우 위치에 따라 판정 결과가 체계적으로 달라지는 현상이다.
ㅆ
- 쌍대 비교쌍대 비교는 두 후보를 동시에 제시하고 어느 쪽이 기준에 더 부합하는지 선택하게 하는 평가 방식이다.
- 쌍대 비교 평가 설계쌍대 비교 평가 설계는 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- 쌍대 LLM 심사쌍대 LLM 심사은 평가 모델이 두 후보 응답을 나란히 비교해 더 나은 쪽이나 동률을 선택하는 방식이다.
ㅇ
- 안전 벤치마크안전 벤치마크는 유해 출력, 편향, 보안 취약성이나 거부 행동 등 모델의 위험 관련 특성을 측정하는 평가다.
- 에이전트 평가에이전트 평가는 자율 시스템의 최종 결과뿐 아니라 계획, 도구 사용, 상태 관리, 복구와 안전한 중단 능력을 측정하는 과정이다.
- 역량 회귀역량 회귀는 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- 온라인 평가 드리프트온라인 평가 드리프트는 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- 완전 일치완전 일치는 예측 문자열이나 구조가 정답과 사전에 정한 정규화 뒤 정확히 같은지를 세는 평가 지표다.
- 인간 평가인간 평가는 사람이 정의된 기준에 따라 모델 출력의 품질·선호·안전성 등을 직접 판단하는 평가 방식이다.
- 인용 정확성인용 정확성은 답변에 붙은 인용이 해당 주장과 올바른 출처를 실제로 연결하는 정도다.
ㅈ
- 자기 선호 편향자기 선호 편향은 평가 모델이 자신이나 같은 계열 모델이 생성한 답변을 다른 모델의 답변보다 더 높게 평가하는 경향이다.
- 자동 평가자자동 평가자는 규칙, 통계 모델 또는 언어 모델을 사용해 시스템 출력을 사람의 개별 판정 없이 점수화하는 평가 구성 요소다.
- 장황성 편향장황성 편향은 평가자가 동일한 핵심 품질에서도 더 길고 자세한 답변을 부당하게 높게 평가하는 경향이다.
- 재현 가능한 평가재현 가능한 평가는 동일한 데이터·모델·평가기·환경을 사용한 독립 실행에서 허용 오차 안의 결과를 얻을 수 있는 평가 절차다.
- 전문가 평가전문가 평가는 해당 분야의 지식과 실무 경험을 가진 평가자가 전문 기준으로 결과의 정확성·유용성·위험을 판정하는 방식이다.
- 정밀도-재현율 곡선분류 임계값을 변화시키며 재현율에 대한 정밀도를 그려 양성 탐지와 오탐의 교환 관계를 보여 주는 곡선이다.
- 정밀도와 재현율정밀도는 양성으로 예측한 항목의 적중 비율이고 재현율은 실제 양성 가운데 찾아낸 비율이다.
- 정성 평가정성 평가는 수치 점수만으로 드러나지 않는 출력의 특성, 오류 양상과 사용 경험을 서술적 근거로 분석하는 방법이다.
- 정확도전체 평가 예시 중 모델이 정답을 맞힌 비율이다.
- 종단간 성공률종단간 성공률은 시스템의 모든 단계를 거친 전체 요청 중 최종 성공 기준을 충족한 비율이다.
- 주석 판정주석 판정은 주석자 사이의 불일치를 지침과 증거에 따라 검토해 최종 참조 레이블을 결정하는 절차다.
- 주석자 편향주석자 편향은 평가자의 배경, 기대, 선호 또는 제시 방식이 정답과 무관하게 라벨이나 점수에 체계적으로 영향을 주는 현상이다.
- 주석자 피로주석자 피로는 반복적이거나 긴 평가 작업으로 주의력과 판단 일관성이 시간에 따라 떨어지는 현상이다.
- 주석자 합의도주석자 합의도는 같은 사례를 독립적으로 판정한 주석자들이 얼마나 일치하는지 나타내는 품질 정보다.
- 지연 시간 모니터링지연 시간 모니터링은 요청 시작부터 첫 토큰과 완료까지 걸린 시간을 단계별 분포로 추적하는 활동이다.
ㅊ
ㅋ
ㅌ
- 토큰 사용량 모니터링토큰 사용량 모니터링은 모델 요청의 입력·출력·캐시·추론 토큰 수를 지속 측정해 비용과 문맥 사용을 관찰하는 활동이다.
- 통계적 유의성통계적 유의성은 귀무가설 아래 관측된 차이 이상이 우연히 나타날 확률이 정한 기준보다 작은지를 나타내는 판단이다.
- 특이도실제 음성 사례 가운데 모델이 음성으로 올바르게 판정한 비율이며 TN을 TN과 FP의 합으로 나눈다.
ㅍ
- 판정 길이 편향 통제판정 길이 편향 통제는 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- 판정 모델 교정 곡선판정 모델 교정 곡선은 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- 판정 위치 무작위화판정 위치 무작위화는 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- 평가 데이터셋 계보평가 데이터셋 계보는 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- 평가 루브릭평가 루브릭은 결과를 판단할 기준과 수준별 설명, 배점 규칙을 명시한 채점 도구다.
- 평가 불확실성평가 불확실성은 제한된 표본·평가자·무작위 실행·측정 오류 때문에 보고된 모델 성능이 참 성능과 다를 수 있는 정도다.
- 평가 슬라이스평가 슬라이스는 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- 평가 신뢰구간평가 신뢰구간은 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- 평가 예산 배분평가 예산 배분은 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- 평가 오류 분류 체계평가 오류 분류 체계는 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- 평가 오염 감사평가 오염 감사는 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- 평가 의사결정 로그평가 의사결정 로그는 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- 평가 지표성능이나 품질의 특정 측면을 수치로 요약하는 측정 기준이다.
- 평가 표본추출평가 표본추출은 전체 가능한 입력 중 평가에 사용할 사례를 규칙에 따라 선택하는 과정이다.
- 평가자 간 신뢰도평가자 간 신뢰도는 여러 평가자의 점수가 평가 대상의 차이를 일관되게 반영하는 정도를 통계적으로 측정한 값이다.
- 프로덕션 평가프로덕션 평가는 실제 트래픽과 운영 제약에서 AI 시스템의 품질·안전·비용을 지속 측정하는 평가 체계다.
- 프롬프트 추적프롬프트 추적은 한 생성 요청에 사용된 시스템·사용자 메시지, 검색 문맥, 도구 결과와 모델 응답의 계보를 연결한 실행 기록이다.
ㅎ
- 행동 회귀행동 회귀는 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- 혼동 행렬분류 모델의 실제 클래스와 예측 클래스를 교차표로 집계해 어떤 종류의 정답과 오류가 발생했는지 보여 주는 행렬이다.
- 회귀 테스트형 평가회귀 테스트형 평가는 모델·프롬프트·데이터 변경 뒤 이전에 통과하던 사례와 핵심 지표가 나빠지지 않았는지 확인하는 반복 시험이다.
- 효과 크기효과 크기는 두 조건의 차이나 변수 관계의 크기를 표본 수와 분리해 정량화한 값이다.
B
- BEIR 벤치마크BEIR 벤치마크는 여러 도메인의 정보 검색 데이터셋에서 검색 모델의 제로샷 일반화 성능을 비교하는 평가 모음이다.
- BERTScoreBERTScore는 문맥 임베딩 사이의 코사인 유사도로 후보와 참조 토큰을 대응시켜 정밀도, 재현율과 F1을 계산한다.
- BIG-benchBIG-bench는 다양한 연구자가 제안한 광범위한 과제로 대규모 언어 모델의 능력과 한계를 탐색하는 협업 벤치마크다.
- BLEU 점수BLEU 점수는 기계 번역 후보와 하나 이상의 참조 문장 사이의 수정된 n-그램 정밀도와 길이 패널티를 결합한 말뭉치 수준 지표다.
F
- F1 점수정밀도와 재현율의 조화평균으로 두 지표가 모두 높을 때만 큰 값을 갖는 분류·검색 성능 지표다.
G
- GPQAGPQA는 전문 지식이 없는 검색만으로 풀기 어려운 대학원 수준 과학 객관식 문제로 추론 능력을 평가하는 벤치마크다.
H
I
- ImageNetImageNet은 대규모 계층형 이미지 범주와 주석으로 구성되어 이미지 분류와 시각 표현 학습 연구에 널리 쓰인 데이터셋이다.
L
- LLM 심사자언어 모델을 사용해 다른 모델 출력의 품질을 판정하거나 비교하는 평가 방식이다.
- LLM 판정 앙상블LLM 판정 앙상블은 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- LLM 평가 계약LLM 평가 계약은 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
- LLM 평가자 간 일치도LLM 평가자 간 일치도는 모델과 LLM 시스템의 품질 측정·비교·배포 판정 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
M
P
- Pass@KPass@K는 코드 생성처럼 여러 후보를 만들 때 k개 후보 중 적어도 하나가 테스트를 통과할 확률을 추정하는 지표다.
R
S
- SWE-benchSWE-bench는 실제 오픈소스 저장소의 이슈와 코드 상태를 사용해 시스템이 결함을 수정하고 테스트를 통과시키는 능력을 평가하는 벤치마크다.
