콘텐츠로 이동

안전·보안·윤리

AI 시스템의 위험을 식별하고 통제하는 방법 분야의 검토 완료 백과 문서다.

  • 가드레일AI 시스템의 입력·출력·도구 행동과 운영 상태를 정책에 맞게 제한·검사·기록하는 다층 안전 통제 장치다.
  • 가드레일 커버리지 행렬가드레일 커버리지 행렬은 모델·데이터·도구·운영 계층의 AI 위협 관리와 보안 통제 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
  • 가명화가명화는 직접 식별자를 별도 관리되는 대체값으로 바꾸어 추가 정보 없이는 개인과 연결하기 어렵게 하는 처리다.
  • 간접 프롬프트 인젝션모델이 읽는 웹·문서·메일·도구 결과 같은 외부 데이터에 악성 지시를 숨겨 애플리케이션의 행동을 바꾸려는 공격이다.
  • 개인 식별 정보개인 식별 정보는 단독 또는 다른 정보와 결합해 특정 개인을 직접·간접적으로 식별할 수 있는 정보다.
  • 개인정보 감사개인정보 감사는 데이터 수명주기와 시스템 동작이 명시된 개인정보 원칙·정책·법적 요구를 지키는지 증거로 점검하는 절차다.
  • 개인정보 공격개인정보 공격은 모델·출력·기울기·API 응답을 이용해 개인의 참여 여부나 민감한 속성·원본 정보를 추론하려는 공격이다.
  • 개인정보 보호AI 시스템이 개인 데이터를 수집·처리·저장·공개할 때 권리와 위험을 관리하는 원칙이다.
  • 검색 콘텐츠 신뢰검색 콘텐츠 신뢰는 모델·데이터·도구·운영 계층의 AI 위협 관리와 보안 통제 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
  • 공정성 지표공정성 지표는 집단 또는 개인 사이의 예측 결과와 오류 차이를 특정 규범 기준으로 수치화한 측정값이다.
  • 과도한 자율성과도한 자율성은 AI 시스템에 필요한 범위를 넘는 기능, 권한 또는 독립 실행 능력을 부여해 피해 가능성이 커지는 위험이다.
  • 교정 가능성교정 가능성은 AI 시스템이 사람의 수정, 중단, 목표 변경과 통제 시도를 방해하지 않고 받아들이는 성질이다.
  • 교차 공정성교차 공정성은 성별·인종·연령 등 여러 속성이 겹치는 하위 집단에서 성능과 결과의 불균형을 평가하는 관점이다.
  • 기만적 정렬기만적 정렬은 모델이 평가나 감독 상황에서는 목표에 맞는 행동을 보이지만 다른 상황에서 숨은 목표를 추구할 수 있다는 가설적 실패 유형이다.
  • 기밀 컴퓨팅기밀 컴퓨팅은 하드웨어 기반 신뢰 실행 환경에서 사용 중인 데이터와 코드를 격리·검증해 보호하는 방식이다.
  • 기회 균등기회 균등은 실제 양성인 사례에서 보호 집단별 참양성률이 같도록 요구하는 공정성 기준이다.

  • 능력 통제능력 통제는 AI 시스템이 가진 위험한 능력을 승인된 범위 밖에서 사용하지 못하도록 접근과 실행 경로를 제한하는 방법이다.

  • 데이터 동의데이터 동의는 개인이 자신의 데이터가 어떤 목적과 범위로 수집·사용·공유되는지 알고 자발적으로 허용한 상태다.
  • 데이터 보존데이터 보존은 수집한 정보를 어떤 목적과 근거로 얼마나 오래 유지하고 언제 삭제할지 정하는 정책과 절차다.
  • 데이터 최소화데이터 최소화는 명시된 목적에 필요한 범위로 수집·사용·보존하는 개인 데이터를 제한하는 원칙이다.
  • 데이터 편향데이터 편향은 수집·표본·레이블·전처리 과정이 현실 모집단이나 사용 목적을 체계적으로 왜곡한 상태다.
  • 데이터셋 데이터시트데이터셋 데이터시트는 데이터의 동기, 구성, 수집, 전처리, 배포, 유지와 권리 정보를 체계적으로 기록하는 문서다.
  • 도구 출력 정화도구 출력 정화는 모델·데이터·도구·운영 계층의 AI 위협 관리와 보안 통제 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
  • 동등 오즈동등 오즈는 실제 결과가 주어졌을 때 예측이 보호 집단과 조건부 독립이 되도록 참양성률과 거짓양성률을 같게 요구하는 기준이다.

  • 레드팀 근거 로그레드팀 근거 로그는 모델·데이터·도구·운영 계층의 AI 위협 관리와 보안 통제 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
  • 레드팀 발견 심각도레드팀 발견 심각도는 모델·데이터·도구·운영 계층의 AI 위협 관리와 보안 통제 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
  • 레드팀 시나리오 커버리지레드팀 시나리오 커버리지는 모델·데이터·도구·운영 계층의 AI 위협 관리와 보안 통제 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
  • 레드팀 조치 검증레드팀 조치 검증은 모델·데이터·도구·운영 계층의 AI 위협 관리와 보안 통제 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.

  • 멤버십 추론 공격멤버십 추론 공격은 특정 데이터가 모델 학습에 포함되었는지를 출력 신뢰도나 행동 차이로 추정하는 개인정보 공격이다.
  • 명세 편법 수행명세 편법 수행은 시스템이 명시된 보상이나 평가 규칙의 허점을 이용해 의도와 다른 방식으로 높은 점수를 얻는 행동이다.
  • 모델 가중치 접근 제어모델 가중치 접근 제어는 모델·데이터·도구·운영 계층의 AI 위협 관리와 보안 통제 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
  • 모델 공급망 보안모델 공급망 보안은 모델·데이터·도구·운영 계층의 AI 위협 관리와 보안 통제 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
  • 모델 롤백 안전성모델 롤백 안전성은 모델·데이터·도구·운영 계층의 AI 위협 관리와 보안 통제 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
  • 모델 백도어평소에는 정상적으로 동작하지만 특정 트리거나 조건에서 공격자가 원하는 출력을 내도록 숨겨진 행동을 가진 모델이다.
  • 모델 보안 취약점 공개모델 보안 취약점 공개는 모델·데이터·도구·운영 계층의 AI 위협 관리와 보안 통제 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
  • 모델 서비스 거부 공격모델 서비스 거부 공격은 긴 입력, 반복 요청 또는 계산량이 큰 패턴으로 추론 자원을 고갈시켜 정상 사용을 방해하는 공격이다.
  • 모델 아티팩트 서명모델 아티팩트 서명은 모델·데이터·도구·운영 계층의 AI 위협 관리와 보안 통제 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
  • 모델 악용 사례 라이브러리모델 악용 사례 라이브러리는 모델·데이터·도구·운영 계층의 AI 위협 관리와 보안 통제 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
  • 모델 역추론 공격모델 역추론 공격은 모델 출력과 접근 가능한 정보를 이용해 입력의 민감한 속성이나 대표적인 학습 특징을 복원하려는 공격이다.
  • 모델 오염공격자가 모델 가중치, 체크포인트 또는 학습·배포 아티팩트를 변조해 의도한 오작동을 심는 공급망 공격이다.
  • 모델 추출 공격공격자가 모델 API를 반복 질의해 대상 모델의 기능, 결정 경계 또는 유사한 대체 모델을 복제하는 공격이다.
  • 모델 카드모델 카드는 학습된 모델의 용도, 성능, 평가 조건, 한계와 윤리적 고려사항을 구조화해 기록하는 문서다.
  • 모델 투명성모델 투명성은 모델의 개발 자료, 구조, 평가, 제한과 운영 조건을 이해관계자가 확인할 수 있게 공개하는 정도다.
  • 목표 오일반화목표 오일반화는 학습 환경에서는 높은 보상을 얻은 정책이 새 환경에서 의도한 목표가 아닌 다른 내부 목표를 추구하는 실패다.
  • 민감정보 노출민감정보 노출은 모델이나 애플리케이션이 개인정보, 비밀 키, 내부 지침 또는 보호된 문서를 허가되지 않은 사용자에게 드러내는 문제다.

  • 보상 변조보상 변조는 에이전트가 과제 수행 대신 보상 계산기, 관측 또는 피드백 경로를 바꿔 높은 보상을 얻는 실패 유형이다.
  • 보안 집계보안 집계는 서버가 개별 참여자의 입력을 보지 못한 채 여러 입력의 합이나 집계값만 얻도록 하는 암호 프로토콜이다.
  • 불확실성 소통불확실성 소통은 AI 결과의 확실하지 않은 정도와 원인을 사용자가 판단에 반영할 수 있게 표현하는 과정이다.
  • 비인지에 의한 공정성비인지에 의한 공정성은 모델 입력에서 보호 속성을 제거하면 공정해진다고 보는 접근이다.

  • 삭제권삭제권은 적용 법률과 예외 조건 아래에서 개인이 자신과 관련된 데이터의 삭제를 요구할 수 있는 권리다.
  • 선택 편향선택 편향은 표본에 포함될 확률이 결과나 관심 변수와 관련되어 모집단 관계가 왜곡되는 현상이다.
  • 설명 가능한 AI설명 가능한 AI는 모델의 예측이나 행동을 사람이 이해하고 검토할 수 있는 형태의 이유와 증거로 제시하려는 방법과 연구 분야다.
  • 시스템 카드시스템 카드는 개별 모델을 넘어 배포된 AI 시스템의 구성, 능력 평가, 안전 조치와 잔여 위험을 설명하는 문서다.

  • 안전 보증 논증안전 보증 논증은 모델·데이터·도구·운영 계층의 AI 위협 관리와 보안 통제 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
  • 안전 예외 처리 절차안전 예외 처리 절차는 모델·데이터·도구·운영 계층의 AI 위협 관리와 보안 통제 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
  • 안전 정책 버전 관리안전 정책 버전 관리는 모델·데이터·도구·운영 계층의 AI 위협 관리와 보안 통제 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
  • 안전 평가안전 평가는 AI 시스템이 정의된 위해·오용·정책 위반 상황에서 얼마나 위험한 결과를 만들고 통제가 작동하는지 측정하는 과정이다.
  • 안전성 논증서안전성 논증서는 모델·데이터·도구·운영 계층의 AI 위협 관리와 보안 통제 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
  • 안전하지 않은 출력 처리안전하지 않은 출력 처리는 언어 모델의 출력을 검증 없이 코드, 쿼리, HTML 또는 외부 명령으로 실행해 취약점이 생기는 문제다.
  • 알고리즘 감사알고리즘 감사는 AI 시스템의 설계, 데이터, 성능, 통제와 운영이 정한 기준을 충족하는지 독립적으로 조사하는 활동이다.
  • 알고리즘 영향 평가알고리즘 영향 평가는 시스템 도입 전후에 권리, 공정성, 안전과 사회적 영향을 구조적으로 검토하는 절차다.
  • 알고리즘 이의제기 가능성알고리즘 이의제기 가능성은 AI 또는 알고리즘 결정의 영향을 받은 사람이 결정을 이해하고 검토·수정 요청을 제기할 수 있는 성질이다.
  • 알고리즘 편향알고리즘 편향은 모델이나 의사결정 절차가 특정 집단·조건에 체계적으로 불리하거나 왜곡된 결과를 만드는 현상이다.
  • 암기 데이터 추출암기 데이터 추출은 생성 모델에 반복 또는 최적화된 질의를 보내 학습 데이터의 희귀하거나 민감한 문자열을 재생하도록 유도하는 공격이다.
  • 에이전트 최소 권한에이전트 최소 권한은 모델·데이터·도구·운영 계층의 AI 위협 관리와 보안 통제 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
  • 역사적 편향역사적 편향은 데이터가 정확히 측정되었더라도 과거 사회의 불평등과 제도적 차별이 목표와 패턴에 반영된 상태다.
  • 연합 분석연합 분석은 원시 데이터를 중앙에 모으지 않고 여러 장치나 기관에서 계산한 통계만 집계해 전체 경향을 분석하는 방식이다.
  • 오용 테스트오용 테스트은 허용되지 않은 목적을 가진 사용자가 정상 기능을 악용할 때 시스템이 이를 예방·탐지·제한하는지 평가하는 활동이다.
  • 의사결정 출처 추적의사결정 출처 추적은 AI가 내린 결과에 영향을 준 데이터, 모델, 규칙, 사람 승인과 처리 단계를 재구성할 수 있게 기록하는 체계다.
  • 이중용도 AI이중용도 AI는 유익한 목적과 해로운 목적 모두에 적용될 수 있어 사용 맥락에 따라 위험이 달라지는 AI 기술이다.
  • 익명화익명화는 합리적으로 사용할 수 있는 수단으로 개인을 다시 식별할 수 없도록 데이터와 개인의 연결을 제거하는 처리다.
  • 인간 감독인간 감독은 사람이 AI 시스템의 동작과 결과를 감시하고 필요할 때 승인·중단·수정할 수 있도록 하는 통제다.
  • 인구통계학적 동등성인구통계학적 동등성은 보호 집단과 무관하게 긍정 예측의 비율이 같도록 요구하는 공정성 기준이다.

  • 적대적 예시사람이 보기에는 같거나 의미가 유지되지만 모델의 예측을 바꾸도록 의도적으로 조작된 입력이다.
  • 적대적 테스트적대적 테스트은 시스템이 최악 조건이나 의도적으로 조작된 입력에서 어떻게 실패하는지 확인하는 검증 방법이다.
  • 정렬 비용정렬 비용은 안전·규정·인간 선호를 만족시키기 위한 통제가 유용성·성능·속도·자원에 추가하는 비용을 뜻한다.
  • 제3자 AI 위험제3자 AI 위험은 외부 모델·데이터·API·도구 공급자 의존으로 인해 생기는 보안·법률·품질·가용성 위험이다.
  • 조정된 취약점 공개조정된 취약점 공개는 발견자와 공급자가 보안 취약점의 확인·수정·공개 시점과 정보를 협력해 관리하는 절차다.

  • 차등 개인정보 보호차등 개인정보 보호는 한 개인의 데이터 포함 여부가 공개 결과의 확률 분포에 미치는 영향을 수학적으로 제한하는 프라이버시 정의다.
  • 차별적 영향차별적 영향은 겉으로 중립적인 결정 규칙이 보호 집단에 결과 비율의 불리한 차이를 만드는 현상 또는 그 평가 개념이다.
  • 창발적 오정렬창발적 오정렬은 제한된 유해 또는 편향 학습 조건이 예상보다 넓은 상황의 부적절한 목표와 행동으로 일반화되는 현상이다.
  • 측정 편향측정 편향은 사용한 관측값이나 라벨이 의도한 개념을 집단이나 상황에 따라 체계적으로 다르게 나타내는 오류다.

  • 콘텐츠 조정유해하거나 정책을 위반하는 콘텐츠를 탐지·분류·처리하는 과정이다.

  • 탈옥 공격모델의 안전 정책과 행동 제한을 우회하도록 입력을 구성하는 공격 기법이다.

  • 파국적 AI 위험파국적 AI 위험은 AI 시스템의 실패나 오용이 광범위하고 회복하기 어려운 사회적 피해를 일으킬 가능성이다.
  • 편향 완화편향 완화는 데이터, 모델 또는 의사결정 과정에서 특정 집단에 체계적으로 불리한 차이를 줄이는 개입이다.
  • 편향과 공정성모델의 결과가 집단이나 특성에 따라 체계적으로 불리하게 달라지는지를 다루는 개념이다.
  • 표현 편향표현 편향은 데이터셋에서 일부 집단이나 상황이 부족하거나 고정관념적인 방식으로 나타나 학습 신호가 불균형해진 상태다.
  • 프롬프트 유출프롬프트 유출은 시스템 지침, 내부 예시나 숨겨진 컨텍스트가 모델 응답을 통해 노출되는 현상이다.
  • 프롬프트 인젝션악의적 입력이 기존 지시를 무시하거나 비밀을 노출하도록 모델 행동을 조작하는 공격이다.
  • 프롬프트 주입 다계층 방어프롬프트 주입 다계층 방어는 모델·데이터·도구·운영 계층의 AI 위협 관리와 보안 통제 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.

  • 학습 데이터 오염공격자가 학습 데이터에 조작된 사례나 레이블을 섞어 모델의 일반 성능 또는 특정 행동을 훼손하는 공격이다.
  • 허용 사용 정책허용 사용 정책은 AI 서비스에서 허용·제한·금지되는 용도와 위반 시 조치를 이용자에게 알리는 규칙이다.
  • 확장 가능한 감독확장 가능한 감독은 사람이 직접 완전히 평가하기 어려운 복잡한 AI 행동을 제한된 인간 노력으로 신뢰성 있게 감독하는 방법이다.
  • 환각모델이 근거가 없거나 사실과 다른 내용을 그럴듯하게 생성하는 현상이다.
  • 회피 공격운영 중인 모델의 입력을 조작해 탐지나 올바른 분류를 피하게 만드는 추론 시점 공격이다.

A

  • AI 거버넌스AI의 개발과 사용을 조직의 정책·책임·통제·감사 체계로 관리하는 활동이다.
  • AI 거버넌스 프레임워크AI 거버넌스 프레임워크는 조직의 AI 의사결정 권한, 정책, 수명주기 통제와 책임 구조를 정한 체계다.
  • AI 공격 표면 지도AI 공격 표면 지도는 모델·데이터·도구·운영 계층의 AI 위협 관리와 보안 통제 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
  • AI 공급망 취약점AI 공급망 취약점은 모델, 데이터, 라이브러리, 저장소와 배포 구성 요소 중 하나가 변조되거나 신뢰되지 않아 전체 시스템이 손상되는 위험이다.
  • AI 규제 분류AI 규제 분류는 시스템의 용도·영향 대상·위험 특성을 법적 범주와 의무 수준에 대응시키는 절차다.
  • AI 긴급 정지 장치AI 긴급 정지 장치는 모델·데이터·도구·운영 계층의 AI 위협 관리와 보안 통제 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
  • AI 레드팀 재시험AI 레드팀 재시험은 모델·데이터·도구·운영 계층의 AI 위협 관리와 보안 통제 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
  • AI 레드팀 평가AI 레드팀 평가은 공격자·오용자 관점에서 모델과 전체 시스템의 실패·우회·피해 경로를 체계적으로 탐색하는 평가 활동이다.
  • AI 보안 모니터링AI 보안 모니터링은 모델·데이터·도구·API와 사용 행위에서 공격·오용·무결성 손상을 지속 탐지하는 활동이다.
  • AI 보안 통제 기준선AI 보안 통제 기준선은 모델·데이터·도구·운영 계층의 AI 위협 관리와 보안 통제 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
  • AI 사고 대응AI 사고 대응은 AI 시스템의 위해·보안 침해·중대한 오작동을 식별하고 억제·복구·통지·학습하는 조직적 절차다.
  • AI 사고 보고AI 사고 보고는 AI 시스템의 피해·오작동·보안 위반을 정해진 형식과 기한에 내부 또는 감독 기관에 알리는 절차다.
  • AI 사용 고지AI 사용 고지는 콘텐츠나 서비스의 생성·변형·의사결정에 AI가 관여했다는 사실과 범위를 이용자에게 알리는 행위다.
  • AI 심층 방어AI 심층 방어는 한 통제가 실패해도 위해가 발생하지 않도록 데이터·모델·애플리케이션·도구·인프라·운영에 독립적인 보호층을 겹치는 전략이다.
  • AI 악용 모니터링AI 악용 모니터링은 모델·데이터·도구·운영 계층의 AI 위협 관리와 보안 통제 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
  • AI 안전AI 안전은 AI 시스템이 의도한 목표를 신뢰할 수 있게 수행하고 오용, 사고와 예측하지 못한 피해를 줄이기 위한 연구와 실무 영역이다.
  • AI 오용AI 오용은 정상적인 AI 기능을 사기, 조작, 공격이나 권리 침해처럼 해로운 목적에 의도적으로 사용하는 행위다.
  • AI 위험 대장AI 위험 대장은 식별된 위험의 원인, 영향, 가능성, 통제, 책임자와 상태를 한곳에 추적하는 관리 기록이다.
  • AI 위험 평가AI 위험 평가는 AI 시스템이 사람, 조직과 환경에 일으킬 가능성과 영향을 사용 맥락에서 식별·분석하는 과정이다.
  • AI 위협 모델링AI 위협 모델링은 AI 시스템의 자산·행위자·신뢰 경계·공격 표면과 가능한 피해 경로를 구조적으로 식별하는 과정이다.
  • AI 이상 현상 분류AI 이상 현상 분류는 모델·데이터·도구·운영 계층의 AI 위협 관리와 보안 통제 계층에서 입력·판단·관측·복구 조건을 일관된 형식으로 관리하기 위한 운영 설계 개념이다.
  • AI 정책 집행AI 정책 집행은 사용·데이터·출력·도구 권한 규칙을 AI 시스템의 요청 처리 경로에서 실제 허용·차단 행동으로 적용하는 활동이다.
  • AI 준수 모니터링AI 준수 모니터링은 시스템 운영과 변경이 적용 법규·표준·내부 통제 요구를 계속 만족하는지 증거로 확인하는 과정이다.
  • AI 책임성AI 책임성은 AI 관련 결정과 결과에 대해 지정된 주체가 설명하고 통제하며 피해를 시정할 의무를 갖는 원칙이다.
  • AI 통제 문제AI 통제 문제는 강력한 AI 시스템이 사람의 의도와 안전 경계 안에서 행동하도록 감시·제한·개입 수단을 설계하는 문제다.
  • AI 해석 가능성AI 해석 가능성은 모델의 내부 표현, 계산 과정과 행동 원인을 조사해 의미 있는 설명을 얻을 수 있는 성질과 분석 활동이다.

L

  • LLM 침투 테스트LLM 침투 테스트은 언어 모델 애플리케이션의 프롬프트·검색·도구·권한 경계를 실제 공격 절차로 검증하는 보안 시험이다.

N

  • NIST AI 위험 관리 프레임워크NIST AI 위험 관리 프레임워크는 AI 위험을 조직적으로 거버넌스하고 식별·측정·관리하기 위한 자발적 지침이다.

R

  • RAG 오염RAG 오염은 검색 증강 생성 시스템의 문서나 인덱스에 악성 또는 거짓 콘텐츠를 넣어 검색 결과와 모델 출력을 조작하는 공격이다.