합성 데이터 Synthetic Data
인공 데이터
실제 관측값을 그대로 복제하지 않고 규칙·시뮬레이션·통계 또는 생성 모델로 만든 데이터다.
개념과 원리
섹션 제목: “개념과 원리”개요와 핵심 정의
섹션 제목: “개요와 핵심 정의”실제 관측값을 그대로 복제하지 않고 규칙·시뮬레이션·통계 또는 생성 모델로 만든 데이터다.
합성 데이터는 희귀 사례 보완, 시험 환경 구성, 데이터 접근 제약 완화에 쓰인다. 생성 방식이 실제 분포를 얼마나 충실히 반영하는지와 민감 정보를 얼마나 보호하는지는 서로 다른 평가 문제다.
배경과 설명 범위
섹션 제목: “배경과 설명 범위”표 형식·시계열·이미지·텍스트의 합성 원리를 포괄하되 표 형식 생성의 데이터 계보와 품질 평가를 주요 예로 든다. 단순 익명화나 기존 자료 복사와 합성 생성을 구분한다.
외부 백과는 표제어의 일반적 범위와 역사적 용례를 대조하는 데 사용했다. 본문은 백과 문장을 복제하지 않고 아래 1차 자료·공식 문서와 내부 개념 관계를 기준으로 다시 구성했다.
작동 원리
섹션 제목: “작동 원리”규칙과 시뮬레이터는 알려진 과정에서 표본을 만들고 통계·생성 모델은 실제 데이터의 분포와 관계를 학습해 새 표본을 샘플링한다. 조건부 생성은 희귀 집단이나 특정 속성 조합을 목표로 만들 수 있다.
학습 데이터 및 데이터 증강를 먼저 보면 입력과 출력의 위치를 구분하기 쉽다.
구성 요소와 처리 흐름
섹션 제목: “구성 요소와 처리 흐름”원본 데이터와 메타데이터, 생성기, 제약 조건, 품질·개인정보 평가, 계보 기록으로 구성된다. 학습·검증·시험 분할 전에 합성 절차를 설계해 동일 원본이 여러 분할에 간접 누출되지 않게 한다.
구현을 비교할 때는 입력 형식, 기본값, 실패 조건, 출력 스키마와 관측 가능한 상태를 함께 기록한다. 같은 이름의 기능도 라이브러리와 서비스에 따라 경계와 기본 동작이 다를 수 있다.
활용과 검증
섹션 제목: “활용과 검증”활용 분야와 선택 기준
섹션 제목: “활용 분야와 선택 기준”개발용 데이터, 희귀 사건 보강, 시뮬레이션, 개인정보 제약이 있는 협업, 모델의 스트레스 테스트에 사용한다. 실제 데이터가 부족한 원인을 가리지 않고 합성 자료가 목표 과제의 오류를 줄이는지 검증한다.
규칙 기반 생성은 통제가 쉽지만 복잡한 상관관계를 놓칠 수 있고 학습 기반 생성은 관계를 포착하지만 원본 오류와 민감 패턴을 재현할 수 있다. 용도에 따라 충실도·다양성·개인정보·하위 과제 효용의 우선순위를 정한다.
한계와 흔한 오해
섹션 제목: “한계와 흔한 오해”생성기가 모르는 사건을 만들어내지 못하고 다수 패턴을 과도하게 반복할 수 있다. 외형상 그럴듯한 표본이 실제 인과 관계나 장기 꼬리 분포를 보존한다는 보장은 없다.
합성이라는 이유만으로 개인정보가 제거됐다고 가정하면 안 된다. 멤버십 추론, 최근접 원본 거리, 하위 집단 품질, 생성기와 원본 데이터의 사용 권한을 별도로 검토한다.
관련 개념과의 구분
섹션 제목: “관련 개념과의 구분”- 데이터 증강: 데이터 증강은 기존 예시를 변형하는 경우가 많고 합성 데이터는 별도 생성 과정에서 새 표본을 만들 수 있다.
- 학습 데이터: 학습 데이터는 모델 학습에 쓰이는 역할을 뜻하며 실제 자료와 합성 자료를 모두 포함할 수 있다.
- 개인정보 보호: 개인정보 보호는 합성 방식의 가능한 목표 중 하나지만 합성만으로 자동 달성되지는 않는다.
구체적 적용 예시
섹션 제목: “구체적 적용 예시”사기 탐지 데이터에서 희귀 사기 유형을 조건부로 생성해 학습 자료에 추가할 수 있다. 원본만 사용한 기준 모델과 합성 자료를 추가한 모델을 같은 실제 시험셋에서 비교한다. 전체 정확도뿐 아니라 사기 재현율, 정상 거래 오탐, 하위 유형별 결과와 개인정보 공격 시험을 함께 본다.
이 예시를 재현할 때는 성공 사례만 고르지 않고 실패하기 쉬운 입력을 먼저 목록화한다. 실행 전 기대 결과와 허용 오차를 적고, 실행 뒤에는 결과뿐 아니라 중간 상태와 선택 이유를 보존한다. 이렇게 하면 합성 데이터 자체의 한계와 데이터·주변 시스템에서 생긴 문제를 분리해 수정할 수 있다.
실무 적용과 검증 절차
섹션 제목: “실무 적용과 검증 절차”- 목적과 경계 정의: 합성 데이터이 해결해야 할 문제와 하지 않아야 할 행동을 한 문장씩 적는다.
- 입력·출력 명세: 입력 형식, 단위, shape 또는 스키마와 기대 출력을 고정한다.
- 기준선 비교: 가장 단순한 방법과 품질·지연·비용·안전 지표를 같은 자료에서 비교한다.
- 실패 조건 시험: 분포·상관관계·희귀 집단의 통계적 충실도, 실제 시험셋에서의 과제 효용, 중복과 개인정보 공격 위험을 분리해 측정한다.
- 버전과 근거 보존: 데이터·코드·모델·문서 버전과 판단 근거를 연결해 변경 뒤 같은 시험을 반복한다.
- 운영 통제: 권한, 예산, 중단·롤백 조건과 사람 검토가 필요한 지점을 지정한다.
운영 기록 템플릿
섹션 제목: “운영 기록 템플릿”- 선택 근거: 합성 데이터을 사용한 이유와 사용하지 않은 대안을 함께 적는다.
- 재현 조건: 입력 자료의 시점과 범위, 코드·모델·라이브러리 버전, 핵심 파라미터와 실행 환경을 기록한다.
- 품질 기준: 평균값 하나만 남기지 않고 성공 조건, 허용할 수 없는 실패, 하위 집단과 경계 사례의 결과를 분리한다.
- 변경 감지: 데이터 분포, 인터페이스, 권한, 비용 또는 정책이 바뀌면 기존 결론을 자동 승계하지 않고 같은 평가를 반복한다.
- 관련 검토: privacy, dataset, evaluation 문서의 역할과 경계를 함께 확인해 인접 단계의 오류를 합성 데이터의 문제로 잘못 진단하지 않는다.
- 종료 판단: 개선 폭이 기준선의 복잡도와 운영 위험을 상쇄하지 못하면 더 단순한 방법으로 돌아간다.
학습 체크
섹션 제목: “학습 체크”- 합성 데이터의 입력과 출력 또는 적용 대상을 한 문장으로 설명할 수 있는가?
- 개인정보 보호와 데이터셋의 차이를 실제 사례로 구분할 수 있는가?
- 이 문서의 실패 조건을 평가 자료와 운영 로그에서 확인할 수 있는가?
문서 관계
섹션 제목: “문서 관계”선행 개념
섹션 제목: “선행 개념”관련 문서
섹션 제목: “관련 문서”이 문서를 가리키는 문서
섹션 제목: “이 문서를 가리키는 문서”이 문서를 포함하는 코스
섹션 제목: “이 문서를 포함하는 코스”포함된 코스가 없다.
참고와 다음 학습
섹션 제목: “참고와 다음 학습”참고 문헌
섹션 제목: “참고 문헌”- Synthetic Data — What, Why and How? — paper
- Synthetic Data Vault Documentation — documentation
- Synthetic data — Wikipedia — encyclopedia
코스에서 계속 읽기
섹션 제목: “코스에서 계속 읽기”이 문서에서 이어지는 코스가 없다.
