멀티모달 AI
텍스트와 이미지·음성·영상을 함께 다루는 모델 분야의 검토 완료 백과 문서다.
ㄱ
- 개방형 어휘 객체 탐지개방형 어휘 객체 탐지는 학습 때 고정된 클래스 목록을 넘어 텍스트로 제시한 새로운 범주의 위치와 이름을 예측한다.
- 객체 탐지이미지나 영상에서 관심 객체의 종류와 위치를 경계 상자 같은 공간 좌표로 함께 예측하는 컴퓨터 비전 과제다.
- 공간 추론공간 추론은 객체의 위치, 방향, 거리, 포함과 이동 관계를 표현하고 보이지 않는 관계를 도출하는 능력이다.
- 공동 임베딩 공간공동 임베딩 공간은 서로 다른 모달리티의 의미적으로 대응하는 항목을 비교할 수 있도록 같은 벡터 공간에 배치한 표현 체계다.
- 광학 문자 인식이미지 속 글자의 위치와 내용을 판독해 텍스트로 변환하는 기술이다.
- 광학 흐름광학 흐름은 연속 영상 프레임 사이에서 각 화소가 이동한 방향과 크기를 추정한 벡터장이다.
- 교차 배열 멀티모달 데이터교차 배열 멀티모달 데이터는 한 문맥 안에서 텍스트와 이미지·영상·음성 등의 항목이 의미 순서에 따라 번갈아 나타나는 자료다.
- 교차모달 어텐션교차모달 어텐션은 한 모달리티의 표현을 질의로, 다른 모달리티의 표현을 키와 값으로 사용해 관련 정보를 선택하는 연산이다.
- 교차모달 정렬교차모달 정렬은 서로 다른 모달리티에서 같은 대상이나 의미를 나타내는 요소를 대응시키는 과정이다.
ㄷ
- 대조 언어-이미지 사전학습대조 언어-이미지 사전학습은 짝이 맞는 이미지와 텍스트 표현을 가깝게, 다른 짝을 멀게 만드는 대조 손실로 공동 표현을 학습한다.
- 독순술 인식독순술 인식은 화자의 입술과 얼굴 움직임만으로 발화 음소·단어·문장을 추정하는 시각 음성 인식 과제다.
- 딥페이크 탐지딥페이크 탐지는 합성·변조된 얼굴·음성·영상과 실제 기록을 구분하고 조작 근거를 찾는 분석 과제다.
ㅁ
- 멀티모달 대조 사전학습멀티모달 대조 사전학습은 짝을 이루는 서로 다른 모달리티 표현을 가깝게, 짝이 아닌 표현을 멀게 학습하는 방식이다.
- 멀티모달 모델텍스트·이미지·음성·영상 등 둘 이상의 데이터 양식을 함께 처리하는 모델이다.
- 멀티모달 생성멀티모달 생성은 텍스트·이미지·음성·영상 중 하나 이상의 입력을 조건으로 여러 양식의 새 콘텐츠를 만드는 작업이다.
- 멀티모달 융합멀티모달 융합은 둘 이상의 모달리티 표현을 결합해 단일 채널보다 풍부한 예측이나 생성을 수행하는 과정이다.
- 멀티모달 임베딩서로 다른 데이터 양식을 비교 가능한 하나의 벡터 공간에 배치한 표현이다.
- 멀티모달 지시 튜닝멀티모달 지시 튜닝은 이미지·음성 등과 자연어 지시 및 응답의 짝으로 모델을 조정해 대화형 과제를 수행하게 하는 과정이다.
- 멀티모달 탈옥 공격멀티모달 탈옥 공격은 텍스트 외 이미지·음성 등 입력 채널을 이용해 모델의 안전 정책이나 입력 검사를 우회하도록 유도하는 공격이다.
- 멀티모달 토크나이저멀티모달 토크나이저는 이미지·음성·영상 같은 연속 신호를 모델이 다룰 토큰 또는 토큰 유사 표현으로 변환하는 구성 요소다.
- 멀티모달 평가멀티모달 평가는 둘 이상의 입력·출력 양식을 사용하는 모델의 인식·정렬·추론·생성 품질을 함께 측정하는 평가 체계다.
- 멜 스펙트로그램멜 스펙트로그램은 음성 신호의 시간-주파수 에너지를 사람의 청각 해상도에 가까운 멜 주파수 축으로 변환한 표현이다.
- 모달리티모달리티는 텍스트, 이미지, 음성, 영상, 센서값처럼 정보를 표현하고 관측하는 자료 형식 또는 채널이다.
- 모달리티 격차모달리티 격차는 이미지, 텍스트, 음성과 같은 서로 다른 양식의 표현 분포와 의미 구조가 자연스럽게 일치하지 않는 현상이다.
- 모달리티 어댑터모달리티 어댑터는 특정 양식 인코더의 출력을 다른 모델이 소비할 수 있도록 연결하는 소규모 학습 모듈이다.
- 모달리티 투영모달리티 투영은 한 양식의 특징을 다른 양식이나 공통 표현 공간이 기대하는 차원과 분포로 변환하는 과정이다.
- 문서 레이아웃 분석문서 레이아웃 분석은 페이지의 텍스트 블록·제목·표·그림·여백을 탐지하고 읽기 순서와 계층을 추정하는 작업이다.
- 문서 시각 질의응답문서 시각 질의응답은 문서 페이지 이미지와 자연어 질문을 받아 배치와 텍스트를 함께 해석해 답을 찾는 과제다.
- 문서 이해문서 이해는 문서의 텍스트와 시각적 구조를 결합해 분류, 필드 추출, 관계 추론과 질의응답을 수행하는 작업이다.
- 문서 AI문서 AI는 스캔·PDF·이미지 문서에서 텍스트, 배치, 표와 의미 구조를 인식·추출·분류하는 AI 시스템 영역이다.
ㅂ
- 분류기 없는 가이던스분류기 없는 가이던스는 별도 분류기 없이 조건부와 무조건부 확산 예측의 차이를 이용해 조건 일치도를 조절하는 방법이다.
- 비디오 분류비디오 분류는 영상 전체 또는 구간을 미리 정한 사건·장면·행동 범주에 할당하는 과제다.
- 비디오 생성비디오 생성은 텍스트·이미지·동작 조건으로 시간적으로 일관된 새 프레임 시퀀스를 합성하는 생성 과제다.
- 비디오 이해비디오 이해는 연속 프레임과 소리의 객체·행동·사건·시간 관계를 해석하는 멀티모달 과제의 총칭이다.
- 비디오 질의응답비디오 질의응답은 영상과 자연어 질문을 함께 입력받아 시간적·공간적 근거를 바탕으로 답을 생성하거나 선택하는 과제다.
- 비디오 캡셔닝비디오 캡셔닝은 영상의 장면, 객체, 행동과 시간적 사건을 자연어 설명으로 생성하는 멀티모달 과제다.
- 비디오 토큰화비디오 토큰화는 연속적인 화소와 시간 정보를 모델이 처리할 이산 코드나 연속 토큰 시퀀스로 변환하는 과정이다.
- 비디오 확산비디오 확산은 잡음에서 시작해 시공간적으로 일관된 영상 표본을 반복 복원하는 생성 모형이다.
- 비전-언어 모델이미지와 텍스트의 관계를 학습해 이해와 생성을 수행하는 멀티모달 모델이다.
ㅅ
- 세계 시뮬레이션 모델세계 시뮬레이션 모델은 관찰과 행동을 조건으로 환경의 다음 상태나 가능한 미래 궤적을 생성하는 모델이다.
- 스펙트로그램스펙트로그램은 오디오 신호의 주파수 성분 세기가 시간에 따라 어떻게 변하는지를 2차원 배열로 나타낸 표현이다.
- 시각 근거화자연어 표현이 가리키는 이미지 영역이나 객체를 좌표, 상자 또는 마스크로 연결하는 과제다.
- 시각 문서 검색시각 문서 검색은 질의와 관련된 문서 페이지를 텍스트 내용뿐 아니라 배치·도형·시각 표현을 이용해 찾는 검색 방식이다.
- 시각 인코더시각 인코더는 픽셀이나 시각 특성을 신경망의 토큰 또는 특징 벡터로 변환하는 모델 구성 요소다.
- 시각 질의응답이미지와 그 이미지에 관한 자연어 질문을 입력받아 답을 생성하거나 선택하는 멀티모달 과제다.
- 시각 추론시각 추론은 이미지 속 객체, 속성, 관계와 사건을 조합해 직접 보이지 않는 답이나 결론을 도출하는 능력이다.
- 시각 환각시각 환각은 이미지나 영상에 존재하지 않거나 근거가 불충분한 객체·속성·관계를 멀티모달 모델이 사실처럼 생성하는 오류다.
- 시간 어텐션시간 어텐션은 비디오나 시계열에서 서로 다른 시점의 특징에 가중치를 부여해 장기·단기 관계를 결합하는 메커니즘이다.
- 시간적 모델링시간적 모델링은 순서·지속 시간·변화 속도·장기 의존성 같은 시간 축 구조를 표현하고 예측하는 방법이다.
- 신경 보코더신경 보코더는 스펙트로그램이나 음향 특징을 조건으로 시간 영역의 음성 파형을 생성하는 신경망 모델이다.
ㅇ
- 영역 제안 네트워크영역 제안 네트워크(RPN)는 특징 지도에서 객체가 있을 가능성이 높은 후보 상자와 객체성 점수를 생성하는 네트워크다.
- 오디오 모델오디오 모델은 시간에 따라 변하는 음향 신호에서 패턴을 학습해 인식, 생성, 분류나 변환을 수행하는 모델이다.
- 오디오 임베딩오디오 임베딩은 음향 구간의 내용이나 화자·환경 특성을 비교 가능한 고정 길이 벡터로 표현한 것이다.
- 오디오 캡셔닝오디오 캡셔닝은 환경음·음악·음성 등이 포함된 오디오의 내용을 자연어 문장으로 설명하는 과제다.
- 오디오 토큰오디오 토큰은 음성·음악 파형의 짧은 구간이나 압축 코드에 대응하는 연속 또는 이산 표현 단위다.
- 음성 번역음성 번역은 한 언어의 발화를 다른 언어의 텍스트 또는 음성으로 변환하는 과제다.
- 음성 언어 모델음성 언어 모델은 음성의 음향·언어 정보를 토큰 시퀀스로 학습해 인식·이해·생성 작업을 수행하는 모델이다.
- 음성 인식음성 신호를 텍스트나 언어 단위로 변환하는 기술이다.
- 음성 합성텍스트를 자연스러운 음성 파형으로 변환하는 기술이다.
- 음성 활동 탐지음성 활동 탐지는 오디오의 각 프레임이나 구간에 사람 음성이 존재하는지 판정하는 과제다.
- 음성-텍스트 변환음성-텍스트 변환은 음성 파형을 해당 발화의 문자나 단어 시퀀스로 변환하는 과제다.
- 이미지 검색이미지 검색은 질의 이미지나 텍스트와 관련된 이미지를 대규모 모음에서 순위화해 찾는 과제다.
- 이미지 분류입력 이미지 전체를 하나 이상의 사전 정의된 범주나 확률분포에 매핑하는 컴퓨터 비전 과제다.
- 이미지 분할이미지의 각 픽셀 또는 영역에 의미 있는 클래스나 객체 식별자를 할당하는 컴퓨터 비전 과제다.
- 이미지 생성텍스트나 다른 조건을 바탕으로 새로운 이미지를 합성하는 생성 과제다.
- 이미지 아웃페인팅이미지 아웃페인팅은 기존 이미지 경계 밖의 캔버스를 확장해 이어지는 장면을 생성하는 작업이다.
- 이미지 인페인팅이미지 인페인팅은 이미지의 지정된 마스크 영역을 주변 문맥과 조건에 맞게 새 내용으로 채우는 생성 작업이다.
- 이미지 임베딩이미지 임베딩은 이미지의 시각적 내용을 고정 길이 벡터로 압축해 유사도 비교나 다른 모델의 입력에 쓰는 표현이다.
- 이미지 캡셔닝이미지의 주요 내용과 관계를 자연어 문장으로 기술하는 시각-언어 생성 과제다.
- 이미지 토큰이미지 토큰은 이미지의 패치, 영역 또는 양자화 코드에 대응해 시퀀스 모델이 처리하는 표현 단위다.
- 이미지 패치이미지 패치는 원본 이미지를 일정 크기의 작은 영역으로 나눈 단위이며 비전 트랜스포머의 입력 토큰으로 자주 사용된다.
- 이미지-이미지 생성이미지-이미지 생성은 입력 이미지의 구조나 내용을 조건으로 새로운 스타일·속성·해상도의 이미지를 만드는 과제다.
ㅈ
- 잠재 확산 모델잠재 확산 모델은 픽셀 대신 학습된 저차원 잠재 공간에서 노이즈 제거 확산 과정을 수행하는 생성 모델이다.
- 장면 문자 인식장면 문자 인식은 자연 이미지 속 간판·상품·화면처럼 기울고 왜곡된 텍스트를 찾아 읽는 작업이다.
- 장시간 비디오 이해장시간 비디오 이해는 수분에서 수시간에 걸친 영상의 사건, 인물, 원인과 장거리 시간 관계를 파악하는 과제다.
- 점수 기반 생성 모델점수 기반 생성 모델은 데이터 분포의 로그밀도 기울기인 점수 함수를 학습해 노이즈에서 표본을 생성하는 모델이다.
- 제로샷 이미지 분류제로샷 이미지 분류는 목표 클래스의 학습 이미지 없이 클래스 이름이나 설명과 이미지 표현의 유사도로 분류하는 방법이다.
ㅊ
- 초기 융합초기 융합은 모달리티별 원시 또는 저수준 특징을 모델 처리의 앞부분에서 결합하는 멀티모달 설계다.
ㅋ
ㅌ
- 텍스트-비디오 생성텍스트-비디오 생성은 자연어 설명을 조건으로 시간적으로 일관된 영상 프레임 시퀀스를 합성하는 과제다.
- 텍스트-오디오 모델텍스트-오디오 모델은 자연어 설명과 오디오 신호를 공동 표현하거나 텍스트 조건으로 소리를 생성하는 멀티모달 모델이다.
- 텍스트-오디오 생성텍스트-오디오 생성은 자연어 설명을 조건으로 음향 효과, 음악이나 일반 소리를 합성하는 과제다.
- 텍스트-이미지 생성텍스트-이미지 생성은 자연어 설명을 조건으로 그 의미와 시각적 속성에 맞는 이미지를 합성하는 과제다.
- 특성 피라미드 네트워크특성 피라미드 네트워크(FPN)는 서로 다른 해상도의 신경망 특징을 상향식·하향식 경로와 측면 연결로 결합하는 구조다.
ㅍ
ㅎ
- 행동 인식행동 인식은 비디오에서 사람이나 객체가 수행하는 동작을 시간 구간과 범주로 식별하는 과제다.
- 화자 분리화자 분리는 녹음에서 누가 언제 말했는지를 구간별 화자 식별자로 나누는 과제다.
- 화자 인식화자 인식은 음성 신호의 발화 내용과 무관한 화자 특성을 이용해 신원을 확인하거나 분류하는 과제다.
- 확산 모델데이터에 노이즈를 더하고 제거하는 역과정을 학습해 샘플을 생성하는 모델이다.
- 확산 스케줄러확산 스케줄러는 확산 모델에서 시간 단계별 노이즈 크기와 역과정 업데이트 규칙을 정하는 구성 요소다.
- 확산 잡음 제거 단계확산 잡음 제거 단계는 현재의 noisy 잠재 표현과 모델 예측으로 더 깨끗한 이전 시간 단계의 표현을 계산하는 한 번의 역과정 갱신이다.
- 후기 융합후기 융합은 각 모달리티를 독립 모델로 처리한 뒤 예측 점수나 고수준 표현을 마지막 단계에서 결합하는 설계다.
C
- ControlNetControlNet은 사전학습 텍스트-이미지 확산 모델에 윤곽, 깊이, 자세 같은 공간 조건을 추가하면서 원본 모델을 보존하는 제어 구조다.
P
- PDF 파싱PDF 파싱은 PDF 객체·글꼴·그림·텍스트 위치와 페이지 구조를 읽어 검색·분석 가능한 표현으로 변환하는 과정이다.
- Perceiver 리샘플러Perceiver 리샘플러는 가변 길이 멀티모달 특징을 고정 수의 잠재 벡터로 압축하는 교차 어텐션 모듈이다.
Q
- Q-FormerQ-Former는 학습 가능한 질의 토큰으로 시각 인코더의 특징을 선택·압축해 언어 모델에 전달하는 경량 트랜스포머 구성이다.
