콘텐츠로 이동

트랜스포머와 모델 구조

현대 언어 모델을 이루는 핵심 아키텍처 분야의 검토 완료 백과 문서다.

  • 가산 어텐션가산 어텐션은 질의와 키를 별도 선형 변환한 뒤 비선형 함수와 점수 벡터로 정렬 점수를 계산하는 어텐션 방식이다.
  • 검색 결합 트랜스포머검색 결합 트랜스포머는 외부 코퍼스에서 찾은 이웃 문맥을 모델 계산에 통합해 매개변수 밖의 정보를 사용하는 구조다.
  • 계층형 트랜스포머계층형 트랜스포머는 토큰, 문장, 문서처럼 서로 다른 해상도의 표현을 단계적으로 계산하고 결합하는 구조다.
  • 그래프 트랜스포머그래프 트랜스포머는 노드와 간선 구조를 어텐션에 반영해 그래프 데이터를 처리하는 트랜스포머 계열 모델이다.
  • 그룹 쿼리 어텐션그룹 쿼리 어텐션은 여러 질의 헤드를 그룹으로 나누고 그룹마다 하나의 키·값 헤드를 공유하는 구조다.
  • 글로벌 어텐션글로벌 어텐션은 선택된 토큰이 시퀀스 전체와 상호작용하거나 모든 토큰이 전역 위치를 볼 수 있게 하는 연결 방식이다.
  • 길이 외삽길이 외삽은 모델이 학습에서 본 시퀀스 길이를 넘어선 입력에서도 규칙과 성능을 유지하는 능력이다.
  • 깊이 혼합깊이 혼합은 각 트랜스포머 층에서 일부 토큰만 계산 블록을 통과시키고 나머지는 우회시켜 토큰별 계산 깊이를 달리하는 조건부 계산 기법이다.

  • 닷프로덕트 어텐션닷프로덕트 어텐션은 질의와 키의 내적을 호환도 점수로 사용하고 정규화한 가중치로 값을 결합한다.
  • 디코더이전 출력과 문맥을 이용해 다음 출력을 순차적으로 생성하는 구성 요소다.
  • 디코더 전용 모델인과적 어텐션을 사용하는 디코더 블록만으로 다음 토큰을 생성하는 모델이다.

  • 레이어 드로핑층 드롭은 학습 중 일부 트랜스포머 층을 확률적으로 건너뛰거나 추론 전에 제거해 깊이에 강건한 모델을 만드는 기법이다.
  • 레이어 정규화한 샘플 내부 특성의 분포를 정규화해 학습과 추론을 안정화하는 연산이다.
  • 로컬 어텐션로컬 어텐션은 각 토큰이 주변의 제한된 창이나 이웃 위치에만 주의를 주도록 연결 범위를 줄인 방식이다.

  • 멀티모달 트랜스포머멀티모달 트랜스포머는 텍스트·이미지·음성 등 서로 다른 양식의 토큰을 어텐션으로 결합해 공동 표현이나 출력을 만드는 모델이다.
  • 멀티쿼리 어텐션멀티쿼리 어텐션은 여러 질의 헤드가 하나의 키·값 헤드 쌍을 공유해 추론 시 KV 캐시 크기와 메모리 대역폭을 줄인다.
  • 멀티헤드 어텐션여러 어텐션 헤드가 서로 다른 관계를 병렬로 학습하도록 구성한 연산이다.
  • 메모리 증강 트랜스포머메모리 증강 트랜스포머는 현재 입력 밖의 과거 상태나 외부 기억 슬롯을 읽고 쓰도록 확장된 트랜스포머 계열이다.
  • 메모리 효율적 어텐션메모리 효율적 어텐션은 전체 어텐션 행렬을 메모리에 물질화하지 않고 동일하거나 근사한 출력을 계산하는 방법군이다.
  • 문맥 길이 확장문맥 길이 확장은 모델이 학습 때 사용한 범위보다 더 긴 입력을 안정적으로 처리하도록 위치 표현과 학습·추론 설정을 조정하는 과정이다.

  • 블록 희소 어텐션블록 희소 어텐션은 어텐션 행렬을 블록 단위로 제한해 일부 질의-키 블록만 계산하는 희소 방식이다.
  • 비전 트랜스포머비전 트랜스포머는 이미지를 고정 크기 패치 토큰 시퀀스로 바꾸어 트랜스포머 인코더로 처리하는 시각 모델이다.

  • 사인파 위치 인코딩사인파 위치 인코딩은 서로 다른 주파수의 사인·코사인 함숫값으로 토큰 위치를 나타내는 고정 벡터 방식이다.
  • 상대 위치 인코딩상대 위치 인코딩은 두 토큰의 절대 인덱스 대신 서로 떨어진 거리와 방향을 어텐션 계산에 반영하는 방식이다.
  • 상태 공간-트랜스포머 하이브리드상태 공간-트랜스포머 하이브리드는 선형 상태공간 시퀀스 층과 어텐션 층을 한 모델에서 결합한 구조다.
  • 선형 어텐션선형 어텐션은 커널 변환이나 연산 순서 변경으로 시퀀스 길이에 대한 어텐션 계산을 선형에 가깝게 줄이는 방법군이다.
  • 세그먼트 임베딩세그먼트 임베딩은 한 입력 안에서 문장 쌍이나 문서 구간처럼 서로 다른 부분의 소속을 나타내는 학습 벡터다.
  • 셀프 어텐션하나의 시퀀스 안에서 각 위치가 다른 위치의 정보를 참조하는 어텐션이다.
  • 순환 메모리 트랜스포머순환 메모리 트랜스포머는 긴 입력을 구간별로 처리하면서 학습 가능한 메모리 토큰을 다음 구간에 반복 전달하는 구조다.
  • 스위치 트랜스포머Switch Transformer는 각 토큰을 여러 전문가 중 하나에 보내는 희소 혼합전문가 피드포워드 층을 사용한 트랜스포머다.
  • 스케일드 닷프로덕트 어텐션스케일드 닷프로덕트 어텐션은 질의와 키의 내적을 키 차원의 제곱근으로 나눈 뒤 소프트맥스를 적용해 값의 가중합을 구한다.
  • 슬라이딩 윈도 어텐션슬라이딩 윈도 어텐션은 각 위치가 일정한 앞뒤 또는 이전 토큰 창에만 주의를 주도록 창을 이동시키는 희소 패턴이다.
  • 시퀀스-투-시퀀스 트랜스포머시퀀스-투-시퀀스 트랜스포머는 인코더가 입력 시퀀스를 표현하고 디코더가 이를 참조해 출력 시퀀스를 자동회귀 생성하는 구조다.

  • 양방향 어텐션양방향 어텐션은 각 토큰이 시퀀스의 앞과 뒤 모든 허용 위치를 함께 참고하도록 하는 어텐션 패턴이다.
  • 어텐션현재 표현을 만들 때 입력의 각 부분에 서로 다른 중요도를 부여해 정보를 결합하는 연산이다.
  • 어텐션 계산 복잡도어텐션 계산 복잡도는 시퀀스 길이, 헤드 차원과 배치 크기에 따라 어텐션이 요구하는 연산과 메모리의 증가율이다.
  • 어텐션 마스크어텐션 마스크는 각 질의 위치가 참조할 수 있는 키 위치를 허용·차단하는 행렬 또는 규칙이다.
  • 어텐션 싱크어텐션 싱크는 특별한 의미가 크지 않은 초기 토큰이 여러 후속 토큰의 높은 어텐션을 지속적으로 받는 현상이다.
  • 어텐션 점수어텐션 점수는 질의와 키가 얼마나 관련 있는지를 정규화 전에 나타내는 스칼라 호환도 값이다.
  • 어텐션 행렬어텐션 행렬은 모든 질의 위치와 키 위치 사이의 어텐션 가중치를 행렬로 모은 표현이다.
  • 어텐션 헤드어텐션 헤드는 독립적인 질의·키·값 투영을 사용해 하나의 관계 패턴을 학습하는 다중 헤드 어텐션의 단위다.
  • 어텐션 헤드 가지치기어텐션 헤드 가지치기는 중요도가 낮은 멀티헤드 어텐션 헤드를 제거해 모델 계산과 크기를 줄이는 압축 기법이다.
  • 언어 모델링 헤드언어 모델링 헤드는 은닉 상태에서 각 어휘 토큰의 조건부 점수를 계산하는 언어 모델의 출력 모듈이다.
  • 위치 보간위치 보간은 사전학습 때보다 긴 문맥을 처리하도록 새 위치 범위를 기존 위치 범위 안으로 압축해 매핑하는 확장 기법이다.
  • 위치 인코딩어텐션 모델에 토큰의 순서와 상대 위치 정보를 주입하는 표현이다.
  • 위치 ID위치 ID는 시퀀스 안 각 토큰에 위치 인코딩이나 회전 각도를 할당하기 위한 정수 인덱스다.
  • 유니버설 트랜스포머유니버설 트랜스포머는 깊이 방향에서 같은 전환 블록을 반복 적용해 위치별 표현을 점진적으로 갱신하는 순환적 트랜스포머다.
  • 융합 트랜스포머 커널융합 트랜스포머 커널은 연속된 여러 텐서 연산을 하나의 가속기 커널로 합쳐 메모리 이동과 실행 오버헤드를 줄인 구현이다.
  • 인과 마스크현재 위치가 미래 토큰을 참조하지 못하게 어텐션 점수를 제한하는 마스크다.
  • 인코더입력 시퀀스를 문맥이 반영된 내부 표현으로 변환하는 구성 요소다.
  • 인코더 전용 트랜스포머인코더 전용 트랜스포머는 입력 전체의 양방향 문맥을 표현하도록 인코더 블록만 쌓은 구조다.
  • 인코더-디코더입력을 인코딩한 뒤 별도의 디코더가 출력을 생성하는 모델 구조다.
  • 인코더-디코더 어텐션인코더-디코더 어텐션은 디코더의 질의가 인코더 출력의 키와 값을 참고해 입력 정보를 가져오는 교차 어텐션이다.

  • 잔차 연결블록의 입력을 출력에 더해 깊은 신경망의 학습을 안정화하는 연결이다.
  • 장문맥 트랜스포머장문맥 트랜스포머는 일반적인 문맥 창보다 훨씬 긴 시퀀스를 처리하도록 어텐션, 위치 표현과 메모리를 설계한 모델이다.
  • 저랭크 어텐션저랭크 어텐션은 키·값이나 어텐션 행렬이 더 낮은 차원 구조로 근사될 수 있다는 가정을 이용해 계산량을 줄이는 방법이다.
  • 적응형 계산 시간 트랜스포머적응형 계산 시간 트랜스포머는 입력 위치나 예제별로 필요한 반복 계산 단계 수를 동적으로 결정하는 구조다.
  • 절대 위치 인코딩절대 위치 인코딩은 각 토큰의 시퀀스 내 고유 위치를 나타내는 벡터를 내용 표현에 더하거나 결합하는 방식이다.
  • 정규화 배치정규화 배치는 트랜스포머 하위 계층의 앞이나 뒤 어느 위치에 정규화 연산을 둘지 정하는 구조 선택이다.
  • 조기 종료 트랜스포머조기 종료 트랜스포머는 중간 층에 예측 헤드를 두고 충분히 확신하는 입력을 마지막 층 전에 반환하는 적응형 추론 구조다.

  • 청크 어텐션청크 어텐션은 긴 시퀀스를 여러 구간으로 나누어 구간 내부 또는 제한된 이웃 구간 사이에서 어텐션을 계산하는 방식이다.
  • 추측형 트랜스포머 블록추측형 트랜스포머 블록은 여러 미래 토큰이나 중간 블록 출력을 병렬로 제안한 뒤 원래 모델이 검증해 순차 계산을 줄이는 구조다.
  • 출력 투영출력 투영은 트랜스포머 은닉 표현을 어휘 로짓이나 과제별 출력 차원으로 선형 변환하는 계층이다.

  • 커널화 어텐션커널화 어텐션은 소프트맥스 유사도를 특징 맵의 내적으로 표현하거나 근사해 어텐션 계산 순서를 바꾸는 방법이다.
  • 쿼리·키·값어텐션에서 무엇을 찾을지 나타내는 쿼리와 비교 기준인 키, 선택된 정보를 전달하는 값으로 입력 표현을 투영한 세 집합이다.
  • 크로스 어텐션한 표현의 질의가 다른 표현에서 만든 키와 값을 조회해 두 입력 사이의 관련 정보를 결합하는 어텐션이다.
  • 키·값 압축키·값 압축은 어텐션의 KV 캐시를 더 적은 토큰, 헤드, 차원이나 비트로 표현해 메모리와 대역폭을 줄이는 기법이다.
  • 키·값 투영키·값 투영은 트랜스포머 입력 표현을 어텐션의 검색 주소 역할인 키와 전달 내용 역할인 값 벡터로 변환하는 선형 연산이다.

  • 토큰 임베딩층토큰 임베딩층은 이산 토큰 식별자를 학습 가능한 연속 벡터로 변환하는 트랜스포머 입력 계층이다.
  • 트랜스포머어텐션을 중심으로 시퀀스의 관계를 병렬 계산하는 신경망 아키텍처다.
  • 트랜스포머 블록트랜스포머 블록은 어텐션·피드포워드·정규화·잔차 연결을 반복 가능한 단위로 묶은 핵심 계층이다.

  • 패딩 마스크패딩 마스크는 길이가 다른 시퀀스를 한 배치로 맞추기 위해 추가한 패딩 위치가 어텐션과 손실에 영향을 주지 않게 하는 마스크다.
  • 페이지드 어텐션페이지드 어텐션은 요청별 KV 캐시를 고정 크기 블록으로 나눠 비연속 메모리에 배치하고 페이지 표로 참조하는 서빙 기법이다.
  • 포스트 정규화포스트 정규화는 트랜스포머 하위층 출력과 잔차를 먼저 더한 뒤 층 정규화를 적용하는 배치다.
  • 프리 정규화프리 정규화는 트랜스포머 하위층에 입력하기 전에 층 정규화를 적용하고 그 결과를 잔차 경로와 결합하는 배치다.
  • 프리픽스 언어 모델프리픽스 언어 모델은 지정된 접두 구간에서는 양방향 문맥을 허용하고 생성 구간에서는 이전 위치만 참조하게 하는 언어 모델이다.
  • 플래시 어텐션플래시 어텐션은 정확한 어텐션 결과를 유지하면서 GPU 고대역폭 메모리 왕복을 줄이는 IO 인식 알고리즘이다.
  • 피드포워드 네트워크각 토큰 위치에 독립적으로 적용되는 비선형 완전연결 변환 블록이다.

  • 학습형 위치 임베딩학습형 위치 임베딩은 각 시퀀스 위치에 대응하는 벡터를 모델 파라미터로 두고 데이터에서 학습하는 방식이다.
  • 확산 트랜스포머확산 트랜스포머는 잡음이 섞인 잠재 표현이나 데이터를 반복적으로 복원하는 확산 모델의 잡음 예측기를 트랜스포머로 구현한 구조다.
  • 회전 위치 임베딩회전 위치 임베딩은 위치에 따른 회전 변환을 질의와 키 벡터의 차원 쌍에 적용해 상대 위치가 내적에 나타나게 하는 방식이다.
  • 희소 어텐션희소 어텐션은 전체 토큰 쌍 중 일부 연결만 계산하도록 고정·학습 패턴을 적용한 어텐션 계열이다.
  • 희소 트랜스포머희소 트랜스포머는 모든 토큰 쌍 대신 미리 정한 일부 위치 쌍에만 어텐션을 계산해 긴 시퀀스의 비용을 줄이는 구조다.

A

  • ALiBi 위치 편향ALiBi 위치 편향은 학습된 위치 임베딩 없이 토큰 거리에 비례하는 선형 음의 편향을 어텐션 점수에 더하는 방식이다.

B

  • BART 아키텍처BART 아키텍처는 양방향 인코더와 왼쪽에서 오른쪽으로 생성하는 디코더를 결합한 잡음 제거 시퀀스-투-시퀀스 모델이다.
  • BERT 아키텍처BERT 아키텍처는 양방향 자기어텐션 인코더를 쌓아 문맥에 따른 토큰 표현을 학습하는 트랜스포머 구조다.
  • BigBirdBigBird는 국소·무작위·전역 연결을 조합한 블록 희소 어텐션으로 긴 시퀀스의 계산량을 줄이는 트랜스포머다.

C

  • Conformer 아키텍처Conformer는 음성의 국소 패턴과 장거리 의존성을 함께 모델링하도록 합성곱과 트랜스포머 블록을 결합한 인코더 구조다.

G

  • GEGLUGEGLU는 GELU로 활성화한 선형 분기와 다른 선형 분기를 원소별로 곱하는 게이트 선형 유닛 변형이다.
  • GPT 아키텍처GPT 아키텍처는 이전 토큰만 볼 수 있는 인과 마스크를 사용해 다음 토큰을 예측하는 디코더 전용 트랜스포머 구조다.

L

  • LongformerLongformer는 각 토큰의 국소 슬라이딩 창 어텐션과 일부 토큰의 전역 어텐션을 결합해 긴 문서를 처리하는 트랜스포머다.

N

  • NTK 인식 스케일링NTK 인식 스케일링은 RoPE의 주파수 기반을 조정해 긴 위치에서의 변화율을 완화하고 문맥 범위를 늘리는 기법군이다.

P

  • PerformerPerformer는 소프트맥스 어텐션을 무작위 특징 기반 커널로 근사해 시퀀스 길이에 선형인 계산을 목표로 하는 트랜스포머 변형이다.

R

  • ReformerReformer는 국소민감해시 어텐션과 가역 잔차 층을 사용해 긴 시퀀스의 메모리와 계산 비용을 줄인 트랜스포머 변형이다.
  • RMS 정규화RMS 정규화는 평균을 빼지 않고 특징 값의 제곱평균제곱근으로 크기를 조정하는 정규화 방법이다.

S

  • SwiGLUSwiGLU는 SiLU로 활성화한 선형 분기와 다른 선형 분기를 원소별로 곱하는 게이트 순방향층 함수다.

T

  • T5 아키텍처T5 아키텍처는 모든 자연어 처리 과제를 텍스트 입력에서 텍스트 출력으로 표현하는 인코더-디코더 트랜스포머다.
  • Transformer-XLTransformer-XL은 이전 구간의 은닉 상태를 다음 구간에서 재사용해 고정 길이 문맥을 넘어선 의존성을 모델링하는 트랜스포머다.

X

  • XLNet 아키텍처XLNet 아키텍처는 토큰 위치의 여러 순열에 대해 자동회귀 예측을 수행해 양방향 문맥을 학습하는 트랜스포머 구조다.

Y

  • YaRN 스케일링YaRN 스케일링은 RoPE 주파수 보간과 주의 로짓 크기 보정을 결합해 긴 문맥으로 효율적으로 확장하는 방법이다.