AI 시스템·하드웨어·서빙
AI 가속기와 메모리 계층에서 컴파일·양자화·KV 캐시·배칭·서빙 운영까지 연결한 전문 과정이다.
대상: 모델 추론 인프라의 성능·용량·신뢰성을 설계하려는 엔지니어
난이도: 전문
권장 선수 코스: LLM 내부 구조 · AI API 개발
권장 문서 순서
섹션 제목: “권장 문서 순서”- 추론
- AI 가속기
- 그래픽 처리 장치
- 텐서 처리 장치
- 신경망 처리 장치
- 고대역폭 메모리
- 가속기 메모리 계층
- 가속기 메모리
- 메모리 대역폭
- 가속기 인터커넥트
- NVLink
- InfiniBand
- CUDA
- ROCm
- 컴퓨트 클러스터
- AI 데이터센터
- 루프라인 모델
- 연산 집약 작업
- 메모리 집약 작업
- 그래프 컴파일
- 사전 컴파일
- 연산자 융합
- 커널 융합
- XLA 컴파일러
- ONNX Runtime
- TensorRT-LLM
- CPU 추론
- GPU 추론
- TPU 추론
- NPU 추론
- 양자화
- 학습 후 양자화
- 가중치 전용 양자화
- 활성값 양자화
- INT8 추론
- INT4 추론
- FP8 추론
- KV 캐시
- 프리필 단계
- 디코드 단계
- 연속 배칭
- 요청 스케줄러
- 첫 토큰 시간
- 스트리밍 생성
- 서비스 수준 목표
- 추론 꼬리 지연 디버깅
- 모델 복제본
- 다중 모델 서빙
- 모델 게이트웨이
- 엣지 추론
