한국어·다국어 AI
한글 표현과 한국어 형태·화용 처리에서 교차언어 전이, 개인정보, 코드 스위칭과 한국어 벤치마크까지 연결한 전문 학습 과정이다.
대상: 한국어와 다국어 AI의 데이터·토큰화·평가·안전성을 설계하고 검증하려는 개발자와 연구자
난이도: 전문
권장 선수 코스: LLM 내부 구조 · 모델 학습과 튜닝
권장 문서 순서
섹션 제목: “권장 문서 순서”- 언어 모델
- 대규모 언어 모델
- 토큰화
- 토크나이저
- 문자 단위 토큰화
- 바이트 단위 토큰화
- 바이트 페어 인코딩
- 유니그램 언어 모델 토크나이저
- 한글 유니코드 정규화
- 문장 분할
- 한국어 문장 분할
- 한국어 띄어쓰기 변이
- 한국어 형태소 분석
- 한국어 토큰화
- 학습 말뭉치
- 마스크 언어 모델
- 다국어 언어 모델
- 다국어 능력
- 교차언어 임베딩
- 전이학습
- 교차언어 전이
- 한국어 언어 식별
- 다국어 토큰 분절률
- 한국어 높임말과 화행
- 한국어 개체명 인식
- 개인 식별 정보
- 한국어 개인정보 탐지
- 한국어·영어 코드 스위칭
- 한국어 출력 언어 정렬
- 한국어 방언 강건성
- 벤치마크
- 벤치마크 오염
- 다국어 평가 프로토콜
- KLUE
- KorQuAD
- KMMLU
- Ko-H5 벤치마크
