멀티헤드 아키텍처
하나의 공통 인코더 뒤에 여러 개의 출력 헤드를 둬 서로 다른 분류 작업을 병렬로 수행하는 구조로서 입력 토큰을 공통 표현으로 인코딩한 뒤 각 헤드가 전용 분류기를 통해 태스크별 예측을 생성한다. 이 구조는 인코더 연산을 공유해 처리 비용을 줄이면서 태스크 간 표현 공유를 촉진하나 헤드 간 경쟁으로 미세조정 섬세함이 요구된다.