openai/whisper-large-v3
멀티링구얼 Whisper 대형 체크포인트(1.55B)로 다수 언어의 인식과 번역을 지원
학습 방식 · 학습 방식은 대규모 약감독(weak supervision)과 의사 라벨링 기반의 혼합 데이터 학습으로, 1백만 시간의 약한 라벨과 4백만 시간의 Whisper large-v2 기반 의사 라벨을 결합해 학습을 수행했습니다. 해당 혼합 데이터셋에 대해 전체적으로 2.0 에폭만큼 학습이 이뤄졌고, 의사 라벨링 단계에서 기존 체크포인트를 활용해 데이터 확장을 진행한 것이 핵심입니다. 대규모의 노이즈가 섞인 데이터로 학습했기 때문에 범용성은 높아졌지만 약한 감독 특유의 생성적 편향(hallucination) 가능성도 동반됩니다.
TL;DR
Whisper large-v3는 1,550M 파라미터의 멀티링구얼 사전학습 Transformer encoder-decoder ASR 체크포인트로, 1백만 시간의 약한 레이블과 4백만 시간의 의사 라벨을 혼합해 학습하여 다언어 제로샷 일반화 성능을 끌어올린 모델입니다. 입력은 128 Mel 빈 스펙트로그램으로 처리되며 자동 언어 검출, transcription·translate 작업 전환, 문장·단어 타임스탬프 반환 같은 유연한 출력 제어를 제공합니다. 대규모 노이즈 데이터 사용으로 일부 언어에서 홀루시네이션과 불균형한 성능이 발생할 수 있으나 Transformers 파이프라인, chunked/ sequential 장기 처리, torch.compile 및 Flash Attention 2 같은 최적화로 실사용 성능과 처리량을 개선할 수 있습니다.
핵심 포인트
- 모델 구조와 규모에 관해 Whisper large-v3는 Transformer 기반 encoder-decoder 아키텍처를 사용하며 대형(multilingual large) 체크포인트로 1,550M 파라미터를 갖고 있습니다. 멀티링구얼 학습 설정에서 음성 인식과 영어 번역(translate)을 동시에 수행할 수 있고, 문장·단어 단위 타임스탬프를 반환하도록 구성할 수 있습니다. 스펙트로그램 입력은 128 Mel 빈을 사용하도록 변경되어 이전 버전과의 입력 전처리 차이를 명확히 합니다.
- 학습 데이터와 개선점에 대해 large-v3는 1백만 시간의 약한 레이블(weakly labeled) 오디오와 Whisper large-v2로 생성한 4백만 시간의 의사 라벨(pseudo-labeled) 오디오를 혼합한 데이터로 학습되었으며, 이 혼합 데이터셋에 대해 2.0 에폭만큼 학습이 진행되었습니다. 이렇게 대규모의 약 supervision 데이터 활용으로 다수 언어와 도메인에 대한 제로샷 일반화 능력이 강화되었고, OpenAI 측 평가는 large-v2 대비 오류율이 10%~20% 감소했다고 보고하고 있습니다. 또한 Cantonese용 언어 토큰 추가와 Mel bin 확장(80→128) 같은 세부 변경이 모델 성능 향상에 기여한 요소로 표기되어 있습니다.
- 실사용·디코딩 기능 측면에서는 Transformers pipeline으로 쉽게 호출할 수 있으며 temperature fallback, condition_on_prev_tokens, compression_ratio_threshold, logprob_threshold, no_speech_threshold 같은 Whisper 고유의 디코딩 히어리스틱을 모두 사용할 수 있습니다. 타임스탬프 반환, 언어 고정 인자 전달, transcription과 translate 작업 전환 등 유연한 입출력 제어가 가능하고, 배치 기반 병렬 처리로 다중 파일 동시 추론이 지원됩니다. 모델 로딩 시 low_cpu_mem_usage나 safetensors 옵션을 권장하며, generate/generation_config를 통해 토큰 생성 행태를 세밀하게 조정할 수 있습니다.
- 배포와 성능 최적화 측면에서는 긴 오디오 처리 알고리즘(Sequential vs Chunked) 선택지와 함께 chunk_length_s=30s, batching 옵션 추천이 제공됩니다. PyTorch의 torch.compile을 사용하면 정적 캐시와 함께 모델 포워드의 속도를 대폭 개선할 수 있으며(공식 예제에서 4.5배 가속 사례 언급), GPU가 지원하면 Flash Attention 2를, 그렇지 않으면 PyTorch SDPA 구현을 권장하고 있습니다. 이들 최적화는 VRAM 요구량과 추론 지연을 낮추어 실제 서비스 환경에서 처리량을 높이는 실무적 이점을 제공합니다.
제한사항
- 약한 감독과 의사 라벨링을 대규모로 사용한 학습 방식 때문에 출력 텍스트에 음성에서 실제로 발화되지 않은 정보가 포함될 위험(홀루시네이션)이 존재합니다. README에서는 모델이 언어 지식과 음성 예측을 동시에 추론하면서 발화와 무관한 문구를 생성할 수 있음을 지적하고 있으며, 이러한 현상은 특히 저자원 언어에서 더 두드러질 수 있다고 명시되어 있습니다. 따라서 민감한 결정에 사용하는 고위험 도메인에서는 사전 검증과 보정 작업이 필요합니다.
- 언어별·악센트별 성능 불균형이 보고되어 있고, 저자원 언어나 발견 가능성이 낮은 언어에서는 정확도가 낮을 수 있습니다. 또한 발화자 인구통계(성별·연령·인종 등)에 따른 WER 차이가 있을 수 있다고 명기되어 있어 공정성·배포 전 평가가 요구됩니다. 이와 함께 sequence-to-sequence 특성상 반복 생성 경향이 발생할 수 있으며 beam search와 온도 스케줄링으로 일부 완화가 가능하지만 완전한 해결책은 아닙니다.
- 실시간(real-time) 전용 모델로 설계된 것은 아니어서 크기와 연산량 때문에 즉시 실시간 전사에 쓰기에는 제약이 존재합니다. README에서는 near-real-time 응용을 구축할 수는 있지만 기본 상태로는 실시간 동작을 보장하지 않는다고 밝히고 있으며, 실제 서비스 구축 시엔 chunked 처리·배치·컴파일·Flash Attention 같은 최적화 조합이 필요합니다. 감독·윤리적 고려사항으로는 동의 없는 녹음 전사나 고위험 분류 작업에의 사용을 경계하도록 권고하고 있습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Error reduction vs Whisper large-v2 | error reduction (WER 기반) | 10%–20% 오류율 감소 | vs openai/whisper-large-v2 |
6.1k
Likes
5.5M
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.