본문으로 건너뛰기

TranslateGemma: Gemma 3 기반의 새로운 오픈 소스 번역 모델 제품군

구글이 Gemma 3를 기반으로 개발한 오픈 소스 번역 모델 TranslateGemma를 출시했으며, 4B, 12B, 27B 세 가지 크기로 제공되어 모바일에서 서버까지 다양한 환경에서 고성능 번역을 지원한다.

챕터별 상세

00:00

TranslateGemma 소개 및 주요 특징

구글이 Gemma 3 아키텍처를 기반으로 설계한 오픈 번역 모델인 TranslateGemma를 출시했다. 이 모델은 4B, 12B, 27B 세 가지 파라미터 크기로 제공되어 다양한 하드웨어 환경에 대응한다. 55개 주요 언어 쌍에 대해 엄격한 훈련과 평가를 거쳤으며, 추가로 500개 이상의 언어 데이터를 포함하여 연구자들이 특정 언어 쌍에 대해 파인튜닝할 수 있는 강력한 기반을 제공한다.
00:45

성능 벤치마크 및 훈련 방법론

TranslateGemma 12B 모델은 파라미터 수가 두 배인 Gemma 3 27B 베이스라인 모델보다 우수한 번역 품질을 기록했다. 이러한 효율성은 Gemini 모델의 지식을 증류(Distillation)하는 2단계 훈련 프로세스를 통해 달성되었다. 첫 단계는 인간과 Gemini가 생성한 고품질 데이터를 활용한 지도 미세 조정(SFT)이며, 두 번째 단계는 더 자연스러운 문장 출력을 위한 강화 학습(RL) 과정이다.
01:38

멀티모달 기능 및 배포 환경 최적화

이 모델은 텍스트뿐만 아니라 이미지 입력을 처리할 수 있는 멀티모달 기능을 기본적으로 내장하고 있다. 별도의 멀티모달 전용 훈련 없이도 이미지 내의 텍스트를 인식하고 번역하는 능력을 보여준다. 배포 측면에서 4B 모델은 모바일 및 에지 기기에 최적화되었고, 12B는 일반 소비자용 노트북에서 원활하게 실행되며, 27B는 고성능 GPU 환경에서 최대의 정확도를 제공하도록 설계되었다.
02:15

Kaggle을 활용한 실전 추론 데모

Kaggle의 무료 GPU 환경에서 TranslateGemma 4B 모델을 로드하고 실행하는 과정을 시연했다. Hugging Face의 Transformers 라이브러리와 pipeline 기능을 활용하여 모델을 설정했으며, 타밀어(Tamil) 문장을 영어로 번역하는 테스트를 수행했다. 결과적으로 모델은 단순한 단어 치환을 넘어 문맥과 뉘앙스를 정확히 파악하여 매우 자연스러운 영어 문장을 생성했다.
python
from transformers import pipeline
import torch
import kagglehub

model_path = "/kaggle/input/translategemma/transformers/translategemma-4b-it/1"

pipe = pipeline(
    "image-text-to-text",
    model=model_path,
    device="cuda",
    dtype=torch.bfloat16
)

Hugging Face Transformers의 pipeline을 사용하여 TranslateGemma 모델을 로드하고 GPU 추론 환경을 설정하는 코드이다.

python
messages = [
    {
        "role": "user",
        "content": [
            {
                "type": "text",
                "source_lang_code": "ta",
                "target_lang_code": "en",
                "text": "வா வாத்தியார் விமர்சனம்: கார்த்தி - நலன் குமாரசாமி காம்போ கலக்கலா, சறுக்கலா?"
            }
        ]
    }
]

output = pipe(text=messages, max_new_tokens=200)

소스 언어(타밀어)와 타겟 언어(영어) 코드를 지정하여 텍스트 번역 요청을 수행하는 페이로드 구성 예시이다.

06:12

이미지 번역 테스트 및 한계점 분석

이미지 URL을 입력으로 전달하여 이미지 속 텍스트를 번역하는 기능을 테스트했다. 텍스트 전용 번역과 달리 이미지 번역에서는 모델이 원문과 전혀 관련 없는 내용을 생성하는 환각(Hallucination) 현상이 발생했다. 이는 모델의 크기나 인터넷 연결을 통한 이미지 다운로드 과정, 혹은 멀티모달 처리의 초기 단계 특성상 발생할 수 있는 한계점으로 분석되었다.

용어 해설

지식 증류(Knowledge Distillation)
거대 모델(Teacher)의 지식을 더 작고 효율적인 모델(Student)로 전달하는 기법이다. 복잡한 모델의 출력을 학습 데이터로 활용하여 작은 모델이 큰 모델의 성능을 모방하게 함으로써 추론 비용을 획기적으로 낮춘다.
지도 미세 조정(Supervised Fine-Tuning (SFT))
사전 학습된 모델을 특정 작업에 맞게 레이블이 지정된 데이터셋으로 추가 학습시키는 과정이다. TranslateGemma에서는 인간과 Gemini가 생성한 고품질 번역 데이터를 사용하여 번역 정확도를 높이는 데 사용되었다.
멀티모달(Multimodal)
텍스트, 이미지, 오디오 등 서로 다른 형태의 데이터를 동시에 처리하고 이해하는 능력이다. 이 모델은 이미지 내의 텍스트를 인식하여 다른 언어로 번역하는 기능을 포함하고 있어 활용 범위가 넓다.
환각 현상(Hallucination)
AI 모델이 사실과 다르거나 문맥에 맞지 않는 정보를 그럴듯하게 생성하는 오류이다. 영상에서는 이미지 번역 시 모델이 원문과 전혀 상관없는 내용을 출력하는 사례를 통해 이 한계점을 지적했다.
강화 학습(Reinforcement Learning (RL))
모델이 생성한 결과물에 대해 보상을 주어 성능을 최적화하는 학습 방식이다. TranslateGemma는 번역 결과가 기계적이지 않고 자연스럽게 들리도록 하기 위해 이 기법을 훈련의 마지막 단계에 적용했다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 01. 16.수집 2026. 02. 21.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.