OCR·번역·시각편집을 통합한 만화 원클릭 번역 UI
이미지 OCR로 말풍선을 분할하고 OpenAI·Gemini 등 다중 엔진으로 번역한 뒤 시각 편집기로 재삽입하고 PSD로 내보내는 오픈소스 만화 번역 툴이다.
TL;DR
이 프로젝트는 말풍선 분할, 만화 특화 OCR, 다중 번역 엔진 연동, 자동 재삽입과 시각 편집을 한 흐름으로 결합하여 만화 이미지를 원클릭으로 번역하고 PSD 레이어로 내보낼 수 있도록 설계된 오픈소스 도구이다. 설치는 설치 스크립트, 패키지 릴리즈, Docker, 소스 실행 네 가지 경로를 제공하며 설치 스크립트는 Miniconda와 GPU 감지, 적합한 PyTorch 선택까지 자동화하여 사용 편의성을 높였다. 초해상 모델과 만화 전용 OCR 옵션이 포함되어 있어 흐릿한 원고나 비정형 레이아웃에 대한 인식 품질을 개선할 수 있으나 GPU와 드라이버 요구사항, 모델 라이선스(CC BY-NC)와 같은 운영 제약을 사전에 확인해야 한다.
주요 기능
- 텍스트 검출과 말풍선 분할을 결합하여 만화 페이지에서 대사 영역을 자동으로 식별하고 그 결과를 OCR 파이프라인으로 전달한다. 이 과정은 분할 모델과 OCR 모델의 출력을 순차적으로 연결하여 잘린 영역의 문맥 손실을 최소화한다. 분할 단계는 번역과 재배치의 전제 조건으로 동작한다.
- 여러 번역 엔진을 내장하여 동일 이미지에 대해 OpenAI, Gemini, Vertex, Sakura 등 다양한 백엔드를 선택할 수 있으며 엔진별 API 키를 관리하여 엔진 전환이 가능하다. 번역 단계는 OCR 결과를 엔진별로 전송하고 회수한 텍스트를 렌더링 형식으로 변환하는 작업을 포함한다. 엔진별 품질과 비용을 비교해 워크플로에 맞는 백엔드를 선택할 수 있다.
- 시각 편집기는 텍스트 박스의 이동·회전·변형, 폰트·스타일 조정, 마스크 기반 복원 및 PSD 레이어 내보내기 기능을 제공하여 번역 후 미세 조정을 가능하게 한다. 편집기는 Undo/Redo와 다양한 단축키를 지원하여 반복 편집 작업을 줄인다. PSD 출력은 전문 편집 도구로의 후속 작업을 보장한다.
- 배치 처리와 명령행 모드를 지원하여 폴더 단위의 대량 이미지 번역 및 서버 모드로의 Web UI 배포가 가능하며 Docker 이미지와 설치 스크립트를 통해 빠른 배포 옵션을 제공한다. 이 기능은 아카이브 일괄 번역이나 자동화 파이프라인 통합을 목표로 한다. CLI는 파라미터로 입력/출력 디렉터리와 모드를 제어한다.
어떻게 동작하는가
프로젝트는 말풍선 분할 모델로 텍스트 영역을 먼저 추출하고, 추출된 각 영역을 OCR 엔진으로 인식하여 원문 텍스트를 얻은 뒤 선택한 번역 엔진으로 번역을 수행하는 파이프라인으로 구성되어 있다. 번역 결과는 자동 타이포그래피 규칙과 렌더러로 재배치되어 이미지에 삽입되며 필요시 Real-CUGAN 또는 MangaJaNai 같은 초해상 모듈을 통해 이미지 품질을 개선한 후 렌더링한다. 데스크톱 Qt UI와 Web UI가 동일한 서버 측 로직을 호출하며 Docker와 설치 스크립트는 환경 구성과 의존성 설치를 자동화한다.
해결 문제
원본 만화 이미지에서 말풍선과 텍스트를 수동으로 분리하고 번역한 뒤 다시 레이아웃에 맞춰 삽입하는 번거로움을 자동화하여 처리 시간을 단축한다. 이 프로젝트는 말풍선 분할, 다국어 OCR, 다중 번역 엔진 연동, 자동 배치 및 시각 편집을 하나의 흐름으로 결합하여 원스톱 처리 파이프라인을 제공한다. 결과물은 PSD 레이어로 내보낼 수 있어 후속 편집과 품질 점검이 용이하다.
지금 주목받는 이유
이 레포는 2000개 이상의 스타와 활발한 문서 링크를 기반으로 다국어 만화 번역 워크플로를 일괄적으로 자동화하는 실용성으로 주목받았으며 OpenAI와 Gemini 같은 주요 번역 백엔드를 기본 지원하여 최신 멀티모달 번역 흐름과 호환된다는 점이 관심을 끌었다.
차별점
- 다중 온라인 번역 엔진을 기본 탑재하여 OpenAI 및 Gemini 등 여러 API를 바로 활용할 수 있으며 엔진 전환을 UI와 설정으로 간단히 제어할 수 있다.
- MangaLens 기반의 말풍선 분할과 만화 특화 OCR 옵션을 결합하여 일반 문서 OCR 대비 만화 레이아웃에 맞춘 전처리 정확도를 높였고 그 결과 번역 누락과 오인식이 줄어든다.
- 설치 스크립트와 패키징된 릴리즈, Docker 이미지를 모두 제공하여 비전문 사용자도 한 번의 설치로 데스크톱 또는 서버 환경에서 바로 실행할 수 있도록 배포 편의를 확보했다.
사용 사례
- 개인 스캔레이터나 번역 동호회가 방대한 만화 컬렉션을 일괄로 OCR 추출·번역·재삽입하여 로컬 아카이브를 빠르게 현지화하는 작업에 활용할 수 있다. 자동화된 배치와 CLI 호출을 통해 수백 장 단위의 작업을 비대면으로 처리할 수 있으며 PSD 출력으로 사람의 최종 교정 작업을 용이하게 만든다.
- 번역가나 편집자가 원문 맥락을 유지하면서 번역 텍스트의 위치와 스타일을 미세 조정할 때 UI의 시각 편집 기능을 통해 반복적인 수동 배치 작업을 줄일 수 있다. 텍스트 박스 변형과 폰트 설정이 가능한 편집기는 디자인 품질을 유지한 채 번역을 적용하는 데 유용하다.
- 작업 자동화 파이프라인에서 Docker 기반 서버 모드를 통해 중앙 서버에서 여러 사용자의 번역 요청을 처리하거나 CI 파이프라인의 일부로 이미지 전처리·번역을 통합할 수 있다. Web UI와 API를 통해 서비스형 워크플로로 확장 가능하다.
- 데이터셋 제작 목적으로 원문 텍스트와 번역본을 추출하여 텍스트 대조 데이터셋을 만들거나, 번역 비교 실험을 위해 여러 엔진의 출력을 수집하는 용도로 활용할 수 있다. 추출된 텍스트는 검수 및 용어 사전 축적에 재사용된다.
시작하기
프로젝트는 세 가지 주요 설치 경로를 제공하며 각각의 초기화 절차가 문서에 정리되어 있다. 권장 방법은 제공된 설치 스크립트를 받아서 실행하는 것이며 스크립트는 Miniconda 설치, 프로젝트 클론, 의존성 설치, GPU 감지 및 적합한 PyTorch 버전 선택까지 자동으로 수행한다. Docker 이미지를 이용하면 로컬에서 포트 8000으로 Web UI를 즉시 실행할 수 있고 소스에서 직접 실행하려면 Python 3.12 환경에서 requirements 파일을 설치한 뒤 `python -m desktop_qt_ui.main` 또는 `python -m manga_translator web`로 실행하면 된다.
요구사항
- Python 3.12 환경을 권장하며 데스크톱 UI와 Web UI 모두 Python 런타임이 필요하다. 설치 스크립트는 Miniconda를 자동으로 설치할 수 있으나 수동 설치 시에는 Conda 환경 구성이 전제되어야 한다. CPU 모드로도 실행 가능하지만 성능과 OCR/초해상 옵션은 GPU 환경에서 유리하다.
- NVIDIA GPU 사용 시에는 CUDA 12.x 지원 드라이버(권장 드라이버 버전 >= 525.60.13)가 필요하며 GPU 버전에 따라 적합한 PyTorch 바이너리를 선택해야 한다. AMD GPU는 문서상 ROCm 실험적 지원을 제공하나 공식적으로는 RX 7000/9000 계열만 권장되어 다른 AMD 카드에서는 CPU 모드 사용이 권장된다.
- Web UI를 운영할 경우 포트 8000이 기본이고 Docker 배포 시에는 지정된 볼륨을 마운트하여 모델 파일, 폰트, 결과물, 로그 등을 영구 저장해야 하며 API Key 보관을 위해 환경파일(.env)을 적절히 설정해야 한다.
이미지 분석


2.1k
Stars
99
Forks
+204
Trending
0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.