ningzimu/image-to-editable-ppt-skill
Python0 / 0
이미지·PDF·이미지 기반 PPT를 페이지 단위로 정규화해 텍스트는 텍스트박스로, 단순 도형은 PowerPoint 도형으로 복원하고 복잡 요소는 이미지 자산으로 분리해 최종 .pptx를 생성한다.
TL;DR
이 레포는 이미지, PDF, 이미지 기반 PPTX를 페이지 단위로 정규화해 편집 가능한 .pptx로 재구성하는 Codex skill이다. 각 페이지는 OCR로 글자 박스와 실측 글자 크기를 측정해 텍스트를 텍스트박스로 복원하고 단순 도형은 PowerPoint 도형으로 재생성하며 복잡한 시각 요소는 독립 이미지 자산으로 분리하는 방식으로 동작했다. 주 agent가 다중 페이지를 page worker에 분배해 병렬 처리하고 editppt CLI가 이미지 생성·편집을 담당하며 최종 manifest 기반으로 .pptx를 조립하고 validation을 수행했다. 다만 실행 시간이 길고 토큰 소모량이 크며 변환 비용은 이미지 생성 비용의 2-3배 수준으로 README에서 명시되어 있고 모델 제약으로 인해 gpt-5.5 이하 모델에서는 기대한 결과가 나오지 않을 수 있다.
핵심 포인트
- 측정 기반 문자 복원 방식을 적용했다. prepare 단계에서 각 페이지의 글자 박스 좌표와 실측 글자 크기, 동급 글자 그룹을 생성하고 모델이 이 측정값을 기준으로 텍스트를 재배치하도록 설계해 단순 OCR 텍스트 추출이 아닌 위치·크기 복원을 목표로 했다. 이 방식은 텍스트 가독성과 편집 가능성 회복에 직접적으로 기여했다.
- 다중 에이전트 병렬화와 페이지 로컬 워커 설계를 채택했다. 주 agent가 페이지를 분배하면 각 page worker가 재구성·자체검증·로컬 수정까지 책임져 대규모 다중 페이지 작업의 동시성 제어와 작업 상태 추적이 용이했다. 이 구조는 대용량 PDF나 이미지 덱을 처리할 때 처리 유연성과 장애 격리에 유리했다.
- 이미지 생성·편집의 백엔드 선택을 자동화했다. editppt image CLI는 우선 로컬 Codex OAuth를 사용하고 없을 경우 사용자 설정의 OpenAI-compatible API를 fallback으로 사용하며, CLI 매개변수는 모델·사이즈·품질·타임아웃 등 필요한 제어만 노출해 상호운영성을 확보했다. 이 점은 다양한 실행 환경에서 이미지 편집 파이프라인을 일관되게 운영하는 데 도움이 된다.
- 페이지 단위 manifest와 검증 기록을 출력 구조에 엄격히 포함했다. 각 페이지의 manifest.json은 텍스트·도형·자산 메타데이터를 권위 있는 입력으로 삼아 finalize 단계에서 신뢰 가능한 재조합을 가능하게 했고 validation.json을 통해 누락 자산이나 저신뢰 영역을 명시적으로 보고했다. 이 접근은 결과물의 품질 검사와 후속 수동 보정 지점을 명확히 했다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| conversion_cost_multiplier | cost_ratio | 2-3x | 이미지 PPT 생성 비용 대비 |
| single_page_time_estimate | time_per_page | >=10 minutes | — |
| ten_page_quota_note | time_quota_risk | 10 pages may exhaust a 5-hour quota | — |
이미지 분석


2.1k
Stars
124
Forks
+207
Trending
0
조회수
2.1k watchers5 open issuesMIT License
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.