본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

ningzimu/image-to-editable-ppt-skill

Python0 / 0

이미지·PDF·이미지 기반 PPT를 페이지 단위로 정규화해 텍스트는 텍스트박스로, 단순 도형은 PowerPoint 도형으로 복원하고 복잡 요소는 이미지 자산으로 분리해 최종 .pptx를 생성한다.

TL;DR

이 레포는 이미지, PDF, 이미지 기반 PPTX를 페이지 단위로 정규화해 편집 가능한 .pptx로 재구성하는 Codex skill이다. 각 페이지는 OCR로 글자 박스와 실측 글자 크기를 측정해 텍스트를 텍스트박스로 복원하고 단순 도형은 PowerPoint 도형으로 재생성하며 복잡한 시각 요소는 독립 이미지 자산으로 분리하는 방식으로 동작했다. 주 agent가 다중 페이지를 page worker에 분배해 병렬 처리하고 editppt CLI가 이미지 생성·편집을 담당하며 최종 manifest 기반으로 .pptx를 조립하고 validation을 수행했다. 다만 실행 시간이 길고 토큰 소모량이 크며 변환 비용은 이미지 생성 비용의 2-3배 수준으로 README에서 명시되어 있고 모델 제약으로 인해 gpt-5.5 이하 모델에서는 기대한 결과가 나오지 않을 수 있다.

핵심 포인트

  • 측정 기반 문자 복원 방식을 적용했다. prepare 단계에서 각 페이지의 글자 박스 좌표와 실측 글자 크기, 동급 글자 그룹을 생성하고 모델이 이 측정값을 기준으로 텍스트를 재배치하도록 설계해 단순 OCR 텍스트 추출이 아닌 위치·크기 복원을 목표로 했다. 이 방식은 텍스트 가독성과 편집 가능성 회복에 직접적으로 기여했다.
  • 다중 에이전트 병렬화와 페이지 로컬 워커 설계를 채택했다. 주 agent가 페이지를 분배하면 각 page worker가 재구성·자체검증·로컬 수정까지 책임져 대규모 다중 페이지 작업의 동시성 제어와 작업 상태 추적이 용이했다. 이 구조는 대용량 PDF나 이미지 덱을 처리할 때 처리 유연성과 장애 격리에 유리했다.
  • 이미지 생성·편집의 백엔드 선택을 자동화했다. editppt image CLI는 우선 로컬 Codex OAuth를 사용하고 없을 경우 사용자 설정의 OpenAI-compatible API를 fallback으로 사용하며, CLI 매개변수는 모델·사이즈·품질·타임아웃 등 필요한 제어만 노출해 상호운영성을 확보했다. 이 점은 다양한 실행 환경에서 이미지 편집 파이프라인을 일관되게 운영하는 데 도움이 된다.
  • 페이지 단위 manifest와 검증 기록을 출력 구조에 엄격히 포함했다. 각 페이지의 manifest.json은 텍스트·도형·자산 메타데이터를 권위 있는 입력으로 삼아 finalize 단계에서 신뢰 가능한 재조합을 가능하게 했고 validation.json을 통해 누락 자산이나 저신뢰 영역을 명시적으로 보고했다. 이 접근은 결과물의 품질 검사와 후속 수동 보정 지점을 명확히 했다.

벤치마크

벤치마크지표비교
conversion_cost_multipliercost_ratio2-3x이미지 PPT 생성 비용 대비
single_page_time_estimatetime_per_page>=10 minutes
ten_page_quota_notetime_quota_risk10 pages may exhaust a 5-hour quota

이미지 분석

Codex 실행 권한 설정 화면의 스크린샷으로 '完全访问权限' 항목이 강조되어 있고 해당 권한이 인터넷과 로컬 파일 접근을 허용한다고 표기되어 있다.
스크린샷은 이 skill이 장시간 실행과 외부 API 호출, 로컬 파일 읽기·쓰기를 수행하기 때문에 Codex에서 '완전 접근 권한'을 권장한다는 점을 시각적으로 나타냈다. 해당 권한이 없으면 '요청 승인' 모드에서 빈번히 중단되어 page worker 환경에서 프로세스가 멈출 가능성이 있음을 암시한다. 따라서 README 내 권장 설정과 일치하는 실행 권한 관련 주의사항을 시청각적으로 보강하는 이미지였다.
시장 개요를 보여주는 원본 슬라이드 이미지로, 복합 차트(누적 막대 및 선 그래프)와 아이콘·텍스트가 함께 배치된 비주얼을 포함한다.
해당 이미지는 복잡한 시각 요소와 여러 텍스트 블록이 섞인 슬라이드를 재구성 대상으로 삼았다는 점을 보여주며 README의 변환 전후 사례와 대응된다. 차트 및 다중 색상 영역은 자동으로 완전한 편집형 오브젝트로 복원되기보다 텍스트와 단순 도형은 추출·재구성하고 복잡한 그래픽은 독립 이미지 자산으로 보존하는 레포의 설계 철학을 시사했다. 이 샘플은 결과물에서 텍스트 편집성과 시각적 유사성 사이의 트레이드오프를 직관적으로 전달했다.

2.1k

Stars

124

Forks

+207

Trending

0

조회수

2.1k watchers5 open issuesMIT License

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.