본문으로 건너뛰기
Matt Wolfe조회 2

AI 생성 영상 판별기 제작 도전기와 AGI에 대한 고찰

범용 LLM과 전문 API를 결합해 AI 영상 판별기를 제작하며 겪은 기술적 한계와 막대한 운영 비용, 그리고 AGI 도달 여부에 대한 비판적 분석

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

소셜 미디어에 범람하는 저품질 AI 영상(AI Slop)을 판별하기 위해 직접 도구를 제작하는 과정을 담았다. Gemini와 ChatGPT를 연동해 판별 로직을 구현했으나 명백한 가짜 영상조차 구분하지 못하는 한계에 부딪혔고, 결국 전문 API인 Sightengine을 도입해 성능을 개선했다. 하지만 6개 영상 테스트에 12,000회 이상의 API 연산이 소모되는 막대한 비용 문제와 모델 간의 판단 불일치가 발생했다. 이 실험은 인간의 직관을 따라오지 못하는 현재 AI의 한계를 지적하며, 우리가 정말 AGI 시대에 도달했는지에 대해 근본적인 의문을 던진다.

챕터별 상세

00:00

AI 슬롭의 범람과 판별기 기획

소셜 미디어에 무분별하게 유포되는 저품질 AI 생성 영상인 'AI Slop'이 지인들 사이에서도 실제 영상으로 오인되는 문제가 심각해졌다. 이를 해결하기 위해 Instagram, TikTok, YouTube 등의 링크를 입력하면 AI 생성 여부를 즉시 판별해주는 웹 도구를 기획했다. 사용자가 가짜 영상을 공유하기 전에 직접 검증할 수 있는 환경을 제공하는 것이 목표이다. 인간의 직관을 넘어서는 정교한 AI 영상이 늘어남에 따라 기술적 판별 수단의 필요성이 커졌다.
01:16

ChatGPT와 Gemini를 활용한 초기 구축

ChatGPT의 프로젝트 기능을 사용하여 앱의 기본 아키텍처를 설계하고 필요한 코드를 생성했다. Google의 비디오 이해 모델인 Gemini와 워터마크 감지 기술인 SynthID를 결합하여 분석 로직을 구성했다. Gemini 3.7 Flash 모델이 영상의 각 프레임을 분석하여 물리적 모순이나 시각적 왜곡을 찾아내도록 프로그래밍했다. LLM의 멀티모달 능력을 활용해 영상의 맥락과 시각 정보를 동시에 검토하는 방식을 채택했다.

SynthID는 Google DeepMind에서 개발한 기술로, AI 생성 콘텐츠에 인간의 눈에는 보이지 않는 디지털 워터마크를 삽입하고 이를 감지하는 기능을 제공한다.

04:46

초기 모델의 판별 실패와 한계

명백한 AI 생성 영상인 'FartZooka' 영상을 테스트했으나 Gemini 모델은 이를 'AI가 아닐 확률이 높음'으로 오판했다. 모델은 영상 속 인물의 부자연스러운 움직임이나 물리 법칙을 무시하는 연출을 포착하지 못하고 일반적인 특수 효과로 인식했다. 신뢰도 점수가 10% 수준으로 낮게 측정되었으며, 이는 범용 LLM이 정교한 시각적 조작을 잡아내는 데 한계가 있음을 보여주었다. 결과적으로 초기 구축한 로직은 실질적인 판별 도구로서 신뢰성을 확보하지 못했다.
06:34

GPT-6 Astra를 이용한 자동 최적화 시도

성능 개선을 위해 차세대 모델인 'GPT-6 Astra Ultra'를 투입하여 8시간 이상 자동화된 코드 수정과 테스트를 반복했다. 모델은 스스로 4개의 문서를 생성하고 수백 개의 테스트 케이스를 실행하며 판별 정확도를 높이려 시도했다. 그러나 장시간의 연산 끝에 모델은 '판단 불가(Goal Stalled)' 상태에 빠졌으며, 자체적인 로직만으로는 정확한 분류가 불가능하다는 결론에 도달했다. 이는 최신 모델조차 AI 영상의 미세한 특징을 정량화하는 데 어려움을 겪고 있음을 시사한다.

영상 속 GPT-6 Astra는 미래 시점의 모델을 가정한 연출이거나 실험적인 고성능 추론 모드를 의미한다.

08:38

전문 API 도입을 통한 성능 개선

범용 모델의 한계를 극복하기 위해 영상 분석 전문 서비스인 Sightengine API를 시스템에 통합했다. Sightengine은 영상 내 AI 지표를 프레임 단위로 정밀 스캔하여 19개 이상의 샘플 구간에서 AI 흔적을 성공적으로 찾아냈다. Gemini가 놓친 시각적 왜곡을 Sightengine이 보완하면서 판별 결과가 '판단 불가'에서 'AI 지표 감지'로 개선되었다. 전문화된 컴퓨터 비전 알고리즘이 범용 추론 모델보다 특정 패턴 감지에 훨씬 효율적임이 증명되었다.
text
SIGHTENGINE_API_USER=
SIGHTENGINE_API_SECRET=

Sightengine API 연동을 위한 환경 변수 설정 예시

15:42

운영 비용 문제와 AGI에 대한 의문

전문 API를 도입하여 성능은 개선했으나 단 6개의 영상을 테스트하는 데 12,000회 이상의 API 연산이 소모되는 막대한 비용 문제가 발생했다. 월 100달러 수준의 유료 플랜으로도 일반 사용자의 수요를 감당하기 불가능한 경제적 구조가 확인되었다. 또한 인간은 직관적으로 알아보는 가짜 영상을 최신 AI 모델들이 구분하지 못하는 현상을 통해, 현재의 AI가 진정한 AGI 단계에 도달했는지에 대해 회의적인 시각을 드러냈다. 기술적 판별력과 인간의 직관 사이에는 여전히 거대한 간극이 존재한다.

용어 해설

AI 슬롭(AI Slop)
인터넷상에 무분별하게 유포되는 저품질의 AI 생성 콘텐츠를 의미한다. 주로 클릭 유도나 광고 수익을 목적으로 제작되며, 사용자의 경험을 저해하는 스팸성 정보를 양산한다는 점에서 문제시된다.
인공 일반 지능(AGI)
인간이 수행할 수 있는 모든 지적 작업을 동등하거나 그 이상으로 수행할 수 있는 인공지능을 뜻한다. 특정 작업에 특화된 현재의 AI와 달리 스스로 학습하고 추론하며 직관적인 판단까지 가능한 단계를 목표로 한다.
응용 프로그램 인터페이스(API)
서로 다른 소프트웨어 구성 요소가 통신할 수 있도록 돕는 규약이다. 이 영상에서는 Sightengine과 같은 외부 전문 분석 기능을 자신의 앱에 연결하여 데이터를 주고받는 통로로 사용되었다.
컴퓨터 비전(Computer Vision)
컴퓨터를 사용하여 디지털 이미지나 영상으로부터 고수준의 이해를 추출하는 AI 분야이다. 영상 내 객체 인식, 움직임 분석, 텍스처 왜곡 감지 등을 통해 AI 생성 여부를 판별하는 핵심 기술로 쓰인다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 10.수집 2026. 09. 10.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.