TL;DR
중고 서적을 유압식 절단기로 분리해 산업용 스캐너로 고속 스캔한 뒤 학습 데이터로 사용하는 관행이 보고되었고 이 방식은 first-sale doctrine과 fair use에 근거해 법적 보호를 받고 있다. 물리적 책을 디지털로 전환하는 과정은 입력(서적 매입)·처리(절단·스캔·OCR)·출력(학습 데이터 통합)의 단계로 작동하며 서점과 중개업체의 경제적 유인으로 확산되는 양상을 보인다. 이로 인해 희귀·절판 도서의 영구적 파괴와 문화적 손실 우려가 제기되며 법적 정당성과 윤리적 책임 사이의 균형 문제, 대안적 데이터 확보 전략 및 보상 체계 필요성이 분명해졌다.
커뮤니티 반응
커뮤니티 반응은 법적 근거의 존재와는 별개로 윤리적 우려가 우세한 편이다. 많은 사용자는 희귀·절판 도서가 문화유산으로서 보존되어야 한다고 주장했고 일부는 데이터 가공을 위한 물리적 파괴가 과도하다고 지적했다. 동시에 법적 허용을 근거로 삼는 의견도 존재하며, 이견은 주로 문화 보존과 기술 발전의 우선순위 문제에 집중되었다. 결과적으로 분노와 우려, 현실적 한계 인식이 혼재한 반응 양상이 전개되었다.
주요 논점
일부 관점에서는 대량의 고품질 텍스트 확보가 모델 성능 개선에 직접적으로 기여하므로 현실적으로 물리적 자료를 활용하는 과정이 불가피하다고 본다. 이 주장은 소유자가 책을 처분할 권리를 행사하고 법적 테두리 내에서 데이터가 생성된다는 점을 근거로 삼는다. 법적 보호와 비용 효율성 측면에서 현재의 수집 방식이 실무적 필요를 충족한다고 평가하는 경향이 있다.
반대 입장에서는 희귀본과 절판 도서의 물리적 파괴가 영구적인 문화적 손실을 초래한다고 판단한다. 이들은 대체 가능한 데이터 확보 방법이나 합법적 라이선싱을 통한 접근이 우선되어야 하며, 단순한 법적 허용이 윤리적 정당성을 제공하지 않는다고 본다. 문화재 보존과 공공의 지적 자산 보호를 이유로 현재 관행을 강력히 비판하는 목소리가 다수였다.
합의점 vs 논쟁점
합의점
- 현재 일부 AI 기업과 중개업체가 중고 서적을 물리적으로 분리·스캔해 학습 데이터로 전환하는 행위를 수행하고 있다는 사실에는 이견이 거의 없다.
- 해당 관행이 first-sale doctrine과 fair use 관련 법리의 해석을 통해 법적 방어를 받고 있다는 점이 널리 인정된다.
- 이 관행은 단기적으로 데이터 확보에는 효율적이지만 장기적으로 문화유산의 손실과 윤리적 논란을 불러일으킨다는 점에서 문제 의식이 공유된다.
논쟁점
- 법적 허용 여부가 윤리적 정당성을 자동으로 부여하는지에 대한 의견이 분분하다.
- 희귀 도서의 현물 파괴를 대체할 수 있는 실용적이고 저비용의 데이터 수집 대안이 실제로 존재하는지에 대한 판단이 엇갈린다.
- 저작권자나 도서 소유자에 대한 보상과 책임 소재를 어떻게 규정해야 하는지에 대해 합의가 이루어지지 않았다.
실용적 조언
- 정책적 대응으로는 저작권·소유권과 데이터 활용의 경계를 명확히 규정하는 법적·행정적 기준 마련이 필요하다. 이는 first-sale doctrine과 fair use의 적용 범위를 구체적으로 정하여 문화재 보존과 데이터 수집 간 균형을 맞추는 방향으로 설계되어야 한다. 또한 도서 소유자와 저작권자에게 보상 체계를 마련하거나 라이선스 기반 데이터 제공 경로를 확립하면 물리적 파괴를 줄일 수 있다.
- 기술적 대안으로는 공개 도메인 자료, 기관 라이선스 기반의 디지털 아카이브 활용, 또는 합성 및 크롤링 기반의 대체 데이터 확보 전략을 강화하는 방안이 있다. 기관 단위의 스캔·보존 프로젝트와 협업하면 원본 보존과 데이터 확보를 동시에 달성할 수 있으며, 데이터의 출처와 사용 조건을 명시하는 메타데이터 표준을 도입하면 투명성을 높일 수 있다. 마지막으로 관련 업계와 학계, 보존 단체 간의 표준 협의체를 구성해 모범 사례와 검증 절차를 공유하는 것이 실효성 있는 대응이 될 것이다.
섹션별 상세
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
