AI 기업들이 희귀 서적을 파쇄하고 있다
(news.hada.io)
AI 기업들이 고품질 학습 데이터를 확보하기 위해 희귀 서적의 원본을 파쇄하며 스캔하는 '파괴식 스캔' 관행이 드러나며, 이는 데이터 독점과 문화유산의 비가역적 훼손이라는 윤리적·법적 논쟁을 촉발하고 있습니다.
이 글의 핵심 포인트
- 1AI 기업들이 고품질 학습 데이터 확보를 위해 희귀 서적의 책등을 절단해 스캔한 후 원본을 파쇄함
- 22022년 이전 출판물은 AI 생성 텍스트가 포함되지 않은 프리미엄 데이터로 높은 가치를 인정받음
- 3ISBNdb와 같은 중개업체는 구매자의 익명성과 NDA를 지원하며 이를 '디지털 보존'으로 포장함
- 4연방 판사는 원본 제거 방식이 공정 이용에 해당한다고 판단했으나, 유일한 사본의 소실 위험이 존재함
- 5파괴식 스캔은 저작권료 지불보다 비용 면에서 압도적으로 유리하여 AI 기업들의 주요 전략으로 활용됨
이 글에 대한 공공지능 분석
왜 중요한가?
AI 학습용 '클린 데이터'에 대한 수요가 급증하면서, 물리적 원본을 파괴해서라도 데이터를 확보하려는 극단적인 비용 효율화 전략이 나타났기 때문입니다. 이는 저작권법의 공정 이용(Fair Use) 범위를 재정의하고 문화유산 보존과 기술 발전 사이의 충돌을 가시화합니다.
어떤 배경과 맥락이 있나?
LLM 성능 향상을 위해 2022년 이전의 '인간이 작성한 순수 데이터'가 프리미엄 자산으로 부상했습니다. 이에 따라 Anthropic 등 주요 AI 기업들은 대규모 서적 데이터를 확보하기 위해 중개업체를 통한 익명 구매와 파괴식 스캔 기술을 활용하고 있습니다.
업계에 어떤 영향을 주나?
데이터 확보를 위한 '물적 자원 약탈' 논란은 향후 AI 기업의 ESG 경영 및 사회적 평판에 리스크로 작용할 수 있습니다. 또한, 저작권료 지불보다 물리적 파쇄가 훨씬 경제적이라는 판단은 콘텐츠 산업과 AI 산업 간의 갈등을 더욱 심화시킬 것입니다.
한국 시장에 어떤 시사점이 있나?
한국 스타트업 역시 고품질 데이터 확보를 위한 전략 수립 시 법적 공정 이용뿐만 아니라 윤리적·사회적 파급력을 고려해야 합니다. 특히 원본을 보존하면서도 고품질 데이터를 추출할 수 있는 비파괴 스캔 솔루션이나 디지털 아카이빙 기술에 대한 새로운 시장 기회가 발생할 수 있습니다.
이 글에 대한 큐레이터 의견
AI 기업의 '파괴식 스캔'은 데이터 확보 비용을 극단적으로 낮추려는 공학적 최적화의 결과물이지만, 이는 인류의 지적 자산을 일회용 소모품으로 취급한다는 비판에서 자유로울 수 없습니다. 창업자 관점에서 볼 때, 이는 '데이터 오염(AI Slop)' 문제를 해결하기 위한 단기적인 돌파구는 될 수 있으나, 장기적으로는 데이터의 신뢰성과 사회적 합의를 무너뜨리는 리스크가 됩니다.
물론 저작권료를 지불하는 것보다 물리적 파쇄가 훨씬 경제적이라는 비즈니스 논리는 강력합니다. 하지만 만약 이 과정이 '공공 자원의 수탈'로 규정되어 규제가 강화된다면, 데이터 확보 비용은 급격히 상승할 것입니다. 따라서 스타트업은 단순히 저렴한 데이터를 찾는 데 그치지 않고, 원본을 보존하면서도 고품질 데이터를 추출할 수 있는 비파괴적 기술이나, 저작권자와 상생할 수 있는 지속 가능한 데이터 파이프라인 구축에 집중해야 합니다.
댓글
아직 댓글이 없습니다. 첫 댓글을 남겨보세요.