Back to InsightsAI

위대한 데이터 스크램블: AI 기업들이 오래된 책을 사는 이유

By James Huang2026년 8월 1일·Updated 2026년 8월 3일6 min read
AI Generated Cover for: The Great Data Scramble: Why AI Companies Are Buying Old Books

위대한 데이터 스크램블: AI 기업들이 오래된 책을 사는 이유

요약: AI 기업들은 2022년 이전에 출판된 물리적 책을 패닉 구매하고 있습니다. 향수를 위해서가 아니라 — 생존을 위해서입니다. 인터넷은 이제 복사본의 복사본이며, AI 출력으로 훈련된 AI의 모든 세대는 점점 더 멍청해지고 있습니다. 2022년 이전의 책들은 대규모로 증명 가능한 인간 작성 텍스트 코퍼스의 마지막입니다. Anthropic은 "프로젝트 파나마"에 수백만 달러를 썼습니다 — 물리적 책을 대량 구매하고, 척추를 잘라내고, 스캔한 다음, 법적으로 방어 가능한 인간 데이터 금고를 만들기 위해 책을 파괴했습니다. 연방 판사는 방금 선을 그었습니다: 책을 사고, 원본을 파괴하고, 내부에 보관하면 문제가 없습니다. 해적 PDF를 다운로드하면 15억 달러의 소송을 당합니다. 진짜 이야기는 책에 관한 것이 아닙니다. 그것은 새로운 희소성으로서의 출처무한하고 가치 없는 콘텐츠의 시대에.

여기 제임스, 머큐리 테크놀로지 솔루션의 CEO입니다. 홍콩 — 2026년 8월


ISBNdb 갬빗

ISBNdb라는 회사 — 책 메타데이터의 데이터베이스, 정확히 그 이름 그대로입니다 — 최근 AI 회사들에게 새로운 서비스를 제공하기 시작했습니다: 대량 물리적 도서 조달.

1,000권의 책이 필요하신가요? 그들은 그것들을 찾을 것입니다. 1백만 권이 필요하신가요? 그들은 도서관, 중고 서점, 절판된 카탈로그를 비울 것입니다. 그들의 제안은?"세계 최고의 AI 훈련 데이터가 선반 위에 놓여 있습니다."

여기서 중요한 점은:그들은 특히 2022년 이전에 출판된 책을 원합니다.

왜 그 기준일까요? 2022년 11월에 ChatGPT가 출시되었기 때문입니다. 그 이후로 인터넷은 주로 인간이 작성한 것이 아니게 되었습니다. 그것은 AI 글쓰기가 AI 글쓰기에 의해 훈련된 자기 반복적 메아리 챔버가 되었습니다. 기술 산업은 이를 위해 용어를 만들기까지 했습니다:"AI 쓰레기." (중국어 번역은 더 생생합니다: AI泔水 — AI 하수유.)

복사 문제

이렇게 생각해 보세요: 복사본을 만듭니다. 그런 다음 복사본을 다시 복사합니다. 그런 다음 그 복사본을 복사합니다.그 복사본. 가장 먼저 사라지는 것은 큰 굵은 헤드라인이 아닙니다 — 미세한 세부사항, 가장자리 질감, 드문 표현, 소수의 관점입니다. 충분한 세대가 지나면 모든 것이 회색 덩어리로 수렴됩니다.

AI 연구자들은 이를 "모델 붕괴"라고 부릅니다. 이론적인 것이 아닙니다 — 지금 일어나고 있습니다. 이전 AI 출력에 주로 기반하여 훈련된 새로운 모델은 충실도를 잃습니다. 인간 지식의 긴 꼬리가 잘려 나갑니다. 이상한 것, 틈새, 진정으로 독창적인 것 — 모두 평균화됩니다.

합성 데이터 자체는 독이 아닙니다. 신중하게 사용하고, 인간의 큐레이션과 실제 데이터 앵커와 함께 사용하면 효과적일 수 있습니다. 하지만 문제는 다음과 같습니다: 인터넷은 더 이상 무엇이 인간이고 무엇이 기계인지 구별할 수 없습니다.이 기사는 사람이 썼나요? AI인가요? 사람이 다시 쓴 AI인가요? AI에 의해 다시 쓰인 사람인가요? 출처 체인이 끊어졌습니다.

2021년에 인쇄된 물리적 책 — 또는 1952년 — 을 매우 구체적인 것으로 만듭니다: 입증 가능한 인간 유물입니다.

프로젝트 파나마: 앤트로픽의 15억 달러 법적 해킹

클로드의 뒤에 있는 회사 앤트로픽은 책 구매로 시작하지 않았습니다. 그들은 해적 행위로 시작했습니다.

초기에는 해적 사이트에서 수백만 권의 책을 다운로드했습니다. 저작권 위험이 증가하자 그들은 급격히 방향을 전환했습니다. 2024년부터 그들은 수백만 달러를 "프로젝트 파나마" — 물리적 책을 대량으로 구매하고, 책등을 잘라내고, 페이지를 고속 스캐너로 통과시켜 내용을 디지털화하는 프로그램입니다.물리적 책을 파괴하십시오.디지털 파일은 Anthropic의 내부 데이터베이스에 남아 있으며, 배포되지 않습니다.

이름? 공식적인 설명은 없습니다. 임무? 영화 태그라인처럼 들립니다: "세상의 모든 책을 파괴적으로 스캔하다."

책을 좋아하는 사람으로서, 제 직감은 혐오감이었습니다. 그러고 나서 법원의 판결을 읽었습니다.

연방 판사의 세 가지 테스트

에서 Bartz 대 Anthropic, 미국 연방 판사가 Anthropic의 행동을 구별된 법적 범주로 나누었습니다:

1부 — 책 텍스트에 대한 훈련:특정 사실에 따른 공정 사용.

2부 — 물리적 책 구매 → 내부 디지털 복사본 생성 → 원본 파기 → 배포 없음:또한 공정 사용.

3부 — 해적 사이트에서 수백만 권의 책 다운로드 → 중앙 데이터베이스에 저장: 공정 사용 아님.

같은 책. 같은 교육 목적. 다른 법적 결과. 기준은 "당신이 그것에 대해 지불했나요?"가 아니라 전체 스택입니다: 합법적인 구매, 단일 전환, 원본 파기, 내부 사용, 배포 없음.

Anthropic은 결국 해적 행위 주장에 대해 $15억에 합의했습니다.벌금이 아니라 — 합의입니다. 즉, 그들은 싸우는 것이 지불하는 것보다 더 나쁘다고 계산했습니다. 그리고 $15억은 수백만 명의 저자 및 출판사와 개별 라이센스를 협상하는 것보다 여전히 저렴했습니다.

이것은 보편적인 법이 아닙니다. 하나의 연방 지방 판사, 하나의 사건, 하나의 해석입니다. 하지만 이것은 플레이북을 구상하기에 충분합니다. 그리고 ISBNdb는 비즈니스 모델을 보았습니다.

클로드가 더 인간적으로 느껴진 이유

클로드를 사용해 본 적이 있다면, 당신은 뭔가를 알아차렸을지도 모릅니다: 그것의 글쓰기는 종종 더 자연스럽고, 더 현실적이며, 더 인간 경쟁자들보다. 이제 그 이유를 알게 되었습니다. 다른 이들이 쓰레기로 가득 찬 인터넷에서 훈련받는 동안, Claude는 수백만 권의 실제 책을 부분적으로 훈련받았습니다 — 실제 인간의 글쓰기, 편집되고, 선별되고, 출판된, 그에 따른 모든 혼란과 구체성을 가지고 있습니다.

$15억의 합의는 Anthropic에게 법적 평화 이상의 것을 가져다주었습니다: 이는 입증 가능한 인간 데이터에 대한 시장을 검증했습니다.

진정한 희소성은 콘텐츠가 아닙니다 — 그것은 출처입니다.

중요한 재구성은 다음과 같습니다:

우리는 수십 년 동안 디지털이 희소성을 해결했다고 생각해왔습니다. 무한한 복사본. 제로 한계 비용. 정보는 자유롭고 싶어합니다. 그리고 AI는 콘텐츠 생성을 사실상 무료로 만들었습니다. 이제 우리는 무한한 텍스트를 생성할 수 있습니다.아무것도 말하지 않는 무한한 텍스트.

하지만 1952년 물리학 교과서 — 손으로 쓴 글꼴, 손으로 그린 도표, 잉크 냄새가 나는 복사된 페이지 — 는 어떤 AI도 생성할 수 없는 것을 담고 있습니다: 인간 판단의 연쇄. 누군가 이 주제가 수년간의 작업 가치가 있다고 결정했습니다. 누군가 자료를 모았습니다. 편집자가 무엇을 남길지 선택했습니다. 독자들은 구매와 인용으로 투표했습니다. 이 책은 인간의 주의와 인간의 의사결정의 화석 기록입니다.

저는 지난주 NYU 도서관에 있었습니다. 1952년 신입생 물리학 교과서를 집어 들었습니다. 모든 도표, 모든 글꼴 선택, 모든 페이지 레이아웃 — 분명히 손으로 구성되었습니다. 마치 손으로 시험지를 작성한 교사가 그것을 복사기로 돌린 것처럼요. AI가 생성한 질문보다 덜 효율적이긴 하지만, 그 뒤에는 한 사람의 사고가 보입니다.

대부분의 대학 도서관 컬렉션은 디지털 흔적이 전혀 없습니다. 인터넷은 그들이 존재한다는 것을 알지 못합니다. 그래서 그들이 가치 있는 이유입니다.

당신의 데이터 금광

이것은 단순히 책에 관한 것이 아닙니다.2022년 이전 운영 데이터를 보유한 모든 기업은 출처 자산을 소유하고 있습니다.

• 패션 전자상거래 회사의 구매자 사진 — 실제 인간, 실제 조명, 실제 결점

• 공장의 생산 기록 — 실제 실패, 실제 조정, 불확실성 속의 실제 결정

• 2019년 고객 서비스 기록 — 실제 좌절, 실제 문제 해결, 실제 인간 상호작용

가장 비싼 데이터는 가장 비밀스러운 데이터도, 가장 큰 데이터도 아닐 것입니다.그것은 데이터가 어디에서 왔는지, 누가 그것을 가치 있다고 판단했는지, 그리고 왜 그것이 신뢰할 수 있는지를 증명할 수 있는 데이터입니다.

새로운 가치 방정식

옛 방정식: 더 많은 데이터 = 더 나은 모델.

새로운 방정식: 출처 × 인간의 판단 = 희소성 = 가치.

AI 회사들이 오래된 책을 사지 않는 이유는 종이가 픽셀보다 낫기 때문입니다. 그들은 인간성의 증거를 사는 것입니다.기계가 무한한 그럴듯한 텍스트를 생성할 수 있는 세상에서 중요한 것은 실제로 인간이 그것을 썼는지, 그것에 대해 생각했는지, 끝내기 위해 충분히 신경 썼는지입니다.

콘텐츠를 쌓아두는 것을 그만두세요. 출처를 쌓아두기 시작하세요.

당신의 책장이 이제 전략적 자산이 되었습니다. 2022년 이전의 아카이브 데이터는요? 그것은 유산이 아닙니다 — 그것은 인류의 마지막 검증 가능한 지문입니다.


머큐리 테크놀로지 솔루션: 디지털화 가속화.

Originally published on MTS Blog & Research