大データスクランブル: AI企業が古い本を買う理由

大データスクランブル: AI企業が古い本を買う理由
要約: AI企業は2022年以前に出版された物理的な本をパニック買いしています。懐かしさのためではなく、生存のためです。インターネットは今やコピーのコピーであり、AI出力で訓練されたAIの各世代はますます愚かになっています。2022年以前の本は、規模で証明可能な人間が書いた最後のテキストコーパスです。Anthropicは「プロジェクト・パナマ」に数百万ドルを費やしました — 大量購入、背表紙を切り、スキャンし、物理的な本を破壊して法的に防御可能な人間データの金庫を構築しました。連邦裁判官はちょうど線を引きました: 本を買い、原本を破壊し、内部に保管すれば問題ありません。海賊版PDFをダウンロードすれば、15億ドルの訴訟を受けます。本の本当の話は本についてではありません。それは新たな希少性としての出所無限で価値のないコンテンツの時代に。
こちらは、マーキュリーテクノロジーソリューションズのCEO、ジェームズです。 香港 — 2026年8月
ISBNdbギャンビット
ISBNdbという会社 — 本のメタデータのデータベース、まさにその通りのもの — が最近、AI企業向けに新しいサービスを提供し始めました:大量の物理書籍調達。
1,000冊の本が必要ですか?彼らはそれを見つけます。1百万冊が必要ですか?彼らは図書館、中古書店、絶版カタログを一掃します。彼らの売り文句は?"世界最高のAIトレーニングデータは棚に置かれています。"
ここがポイントです:彼らは特に2022年以前に出版された本を求めています。
なぜそのカットオフなのか?2022年11月にChatGPTが登場したからです。それ以降、インターネットは主に人間が書いたものではなくなりました。それは再帰的なエコーチェンバーになりました — AIが書いたものがAIが書いたものに基づいて訓練され、さらにAIが書いたものに基づいて訓練されるようになりました。テクノロジー業界はそれに対して用語を作りました:"AIスロップ。"(中国語の翻訳はより生々しいです:AI泔水 — AIの下水油。)
コピー問題
こう考えてみてください:コピーを作ります。次に、そのコピーをコピーします。さらに、そのコピーをコピーします。それのコピーです。最初に消えるのは大きく太字の見出しではなく、微妙な詳細、エッジの質感、珍しい表現、少数派の視点です。世代が進むにつれて、すべてが灰色の mush に収束します。
AI 研究者はこれを「モデル崩壊」と呼びます。理論的なことではなく、今まさに起こっています。主に以前の AI 出力に基づいて訓練された新しいモデルは、忠実度を失います。人間の知識の長い尾が削ぎ落とされます。奇妙なもの、ニッチなもの、本当にオリジナルなもの — すべてが平均化されてしまいます。
合成データ自体は毒ではありません。人間のキュレーションと実データのアンカーを用いて慎重に使用すれば、機能することができます。しかし、問題はここにあります:インターネットはもはや人間と機械の違いを教えてくれません。この記事は人によって書かれたものですか?AIですか?人によって書き直されたAIですか?AIによって書き直された人ですか?出所の連鎖が途切れています。
2021年または1952年に印刷された物理的な本は、非常に特定のものになります:証明可能な人間の遺物。
プロジェクト・パナマ:アンソロピックの15億ドルの法的ハック
クロードの背後にいる会社アンソロピックは、本の購入から始まりませんでした。彼らは海賊行為から始まりました。
初期には、彼らは海賊サイトから何百万冊もの本をダウンロードしました。著作権リスクが高まると、彼らは大きく方向転換しました。2024年から、彼らは何百万ドルを費やしました。"プロジェクト・パナマ" — 物理的な本を大量に購入し、背表紙を切り落とし、高速スキャナーでページを読み取り、内容をデジタル化するプログラムです。物理的な本を破壊する。デジタルファイルはAnthropicの内部データベースに保存され、配布されることはありません。
名前?公式な説明はありません。ミッション?映画のキャッチコピーのようです:"世界中のすべての本を破壊的にスキャンする。"
本好きとして、私の直感的な反応は嫌悪感でした。それから裁判所の判決を読みました。
連邦裁判官の三部構成のテスト
にBartz v. Anthropic, 米国連邦裁判官はAnthropicの行動を明確な法的カテゴリーに分けました:
第1部 — 書籍のテキストでのトレーニング:これらの特定の事実に基づく公正使用。
第2部 — 物理的な書籍を購入 → 内部デジタルコピーを作成 → 原本を破棄 → 配布なし:これも公正使用。
第3部 — 海賊サイトから何百万冊もの書籍をダウンロード → 中央データベースに保存: 公正使用ではありません。
同じ本。同じトレーニング目的。異なる法的結果。ラインは「支払いましたか?」ではなく、フルスタックです:法的購入、単一変換、元の破棄、内部使用、配布なし。
Anthropicは最終的に海賊行為の請求を和解しました。$15億。罰金ではなく、和解です。つまり、戦うことが支払うことよりも悪いと計算したのです。そして$15億は、何百万もの著者や出版社と個別のライセンスを交渉するよりもまだ安かったのです。
これは普遍的な法律ではありません。1人の連邦地区裁判官、1件のケース、1つの解釈です。しかし、プレイブックを描くには十分です。そしてISBNdbはビジネスモデルを見ました。
なぜクロードはより人間らしく感じたのか
クロードを使用したことがあるなら、何かに気付いたかもしれません:その文章はしばしばより自然で、より地に足がついていて、より人間 競合他社よりも。今、あなたはその理由を知っています。他の人々がスロップで満たされたインターネットで訓練されている間、クロードは数百万の実際の本で部分的に訓練されました — 本物の人間の文章、編集され、キュレーションされ、出版され、すべての混乱と特異性を伴っています。
15億ドルの和解は、アンソロピックに法的な平和以上のものをもたらしました:それは、証明可能な人間データの市場を検証しました。
真の希少性はコンテンツではなく、出所です
重要な再構築はこれです:
私たちは数十年にわたり、デジタルが希少性を解決したと考えてきました。無限のコピー。ゼロの限界コスト。情報は自由であるべきです。そしてAIはコンテンツ生成を事実上無料にしました。今、私たちは無限のテキストを生成できます。何も言わない無限のテキスト。
しかし、1952年の物理学教科書 — 手書きのフォント、手描きの図、インクの匂いがするミメオグラフのページ — は、AIが生成できない何かを持っています:人間の判断の連鎖。誰かがこのテーマは数年の労力に値すると決めました。誰かが資料を集めました。編集者が何を残すかを選びました。読者は購入や引用で投票しました。この本は人間の注意と意思決定の化石記録です。
先週、NYUの図書館に行きました。1952年の新入生向け物理学テキストを手に取りました。すべての図、すべてのフォントの選択、すべてのページレイアウト — 明らかに手作りです。手書きでテストを作成し、その後ミメオグラフのドラムを通した教師のようです。AI生成の質問よりも効率的ではありませんが、その背後には、あなたは見ることができます人の思考。
ほとんどの大学図書館のコレクションにはデジタルフットプリントがありません。インターネットは彼らの存在を知りません。だからこそ、彼らは価値があるのです。
あなたのデータの金鉱
これは単に本についてのことではありません。2022年以前の運用データを持つすべてのビジネスは、出所資産を所有しています。
• ファッションEコマース会社のバイヤー写真 — 実際の人間、実際の照明、実際の欠陥
• 工場の生産ログ — 実際の失敗、実際の調整、実際の不確実性の下での決定
• 2019年のカスタマーサービスのトランスクリプト — 実際のフラストレーション、実際の問題解決、実際の人間の相互作用
最も高価なデータは、最も秘密のものでも、最も大きなものでもありません。それは、どこから来たのか、誰がそれを価値あるものと判断したのか、なぜそれが信頼できるのかを証明できるデータです。
新しい価値の方程式
古い方程式: より多くのデータ = より良いモデル。
新しい方程式:出所 × 人間の判断 = 希少性 = 価値。
AI企業は古い本を買っていません。紙はピクセルに勝るからです。彼らが買っているのは人間性の証明です。機械が無限の信頼できるテキストを生成できる世界では、重要なのはそれが実際に人間によって書かれたか、考えられたか、完成させるために十分に気にかけられたかだけです。
コンテンツを蓄積するのをやめましょう。出所を蓄積し始めましょう。
あなたの棚の本は戦略的資産になりました。2022年以前のアーカイブのデータ?それはレガシーではありません — それは人類の最後の検証可能な指紋です。
マーキュリー・テクノロジー・ソリューションズ:デジタル化を加速する。
Originally published on MTS Blog & Research