アマゾンは、紙本の調達を通じてAIのトレーニングデータを補完していたというメディア調査が示されました。 ラスベガスの施設に送られた後、本はリッジから削除され、ページごとにスキャンされたページをスキャンし、その後は紙の形で破壊されました。
AirTagはベガス倉庫を追跡しました。
独立した技術メディア404メディアは、Apple AirTagを少数の本注文に入れ、その後、貨物が最終的にラスベガスのVGT3倉庫に到着したことを発見しました。 レポートは、チームのメインタスクが大量の書籍を受け取ることと、ページがより迅速にスキャナに送信できるように、バインディングパーツを削除することだったことをスタッフステートメントを引用します。
2022年、AIで書籍が普及しました。
AIの生成は最近、大量の紙本を再購入しました。2022以前に公開されたコンテンツが機械で生成されたテキストによって汚染されず、多くのテキストが完全にオンラインではなかったことである理由の1つです。 モデル開発者にとって、そのような材料は、生の訓練言語としての使用に適しています。
レポートでは、モデルがAI自身によって生成されたコンテンツを繰り返し吸収する場合、出力品質は引き続き低下する可能性があると言及しています。 その結果、大規模にデジタル化されていない、早期に公開された紙本は、トレーニングデータ市場におけるリソースが不足しています。
ブックスキャンは、著作権の訴訟でタンデムでウォームアップされています。
レポートはAmazonが例ではないことを示しています。 調達、解体、スキャン、紙本を廃棄するサプライチェーンは、AIトレーニングデータを中心に出現しています。 以前、Anthropicの社内プロジェクトは、数千万本の著名なデジタル化に晒されました。
近年、AI研修の適法性に関する論文が米国裁判所の裁判管轄に入りました。 連邦裁判官は、法律的に購入した本訓練AIの使用が合理的な使用を構成する可能性があることを以前に規定していたと述べました。 しかしながら、海賊版スキャンを伴うケースは同じではありません。 人類学は、これまで、海賊版本のスキャンに関する紛争で1.5億ドルの決済に至りました。また、 Salesforce は、書籍の盗難に関するクラスアクションに直面していました。
追加情報:Amazonの応答によると、顧客志向の製品やサービスを開発し、改善するために、企業は「商業的に本を買います」。 メディアによると、これは、関連する運用場所が特定の施設に公に向けられた初めてでした。
