TechCrunch は、Amazon が膨大な数のレアブックを購入し、ポストリッジスキャニングを削除し、AIモデルを訓練するために使用できるテキストデータを取得することを 404 メディアレポートを参照しています。 追跡者に配置された珍しい本は、最終的にラスベガスのアマゾン施設に送られました。

VGT3に追跡された予約

本書がついにVGT3と呼ばれるアマゾン施設に到達したメディア状態。 恐竜の爪で「本」とマークされています。 Amazonは、クライアントが使用する製品やサービスを改善するために、同社が商用チャネルを通じて書籍を購入する404メディアに示しました。

新しい言語のソースとして認識テキスト

レポートは、大規模な言語モデルのトレーニングに大量のテキストデータが必要であること、インターネット上で直接利用できるパブリックコンテンツが広く使用されていることを示しています。 Amazonia、ハード・ツー・リーチ、まれな、またはオンライン・ブックなどの企業は、トレーニングの新しいソースになっています。

型式の研修シフトについて

そのようなテキストの値は、2022よりも以前に公開されたコンテンツもAI生成されたテキストが含まれていません。 モデルは、あまりにも多くのAI生成されたコンテンツを摂取し続けると述べた, そこに “モデル崩壊”, i.e. 出力品質の段階的な低下. また、AIが品質元のテキストを取得する方法について再び焦点を合わせることも可能です。