Axiosによると、米国の破産裁判所の文書を引用し、Googleはスピリット航空の資産処分競争で1,000万ドルの事業データを社内で獲得し、約100万人の電子メール、500万人のMicrosoftチームチャットレコード、カレンダー、文書、フォーム、その他の運用情報をカバーしています。 Googleは、データがマークされていないと、製品を改善し、AIモデルを訓練するために使用できるメディアに示しました。 取引はまだ破産裁判所によって承認される必要があるので、より正確な表現は、データを渡すよりもむしろ「成功し、司法確認を待っています」。

最大の関心事の1人あたり10万ドルではなく、ビジネスの日常業務がそのような視覚的な方法でマークされるのは初めてです。 過去には、大規模なモデル企業が購入した一般的なデータには、オープンウェブページ、認定出版物、コードライブラリ、画像、専門データベースが含まれています。 スピリットは、実際のビジネスがどのように機能するかについてのレコードのセットを残しました。従業員がどのように問題、部門がどのようにコラボレーションするか、どのようにフォームが渡されるか、プロセスが変更されるか、異常がアップグレードされるか。 このタイプのデータは、モデルが組織された知識ファイルの場合よりも将来的に行われると予想される仕事に近いです。

単なる言葉ではなく、プロセスから得られる企業データの希少性

600万人のメールやチャットは、600万人の質の高いトレーニングサンプルを等しくしません。 元の企業データは、通常、重複通知、不足している添付ファイル、頭字語、無効なコピーとコンテキストのブレークがいっぱいです。 本当に貴重な部分は、情報間の時間、役割とタスクの関係です。クライアントの問題は、フロントラインから運用部門にどのように移動するか、予算は意思決定のために議論され、システム故障が配置され、閉鎖される方法です。 モデルは、これらのチェーンについて学習した場合, 目標は、まともな電子メールを生成するために、もはやありません, しかし、組織内のジョブの進捗状況を理解するために.

大会に参加するGoogleの意思について説明しています。 オープンインターネットは豊富な知識を提供していますが、企業内での意思決定プロセスの完全な画像を表示することは困難です。 多くのAIエージェントは、概要を記述し、プレゼンテーションでフォームを記入することができますが、実際の作業環境を入力すると、特権、バージョン、承認、例外が発生します。 構造とプロセスを持つエンタープライズデータは、アプリケーションタスク、ドキュメントの関連性、異なるジョブの通信モードを学習するのに役立ちます。

しかし、サイズは効果に自動的に変換されません。 スピリットは、フライトの動き、メンテナンス、旅客サービス、規制要件の影響を受ける航空会社です。 航空シーンではデータが豊富で、他の業界に直接転送できない場合があります。 スピリットが運用を中止し、資産の処分に入ったという事実は、障害の期間中に特別な騒音を含む可能性があることを意味します。 トレーナーは、通常のプロセス、危機の状況、および時々のエラーを区別する必要があります。そうしないと、モデルは、複製されない組織習慣を学ぶことができます。

10億ドルの取引は、ラフな参照を提供します。 データが合法的に転送される場合、明確なソースを持ち、実際の作業シーンを覆うと、それは不溶性の資産となり、サーバーコンテンツが待っている除去になることができます。 将来のビジネスファイナンスでは、M&Aおよび清算、データのカタログ、認可の範囲、保持期間およびトレーニング期間は、ソフトウェア著作権および顧客の契約の場合として評価リストを入力することができます。

マークは終わりではありません。 裁判所は、権利のチェーン全体を調べています。

報告された「備考」は、個人を直接識別するリスクを低減しますが、すべてのプライバシーとビジネスの秘密を自動的に対処しません。 顧客からの苦情、ベンダー価格、従業員の評価、セキュリティプロセス、内部調査を含む場合があります。 名前、メールボックス、アカウント番号が削除される場合でも、時間、投稿、ルート、またはまれなイベントの組み合わせは、特定の個人や企業にリダイレクトされる部分的なレコードにつながる可能性があります。 データの買い手は処置が明示的な印を取除くだけでなく、推論、モデル記憶および輸出漏出を制御することを証明する必要があります。

元の参加者が、外部の企業モデルを訓練するために通信が使用されると予想していたかどうか別の重要な質問でした。 「保有レコード」は「制限なく販売できるレコード」と全く同じではありません。 裁判所の承認プロセスは、不動産の処分の合法性のレビューを必要とし、関連する契約、プライバシーポリシー、規制上の義務と課題メカニズムは、まだ最終的なスコープに影響を与える可能性があります。

Googleでは、最も安全なパスは、データを直接トレーニングに入れるのではなく、ストラテジーを確立し、限界とトレーサビリティを使用する。 リスクの高いフィールドは、プライバシーの攻撃とトレーニングの結果のためにテストされたサンプルで、メモリレプリケーションの対象外である必要があります。 特定の企業機能、アクセス、保持期間および除去メカニズムにのみ使用されるデータは、使用と一致する必要があります。 データを傷つけるほど、より鮮明な処理記録が必要です。

取引は、ビジネスデータガバナンス契約にも影響を及ぼします。 将来的には、クラウドサービスプロバイダ、共同ソフトウェアおよび従業員との合意に入った場合、データが不溶性、合併、買収または業務の終了、バックアップと業務の継続とモデルのトレーニングの目的を区別した後にどのように処分されるかを明確にする必要があります。 事前承認の権利がなければ、技術的に識別できない場合でも、資産を売却したときに長期にわたる紛争が発生する可能性があります。

この未完成のトランザクションは、AI業界における新しいフェーズを明らかにします。モデルの競争は、「よりオープンなWebページをキャプチャする」から「法的、構造化、および現実的なジョブ固有のデータを取得」に移動しています。 したがって、データ市場は、より高価になり、失礼の対象となります。 オフ・ザ・シェルフの答えではなく、ジョイント・コート、プライバシー・ワーク、モデル・アセスメントを要求する適切な作業として、1,000万ドルが購入されました。