DeepSeekは8月14日にエージェントフレームワークを開設しました。 DeepSeekモデルに接続するだけでなく、プラグインやMITライセンスの発行など、モデル、ツール、ストレージ、サンドボックスなどを設計できるクローズド製品自体は作りませんでした。 開発者は、他の企業からモデルにアクセスしたり、環境およびメモリシステムの実装を置き換えたりすることができます。 基礎的なモデルでよく知られている会社にとって、このオプションは重要です。DeepSeekは、「知能の仕組みを制御する」に「最もスマートな脳を提供する」競争的な立場から移動しています。

ハーネスは開発者のプレビューです。 正式に、それ以降の変更の明確なリマインダーは、互換性を損なう。 既にコードリポジトリを開き、ファイルを編集したり、コマンドを実行したり、Webページを検索したり、実装計画を開発したり、他のエージェントにタスクを割り当てたり、ツールの呼び出しを維持したり、結果を実行したり、インタラクティブレコードをモデル化したりします。 古いセッションは、以前のノードを続行または横断することができます。 これらの関数は、新しいモデルパラメータよりも可視性が低いが、エージェントが生産環境をデモンストレーションから入力できるかどうかを直接決定します。

ハーネスに加えて、DeepSeek V4-Pro-0813は注目を集めました。 DeepSeek のモデルがターミナル ベンチ 2.1 の 87.9 ポイントを受け取り、 Toolathlon-Verified および 71.1 および 67.2 ポイントをそれぞれ DSBench-FullStack および DSBench-Hard でそれぞれ 87.9 ポイントを受け取ったことを発表しました。 パブリックコーディングエージェントのテストでは、ハーネスの最小モデルを使用しました。 しかし、これらの数字はメーカーによって自己報告されており、すべてのビジネスシーンに直接装備することはできません。プレビューフレームワークが既に安定していることを単独で実証しましょう。

エージェントの真のハード部分は、回答から管理まで移動します。

単一の質問と回答は一見合理的な結果だけを必要としますが、エージェントは数十人の方向や数百のステップにとどまる必要があります。 すでに完了したことを覚えておく必要があります。ツールを呼び出すときは、結果が信頼できるかどうかを判断し、その能力の制限内で文書を変更し、間違った方法で行ったときに退役ノードを残してください。 モデルはキャッピングされ、実装フレームワークは、安全かつ繰り返し使用できる機能のセットかどうかを決定します。

これは、プラグインであるすべての最も実用的な値です。 企業は1つのモデルだけを使用しません。高リスクの使命は、強力なモデル、安価なモデルへのバルク分類、そして機密データはローカルモデルを必要とします。 ワークストリームがモデルの深さに結び付けられている場合、各価格または容量の変更はシステム全体をトリガーします。 ハーネスは、企業は、ミッションコスト、コンプライアンス要件、およびダイナミクスの遅延に応じてサプライヤーを選択できるように理論的に、モデルを楽しいコンポーネントに減らしました。

プラグインも隠れたエンジニアリングの問題を公開します。 サンドボックスがハザードの注文を隔離できるかどうか、それらがどのように配布されているか、長期的なメモリが保持されるか、失敗したミッションが復元され、監査人がエージェントの決定を再現できるかどうかは、実際に「モデルをよりスマートにする」よりも、そのビジネスが実際に支払う場所に近いです。 ハーネスは、セッションのステップを節約し、フォークリフトをサポートし、DeepSeekは、エージェントが回答よりも多く必要とすることを理解していますが、操作の保守可能な追跡可能で修復可能な履歴も説明しています。

しかし、オープン構造は、自動的にセキュリティをもたらすことはありません。 プラグインの数の増加は、サプライチェーンの攻撃の増加、権限の乱用、バージョンの競合へのアクセスを意味します。 MIT ライセンスは、商用利用の自由の大きな対応をしますが、ユーザの認証責任は負いません。 特に、フレームワークがプレビュー期間中に明確に表示されている場合は、生産データベースまたは分離された環境で評価されるよりもはるかに高いリスクで自動配信システムに直接リンクされます。

Open-source Agentフレームワークは、開発者のデフォルトポータルに競合します。

基本モデルは急速に更新されています。 モデルの容量の違いはまだありますが、API の価格が低下し続けています。バージョンは高速になり、企業は単一サプライヤーのターゲティングを避けるための取り組みを行っています。 モデルの外層になることができる人は、ツールの規格、プラグインのエコロジー、運用ログ、開発者の習慣を習得する可能性があります。 この位置は、単なるチャットインターフェースよりもAI-eraアプリケーション環境のようなものです。

DeepSeekは、競争モデルがハーネスに入ることを許可しました。これは、ホームモデルの排ガス率を低下させ、実際にそのエコロジーの影響を増加させる可能性があります。 開発者が最初にタスク、パーミッション、プラグインをハーネスで設定する場合、将来的には、モデルが置換される場合でもDeepSeekによって定義されたフレームワークにワークフローが残されます。 モデルは、収入を動員する唯一の目的ではなく、Agent ' s 開発のデフォルトベースとなる長期的な値と同じです。

勿論、ハーネスはこの大会に勝ったから遠く離れたところです。 開発者のプレビューは、インターフェイスが変化することを意味します, エコロジーはまだ成熟していません, 企業は、安定性を再検証する必要があります, 権限とメンテナンスコスト. 公式のベンチマークは、特に長いミッションの成功率、エラーの回復、トークン消費と買収の頻度に関して、独立してテストする必要があります。 エージェントの10分のデモンストレーションの使命は、リスクを作成せずに1ヶ月間実行できるという意味ではありません。

このオープンソースの最も重要な兆候は、DeepSeekが別の製品を持っていたことではなく、AIの境界線は拡大し続けました。 モデリング会社は、エージェントの動作層、ツールやデータエントリのクラウドメーカー、プラグインの規範を開発するためのプラットフォームのために競争し始めています。 成功の次の段階は、誰がリストにあるかによって決定されるだけでなく、実際のシステム内の異なるモデルを安定させ、各ステップで見、拘束され、撤退することができる人によって決定されることはありません。 ハーネスが与えられた答えは開いていますが、その日の熱ではなく、製造環境によって標準になるかどうかがまだ実証されています。