8 月 25 日、OpenAI は、Jalalapeño の推論の自己研究の結果を発表しました。 同社によると、GPT-OSS 120B を使用したオープン InferenceX ベンチマークでは、チップは、比較に関与する商用システムよりも高いピークと低いトークン遅延を達成しました。 また、DeepSeek R1 と Kimi K2 で強く実行しました。 OpenAIは、現在、最初のチップとそれ以降の生成が開発されていることを示しています。

正確な境界線のこのリリースは、Galpeñoがすでに大規模にすべてのデータセンターをレイアウトしていないので、トレーニングと推論だけで自己学習ハードウェアに移行しました。 公開記事は、生産、プロセス、シングルカード力、メモリ容量、システム販売またはフル展開スケジュールのサイズを与えません。また、それらは、比較システムのフル構成を示しています。 モデル、サービスソフトウェア、チップ、メモリ、ネットワークの共同設計の設計の計画段階から検出可能なシリコンフェーズに移動したことを確認することができます。 確認されていないものは、一般的に実際の総所有コストでリードを取ったことです。

トークンの遅延が各キロワットの嘔吐のために表示されている間ピークは一定の負荷の代替はできません。

推論チップの競争は、多くの場合、毎秒より多くのトークンを生成するために簡素化されます, しかし、大規模なサービスは、最初のトークンタイムによっても制約されます, トークンツートークン遅延, 共同処理ユーザー, バッチサイズ, モデルの精度, コンテキストの長さ, メモリの帯域幅と消費電力. OpenAIは、確立されたトークンの遅延とキロワットごとのエネルギー効率の測定でスループットの拡大に特に重点を置いています。Jalalapeñoは単一のピークの追求ではなく、継続的な運用の経済的推論を目標としています。

GPT-OSS 120B をオープンベンチマークとして使用することにより、外部の比較を容易にします。テストの対象は、社内では使用できないプライベートモデルではありません。DeepSeek R1 と Kimi K2 の結果は、モデルファミリーだけでなく、最適化を実証するために使用されます。 しかし、プレスリリースは、十分に詳細な生データ、ソフトウェアバージョン、精密モデル、バッチパラメーター、実験スクリプトを複製するリリースと同期しません。 定量的精度、遅延ターゲットまたはハングパワーの定義に矛盾がある場合、異なるシステムのランキングが変更される可能性があります。 したがって、この段階では、パフォーマンスの最初のパーティステートメントとして結果を考慮すると、InferenceXエントリーとサードパーティの再承認を終わらせます。

モデルによるチップの共同最適化により、汎用ハードウェアの冗長性を低減し、互換性のある負荷を軽減します。また、ライフサイクルリスクを提示します。 モデル構造は、通常、チップ設計と製造サイクルよりも速く変化します。, 注目のために今日最適化されているハードウェア, 混合専門家や特定のメモリアクセスは、将来の異なる計算に直面することができます. OpenAIは、最初のチップが高速で実行できるだけでなく、コンパイラ、実行時間、ソフトウェア倉庫がモデル変更で追いつくことができることを証明しなければなりません。

エネルギー効率は、チップの努力に等しいだけでなく、. 格納庫ネットワーク、メモリ、冷却、電力変換、低利用スタンバイは、データセンターの実際のトークン消費に影響を及ぼします。 ピークは重要な指標ですが、直接平均年間費用を課すものではありません。 商用価値の本当の決定は、システムが本物リクエストの変動、長いコンテキスト、ユーティリティコール、複数のモデルパスで同じ利点を維持できるかどうかです。

セルフスタディチップは、供給オプションを追加し、電力を取り巻く, ないエンドの協力.

OpenAIは、パートナーアクセラレータを超えて信頼できるファーストパーティパスとしてJalalapeñoを配置しました。 同社は、その成長のためにマイクロソフトとNVIDIAの根本的な役割を明らかにし、計算の組み合わせもAWS、AMD、ブロードコム、Cerebras、CoreWeave、Oracle、SBエネルギーおよびソフトバンクを含むことを示しました。 異なる種類のトレーニング、バルク推論、低遅延の推論と永続的なインテリジェントミッションは、異なるハードウェアを必要とし、企業は、最高のパフォーマンスとコストにマッチするシステムに負荷を置きます。

OpenAIでは、自己学習チップの戦略的価値は3つのレイヤーです。 まず、独自の高周波推論パターンを最適化し、マージンサービスのコストを削減します。 第二に、供給制約の時に制御可能な容量ルートを増加させます。 第三に、代替オプションを通じて調達バーゲン電力を維持します。 ガラペニョの割合が低い場合でも、外部アクセラレータの価格と展開のペースは十分な安定した負荷を運ぶことができる限り影響を受ける可能性があります。

この制御は製造業、シーリング、HBM、ネットワークおよびデータセンターの建設パートナーに依存します。 いわゆる「セルフスタディ」は通常、アーキテクチャとシステム設計が企業主導であり、すべての物理的なリンクがOpenAIによって完了しているという意味ではありません。 サプライチェーンの能力、ソフトウェアの移行コスト、および新世代の重複は、測定チップから安定した生産に移行できるかどうかを決定します。 記事は、生産の日付を開示しないので、「仕事のシリコーンは既に存在しています」という言葉は「完全なコマーシャル」として書かれるべきではありません。

クラウドサービスやAPIユーザーの場合、Galapeño は製品インターフェイスを短期的に変更するわけではありません。 より高いエネルギー効率は、より低い遅延、より高いクォータ、またはユニットコストのためのスペースを作成することができますが、価格への伝送は、容量、需要、製品戦略の組み合わせによって決定されます。 ユーザーは、セルフスタディチップが自動的に価格削減につながるという前提よりも、サービスレベル、モデルの一貫性、プライバシーの境界に焦点を当てるべきです。

この開示の実際の変更は、計算機のOpenAIの位置です。 それはもはや単なる大加速器買い手ではありませんが、測定可能なファーストパーティの推論ハードウェアを所有し始めています。 次のフェーズでテストする必要があるのは、アドボカシーの「リーディング」ではありませんが、オープンベンチマークの再エマージ、実際のクラスターの長期安定化、デプロイメントのスケール、および企業が複数のパートナーを引き続き使用しながら、自己学習ハードウェアを1オフ経済レバーではなく、持続的に変える能力です。

出典:OpenAI、予想の背後にあるフルスタック、2026年8月25日、https://openai.com/index/the-Full-stack-behind-abundant-intelligence/