競争のスピードアップを加速させるAIが温まる。 フランスの元の会社コグは、チップの自己学習を選ぶことができませんでした, しかし、むしろ、さらに、エンタープライズGPUの既存のデータセンターの推論を解明するために、ボトムソフトウェアの最適化に留意しました.
初めてハイタイムのシナリオを狙います。
今年5月にテクノロジープレビューで注目を集めました。 その後、AMD MI300XやNvidia H200 GPUなどの標準的なデータセンターを使用して、非常に高速なシングルリクエストデコーダー速度を達成することができることを実証しました。 同社は、その後、展覧会が約200の明確なビジネスリードをもたらしたと述べた。
Kogは現在、高い応答速度、特にソフトウェアエンジニアリングのシナリオを必要とするプロフェッショナルなワークフローに優先的に注目しています。 同社によると、ユーザが数時間で重厚なコードの一部を生成でき、推論の遅延は、経験と使用コストに影響を与える重要な問題となっています。
また、一部の設計パートナーと協力して、アプリケーションの着陸を容易にします。 そのような顧客は、ユーザーがヒントを通してゲームやアプリケーションを生成することができます。これは、推論のペースが増加すると、通常、より高い変換効率と収入空間を意味します。
小さいモデルは30000 TPS出ます
以前は「大型モデル推論で30倍速」という目標を提唱していたが、公共のデモンストレーションは、主に小型モデルをベースにした。 レーンフォーマー2Bの約2億個のパラメータを使用して表示され、毎秒30000トークンの単一の控除速度を要求しました。 モデルが開きます。
しかし、市場需要は小型モデルの微調整で止まりませんでした。 コグは、実証の発表以来、小規模なモデルに焦点を合わせる見込み客が準備されていないことを指摘し、実際のニーズに合った大型モデルの開発を加速するために、同社の主な努力をシフトしました。
9月頃の大型モデル能力の検証
コグは、理解のコードのGPUの潜在能力はまだ完全にリリースされていないと信じています。 同社のCEOであるGaël Delalleauは、GPUメモリ帯域幅の新世代として、ソフトウェア層の最適化のためにまだ多くの部屋があったと述べました。
このアプローチのコストは、より長いR&Dサイクルです。 コグは、各適切な新しいGPUのために、多くの場合、ハードウェアレベルの研究で数週間または数ヶ月を投資する必要があります。 現行の11人チーム規模で、短期間でサポートできるチップ数。
今後、よりチップやモデルをサポートするインテリジェントな開発プロセスに方法論を徐々にアクセスしていく予定です。 現時点でもっと重要なノードは、大きなモデルにルートが構築されていることを証明することです。 同社は9月頃より約10倍のスピードで最初の主要なモデルを完成させ、クライアントの進捗を実証し、フォローアップラウンドAを促進することを期待しています。
