Anthropicは、モデルアライメントを改善するAIシステムのトレーニングで最新の開発を示す新しい論文を公開しています。 紙は、自動研究システムが、全体的なパフォーマンスを低下させることなく、不一致のための10のマッチングベンチマークにモデル性能を増強したと述べた。

自動化されたシステムは、研究を完成させます。 お問い合わせ

紙は、自動化された研究者が確実に航空障害を軽減することができます。 研究は、Anthropic Fellow Chen Yueh-Hanによって導かれました。 紙に記述したシステムは、既存の文献を最初に取得し、約30分間モデルを訓練するために使用されるトレーニング方法論を提案します。

システムは、結果に基づいてベースラインの要件を上げ、複数のラウンドのテストを繰り返します。 効果的なメソッドは保持され、効果的なメソッドは排除されます。 紙で説明したこのプロセスは、従来の研究では「チェック、提案、実験、シフティング」に近いが、実装はより速く、より大きい。

10のベンチマークのアップグレード

紙は、与えられた10のアライメントベンチマークのうち、各ケースで自動システムが改善され、全体的な容量の減少をもたらしなかったと述べた。 これは、システムが特定の不一致に応答して変更することができるだけでなく、いくつかの程度の問題を避けることができることを意味します “1つまたは他の再定義”.

また、マニュアル研究者とシステムを比較しました。 論文は、自動整列研究方法論が最も適していると述べました, 平均して, 6 時間以内にシニア研究者によって提案されたプログラムを上回ります; そして、マニュアル主導の研究のオリエンテーションは、より強力な結果をもたらしませんでした.

コストを下げるが、ベンチマークの対象となる

また、紙は、自動アライメントシステムで1時間あたり約4ドルのAPI推論コストを提供し、Anthropicはマニュアル研究者にとって1時間あたり150ドルを支払います。

しかし、その論文は、方法論の明らかな制限とも呼ばれます。 自動化されたシステムの有効性は、アライメントのベンチマーク自身が実際の目的を正確に反映するように提供されます。 ベースライン設計が不十分な場合は、システム最適化の結果も実際のニーズから逸脱することがあります。

また、研究文書や評価システムを継続的に管理しています。 言い換えれば、自動研究者はテストとスクリーニングプロセスをスピードアップすることができますが、ベンチマーキング、更新情報とターゲットの校正で多くの作業は残っています。