8月27日、イタリア・ボコニー大学のOpenAIと研究者が、教育における最も困難な質問の1つに答えるために、ランダムな実験を発表しました。 生徒がAIを生成したときに、仕事の質、推論、オリジナリティの変化はどのように変化しますか? ボコニ大学の1年生から1,000名以上の学部生が実験に携わり、学校土産店のマーケティングアドバイスを依頼しました。 研究者は、クラスタイムで4つのグループにランダムに分けられた: GPT-4o を使用して、原因論点の訓練を受け、両方またはどれも。
結果は「AIのいい」や「AIの悪い」ではありません。 ChatGPTを受け取った学生は、平均して、5ポイントのマニュアルスコアでほぼ1ポイント増加し、回答には、よりアイデア、より明確なロジック、専門家の助言に近づいています。 原因で訓練された学生は、従来のスケールで大幅に改善しません, むしろ、より広範な同様のアイデアを提供し、プログラムが効果的であり、彼らが失敗する条件下で説明. 同時にAIで訓練された学生は、回答の質と多様なアイデアの利点を保持しています。
研究は、与えられた教室のタスクで因果性の証拠を提供します, ない “AIは完全に学生の能力を向上させました”. このサンプルは、GPT-4oモデルを使用して、ケースをマーケティングする作業で、同じビジネス大学で初年度の学生から来ました。 結論は、数学的な証明書、歴史の執筆、プログラミング、薬、または一次および二次学校のクラスにコピーされ、新しい実験を必要としていました。 また、OpenAI経済研究の参加に伴い、論文の方法論、データ、潜在的な利点をご覧いただけます。
AIは、完成品の品質を向上させるだけでなく、伝統的なスコアのブラインドスポットを露出します。
生徒が提出した内容は、店舗の可視性や使用率を高める2つの目的に対応する推奨事項の有効性に焦点を当てた5点スケールに基づいて訓練されたマニュアルスコアラーによって評価されました。 ChatGPTは、ほぼ1つのポイントで上げられたグループです。このモデルは、より早く構造、式、および一般的な専門フレームワークにアクセスできるように提案しています。 生徒は、単に出力をコピーする必要はありません。彼らはまだ質問、画面の推奨事項、最終回答をグループ化する方法を決定します。しかし、AIは、「専門家の仕事のような外観」を生成するためのしきい値を大幅に下げます。
問題は従来のスケールがより容易に明確、完了し、慣習的な答えを、必ずしも独特であることができないことです。 JRTは、仲間の学生とあまり似ていないプログラムを提案することができましたが、その違いは、合計スコアに完全に反映されませんでした。 研究者が様々なアイデアを観察する自動テキスト解析、違いの程度、原因説明、専門家のテキストと類似性を観察するだけです。
学校の最終製品だけを見続けると、学生が本当に理解していることを区別することがますます困難になります。 成熟したプログラムは、徹底した学生の推論から来るか、モデルが提供する構造から主に来るかもしれません。 逆に、新しい道を提案するのに十分なスムーズではない答えは、より高い独立した判断を伴います。 設計の評価は、「完成品の規格」から問題の定義、証拠の選択、仮説検査、プロセス記録および経口防衛まで拡張する必要があります。
カルマトレーニング自体はAIをターゲットにしていません。 ゲーム、ケース、問題、学習の原因と結果のフィードバックを通して、学生は、プログラムが成功または失敗できる理由を疑問に思います。 従来のスコアを上げませんが、むしろ推論とアイデアの多様性を高めます。 重要な考え方は抽象的なスローガンではなく、実践できる特定の行動に分解し、特定の評価指標を見られるように要求することができる学校を思い出させます。
最も合理的な教室の戦略は、無効化したり、行かないようにしますが、2つの能力を組み合わせる。
ChatGPTと原因の実験で訓練された学生は、AIグループだけの使用に近いスコアとアイデアを与えられました, アイデアの多様性は、推論グループだけを受信することに近づいていました; 彼らはまた、より大きな論理的な一貫性を示し、説明と課題の仮定を求めることを喜んでいました. AIツールや思考のトレーニングがゼロサム関係ではないことを示唆しています。 モデルは、学生が知識と表現のしきい値を渡るのを助けることができ、トレーニングは、すべての回答の同じ美しいセットを避けるのに役立ちます。
教室の実装はステージに分けることができます。 生徒は、質問、仮定、初期プログラムを独立して記述し、AIを使用してビューを拡大または改善します。その後、採用や拒絶の理由を述べたモデルから派生したものを指摘し、最終的に口頭の議論や移行の新しい状況による理解を検証します。 格付けは、完成品、独創性、包装チェーン、証拠の信頼性と反射プロセスの品質をそれぞれ考慮に入れます。 そのため、AIは効率性を提供しますが、判断の代わりにはありません。
教師は、タスクとデータ境界を制御することもできます。 研究の使命は、非常に機密性の高い個人情報に対処しません, 実際の生活の教室は、学生の記録を含むことができます, 健康や家族資料. 管理されたアカウントを使用する必要があります。, データのアップロード可能性を制限し、エラーをレビューする人を特定します。. 未成年者の場合、保護者の知識、年齢の要件、退会のメカニズムも対処します。
再編研究も重要である。 フォローアップ実験は、学校、懲戒、モデル、タスクを困難に置き換えるべきであり、それより短期的、独立した応答の数週間に翻訳する高いスコア、および文書の学生の「実際のヒント、変更プロセスと実際のエラー。 教育的価値観やツールは、AIを使用するときにのみうまく実行する学生が移行する能力を開発しない場合は、別々に評価する必要があります。 逆に、教室の設計の継続的な学習効果は、構造化された使用が徐々に質問をし、原因のチェーンを調べるのに役立つという事実によって示されています。
実験の最も重要な結論は、ChatGPTが学生を「スマート」としていたことではありませんでしたが、その異なる教育的介入が異なる次元を改善しました。 AIは、より専門的かつ完全な答えを作ります。 原因は、アイデアの幅を広げ、国境を詳しく説明するために訓練されています。 ポリッシュされた回答だけに報いる学校は、その独創性を残します。AIだけが禁止されている場合、彼らはまた、スターターがプロのフレームワークに近づくのを助けるためのツールを提供します。 本当に何をすべきかは、仕事とスコアリングでより多くのことを行うことです, ツールと独立した人間の推論は、学習結果として見られ、テストすることができますように.
