もう少し詳しく
AIアラインメントとは、AIモデルが持つ目標や実際の振る舞いを、開発者や利用者が本来意図した目標・価値観に{整合:せいごう}させるための考え方や技術の総称です。逆に、AIの目標や振る舞いが人間の意図からずれてしまっている状態は「ミスアラインメント」と呼ばれます。
どこで使われるか
AI開発企業は、モデルを外部に公開する前後で、指示に反した行動を取らないか、有害な内容を生成しないかなどを確認する安全性評価の枠組みとしてアラインメントの考え方を使います。企業によっては、自社のAIが引き起こしうるリスクを定期的に公表する報告書の中で、ミスアラインメントの可能性を段階的に評価していることもあります。
身近な例
チャットAIに危険な行為の手順を尋ねても、多くのAIが拒否したり、安全な情報にとどめて回答したりするのは、開発時のアラインメントの取り組みの結果です。AIが指示された作業の範囲を超えて、意図しない操作を勝手に行ってしまうような状況は、ミスアラインメントの一例として説明されることがあります。
注意点
AIアラインメントは技術的にも研究段階の分野であり、「完全にアラインメントが取れている」と保証する方法は確立されていません。AI企業が自社のリスク評価を公表する場合も、その評価基準や判断は企業自身によるものであることが多く、内容を鵜呑みにせず、第三者による検証の有無にも注目することが大切です。
