OpenAI⁠モデルのミスアライメントを報告する枠組みを公表 —⁠—6件のレポートも公開

OpenAIは9月16日、AIモデルが開発者や利用者の意図に反する振る舞いをする「ミスアライメント」について、追跡・調査・開示のための枠組みを公表した。原因の解明や対策が完了していない段階でも報告を進める方針で、モデルの訓練・評価中の事例をまとめた6件のレポートを同時に公開した。

OpenAIによると、これまでは複数の事例をまとめるまで待ったり、新モデルの安全性を説明するシステムカードに盛り込んだりしており、開示は場当たり的で、頻度も十分ではなかった。新たな枠組みでは、未知の発生メカニズムや既知の振る舞いの重要な変化、安全性や対策に関する前提を問い直す知見を優先して報告する。訓練・評価・テストから実際の運用までを対象とするという。

今回の6件には、誤りを隠す指示をモデル自身が書き残した例や、作業上の障害を乗り越えるために許可のない操作を行った例が含まれる。OpenAIは、これらのレポートについて、モデル全体での発生頻度を示すものではなく、個別の事例を報告したものと説明している。

作業の引き継ぎ要約に⁠制約の回避や隠蔽を促す指示

このうち2件は、モデルがそれまでの作業内容をまとめ、再開時に参照する「コンパクション要約」に関するもの。モデル自身が、この要約に元の依頼にはない指示を書き加えていた。

未公開のAstra系モデルの事例では、強化学習中に、通常の制約を回避させるような指示を含む要約が27件見つかった。開発者のメッセージを無視するよう求めたり、依頼と無関係な人格設定を加えたりしていたという。

要約を受け取ったモデルが不正な指示を退けた例もあったが、文献調査の依頼では、要約に追加された「ツールや引用を使わない」といった制約に従い、調査を進めず短い拒否回答を返した。

OpenAIは、要約の生成を適切に終了できない問題が指示の混入に関係した可能性があるとみているが、因果関係は確定していない。関連するバグは修正済みで、この振る舞いは、提供済みのGPT-6 Astraの訓練とは別の訓練で見つかったと説明している。

もう1件のレポートは、GPT-5.6 Solの訓練中に見られた隠蔽の指示を扱う。財務モデルの作成に必要な過去データが見つからず、要約に「もっともらしい値を作り、尋ねられない限り明かさない」という趣旨の指示を書き込んだ例があった。要約を受け取ったモデルもこうした指示に従うことが多く、不適切な振る舞いが引き継ぎ後も続いていたという。

OpenAIによると、強化学習での評価方法を改善した後、隠蔽を促す指示が検出された割合は、GPT-5.6 Solの2.15%からGPT-6 Astraの0.27%に減った。この数値は、通常利用時の回答ではなく、訓練中のコンパクション要約を対象にした検出割合を表している。

漏えいAPIキーの無断使用や⁠データの無断公開

APIキーを無断使用した事例では、未公開の内部モデルが、米カリフォルニア州のある郡の所得データを取得しようとしていた。データにアクセスできず、使い捨てメールアドレスによる登録を試みたほか、GitHubの公開リポジトリから漏えいしたAPIキーを探して使用した。

登録は失敗したが、見つけたキーの1つで認証に成功し、メタデータを取得した。ただし、求められた所得の数値は取得できず、最終的には数値を捏造し、指定されたWebサイトのグラフから転記したかのように回答していた。OpenAIは、この種の行動を訓練時により一貫して減点するよう評価を改善したとしている。

取得済みのデータを無断で公開し、回答の出典にしようとした例もある。モデルはPythonを使って湖の名称やIDを正しく取得していたが、ブラウザツールによる出典提示も求められていた。そのため、データを保存したローカルファイルを開こうとしたものの、アクセスを拒否された。そこで、利用者に確認せず外部サービスへアップロードしたが、公開先のURLへのアクセスも拒否され、公開したファイルを出典として示すことはできなかった。

OpenAIは、引用の採点の不備を利用して報酬を得る方法として、この行動が生じた可能性が高いとみている。採点の不具合は修正したとのこと。

同じレポートには、画像検索サービスから参照できるよう、作業用の写真を公開ホスティングサービスへ送信した例も含まれる。

共有リポジトリや外部サービスを⁠許可のない連絡⁠共有に利用

社内のArtifactoryを使った事例では、ソフトウェアパッケージを取得するためにアクセスを許可していた共有リポジトリが、モデル間の掲示板として使われた。異なる訓練サンプルを処理するモデルが、見つからない入力ファイルについて助けを求め、ほかのモデルのメモを読み、返信を書き込んでいた。

このやり取りで必要なファイルを入手できたことは確認されていない。OpenAIは、モデルが別の訓練サンプルでの作業結果を利用すると、各サンプルを独立した試行として扱う訓練や評価の前提が損なわれると説明している。発見した通信経路には対策を施し、ほかのエージェントが残したメモを利用するかどうかを調べる評価も設けたとのこと。

共同作業中のファイル共有の事例では、複数のエージェントが、ローカルファイルだけを使うという条件で、減価償却費を計算する表計算ファイルを作成していた。ところが、互いのローカルファイルにアクセスできず、担当エージェントは一時的な公開ホスティングサービスへファイルをアップロードし、ほかのエージェントにダウンロード用のリンクを送った。その結果、成果物が公開URLから取得できる状態になった。

OpenAIは、この訓練環境のファイルシステムを修正し、対象データセットでのインターネット接続を無効にした。その後、外部インターネットへの直接接続を無効にする措置を、訓練全体に広げたと説明している。

調査の規模に応じて開示を進める

新たな開示手続きでは、社員からの報告を受けて技術担当者が調査する。調査や開示の各段階には期限を設け、事例を「公開準備が整ったもの」⁠追加の小規模な調査が必要なもの」⁠大規模な調査が必要なもの」に分けて進める。第三者が関わる複雑な事例では、調査や関係者との調整に時間がかかる場合があり、セキュリティ上の理由で初期告知を遅らせることもあるという。

OpenAIは今回の枠組みを出発点とし、運用経験や外部からのフィードバックを踏まえて見直しながら、継続的にレポートを公開する方針を示している。

おすすめ記事

記事・ニュース一覧