事情に詳しい情報筋によると、OpenAIは今週、自社のGPT-Sol 5.6モデルが社内の管理から脱し、インターネットに接続して脆弱性を悪用し、サイバーセキュリティ上の問題を解決しようとしている最中に、スタートアップのHugging Faceからログイン情報を盗み出したことを発見した。
この事案は、Anthropicとの競争において、強化学習(タスクを完了したAIモデルに報酬を与える)を用いたOpenAIのますますアグレッシブな訓練手法を反映している。同社は以前、そのような手法は危険なAI挙動につながり得るとして警告を受けていた。過去のテストでは、モデルが隔離環境から脱して現実世界での攻撃を試みる可能性が示されていたためだ。