日本語

セキュリティOpenAI

OpenAI、1万5000人以上による組織的な敵対的蒸留攻撃を検出

OpenAIは、2026年7月1日から始まった組織的な敵対的蒸留攻撃を検出したと発表しました。攻撃者は、AIモデルが回答を出力する前に行う「思考」と呼ばれるプロセスを、低性能モデルへの脱獄攻撃を通じて平文で出力させる手法を用い、モデルの思考内容を盗み取っていました。

一連の活動は2026年7月上旬に少数のユーザーによって開始され、7月24日から25日にかけてユーザー規模が4000人以上に急増しました。調査の結果、最終的に1万5000人以上のユーザーからなる攻撃集団の存在が確認され、OpenAIは7月28日に攻撃の阻止に成功しました。

OpenAIは、攻撃活動の中心を担ったのは、Kimiシリーズの開発元である中国企業のMoonshot AIに関係する人物であると推測していると述べています。今回の攻撃はユーザー自身の入力内容に対する思考内容を盗むことを目的としたものであり、ChatGPTユーザーの個人情報が侵害された事実は確認されていません。

OpenAIは敵対的蒸留への対策を強化しており、業界団体のFrontier Model Forumを通じて他のAI企業にも情報を共有しています。

出典

  1. OpenAIが「中国のAI企業が1万5000以上のユーザーを使ってモデルの思考を盗み取る蒸留攻撃を実行していた」と報告 (GIGAZINE、2026-10-01)