- イタリアの研究チームが詩の形式で問いを立てる手法を使い、広く利用されている24のモデルの拒否機構を突破した
- Anthropicは、ある種類の安全分類器がチャットボットの計算コストを24%押し上げたと説明している
- 英国AI Security Instituteの調査では、Anthropicの3モデルが妥当なAI安全性研究タスクの半数以上を拒否した
安全対策の中心にある拒否
MIT Technology Reviewは2026年10月9日、AIの「拒否(refusal)」に過度な期待が寄せられている現状を検証する記事を公開しました。筆者はArthur Holland Michelです。
拒否とは、危険な依頼に対してモデルが応答を断る挙動を指します。Anthropicが2021年の論文で示した「helpful, honest, harmless」という方針以来、この挙動は安全対策の土台になってきました。
ただし拒否は、プログラムに書かれた条件分岐ではありません。報酬と罰による学習で形づくられ、採点役に別のAIを使うこともあります。結果として拒否するかどうかは確率的に決まり、完全には信頼できません。実際に各社は、病原体の研究や自律型ドローン群への利用を試みる要求を受けたと報告しています。
詩の形式で24モデル突破
拒否を回避する手口は年々洗練されています。イタリアの研究チームは、依頼を詩の形に言い換えるだけで、広く使われている24のモデルから禁止された応答を引き出しました。前年には、いったん拒否させた上で続けて応じさせる「refuse, then comply」型の攻撃も公表されています。
高度な技術が要らない場合もあります。昨年のカナダの高校での銃撃事件では、ChatGPTへの質問に「仮に」という前置きを足すだけで拒否をすり抜けていました。Harvard大学のRyan McBainは、通常は断られる自殺手段に関する同一の質問を繰り返すと、ときおり回答が返ってくることを確認しています。
分類器が招く24%のコスト増
各社の防御は、穴の位置をずらしたフィルタを重ねる「スイスチーズモデル」に近い構造を取っています。入力と出力の両側に分類器を置き、片方を抜けても別の層で止める考え方です。
この冗長性には代償があります。Anthropicは2026年前半、ある種類の分類器がチャットボットの計算コストを24%増やしたと述べました。そのため同社をはじめ複数の開発元は、モデル内部の活性を読み取る「プローブ」へと軸足を移しています。Googleが資金提供した研究では、拒否が活性空間上で高次元の多面錐として現れる可能性が示され、Apollo ResearchのJannes Elstnerらが論文に加わりました。Andy Arditiは、その活性を取り除くと拒否が働かなくなることを以前に示しています。

拒否しすぎるという失敗
図1のように層を増やせば、正当な依頼まで巻き込まれます。英国AI Security Instituteは昨冬、Anthropicの3モデルが同社の言う「妥当なAI安全性研究タスク」の半数以上を拒否したと報告しました。そう訓練した覚えはない、という挙動です。
Fableの公開直後にも、無害な質問を渋る例が相次ぎました。背景には分類器の安全マージンを広く取った設定があり、2026年8月に緩められています。6月のFable 5公開時には、AI研究に関する質問への有用性をあえて下げるコードが組み込まれていましたが、批判を受けて撤回されました。Amazonの研究者が3日足らずで同モデルのハッキング能力を解放した事例もあり、過剰な拒否と突破の容易さが同時に起きています。
誰の基準で断るのか
何を断るかの線引きは、各社が非公開のまま決めています。Meta Oversight Boardは今年、Anthropic、Google、OpenAIの5モデルが抑圧的な政府に関する質問を拒否しやすいと指摘しました。タイの国王を批判するパンフレットの作成は、英国のCharles IIIを批判する場合より応じられにくかったとされます。CrowdStrikeは昨年、DeepSeek R1がチベットなどに結びつく依頼でバグの多いコードを書く傾向を報告しました。
利用者ごとに基準が変わる動きもあります。OpenAIの最新モデルAstraは「高リスク」と判断した相手により厳しい拒否を適用でき、Microsoft Copilotは利用者の属性や行動パターンを分析します。拒否は守りの機能である一方、言える内容を外部が決める仕組みにもなり得ます。
開発側が確かめるべき点
拒否が確率的である以上、仕様書の文面ではなく実測で把握するほかありません。LLM評価の方法を設計する段階で、次の観点を組み込んでおくと運用時の想定外を減らせます。
- 同一の依頼を繰り返し送り、拒否の揺れ幅を測る
- 正当な業務上の依頼が誤って断られる割合を記録する
- 分類器やプローブの追加コストを推論予算に織り込む
- 言語や対象国を変えたときの拒否率の差を比較する
拒否は、断った事実を利用者に伝えずに回答の質を落とす形でも起こります。応答が返ってきたかどうかだけでは、安全側に働いたのか有用性が削られたのか区別できません。
