本文へスキップ
AI-Papers

Googleが「Gemini 4 Argon」発表、出力100万トークンで長期タスクに対応

Googleが「Gemini 4 Argon」発表、出力100万トークンで長期タスクに対応
  • Gemini 4 Argon は1回の応答で生成できる出力トークン上限を従来の64Kから100万へ引き上げ、長時間の自律作業を1つの思考過程で続けられるようにした
  • ソフトウェア開発の DeepSWE v1.1 で77.9%、脆弱性修正の CWE-bench v1 で68%、業務自動化の AutomationBench で51.3%の首位を記録した
  • 導入価格は入力100万トークンあたり2ドル、出力10ドルで、キャッシュ済み入力は95%割引。まずサイバー防御者向けの Fairwind Program から提供が始まる

出力上限を100万トークンへ

Google は2026年9月30日、フロンティアモデル「Gemini 4 Argon」を発表しました。発表文は Google DeepMind の SVP である Koray Kavukcuoglu 氏の名義で公開されています。

最も大きな変更点は、1回の生成で出力できるトークン数の上限です。従来の64Kから100万トークンへと拡大し、モデルが1つの思考の流れを途中で切らずに維持できるようになりました。Google はこれを「深く考え、1つの軌跡で数十万トークンを生成する」能力と説明しています。

入力側の文脈長については、発表文では具体的な数値が示されていません。強調されているのは入力の広さではなく、出力を長く続けられることで、作業を細かく分割せずに最後まで走らせられる点です。

長期タスクに照準

Argon が狙うのは、数時間から数日かかる種類の仕事です。発表文では、データセンター全体にまたがるメモリ最適化や、80万行を超える規模のコードベース移行を、エージェントが自律的に処理した例が挙げられています。

ベンチマークの結果は次の通りです。DeepSWE は実際のソフトウェア開発課題、CWE-bench は脆弱性の修正、AutomationBench は業務自動化、LVBench は長尺動画の理解を測る評価です。

ベンチマーク

スコア

内容

DeepSWE v1.1

77.9%

実務的なソフトウェア開発

CWE-bench v1

68%

脆弱性修正(首位タイ)

AutomationBench

51.3%

業務自動化(1位)

LVBench

91.7%

長尺動画の理解

このほか、金融・コーディング・法務・税務を横断する Vals Index でも上位の成績を示したとされています。プロンプトインジェクション(指示の注入による乗っ取り)への耐性を測る Gray Swan IPI Benchmark では、最も堅牢な結果だったと報告されています。

実例として、世界中の病院で使われている医療ソフトウェアに、個人情報が露出する重大な脆弱性を Argon が発見したことが挙げられています。Google によれば、これは以前のフロンティアモデルが見逃していたものです。

価格と提供の順序

API の導入価格は、入力が100万トークンあたり2ドル、出力が10ドルです。導入期間の終了後は入力4ドル、出力20ドルの標準価格になります。キャッシュ済みの入力トークンは入力価格から95%割引されるため、同じコードベースや資料を繰り返し参照するエージェント用途では実コストを抑えられます。

提供はまず、信頼できるサイバー防御者を対象とした Fairwind Program から始まります。その後、有料 API 顧客、Google AI Ultra の加入者、開発者と企業へ順次広げる計画です。音声領域で先行して公開されたGemini 3.8 Liveと同様、用途を絞った限定提供から段階的に拡大する形を取っています。

安全対策と監視の仕組み

出力が長くなれば、モデルが自律的に動く時間も伸びます。Google は内部および外部のレッドチームによる悪用耐性テストに加えて、モデル内部の活性化状態を監視して悪用を検知する手法を導入しました。

さらに、思考連鎖(chain-of-thought)の監視によって目標のずれを検出し、評価は強化されたサンドボックス環境で実施します。アラインメントの診断を可能にするため、推論過程の透明性を保つ設計も維持されました。図1は、長期タスクの実行と監視がどう組み合わされるかを示したものです。

図1: 長期タスクの自律実行と監視による制御
図1: 長期タスクの自律実行と監視による制御

脆弱性を自動で見つけて修正する能力は、防御側にも攻撃側にも使えます。サイバー防御者を最初の提供先に選んだ順序には、この両義性への配慮が表れています。

開発者にとっての意味

出力上限の拡大は、単にスコアが上がったという話ではありません。これまで長い作業はタスクを分割し、中間結果を受け渡す仕組みを開発者側で組む必要がありました。1回の生成で数十万トークンを扱えるようになれば、その足場作りの一部を省けます。

一方で、長く走るほど途中の誤りが積み重なるリスクも増えます。キャッシュ割引で推論コストを下げつつ、思考連鎖の監視で逸脱を捕まえるという設計は、この条件下で使い物にするための現実的な落としどころと言えます。価格が明示されたことで、エージェント運用の見積もりを事前に立てられる点も実務上の違いになります。

シェア:

投稿には GitHub アカウントが必要です。投稿内容は公開され、利用規約に反するものは予告なく削除します。