Gemini 4 Argon発表|AstraやOpus 5.5を超えた?100万トークン出力と一般公開の行方

Gemini 4 Argonの性能と料金、公開時期を比較する記事のアイキャッチ AIを知る

「最近はChatGPTやClaudeの話題を追っていたけれど、Geminiはどうなったんだろう」。そんなタイミングで目に入ると、思わず比較表を拡大したくなる発表です。

Googleは2026年9月30日、Gemini 4 Argon(ジェミニ4 アルゴン)を発表しました。注目は、仕事に関わる複数の評価で他社の有力モデルを上回ったことと、最大100万トークンという大きな出力上限です。[1][2]

では、GPT-6 Astra、GPT-6.1 Sol、Claude Opus 5.5よりも優秀なのでしょうか。公表データには、そう期待したくなる結果があります。ただし、勝っている仕事と負けている仕事は分かれています。そして、発表されたことと、私たちが今すぐ使えることは別です。[2][3][1]

この記事では、公式の比較表を読み解きながら、Solとの比較、出力上限の意味、利用できる人、料金まで整理します。情報は2026年10月1日時点。公開資料をもとにした解説であり、Argonを実際に使ったレビューではありません。

複数のAIモデルの比較資料を見比べる読者のイメージ


Geminiは本当に「息を潜めていた」のか

Geminiの更新が続く中でArgonが登場したことを示すイメージ

最初に、ここは少し整理しておきたいところです。Geminiの開発が止まっていたわけではありません。公式の更新履歴を見ると、2026年8月13日にGemini 3.7 Flash、9月2日にGemini 3.8 Flashが一般提供されています。[4]

「しばらく静かだった」という感覚と、実際の更新状況は別です。今回のArgonは、その流れの中で登場した、複雑な仕事を長い工程にわたって進めることを重視したモデルです。Googleが中心に挙げているのは、ソフトウェア開発、法務・金融などの知的業務、サイバー防御です。[2]

単に質問に答えるだけでなく、資料を調べ、条件を整理し、作業し、結果を確認して直す。そうした一連の仕事をどこまで任せられるか。この観点で比較表を見ると、今回の発表の狙いがつかみやすくなります。


比較表でわかる、Astra・Opus 5.5に勝つ分野と負ける分野

Google公開のGemini 4 Argon、GPT-6 Astra、Claude Fable 5.1、Claude Opus 5.5のベンチマーク比較表。業務、開発、長文処理、動画理解などを比較。

図1:Google公開の4モデル比較。画像はクリック・タップで拡大。出典:Google DeepMind「Gemini 4 Argon」および評価方法資料。[2][5]

まずは、Googleが公開した比較表です。比較相手はGPT-6 Astra、Claude Fable 5.1、Claude Opus 5.5。GPT-6.1 Solは、この表には含まれていません。[2]

青く塗られた項目が多く、Argonの強さが目を引きます。掲載されている19の評価条件を数えると、Argonは13条件で単独トップ、1条件で同率トップです。残る5条件では他のモデルが上回っています。これは図1の掲載値を筆者が集計したもので、GraphWalksの2条件を別々に数えています。「世の中の全モデルを対象にした19戦」ではありません。

特に目立つのは、業務・長い情報の処理・動画理解

業務をまとめて評価するVals Indexは68.9%、業務の一連の実行を評価するAutomationBenchは51.3%。金融分野のVals Finance Agent v2も65.4%で、この4モデルの中では最も高い値です。[2]

長い情報を扱うGraphWalksの256K〜1M条件では、Argonが84.2%、Astraが71.8%、Opus 5.5が66.8%。長時間の動画理解を扱うLVBenchでも、Argonが91.7%と、この表では最も高くなっています。[2]

ここから読み取れるのは、短い一問一答だけではなく、情報量の多い仕事で試す価値がありそうだということです。ただし、GraphWalksは特定の課題に対する評価であり、「大量の社内資料を必ず正しく読める確率」ではありません。

コーディングは「全部勝った」わけではない

長い工程を伴うソフトウェア開発のDeepSWE v1.1では、Argonが77.9%で、この4モデルを上回ります。一方、FrontierSWE v2はArgonの55.0%に対し、Astraが65.5%。Terminal-bench 4.0ではArgonが57.4%、Opus 5.5が66.4%です。同じ開発系の評価でも、結果は一枚岩ではありません。[2]

ほかにも、PostTrainBenchはOpus 5.5、Terminal-Bench Science 0.1とOSWorld-2.0の掲載条件はAstraが上回ります。サイバー分野のCWE-bench v1は、ArgonとAstraが68.0%で並んでおり、Argonだけが首位ではありません。[2]

「メーカー発表だから無意味」でも「完全に同じ条件」でもない

評価方法の資料によると、この表にはGoogleが実施した評価、各社の公表値、外部の評価サイトの結果が含まれています。すべての数値が、同じ道具・同じ計算量・同じ費用で一斉に測られたものではありません。たとえば動画理解では、APIの制限に応じてモデルごとの入力フレーム数が異なります。[5]

そのため、点差をそのまま仕事の生産性の差に読み替えたり、小さな差だけで決定的な優劣をつけたりするのは早計です。また、「—」は比較可能な値が掲載されていないという意味で、0点や機能非対応を示すものではありません。[5]

この表は、使う前から勝者を決めるものというより、自分の仕事のどこを比較してみると面白いかを知る材料として読むのがよさそうです。


GPT-6.1 Solよりも有能?別の評価表で確かめる

異なるAI評価資料を比べ、仕事ごとに適性を考える概念画像

「Googleの表にSolがいないなら、比較できないの?」と思うかもしれません。実は、外部の評価サイトVals AIには、GPT-6.1 Solを含む比較が掲載されています。[3]

Vals Indexでは、ArgonがSol・Astra・Opusを上回る

2026年10月1日に確認したVals Indexの掲載値から、主なモデルを抜き出すと次のとおりです。図1にSolの数値を付け足したものではなく、Vals AIの同じ指標から別に抜き出した表です。[3]

Vals IndexでGemini 4 Argonなど6モデルの掲載スコアを比較した画像

出典:Vals AI「Vals Index」。2026年9月30日更新の掲載値。上表は一部モデルの抜粋であり、全モデルの順位表ではありません。[3]

この指標では、ArgonがGPT-6.1 Solを上回っています。 ただし、Vals Indexが扱うのは金融・開発・法務・税務で、米国のGDP構成に基づく重み付けがされています。日本語の自然さ、創作の好み、日常会話の速さまでを一つに測った「AI総合偏差値」ではありません。[3]

比較する相手を増やすと、別の面も見えてきます。Webアプリ構築を評価するVibe Code Benchでは、Valsの公表値はArgonが91.91%、Claude Sonnet 5.5が92.39%。Googleの4モデル表に載っていないSonnetのほうが高い値です。[6]

つまり、「AstraやOpus、Solを上回る評価がある」は確認できます。一方で、「どの仕事でも、どのAIよりも優秀」までは言えません。 乗り換えを考えるなら、資料整理、記事執筆、コード修正など、普段の仕事ごとに比べる必要があります。


最大100万トークンは「入力」ではなく「出力」

AIに渡す短い入力と、長い文章を生成する出力の違いを示すイメージ

今回、性能表と並んで注目したいのが、出力上限の64Kから1Mへの拡大です。1Mは100万。大まかには従来の約16倍に当たる規模ですが、これは能力や賢さが16倍になったという意味ではありません。[1]

たくさん読めることと、長く生成できることは別

入力はAIへ渡す質問や資料、出力はAIが生成する内容です。トークンは、文章などをAIが処理する際の単位で、日本語の文字数と一対一には対応しません。「100万トークン出力」を「日本語で100万文字の記事が必ず書ける」と読み替えることはできません。[7]

また、図1のGraphWalksにある「256K〜1M」は、長い情報を扱う評価の条件です。今回の「最大1M出力」と同じ数字が登場しますが、指しているものは別です。[5]

長文を書くだけでなく、途中の検討にも余地が生まれる

Googleは、この出力上限の拡大を、複雑な問題を深く考え、長い工程を進めるための余地として説明しています。既存のGemini APIの仕様では、出力上限に思考用トークンも含まれ、課金も最終回答だけでなく思考分を含みます。[1][8]

たとえば、資料を照合して案を作り、条件の矛盾を見つけ、修正してから成果物をまとめる。長い生成の余地は、こうした作業に役立つ可能性があります。これは「長文を大量に読まされる機能」というより、最終回答を出すまでの検討を長く続けられる可能性に注目したい変更です。

比較すると、GPT-6 AstraとGPT-6.1 Solの公式API仕様の最大出力は128,000トークン。Argonの発表値は、その約7.8倍です。ただし、これは出力上限だけの比較です。複数回のモデル呼び出しをつなぐエージェントでは、1回の上限を超える作業を段階的に進められるため、数字だけで作業全体の限界は決まりません。[9][10][11]

なお、100万トークンが一般公開後のすべての画面・プランで使えるかは未確認です。Googleの発表値と外部評価サイトの掲載仕様にも差があるため、実際に提供される設定は公開後に確認する必要があります。[12]


まだ一般には使えない。Ultraも「今すぐ」ではない

Argonの先行提供と今後の有料API・Ultra向け展開を示す章画像

2026年10月1日時点では、Argonは一般向けに広く提供されていません。先行提供は、GoogleのFairwind Programに参加する、選ばれたサイバー防御のパートナーが中心です。Google社内での活用も報告されています。[13][1]

Fairwind Programは、個人が有料プランに入れば自動的に利用できる仕組みではありません。政府機関や重要インフラ、基盤的な技術を担う組織などを優先し、組織の審査やアクセス管理を伴います。プログラム参加者全員にArgonが一律提供される、とも案内されていません。[13]

一般向けは、有料APIとGoogle AI Ultraからの展開を予定

Googleは、今後の提供を有料APIの利用者とGoogle AI Ultra加入者から始める方針を示しています。ただし、具体的な開始日は公表していません。[1]

Gemini 4 Argonの先行提供と今後の提供対象を整理した画像

出典:Googleの発表とFairwind Programの説明。将来の対象と、現在の利用権を区別しています。[1][13]

公開Gemini APIのモデル一覧でも、確認時点ではArgonの一般向けモデルIDを見つけられませんでした。今は、名称からAPIの識別子を推測して「このコードですぐ使える」と案内できる段階ではありません。[14]

先行提供がサイバー防御なのはなぜか

ソフトウェアの弱点を見つけて修正する能力には、防御を助ける価値と、悪用されるリスクの両方があります。Googleは段階的にアクセスを広げながら、悪用対策などの安全策を強化する方針を示しています。[1]

したがって、「一般には永久に使わせない」という話でも、「Ultraに加入すれば今日から使える」という話でもありません。契約を変える判断は、提供開始と自分のアカウントの対象条件が確認できてからでよいでしょう。


料金はいくら?導入価格と通常価格を分けて比較

Argonの導入価格から通常価格への変更と利用量に応じる費用を示す章画像

料金は、Geminiアプリの月額料金ではなく、APIで使ったトークン量に応じる単価です。GoogleはArgonの導入価格と、その期間が終わった後の価格を分けて発表しています。[1]

以下は、100万トークン当たりの基本単価です。日本円は規模感をつかむため、1米ドル=150円で概算しました。現在の為替レートを示すものではなく、税・決済手数料などを含む実際の円建て請求額とも異なります。

Gemini 4 ArgonなどのAPI入力・出力料金を比較した画像

出典:Google、OpenAI、Anthropicの公式料金・モデル仕様。OpenAIの2モデルは入力272K以下の標準処理の単価。長い入力への割増、キャッシュ、Batch・高速処理、外部ツールなどの料金条件は表に含めていません。[1][10][9][15]

導入価格ならSolと同じ単価。ただし、期間終了後は変わる

表の基本単価だけを比較すると、Argonの導入価格はSolと同じで、Opus 5.5の半額、Astraの5分の1です。一方、導入期間終了後はOpus 5.5と同じ単価になり、Solの2倍になります。導入価格を、そのままずっと続く料金として比較しないことが大切です。導入期間の終了日は、確認したGoogleの発表本文には記載されていません。[1]

キャッシュ済みの入力には、入力単価から95%の割引も案内されています。ただし、割り引かれるのは該当する入力部分です。「仕事全体の料金が95%引きになる」という意味ではありません。[1]

「10ドル」は、1回質問するたびの料金ではない

仮に課金対象の入力が10万トークン、出力が2万トークンなら、Argonの導入価格では入力0.20ドルと出力0.20ドルで、合計0.40ドル、約60円です。導入期間終了後の単価なら、合計0.80ドル、約120円になります。これはトークン量を仮定した計算例で、外部ツール料金などは含めていません。

ここでいう出力は課金対象の量です。画面に出た回答だけを数えても、思考用トークンを使っていれば料金の見積もりには足りません。[8]

また、単価が同じでも、一つの仕事を終える費用が同じとは限りません。Vals Indexに掲載された1テスト当たりの費用は、Argonが15.68ドル(約2,352円)、Solが3.24ドル(約486円)。Argon側は導入期間終了後の単価で計算された掲載値なので、そのまま導入価格での比較には使えませんが、利用量まで見ないと総額はわからないことを示す例です。[3]

実際に導入するときは、利用料金だけでなく、やり直しや人が確認する時間まで含めて比べたいところです。


一般公開されたら、仕事で何を試したいか

記事、コード、動画資料を人が確認して使い方を考えるイメージ

ここからは、公開された能力を踏まえた活用の提案です。Argonで実際に動作確認したものではありません。

記事・提案書は「書く」より「照合する」を試す

複数の資料から記事や提案書を作るとき、最後まで数字や条件がそろっているかを確認する作業に期待しています。本文、料金表、図の説明で数字が食い違っていないか。資料にはない実績を足していないか。以前の条件が一部に残っていないか。

長い文章を一度に出すよりも、根拠を照合し、直すべき箇所と参照先を示してもらう。そのほうが、公開後に自分の仕事で役立つかを評価しやすいはずです。

コードは「作れた」ではなく「直して確かめた」で比較する

コード修正では、既存の仕組みを調べ、変更し、テストして、問題があれば再修正する一連の作業を試したいところです。Googleは社内事例として、動画デコーダーlibgav1の既存Rust移植版を最適化し、そのRust版に対して2.7倍の速度を得たと報告しています。最適化済みのC++版より2.7倍速くなった、という意味ではありません。[1]

自分の小さなツールでも、処理時間と出力結果を変更前後で測れれば評価できます。見栄えのよいコードが出るかより、既存機能を壊さず改善できたか。そこを同じ課題で比べたいと思います。

動画と資料を組み合わせ、確認箇所を絞る

研修動画と配布資料、説明会の録画と議事録を照合する使い方も考えられます。違いを探すだけでなく、確認すべき時間帯やページを示してもらえば、人が見直す範囲を絞れます。

ただし、モデルの理解力と、ファイルを開く機能や外部サービスを操作する権限は別です。Gemini APIの関数呼び出しも、モデルが提案した処理をアプリ側で実行し、結果を返す仕組みです。どこまで作業できるかは、利用する環境と接続する道具によって変わります。[11]

最初は読み取り・下書き・作業用コピーでの修正から始め、公開、送信、本番反映は人が確認する。比べるべきなのは、回答の派手さではなく、最終的に使える状態になるまでの時間と手直しの量だと考えています。


まとめ:強力な新候補。ただし、全面乗り換えの判断はこれから

Gemini 4 Argonには、AstraやOpus 5.5を上回る評価が複数あり、Vals IndexではGPT-6.1 Solも上回っています。特に、業務を進める力や長い情報の処理に注目したい一方、開発を含めてすべての分野で勝っているわけではありません。[2][3]

最大100万トークンの出力も、大きな変更です。ただし、一般向けの提供日はまだ示されておらず、利用できるプランや実際の上限まで確定した話ではありません。[1]

今は、「次に試す有力候補が出てきた」と捉えるのがよさそうです。公開されたら、普段使っている資料や開発課題を用意し、同じ条件で比較する。比較表での強さが、自分の仕事の手直しをどれだけ減らしてくれるか。 そこまで確かめて初めて、Argonの本当の価値が見えてくるはずです。

資料を整理してAIを同じ条件で試す計画を立てる読者のイメージ

参考資料・注記

公式情報と、評価を実施・公開した主体の資料を中心に確認しました。確認日は2026年10月1日です。順位、料金、提供対象は今後変わる可能性があります。

  1. Google公式発表「Gemini 4 Argon: our next era of frontier intelligence」(2026年9月30日)。発表日、出力上限、導入価格と終了後の価格、先行提供、今後の有料API・Google AI Ultraへの展開、Google社内の活用事例を確認。https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
  2. Google DeepMind「Gemini 4 Argon」。図1と同じ4モデルの比較表、モデルの対象領域を確認。https://deepmind.google/models/gemini/
  3. Vals AI「Vals Index」(2026年9月30日更新、Version 2.1)。金融・開発・法務・税務のGDP加重指標であること、各モデルのスコアと1テスト当たりの掲載費用を確認。Argonの費用欄は入力4ドル・出力20ドル、すなわち導入期間終了後の単価が前提。本文では2026年10月1日に確認した数値表を採用。https://www.vals.ai/benchmarks/vals_index
  4. Google AI for Developers「Release notes」。2026年8月13日のGemini 3.7 Flash、9月2日のGemini 3.8 Flashの一般提供を確認。https://ai.google.dev/gemini-api/docs/changelog
  5. Google DeepMind「Gemini 4 Argon — Model evaluation: Approach, methodology & results」(PDF、全5ページ)。比較値の出所、思考設定、GraphWalksの条件、動画入力の条件差、欠測の理由を確認。図1は5ページ目の表と照合。https://deepmind.google/models/evals-methodology/gemini-4-argon
  6. Vals AI「Gemini 4 Argon Benchmarks, Cost and Capabilities」。2026年9月30日の評価報告にあるVibe Code BenchのArgon 91.91%、Sonnet 5.5 92.39%などを確認。Googleの表とは掲載の丸め方や評価条件が異なる項目があるため、出所を混ぜない。https://www.vals.ai/models/google_gemini-4-argon
  7. Google AI for Developers「Understand and count tokens」。トークンの意味と、日本語の文字数への単純換算が適切でないことの確認に使用。https://ai.google.dev/gemini-api/docs/tokens
  8. Google AI for Developers「Gemini thinking」。既存APIの出力上限が思考用トークンを含むこと、思考と回答の生成量が課金に関係することを確認。これは一般的なAPI仕様の説明であり、未公開のArgon向け画面・プラン別設定の確定情報ではない。https://ai.google.dev/gemini-api/docs/thinking
  9. OpenAI「GPT-6 Astra Model」。最大出力128,000トークン、基本単価の入力10ドル・出力50ドル/100万トークンを確認。入力272K超では全リクエストの入力等が2倍、出力が1.5倍となる別条件がある。https://developers.openai.com/api/docs/models/gpt-6-astra
  10. OpenAI「GPT-6.1 Sol Model」。正式名称、最大出力128,000トークン、基本単価の入力2ドル・出力10ドル/100万トークンを確認。入力272K超では全リクエストの入力等が2倍、出力が1.5倍となる別条件がある。https://developers.openai.com/api/docs/models/gpt-6.1-sol
  11. Google AI for Developers「Function calling with the Gemini API」。モデルが提案する処理、アプリによる実行、結果を返して次の処理へ進む仕組みの確認に使用。モデルの能力と外部ツールの権限・実行環境を区別するための参考。https://ai.google.dev/gemini-api/docs/function-calling
  12. Googleの公式発表は最大出力1M。一方、確認時点のVals AIのモデル紹介は最大出力262Kとし、評価設定にも262,144と記載していた。差が提供経路・評価設定等によるものか、掲載の更新状況によるものかは確認できていない。この記事は両者を勝手に同一視せず、発表上限を「Googleが公表した値」として扱う。https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/ / https://www.vals.ai/models/google_gemini-4-argon
  13. Google DeepMind「Fairwind Program」。先行提供が選ばれた防御パートナー向けであること、対象・審査・アクセス管理等を確認。すべての参加者への自動提供や、個人向けの一般販売と同一視しない。https://deepmind.google/fairwind-program/
  14. Google AI for Developers「Models」。2026年10月1日に確認した公開モデル一覧では、Argonの一般向けモデルIDを確認できなかった。未記載であることだけで提供状況を断定せず、Googleの発表と併せて判断した。https://ai.google.dev/gemini-api/docs/models
  15. Anthropic「Claude Opus 5.5」。基本単価の入力4ドル・出力20ドル/100万トークンを確認。通常の最大出力は128Kだが、Batch APIのベータでは300Kの記載もあるため、「Claudeの出力上限はあらゆる条件で128K」とは書かない。https://platform.claude.com/docs/en/models/opus-5-5/overview

コメント

タイトルとURLをコピーしました