これは日本語版です。韓国語版と 英語版もご覧いただけます。

Gemini 4 Argonのベンチマークと9つの噂を検証

2026-10-03 · AI · 日本 · Zoogom編集部

#Google#Gemini 4 Argon#AIベンチマーク#Xの噂#ファクトチェック

AIベンチマークの主張を確認と保留と反証に分けて調べる分析者のコンセプト画像

Gemini 4 Argonというモデル名そのものはリークや作り話ではない。Googleが2026年9月30日に発表した実在のモデルだ。しかしXでは、確認済みの数値と「全モデルを圧倒した」「ハルシネーションを解決した」「もう使える」といった未確認の解釈が一つの投稿にまとめられている。

この記事は10月3日日本時間の公開情報を基準に、Googleの発表、独立評価、Arena、専門業務ベンチマークを照合した。韓国、米国、日本の反応とは、国籍を認証した世論調査ではなく、韓国語X、米国英語圏の技術コミュニティ、日本語Xの公開投稿を言語別に見たものだ。筆者がArgonを利用して再現試験を行った結果ではない。

冒頭の画像は、主張を根拠別に分ける作業を表した新しいコンセプトイラストである。実際のGoogle製品、X投稿、ベンチマーク画面、特定の人物を撮影した資料ではない。

先に結論を確認する

最も無理のない表現は「重要な複数の評価で首位級の、現在は限定提供中のフロンティアモデル」である。「誰でも今使える絶対的な最強モデル」ではない。

数字を一つの総合順位にしない

Googleが公表した強い結果

Googleの公式発表は、DeepSWE v1.1で77.9%、AutomationBenchで51.3%、LVBenchで91.7%、CWE-bench v1で68%を示した。長期間のソフトウェア開発、複数ツールの自動化、長い動画の理解、脆弱性修正をそれぞれ測る評価である。

重要な結果だが、提供元が選び公表した数値でもある。DeepSWEの首位をコーディング全体の首位へ広げることはできない。課題、ツール、時間制限、判定条件が異なる評価の百分率を横に並べ、単純な優劣に変えることもできない。

Valsでは専門業務と画面操作の差が大きい

Valsのモデルページでは、Vals Indexが68.90%±0.97で41モデル中1位、Finance Agent v2が65.40%で1位、Vibe Code Bench v1.1が91.91%で2位、Code Migrationが68.17%で2位だった。

一方、Terminal-Bench 4.0は57.58%で5位、コンピューター画面を操作するCUA-benchは4.83%で8モデル中7位である。Valsの実行設定における最大出力は262,144トークンなので、公式の100万出力すべてを実証した試験でもない。専門業務の総合指標と一部のコーディングには強いが、端末やUIの実行能力には弱点が見えると読むのが適切だ。

53点、ハルシネーション15%、正答率50%

Artificial Analysisの分析は、Intelligence IndexでArgonを53点とし、GPT-6 Astraの最大設定と同水準に置いた。導入価格での1課題当たり費用は約1.99米ドルである。Argonはこの評価で1課題当たり平均約6万2千出力トークンを使い、Astraの約2万7千を大きく上回った。

AA-Omniscienceのハルシネーション率は約15%と低いが、正答率は約50%である。分からない問題で推測するより、回答を控える傾向が反映された。契約や調査では価値がある一方、回答率が必要な業務では別の弱点になり得る。「誤った推測を減らす」と「すべて正しく答える」は同じではない。

専門業務、人間の好み、エージェントでも順位が違う

Mercor APEX-AgentsではPass@1が82.2%±4.4で1位だった。内訳はコンサルティング90.3%、投資銀行80.9%、企業法務75.3%である。長い専門業務に強い証拠だが、特定の課題と実行環境を日本企業の全業務へ一般化することはできない。

ArenaのTextとWebDevの発表では、Text Arenaが1,525点で1位、Code Arena: WebDevが1,679点で8位だった。同じモデルでも文章の好みとWeb開発で結果が大きく異なる。別のAgent Arenaの初期結果は約3,000セッションを基に8位としている。予備的な利用データを固定順位として扱ってはいけない。

PublicAIの初期集計は総合4位、人間の好みと専門業務1位、推論は181モデル中24位と表示した。ただし当時は19ボード中5つだけを反映した初期画面であり、最終的な合意順位ではない。

噂1:すでに一般ユーザーが利用できる

判定:誤りに近い誇張

モデルの発表と一般提供は別である。確認済みの初期提供は、Fairwindを通じた信頼できるサイバー防御組織と評価者が中心だ。Googleは次に有料API利用者とGoogle AI Ultra加入者から広げる方針を示したが、日付は発表していない。

日本の有料プラン名だけで利用可能とは判断できない。実際のモデル選択画面、APIのモデルID、地域条件を確認する必要がある。

噂2:GPTとClaudeをすべて上回った

判定:誤り

DeepSWE、Vals Index、APEX-Agents、Text Arenaでは首位である。ValsのTerminal-BenchとCUA-bench、ArenaのWebDevとAgentでは首位ではない。Artificial Analysisの総合点はAstraと同等で、PublicAIの初期総合は4位だった。

発表資料で色が付いた行を数え、「18項目中13項目で1位だから全分野で最強」とする読み方では、同率、設定、課題の違いが消える。自社の仕事に近い評価と失敗例を見る方が重要だ。

噂3:15%のハルシネーション率で問題を解決した

判定:誤解を招く

根拠のない回答を減らした点は評価できる。しかし同じ試験の約50%という正答率を外してはいけない。Argonは不確かなときに無理に答えないことで誤答を減らしている可能性が高い。

日本語の契約レビューで試すなら、正答、根拠のない回答、明示的な保留を分けて数える必要がある。保留を自動的に成功や失敗へまとめると、実務上の価値を読み違える。

噂4:Astraより40%安い、または5分の1の価格

判定:条件付き

導入価格の入力2米ドル、出力10米ドルを使うと、Artificial Analysisの同じ課題はArgon約1.99米ドル、Astra約3.26米ドルで、Argonが約40%安い。

しかし導入期間後は入力4米ドル、出力20米ドルになる。同じ使用量ならArgonは約3.98米ドルとなり、Astraより約20%高くなる可能性がある。Argonの出力が長かったことも総費用へ影響する。トークン単価、評価1回の費用、完成物1件の費用を混同してはいけない。

噂5:今すぐ1回で100万トークンを安定出力できる

判定:仕様は確認、一般利用は未確認

最大出力100万トークンはGoogleの公式仕様であり、従来の64Kから拡大した。ただし一般公開APIはなく、独立評価もより小さい設定で実施されている。

実際のサービスでは長時間応答の再開、タイムアウト、割り当て、保存費用、失敗時の再試行が関係する可能性がある。モデル設計の上限と、日本の一般利用者が今日1回の呼び出しで安定して受け取れる量は同じではない。

噂6:Google社内でも失敗作と判断された

判定:報道はあるが結論は未確定

Madison MillsによるAxiosの整理は、Bloombergが匿名情報を基に一部社員の内部テストへの懸念を報じ、Googleがその説明は不正確だと反論したことを伝えている。「社内の懐疑論を伝える報道があった」は事実だが、「内部テストで失敗が証明された」にはならない。

判断には一般公開後、同じリポジトリ、同じ権限、同じ時間と合格条件で行う再現試験が必要だ。匿名報道も企業の反論も、その試験結果の代わりにはならない。

噂7:Veloxや3.8 Flashを装ったモデルがArgonだった

判定:未確認

提供前のXやRedditでは、強い匿名Arenaモデル、Velox、Gemini 3.8 Flashと表示されたチェックポイントをArgonへ結び付ける推測があった。GoogleやArenaは同一性を確認していない。匿名モデルの出力をArgonの再現可能な性能証拠として使うべきではない。

噂8:一般公開版は必ず大幅に弱くなる

判定:根拠のない予測

公開版の推論設定、速度、上限、安全制御、地域条件はまだ十分に発表されていない。過去のアプリ版とAPI版の体感差から仮説を立てることはできるが、Argonですでに決まった事実にはできない。

提供後はモデルID、日付、推論レベル、ツール権限、契約プランを記録して比較する必要がある。それがなければ「弱体化」を検証できない。

噂9:3.5 Proは中止されNeonとHeliumも確定した

判定:系譜と名称の推測

予想されていたGemini 3.5 Proが一般提供されないままGemini 4が発表されたことは確認できる。しかしGoogleは3.5 Proの正式中止、Argonへの単純な改名、NeonやHeliumという製品群を確認していない。「3.5 Pro一般版の前にGemini 4が発表された」という範囲にとどめるのが安全だ。

韓国・米国・日本の公開Xで注目点はどう違ったか

韓国語XではDeepSWE 77.9%、Vals首位、100万出力、2米ドルと10米ドルが一つの短い投稿へ集約される傾向があった。理解は速いが、導入価格、弱い評価、限定提供が抜けると「安く、完璧で、今使えるモデル」に変わってしまう。

米国英語圏ではArtificial Analysisの費用計算、出力量、Arenaの順位差、社内懐疑論の報道を巡る方法論の議論が多かった。高い点数そのものより、導入価格終了後や一般環境で再現するかが争点になった。

日本語Xでは100万出力が契約書、開示資料、コードベースの処理をどう変えるかへの期待が大きかった。「仕様だけなら魅力的だが、まだ使っていない」という慎重な説明も見られた。一方、過去の経験を基に公開版の大幅な性能低下を既定路線とする推測も広がった。

これらは検索語、推薦アルゴリズム、観察時間に左右される言語コミュニティの標本である。3か国の支持率や世論の割合として引用できるデータではない。

日本語業務で公開後に確認したい7項目

  1. 正確なモデルID、版の日付、アプリかAPIかという提供経路
  2. 推論レベル、ツール権限、最大出力、継続生成の設定
  3. 再試行と人の確認を含む合格成果物1件当たりの費用
  4. 正答、根拠のない回答、回答保留の比率
  5. 日本語契約書の条番号、固有名詞、金額、日付の維持
  6. 長いコードベースでのテスト通過と不要な変更、セキュリティ回帰
  7. タイムアウトからの復旧、利用上限、混雑時の失敗率

今必要なのは、さらに多くの順位表を集めることではない。同じ資料と合格条件で公開後に再試験できる設計を準備することだ。長い回答の印象ではなく、合格した仕事の数と人が直した時間を記録したい。

最終判断

Gemini 4 ArgonはGoogleがフロンティア競争へ戻ったことを示す強いモデルである。専門業務、長時間のコーディング、文章の人間評価、長い出力には十分な注目理由がある。同時に、端末操作、Web開発、エージェント、コンピューター操作では競合が上回る結果があり、一般公開前なので実務の再現データも不足している。

現時点で信頼できる見出しは「Argonは重要な複数評価で最上位級となり、100万出力仕様と積極的な導入価格を示した」である。「全モデルを倒し、ハルシネーションを解決し、誰でも安く使える」は確認された事実ではない。次の判断は公開APIの実際の設定と、合格成果物1件当たりの費用が決める。

出典利用と編集上の告知

本稿はリンク先から日付、公開仕様、一部の点数・順位、方法上の制限を確認し、独自の構成でまとめた。原文、表、チャート、ベンチマーク画面、X投稿画像、ロゴ、製品UI、出典画像は複製していない。Axiosの記事はMadison Millsに帰属を示し、匿名情報に基づく報道とGoogleの反論が存在したことだけを扱い、どちらも検証済みの性能結果として採用していない。各評価の完全な方法、標本、設定、最新状態はリンク先の原文で確認してほしい。

出典: Google · 独自の画像・図版を含みます