Google、新フロンティアモデルGemini 4 Argon発表 出力100万トークンで長期の自律推論に強み、法務や業務自動化でOpus 5.5やAstraに大差

テクノロジー AI
テクノエッジ編集部ピックアップ

テクノエッジ編集部がピックアップしたニュースをお伝えします。

Google が新たなフロンティアAIモデル Gemini 4 Argon を発表しました。

審査を経たサイバー防御組織が参加できる「Fairwind Program」を通じた提供を開始しており、続いて有料APIの顧客とGoogle AI Ultraユーザーに段階的に提供予定です。

■出力上限は100万トークン、提供はサイバー防衛組織から

Gemini 4 Argonは出力上限を6万4000トークンから100万トークンへと大幅に拡大し、長期にわたる自律的な推論と作業に優れたモデル。Googleは「複雑かつ長期的なワークフロー全体にわたって深い推論を持続」するよう構築したと表現しています。

Claude Opus 5.5とGPT-6 Astraはどちらも最大出力が12万8000トークンで、Argonの100万トークンはその約8倍にあたります。

深い推論を持続できる能力の反映として、高度な法務ベンチマークで他社に大差をつけて首位を記録したほか、業務自動化のAutomationBenchでもAnthropic の Claude Opus 5.5 や OpenAI GPT-6 Astraを大きく上回るなど、Googleは「高度なナレッジワーク」「コーディング」「サイバーセキュリティ」分野での強みをアピールします。

Googleによれば、すでに社内では数千人が日常業務のワークフローで使用中。Argonのエージェント群がデータセンターのメモリを最適化し500TiBから1PiBを節約できる見込みであることや、動画再生のlibgav1で手書きの高速化コード3万2000行を安全なRustに書き換え、映像品質を保ったままC++版に迫る速度を実現したといった例を挙げています。

サイバーセキュリティについては、このレベルの能力を安全に公開するには段階的なアプローチが欠かせないとして、米国政府によるリリース前モデルへの自主的なアクセスの枠組みにも参加しつつ提供範囲を拡大します。脆弱性を見つける力は攻撃にも使えるため、防御側に先行期間を与える目的です。

■ ベンチマークは法務・金融や業務自動化でSOTA

Googleは自社で選んだ18項目の比較表を公開しています。Claude Opus 5.5とGPT-6 Astraと比較すれば、どちらに対しても差が大きいのは4項目。

・業務の自動実行を測るAutomationBenchは51.3%で、Opus 5.5(42.5%)に8.8ポイント、Astra(41.4%)に9.9ポイントの差。
・法務の調査と文書作成を測るHarvey's Legal Agent Benchmarkは19.6%で、Opus 5.5(3.8%)に15.8ポイント、Astra(5.4%)に14.2ポイントの差(ただし、絶対値ではまだどのモデルも低い水準)。
・財務リサーチのVals Finance Agent v2は65.4%で、Opus 5.5(58.6%)に6.8ポイント、Astra(53.5%)に11.9ポイント上回る。
・入力256kから100万トークンの区間のGraphWalksは84.2%で、Opus 5.5(66.8%)に17.4ポイント、Astra(71.8%)に12.4ポイントの差。

相手で差が分かれる項目もあります。

・科学ベンチのLABBench 2(88.8%)はOpus 5.5(73.1%)に15.7ポイント差、Astra(85.4%)とは3.4ポイント差。
・GraphWalksの128k以下(99.7%)はOpus 5.5(90.6%)に9.1ポイント差でAstra(98.7%)とは1.0ポイント差。
・チャート読解のChartography(71.6%)はOpus 5.5(66.3%)に5.3ポイント差でAstra(71.0%)とは0.6ポイント差。

Googleが最高水準とするコーディングのDeepSWE v1.1は77.9%で、Opus 5.5(74.2%)、Astra(74.1%)とも3.7~3.8ポイント差。
CWE-bench v1は68%でAstraと同率、Opus 5.5(67%)とは1ポイントとわずかな差で、評価環境もArgonがAntigravity、AstraがCodex、Opus 5.5がClaude Codeと異なります。

発表文では特に触れていませんが、他社が上回る項目も当然あります。FrontierSWE v2(Argon 55.0%)はOpus 5.5(62.3%)に7.3ポイント、Astra(65.5%)に10.5ポイント下回り、Terminal-bench 4.0(57.4%)はOpus 5.5(66.4%)に9.0ポイント下回ります(Astraの58.2%とは0.8ポイント差)。

Terminal-Bench Science 0.1(57.6%)はAstra(68.1%)に10.5ポイント、OSWorld-2.0(69.2%)もAstra(72.6%)に及びません。

■ サイバー防衛向けにガードレールなしで提供

Argonは重要なソフトウェアの脆弱性を自律的に発見、検証、パッチ適用できるとされ、信頼できる防御組織とGoogle社内にはサイバー分野のガードレールを外した状態で提供します。

実際の例としては、Wizが「Scan for Good」でArgonを使い、世界の病院で使われる医療ソフトウェアの重大な脆弱性を見つけたとGoogleは説明しています。

広く公開する前に、Fairwind Programを通じて悪用への防御、プロンプトインジェクションへの耐性、思考と行動の監視、サンドボックス環境の隔離の4領域の安全対策を強化します。Fairwind Programは世界で650以上の組織が参加する申請制で、使えるのは社内のセキュリティ、インシデント対応、ペネトレーションテストのチームに限られます。

■ 導入価格はSonnet 5.5 / GPT-6.1 Solと同等

導入価格は100万トークンあたり入力2ドル、出力10ドルで、キャッシュ済み入力は95%引き。期間終了後は4ドルと20ドルに上がる予定です。

各社の公式価格表と並べると、導入価格はClaude Sonnet 5.5、GPT-6.1 Solと同額、通常価格はClaude Opus 5.5と同額。各社の最上位であるGPT-6 AstraとClaude Fable 5.1は10ドルと50ドルとさらに高価なため、Argonは価格では中位モデルということになります。

《テクノエッジ編集部ピックアップ》

Amazon売れ筋ランキング

テクノエッジ編集部ピックアップ

テクノエッジ編集部がピックアップしたニュースをお伝えします。

BECOME A MEMBER

『テクノエッジ アルファ』会員募集中

最新テック・ガジェット情報コミュニティ『テクノエッジ アルファ』を開設しました。会員専用Discrodサーバ参加権やイベント招待、会員限定コンテンツなど特典多数です。