Novo Google Gemini 4 Argon

Gemini 4 Argon: a Google voltou pra briga de verdade, 1 milhão de tokens de output e empate com GPT-6 Astra custando 60% menos

30 de setembro de 2026, depois de quase um ano só com Flash, a Google finalmente soltou um flagship de verdade. O Gemini 4 Argon é o primeiro modelo proprietário acima da classe Flash em 7 meses, marca 53 no Artificial Analysis Intelligence Index, empata com GPT-6 Astra (53) e abre 1 ponto sobre o GPT-6.1 Sol (52). E custa, na promoção de lançamento, $1,99 por tarefa do Intelligence Index, ou seja, 60% do preço do Astra pelo mesmo nível de inteligência. O Argon não está disponível publicamente ainda: o rollout começa pelo Fairwind Program para trusted defenders de cybersecurity, com expansão gradual para developers, enterprises e consumidores depois.

A cereja do bolo técnico é um número absurdo: o Argon aumenta o teto de output tokens para 1 milhão, contra os 64K do limite anterior. É o maior teto de geração de qualquer modelo frontier hoje, e foi pensado especificamente para deixar o modelo “pensar por horas” em uma única trajetória de raciocínio. A Google também publicou números novos em knowledge work, long-horizon software engineering, defesa cibernética e raciocínio multimodal.

Gemini 4 Argon

O grande número

53 pontos no Artificial Analysis Intelligence Index. Para efeito de comparação, o melhor modelo da Google até então era o Gemini 3.8 Flash (high) com 41, e o antecessor Gemini 3.1 Pro Preview marcava apenas 30. Argon é um salto de +23 pontos sobre o Pro Preview e +12 sobre o Flash. Em termos práticos, a Google voltou ao top 3 de laboratórios por capacidade bruta de inteligência, lugar que vinha perdendo para OpenAI, Anthropic e dois laboratórios chineses desde o lançamento do Gemini 3.5 Pro (cancelado em maio).

Tabela-resumo de capacidades do Gemini 4 Argon publicada pela Google

O segundo número absurdo é o de 1 milhão de tokens de output. GPT-6 Astra e Fable 5.1 documentam 128K de output. Claude Opus 5.5 documenta 128K com um beta de 300K para Message Batches. Argon não é 8x maior, é quase 8x maior que o teto padrão de qualquer concorrente direto. Tradução: dá pra pedir pro Argon gerar uma codebase inteira, um relatório de due diligence de 200 páginas ou um exploit chain completo em uma única chamada, sem precisar emendar respostas.

O treinamento que o mundo não assistiu (mas o Google usou)

Diferente da Xiaomi com o MiMo ou da DeepSeek com o V4, a Google não documentou treinamento público dessa vez. O que a empresa contou foram três vitórias internas em produção que servem como vitrine:

  • Otimização quântica: Argon ajudou pesquisadores de quantum computing a otimizar o “spacetime resource” (qubits × gates) de subrotinas que travavam aplicações importantes. Em um caso, superou o baseline publicado em 40% em minutos.
  • Eficiência de memória: agentes Argon analisaram telemetria de profiling de toda a frota de data centers da Google, identificaram e aplicaram otimizações de memória autonomamente. Resultado: 300 TiB liberados na primeira rodada, com estimativa de 500 TiB a 1 PiB no total.
  • Migração de C/C++ para Rust em escala: agentes Argon estão migrando partes do Google de C/C++ para Rust, variando de dezenas de milhares de linhas em bibliotecas como re2 e libgav1, até 800K+ linhas do kernel Zircon do Fuchsia OS. No caso do libgav1 (decodificador de vídeo open source), os agentes pegaram um port em Rust e substituíram 32K linhas de código SIMD rodando várias rodadas de experimentos profile-guided, estudando o output do compilador e produzindo Rust safe que o compilador vetoriza automaticamente. O decoder final roda 2.7x mais rápido que o port original, com output de vídeo idêntico.

Esse último caso é especialmente relevante: o Argon não só reescreveu 32K linhas de código SIMD crítico de performance, como melhorou o resultado. É o tipo de tarefa que humanos Sênior de kernel passam semanas afinando.

Especificações e preços

A linha de produto segue enxuta. Argon é um único modelo (não há “Argon Pro” ou “Argon Flash” ainda), com preços que dobram depois do período promocional:

Modelo / Fase Input / 1M tokens Output / 1M tokens Cache read / 1M
Argon (intro) $2,00 $10,00 $0,10 (95% off)
Argon (pós-promo) $4,00 $20,00 $0,20
GPT-6 Astra $10,00 $50,00 $1,00
GPT-6.1 Sol $2,00 $10,00 $0,10
Claude Opus 5.5 $4,00 $20,00 $0,20
Claude Fable 5.1 $10,00 $50,00 $0,25
Claude Sonnet 5.5 $2,00 $10,00 $0,20
Gemini 3.8 Flash $0,75 $3,75 $0,075

A Google não divulgou data de fim da promoção. Comparando com GPT-6 Astra no período promocional, Argon é 5x mais barato no input e 5x mais barato no output. Mesmo depois da promoção, Argon fica 60% mais barato que Astra nos dois lados.

Specs principais que aparecem no anúncio e em cards de modelo:

Spec Valor Observação
Output máximo 1.000.000 tokens Subiu de 64K. Maior teto de qualquer frontier hoje.
Context window Multimodal evaluations até 1M Limite de input na API pública ainda não totalmente confirmado.
Modalidades de input Texto, imagem, vídeo, arquivo Mesmas do Gemini 3.8 Flash.
API ID pública Não confirmado no anúncio Google ainda não publicou o ID de produção.
Reasoning Thinking effort “max” usado na maioria dos evals Controles de API pública pendentes.
Pesos Privados Sem plano de open-weight anunciado.

Benchmarks: vitórias, derrotas e onde “empate” não é vitória

Aqui é onde o post fica honesto. Os números abaixo são da tabela oficial da Google, comparando Argon com GPT-6 Astra, Claude Fable 5.1 e Claude Opus 5.5. O Google usou configuração “highest thinking” e geralmente tentativa única. Onde o Google omitiu o resultado de um rival, marquei com N/D.

Knowledge work e enterprise

Benchmark Argon GPT-6 Astra Fable 5.1 Opus 5.5
Vals Index (impacto econômico) 68,9% 63,1% 65,8% 67,0%
Vals Finance Agent v2 65,4% 53,5% 58,9% 58,6%
Harvey’s Legal Agent Benchmark 19,6% 5,4% 6,7% 3,8%
AutomationBench (Zapier) 51,3% 41,4% 31,4% 42,5%
PostTrainBench 45,3% 44,3% 40,2% 49,3%

Aqui o Argon varre: lidera 4 de 5 benchmarks. Margem mais gorda no Harvey’s Legal (3,6x mais que o Fable) e no AutomationBench (+8,8 pontos sobre o Opus). A ressalva honesta: PostTrainBench o Opus 5.5 ainda lidera, então Argon não é dominador absoluto em conhecimento profissional.

Software engineering

Benchmark Argon GPT-6 Astra Fable 5.1 Opus 5.5
DeepSWE v1.1 (long-horizon eng) 77,9% 74,1% 67,4% 74,2%
FrontierSWE v2 55,0% 65,5% 56,3% 62,3%
Vibe Code Bench 91,9% 89,6% 90,3% 90,3%
Terminal-bench 4.0 57,4% 58,2% 57,9% 66,4%
Terminal-Bench Science 0.1 57,6% 68,1% 52,6% 63,3%

Aqui a história muda. Argon lidera DeepSWE e Vibe Code Bench, mas perde feio em FrontierSWE v2 (Astra +10,5 pontos), Terminal-bench 4.0 (Opus +9 pontos) e Terminal-Bench Science 0.1 (Astra +10,5 pontos). Em três dos cinco benchmarks de engenharia mais pesados, Argon está atrás. Isso é informação importante porque derruba a narrativa “Argon domina coding”: ele domina um benchmark específico de software engineering long-horizon (DeepSWE), mas em testes de execução real no terminal e em ciência ele apanha.

Benchmark DeepSWE v1.1

Raciocínio e ciência

Benchmark Argon GPT-6 Astra Fable 5.1 Opus 5.5
LABBench 2 88,8% 85,4% 68,6% 73,1%
RiemannBench 76,0% 72,0% 65,6% 69,6%
Agent’s Last Exam (pass rate) 39,5% 34,2% N/D 38,2%

Argon lidera todos os três, com vantagem bem gorda em LABBench 2 (+15,7 sobre Opus). Em Agent’s Last Exam, Argon finalmente ultrapassa os 38,2% do Opus 5.5, que era o teto dos modelos anteriores para a avaliação.

Multimodal e visão

Benchmark Argon GPT-6 Astra Fable 5.1 Opus 5.5
LVBench (long video) 91,7% 87,5% 79,7% 83,7%
Chartography 71,6% 71,0% 46,2% 66,3%
OSWorld-2.0 (offline subset) 69,2% 72,6% N/D N/D

Argon lidera LVBench e Chartography, mas perde para Astra em OSWorld-2.0 por 3,4 pontos. Importante: o Google rodou OSWorld com no máximo 3 tentativas no subset offline, o que limita a comparabilidade direta.

Long-context reasoning (GraphWalks)

Condição Argon GPT-6 Astra Fable 5.1 Opus 5.5
Até 128K; breadth-first search, F1 99,7% 98,7% 91,4% 90,6%
256K a 1M; BFS F1 84,2% 71,8% 65,0% 66,8%

Esse é talvez o resultado mais importante do anúncio. No regime de 256K a 1M tokens de contexto, Argon é 12,4 pontos acima de Astra, 17,4 acima de Opus e 19,2 acima de Fable. A maioria dos modelos “degrada” em raciocínio conforme o input cresce. Argon degrada muito menos. Isso é evidência forte de que o teto de output de 1M tokens é genuíno, não marketing.

Vals Index benchmark
Vals Finance Agent benchmark
Harvey's Legal Agent Benchmark
AutomationBench (Zapier)

Cybersecurity: o foco real do lançamento

Argon foi explicitamente treinado para defesa cibernética, e a Google está lançando-o sem guardrails de cyber para trusted defenders e para times internos da Google. O case público mais marcante é com a Wiz, através do programa Scan for Good (que usa o Red Agent da Wiz em cima de modelos Gemini):

“Em uma demonstração inicial de impacto, o modelo descobriu uma vulnerabilidade crítica expondo informações pessoais sensíveis em software de saúde usado por hospitais no mundo todo, identificando um risco severo que modelos frontier anteriores tinham deixado passar.”

A Wiz adquiriu participação da Google no início do ano por $32 bilhões, então não é parceria casual. Os números reportados em cyber:

Benchmark Argon Notas
CWE-bench v1 68,0% (empata com GPT-6 Astra) Remediação de vulnerabilidades conhecidas.
CyberGym (interno) Supera 3.8 Flash Cyber Argon supera o Flash Cyber e modelos maiores.
Wiz black-box pentest (interno) Supera 3.8 Flash Cyber Análise de sistemas web sem source code.
Gray Swan IPI (prompt injection) Líder da categoria Mais resiliente do que qualquer modelo anterior a prompt injection indireta.
Internal vuln discovery (20 linguagens) Cobre amplo espectro Sucesso em descobrir exposições em 20 linguagens diferentes.
CWE-bench v1: Argon empata com GPT-6 Astra em 68%
Comparativo de descoberta de vulnerabilidades vs. 3.8 Flash Cyber
Gray Swan IPI: Argon lidera em resiliência a prompt injection

Detalhes do CWE-bench valem destaque: 68,0% pass@1 empata com GPT-6 Astra, e Grok 4.7 também marca 68,0% segundo o índice independente da Vals. Ou seja, Argon lidera junto com dois modelos de laboratórios completamente diferentes. O real concorrente em cyber agora é o próprio ecossistema.

Safeguards e o rollout

A Google enfatiza que Argon passou por red teaming interno e externo com métodos manuais e automatizados, e está implantando:

  • Monitoramento de activations internas do modelo para detectar misuse (algo que apareceu no report técnico do Gemini 2.5 Pro e que agora está expandido para cyber e CBRN).
  • Defesa contra prompt injection indireta, com testes via Gray Swan IPI benchmark (onde lidera).
  • Mitigação de misalignment, monitorando o chain-of-thought e as ações do Argon durante a execução e parando quando ele tenta sair do escopo.
  • Sandbox hardening: isolamento dos ambientes de avaliação de alto risco, alinhado com o agent control roadmap.

A Google também encorajou a indústria a preservar transparência de raciocínio (“model thoughts remain helpful in identifying and diagnosing misalignment”). Isso é jab direto contra fornecedores que escondem CoT por motivos de IP.

Custos por tarefa: a comparação que importa

O preço por token é marketing. O que importa é preço por tarefa completa. Aqui a conta muda bastante, e tem um gráfico independente da Vals que vale reproduzir:

Modelo Vals Index score Custo por teste (Vals) Base
Gemini 4 Argon 68,90% $15,68 Taxas $4/$20 (pós-promo)
Claude Sonnet 5.5 (max) 67,04% $21,34 Com fallback
Claude Opus 5.5 (max) 66,97% $32,14 Com fallback
Claude Fable 5.1 65,83% $28,71 Com fallback
GPT-6 Astra 63,13% $18,46 Suite Vals
GPT-6.1 Sol 61,15% $3,24 Suite Vals

O detalhe importante: o custo por teste do Argon foi calculado pela Vals usando a tarifa pós-promo ($4 input / $20 output). Na tarifa intro, esse número cai para cerca de $7,84, metade do Astra. Mas mesmo no pior cenário (tarifa cheia), Argon é 15% mais barato que Astra no mesmo nível de inteligência.

E pela Artificial Analysis: $1,99 por tarefa do Intelligence Index no período promocional, 60% do Astra. Quando a promoção acabar, vai pra $3,98, 1,2x Astra. Para chamadas com cache hit, a economia é brutal: cache a $0,10 / 1M de tokens é praticamente de graça.

O que isso significa (opinião)

  • A Google voltou pro jogo de verdade. Depois de 7 meses só com Flash e um Pro Preview capenga, Argon coloca a Google empatada com OpenAI em Intelligence Index bruto e acima em knowledge work (Vals Index), long-context reasoning e defensiva cyber. A defasagem de 17 pontos do 3.1 Pro Preview era vexame. Os 23 pontos de salto em uma geração são correção agressiva de rota.
  • O ângulo de cyber é sério. Argon não é só mais um modelo com CWE-bench alto. É o primeiro modelo lançado pela Google sem guardrails de cyber para trusted defenders, integrado com Wiz/Red Agent, com case público em saúde. A Wiz pagou $32 bi pra Google e já está mostrando ROI. Para CISOs, isso importa mais do que mais um benchmark de coding.
  • Knowledge work é o novo campo de batalha. O salto em Harvey’s Legal Agent Benchmark (19,6% vs. 5,4% do Astra, 3,6x) e Vals Index sugere que Argon é o melhor modelo atual para trabalho jurídico e financeiro de fato, não de demo. Para um modelo que custa metade do Opus, é argumento de venda fortíssimo em firmas de advocacia, fundos e consultorias.
  • Os números de coding são mais mistos do que o marketing diz. Argon lidera DeepSWE e Vibe Code Bench, mas perde feio em FrontierSWE v2, Terminal-Bench 4.0 e Terminal-Bench Science 0.1. Quem escolher modelo só por “DeepSWE = coding champion” vai ter surpresa. Em coding agentic sério, Opus 5.5 e GPT-6 Astra ainda são apostas mais seguras para casos específicos.
  • O teto de 1M output muda workflows, mas com asterisco. A Google não documentou se isso é teto duro da API ou se vira cobrança diferenciada acima de certo threshold. O detalhe de o Google não ter publicado a API ID pública no anúncio sugere que o contrato de produção ainda está sendo finalizado. Esperar para workflows críticos.
  • O Independent Verification está vindo. A Artificial Analysis já marcou 53 (empate com Astra). Vals marcou 68,9% no Index. Falta LMArena/Chatbot Arena, que não conseguiu testar porque Argon não está acessível. Quando sair, vai ser interessante ver se a vitória em knowledge work se sustenta em preferência humana.
  • A promoção acaba (e ninguém sabe quando). Google não disse data. Comparando com Gemini 3.8 Flash (intro até 31/12/2026), o padrão é promoção de ~3 meses. Quem quiser economia de 50%, melhor não dormir.
  • O caso libgav1 é a melhor propaganda. Reescrever 32K linhas de SIMD crítico e ainda melhorar 2,7x é o tipo de coisa que engenheiro de kernel veterano faz em semanas. Argon fez em “rodadas de experimentos profile-guided”. É sinal de que, pelo menos em tarefas onde há telemetria rica, o modelo está genuinamente útil para otimização agressiva.

Linha do tempo e referências

Quando a API pública abrir, volta aqui. Vou rodar Argon em DeepSWE, Vibe Code Bench, FrontierSWE e Terminal-Bench com a minha suíte e publicar resultados de verdade, não print de tabela oficial. Se a API ID for confirmada até lá, vai no próximo post.

Aviso metodológico: todos os benchmarks comparativos acima são da tabela oficial publicada pela Google DeepMind em 30/09/2026, exceto onde explicitamente como Vals ou Artificial Analysis. A Google usou reasoning “max” para Argon e configurações equivalentes para rivais, mas detalhes de harness variam por benchmark. Resultados em produção podem divergir.

Gostaria de receber mais novidades?

Nossas publicações serão sempre voltadas ao mundo do marketing digital, design e criação de sites. Você não será importunado com assuntos que não são do seu interesse!

Compartilhe com seus familiáres e amigos!

Baita Site

Desenvolvemos soluções completas em Marketing Digital para o seu o seu negócio.

Contate-nos, solicite um orçamento, teremos o maior prazer em lhe ajudar!

baitasite@baitasite.com.br
+55 (47) 3360-7843
CNPJ 22.130.607/0001-29

Porque nos escolher?

É algo muito simples! Temos anos e uma vasta experiência com internet, nosso preço é justo e nosso trabalho profissional.

São anos de estudo e dedicação para adquirir o conhecimento necessário para executar projetos com qualidade e eficiência

Onde Estamos

Estamos localizados em um aconchegante home office em Itapema, litoral de Santa Catarina. Você está longe? Não tem problema!

Somos feras em atendimento e suporte a distância, por WhatsApp e pela internet!

Copyright 2020 - Baita Site - Criação de Sites em Itapema. Site feito com amor por nós mesmos!