O Google anunciou em 30 de setembro de 2026 o Gemini 4 Argon, seu novo modelo de fronteira voltado a tarefas longas em desenvolvimento de software, trabalho corporativo e cibersegurança. O número que domina as manchetes é o limite de saída: ele saltou de 64 mil para 1 milhão de tokens, um aumento de mais de quinze vezes.
Mas há duas histórias aqui que merecem atenção igual. Uma é o que esse salto técnico permite fazer. A outra é o fato de que, por enquanto, quase ninguém pode usá-lo. Vamos por partes.
Por que o limite de saída importa tanto
Vale esclarecer uma confusão comum. O limite de saída não é a mesma coisa que a janela de contexto. A janela de contexto define quanto o modelo consegue ler; o limite de saída define quanto ele consegue escrever em uma única resposta.
Na prática, era esse teto de 64 mil tokens que obrigava a quebrar trabalhos longos em pedaços, com o modelo parando e sendo reiniciado. Com 1 milhão de tokens, uma migração de código extensa, um relatório completo ou uma análise jurídica longa podem sair em uma única execução, sem fragmentação.
Segundo o Google, essa margem permite que o modelo raciocine por problemas difíceis em uma corrida longa, gerando centenas de milhares de tokens em uma só passagem. Internamente, os engenheiros da empresa já vêm usando o Argon em projetos de grande escala, como migração de código e otimização de bases existentes, com ganhos relatados de desempenho e economia de memória.
Os números divulgados (e os que ficaram de fora)
O Google reporta 77,9% no DeepSWE v1.1, 51,3% no AutomationBench, da Zapier, e 91,7% no LVBench. A empresa afirma que o Argon lidera o Vals Index e supera o GPT-6 Astra, da OpenAI, e o Claude Opus 5.5, da Anthropic, em várias avaliações. Na área de segurança, marcou 68% no CWE-bench v1, empatando em primeiro lugar.
Aqui, porém, cabe uma dose de equilíbrio que a maioria das coberturas deixou passar. Por uma contagem dos próprios resultados divulgados pelo Google, o Argon lidera isoladamente em 12 dos 18 benchmarks apresentados — o que significa que ele fica atrás nos demais. Entre as derrotas estão o Terminal-Bench 4.0 e o FrontierSWE v2, com relatos de que o modelo perde para o GPT-6 Astra por cerca de 10 pontos em tarefas conduzidas por terminal.
Há ainda uma ressalva mais fundamental: até agora, nenhum laboratório independente reproduziu qualquer um desses resultados. Todos os números publicados vêm do próprio Google ou do grupo restrito que teve acesso antecipado. Como sempre, o mais sensato é tratá-los como indicação de direção, e não como veredito.
Quem pode usar: praticamente ninguém, por enquanto
Esta é a parte mais incomum do lançamento. Fora as equipes internas do Google, o acesso está limitado a defensores de cibersegurança previamente avaliados e inscritos no Fairwind Program, uma iniciativa que o Google criou algumas semanas antes, junto com o modelo Gemini 3.8 Flash Cyber.
O motivo dessa cautela aparece quando se entende o que o Argon é capaz de fazer. O modelo foi treinado especificamente para defesa cibernética e consegue, de forma autônoma, descobrir vulnerabilidades, validar se elas são exploráveis e gerar correções. A equipe da Wiz já o utiliza por meio da iniciativa Scan for Good.
E há um detalhe que merece destaque: para os membros do Fairwind e para os times internos, o Google está liberando o modelo sem as salvaguardas de cibersegurança. É uma decisão coerente com o objetivo — um defensor precisa que a ferramenta analise código malicioso sem travar — mas que explica por que a empresa está sendo tão seletiva sobre quem entra nessa lista.
O Google também informou estar participando do processo voluntário do governo americano para acesso antecipado a modelos, enquanto continua testando suas proteções.
As defesas que o modelo traz
Vale registrar que o Argon chegou com reforços na própria segurança. O Google afirma que ele apresenta resistência aprimorada a injeção indireta de prompt — aquele ataque em que instruções maliciosas ficam escondidas em um documento ou página que o modelo vai processar — e conta com monitores separados para impedir ações não pretendidas.
Para um modelo projetado para operar de forma autônoma por longos períodos, essas proteções são tão importantes quanto a capacidade bruta.
Preço agressivo, disponibilidade indefinida
Quando o acesso for ampliado, ele chegará primeiro a clientes pagantes da API e a assinantes do Google AI Ultra. O preço promocional de lançamento é de 2 dólares por milhão de tokens de entrada e 10 dólares por milhão de saída, com desconto de 95% sobre entradas em cache. Encerrado o período introdutório, os valores sobem para 4 e 20 dólares, respectivamente.
Analistas apontam que, nesse patamar introdutório, o Argon fica em torno de cinco vezes mais barato que o GPT-6 Astra — o que, na avaliação de alguns, é um argumento competitivo mais sólido que a liderança em benchmarks ainda não verificados.
O Google, porém, não anunciou data para a disponibilidade ampla. Então, para a maior parte dos desenvolvedores e empresas, o Argon segue sendo uma promessa no horizonte, não uma ferramenta disponível.
O que esse lançamento revela sobre o momento da IA
Além do produto em si, há um padrão interessante acontecendo. Liberar primeiro para defensores de cibersegurança verificados, com salvaguardas relaxadas e sob programa de acesso controlado, é uma estratégia que outras empresas do setor também vêm adotando para seus modelos mais capazes.
Isso diz algo sobre a maturidade do mercado: quando um modelo se torna bom o bastante para encontrar e explorar vulnerabilidades sozinho, a decisão de quem recebe acesso deixa de ser comercial e passa a ser de segurança. A mesma capacidade que ajuda a defender também ajuda a atacar.
Para quem acompanha o setor, vale ficar de olho em três pontos nos próximos meses: se avaliações independentes confirmam os números divulgados, se o Google mantém o preço introdutório ou o eleva rapidamente, e quando — ou se — o acesso realmente se abre para além do círculo fechado atual. Até lá, o mais notável do Gemini 4 Argon continua sendo o milhão de tokens de saída, que é uma mudança concreta e verificável no que um modelo consegue produzir de uma só vez.
