Sonnet 5.5 é 30% Mais Rápido — E Com Economia

No momento, você está visualizando Sonnet 5.5 é 30% Mais Rápido — E Com Economia

A guerra dos modelos de IA ganhou mais um capítulo. A Anthropic lançou em 28 de setembro de 2026 o Claude Sonnet 5.5, nova versão de seu modelo intermediário, prometendo trabalho bem mais rápido e um custo por tarefa consideravelmente menor que o do antecessor.

O laboratório descreve o Sonnet 5.5 como um parceiro ideal para tarefas do dia a dia — desde programação até a criação de documentos de escritório. Mas há uma nuance importante na história da economia prometida, e vale começar por ela.

Organização de TI

A economia existe, mas o preço não mudou

Aqui está o ponto que a maioria das manchetes embaralha: o preço por token do Sonnet 5.5 é exatamente o mesmo do Sonnet 5. São 2 dólares por milhão de tokens de entrada e 10 por milhão de saída, além de 20 centavos por milhão em leituras de cache e 2,50 dólares em escritas de cache. Para comparação, o Opus 5.5 custa 4 e 20 dólares nas mesmas categorias.

A economia de até 30% por tarefa, portanto, não vem de uma tabela mais barata. Ela vem do fato de o modelo precisar de menos tokens e menos chamadas de ferramentas para concluir o mesmo trabalho. Segundo a Anthropic, o Sonnet 5.5 agrupa chamadas de ferramentas com mais frequência que seu antecessor, o que reduz etapas e, consequentemente, o gasto.

É uma distinção prática relevante. Se a sua carga de trabalho for atípica, a economia real pode ficar acima ou abaixo desse número — ela depende de quantos tokens o seu caso específico consome.

Velocidade como principal argumento

O Sonnet 5, antecessor direto, foi anunciado cerca de três meses antes, em 30 de junho. Naquele momento, o argumento de venda era a implantação eficiente de agentes, rodando-os a um custo menor que o da concorrência.

Com o 5.5, o foco mudou para velocidade. A Anthropic afirma que ele gera respostas mais de 30% mais rápido que o antecessor, o que o torna o Sonnet mais veloz já lançado. Vale registrar que a empresa não detalhou publicamente a metodologia dessa medição, e veículos especializados chegaram a solicitar esse esclarecimento.

O modelo chegou seis dias depois do Opus 5.5 e é o segundo integrante da família Claude 5.5. Ele traz janela de contexto de 1 milhão de tokens, saída máxima de 128 mil tokens e corte de conhecimento em junho de 2026.

Os relatos de quem testou antes

A Anthropic divulgou resultados de clientes que avaliaram o modelo antecipadamente, e os números ajudam a dimensionar o ganho.

O Slack relatou cerca de 14% menos tokens de saída em avaliações internas, sem qualquer mudança nos prompts. A Zendesk afirmou processar tickets 20% mais rápido que com os modelos Claude que já rodava em produção. A Box reportou resultados 2,4 vezes mais rápidos com 12% menos tokens no total, e a Atlassian disse que seus clientes podem rodar agentes até 30% mais rápido.

O caso mais chamativo veio da gestora Balyasny, que em uma bateria privada de 2.441 tarefas financeiras registrou cerca de 121 mil tokens por resposta, contra 497 mil do Sonnet 5.

Onde ele se posiciona na hierarquia dos modelos

Na estrutura da Anthropic, o Sonnet é menos poderoso que o Opus, mas pode ser mais útil em certas situações justamente por sua agilidade.

Os benchmarks da empresa mostram o Sonnet 5.5 superando o Opus 5.5 em programação agêntica — provavelmente por conseguir acionar múltiplos agentes sem estourar os limites de custo. No Terminal-Bench 4.0, teste de programação agêntica, ele marcou 70,6%, contra 66,4% do Opus 5.5 e 10,3% do Sonnet 5.

Em trabalho de conhecimento, a diferença praticamente desaparece. Na avaliação GDPval-AA, que cobre 44 ocupações em nove setores, o Sonnet 5.5 alcançou 1.844 pontos de Elo, apenas dois abaixo dos 1.846 do Opus 5.5 e bem acima dos 1.449 do Sonnet 5. Vale destacar que esse resultado específico foi apurado pela Artificial Analysis, uma avaliadora independente — o que lhe dá um peso diferente dos números medidos pela própria fabricante.

Ainda assim, cabe a ressalva honesta: os benchmarks não são substitutos diretos de cada carga de trabalho real, e a própria Anthropic afirma que o Opus 5.5 continua claramente mais forte em trabalhos difíceis e abertos, que exigem julgamento cuidadoso. Testes independentes mais amplos ainda precisam confirmar as demais alegações.

O controle de esforço muda a conta

Um recurso que merece atenção de quem calcula custos é o ajuste de esforço, com cinco níveis disponíveis. Ele permite trocar profundidade de raciocínio por menor latência e menos consumo de tokens, ou o contrário.

Os números divulgados mostram o impacto dessa alavanca. Em várias avaliações, o Sonnet 5.5 rodando em esforço baixo ou médio já supera o melhor resultado do Sonnet 5 por cerca de um décimo do custo por tarefa. No teste FrontierCode, em esforço alto, ele pontua aproximadamente 10 pontos acima do Sonnet 5 no mesmo ajuste, custando algo em torno de um quinze avos por tarefa.

Na prática, o Claude Code e os aplicativos de consumo usam o nível médio como padrão, enquanto a plataforma para desenvolvedores adota o alto. Ajustar esse parâmetro é, provavelmente, a decisão que mais mexe na fatura.

Capacidades cibernéticas trouxeram novas salvaguardas

O Sonnet 5.5 também tem capacidades cibernéticas significativas — comparáveis, segundo a empresa, às do Opus 5. Como consequência, ele é o primeiro modelo Sonnet a ser lançado com as mesmas salvaguardas de cibersegurança e mecanismos de contenção desenvolvidos para os modelos mais capazes da linha.

A Anthropic informou ainda ter adicionado proteções contra ataques de destilação, técnica usada para extrair capacidades de um modelo treinando outro a partir de suas respostas. O modelo é oferecido com retenção zero de dados e está disponível em todas as plataformas, incluindo Amazon Web Services, Google Cloud e Microsoft Azure, sob o identificador claude-sonnet-5-5. Por ser de pesos fechados, não há opção de hospedagem própria.

Atenção às mudanças que quebram integrações

Um aviso prático para quem já roda o Sonnet 5 em produção: a atualização traz cinco mudanças incompatíveis na API. Entre elas, o raciocínio estendido não pode mais ser desligado, e chamadas forçadas de ferramentas passam a retornar erro 400.

Se você mantém integrações ativas, vale revisar a documentação de migração antes de simplesmente trocar o identificador do modelo.

O que vem a seguir

A empresa também planeja lançar uma nova versão do Haiku, seu modelo menor, nas próximas semanas — sem data firme divulgada.

O lançamento se insere em um ano especialmente movimentado. Na semana anterior, a OpenAI apresentou vários modelos novos, incluindo versões aprimoradas do Sol e do Luna, suas opções intermediária e econômica. A Meta também anunciou um modelo que deve alimentar um recurso ligado a seus óculos inteligentes.

A disputa mudou de eixo

Talvez o aspecto mais revelador desse lançamento seja o que ele diz sobre a direção do mercado. Com o preço por token congelado e a economia vindo de eficiência, a competição deixou de girar em torno do valor nominal do token e passou a girar em torno de quantos tokens cada tarefa realmente consome.

Para quem desenvolve ou opera sistemas com IA, isso muda a forma de avaliar um modelo. Comparar tabelas de preço já não basta: é preciso medir o custo por tarefa concluída no seu próprio fluxo de trabalho. E, como sempre, vale tratar os números divulgados pelos fabricantes como indicação de direção, esperando as avaliações independentes para confirmar o que se sustenta fora do laboratório.

Claude

Deixe um comentário