28 de setembro de 2026, A Anthropic colocou no ar hoje o Claude Sonnet 5.5, o segundo modelo da família Claude 5.5. Em uma única tacada, o mid-tier da Anthropic cravou 70.6% no Terminal-Bench 4.0, uma prova de programação agêntica que o Sonnet 5 de junho fazia 10.3% e que o Opus 5.5, flagship lançado há seis dias, fazia 66.4%. Traduzindo: o modelo mais barato da família superou o modelo mais caro no benchmark mais importante de coding agentivo do ano.
Não é só marketing. Os números foram confirmados pelo Artificial Analysis, pelo Handy AI Substack e auditados no System Card que a própria Anthropic publicou. O preço por tarefa caiu até 30% na média, a velocidade de output subiu 30%+, e o per-token ficou idêntico ao Sonnet 5: US$ 2 (input) e US$ 10 (output) por milhão de tokens, com cache reads a US$ 0.20 por milhão.

O que a Anthropic está vendendo (e o que isso significa de verdade)
Índice
ToggleSonnet 5.5 não é um upgrade incremental. É a maior salto de capability-per-dollar que a Anthropic já entregou entre gerações de uma mesma linha. Em três meses, o modelo mid-tier saiu de 10.3% para 70.6% no Terminal-Bench 4.0, uma multiplicação por 6.85x. Em outras métricas:
- GDPval-AA v2.1 (trabalho real em 44 ocupações): 1844 pontos vs 1449 do Sonnet 5. Quase empatado com Opus 5.5 (1846), diferença de 2 pontos.
- CursorBench 4.0 (sessões reais do editor Cursor): 55.5% vs 34.1%, a 2.3 pontos do Opus 5.5.
- AA-Briefcase v1.1: 1811 vs 1359 do Sonnet 5.
- OSWorld 2.1 (uso de computador): 80.1% parcial vs 57.0%, só 1.7 ponto abaixo do Opus.
- Chartography (reconhecimento de gráficos): 61.6% sem tools vs 15.6% do Sonnet 5, multiplicação por 4x.
- Humanity’s Last Exam com tools: 64.5% vs 54.9%.
Em outras palavras: não é só mais rápido e mais barato, é objetivamente mais inteligente em quase toda a régua.
A comparação que a Anthropic quer que você veja
A Anthropic colocou lado a lado a performance do Sonnet 5.5 contra os concorrentes diretos. A tabela abaixo foi extraída da [página oficial de lançamento](https://www.anthropic.com/claude-sonnet-5-5), com benchmarks self-reported (confirme depois no System Card):
| Benchmark | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 10.3% | 66.4% | — |
| FrontierCode 1.1 (Main) | 46.2% Max / 52.1% Xhigh | 42.4% | 54.4% | 49.3% |
| CursorBench 4.0 | 55.5% | 34.1% | 57.8% | — |
| GDPval-AA v2.1 | 1844 | 1449 | 1846 | 1487 |
| AA-Briefcase v1.1 | 1811 | 1359 | 1822 | 1483 |
| Humanity’s Last Exam (tools) | 64.5% | 54.9% | 67.7% | — |
| OSWorld 2.1 (parcial) | 80.1% | 57.0% | 81.8% | — |
| Chartography (sem tools) | 61.6% | 15.6% | 64.4% | 53.6% |
Note a primeira linha: Sonnet 5.5 > Opus 5.5. Isso é quase inédito em lançamentos de modelos do mesmo fornecedor, e aconteceu justamente na régua mais visada pelos desenvolvedores (coding agentivo).

A imagem acima é a demo oficial da Anthropic para o Sonnet 5.5: o modelo escrevendo do zero um programa JavaScript que simula a murmuração de estorninhos (algoritmo de Boids). O screenshot mostra o Sonnet 5.5 no meio da geração de 4.520 tokens de código em uma única resposta, algo que o Sonnet 5 raramente fazia sem corte.
As derrotas que ninguém vai te contar
Toda a tabela acima é self-reported pela Anthropic. Mas tem coisas que nem eles escondem no: [Link do PDF]
- FrontierCode piora em Max effort. O Sonnet 5.5 faz 46.2% em Max mas 52.1% em Xhigh, ou seja, raciocinar mais não ajuda. No Opus 5.5 acontece o contrário: o modelo escala monotônicamente. Isso sugere que o Sonnet 5.5 tem um teto de capacidade bruta que o Opus não tem.
- GDPval-AA: 2 pontos abaixo do Opus. Parece nada, mas é trabalho de conhecimento de longo horizonte, a área onde a Anthropic sempre vendeu o “cuidado” do Opus. A Anthropic admite no próprio release: “Opus 5.5 remains clearly stronger at complex, open-ended work requiring sustained judgment”.
- Toolathlon: 31.6 turnos médios por task. É mais do que qualquer outro Claude na tabela do System Card. O [Handy AI](https://handyai.substack.com/p/model-drop-claude-sonnet-55) cravou: “fica esquisito perto das citações de ‘menos passos’ da Anthropic”.
- Hallucina mais que o Opus 5.5. Está no System Card, § 3.3. Em produção, isso significa que você paga menos mas revisa mais.
- FrontierCode de Sonnet 5 → 5.5 melhorou só 3.8 pontos (42.4 → 46.2). A maioria do salto dramático está em Terminal-Bench, um benchmark novo e específico. Cuidado para não extrapolar.
A própria Anthropic reconheceu isso na coletiva: “benchmark scores capture only one facet of a model’s capabilities”. Tradução em PT-BR: olha o número, mas não esquece que benchmark é só do freguês que vende.
O gráfico que importa: capability por dólar
A Anthropic publicou também o gráfico que realmente mostra o ângulo do lançamento, acurácia vs. custo por tarefa nos diferentes níveis de effort. Os dados estão na própria [página oficial](https://www.anthropic.com/claude-sonnet-5-5) e no [blog do Addy Osmani](https://claude.dev/blog/building-with-claude-sonnet-5-5/):
| Modelo | Effort | Terminal-Bench 4.0 | Custo/tarefa |
|---|---|---|---|
| Sonnet 5.5 | Low | 20.0% | US$ 0.76 |
| Sonnet 5.5 | Medium | 28.8% | US$ 0.83 |
| Sonnet 5.5 | High | 43.0% | US$ 1.94 |
| Sonnet 5.5 | Xhigh | 61.5% | US$ 5.30 |
| Sonnet 5.5 | Max | 70.6% | US$ 12.54 |
| Opus 5.5 | Medium | 57.6% | US$ 2.94 |
| Opus 5.5 | Max | 64.8% | US$ 11.24 |
| Sonnet 5 | Max | 10.3% | US$ 11.62 |
| GPT-5.6 Sol | Max | 37.3% | US$ 7.89 |
Tradução rápida do que esse gráfico está dizendo:
- Sonnet 5.5 em Medium (US$ 0.83/tarefa) entrega mais que o Sonnet 5 em Max (US$ 11.62) por quase 14x menos. 14x.
- Sonnet 5.5 em High (US$ 1.94) já passa o Opus 5.5 em Medium (US$ 2.94), e custa 34% menos.
- Para chegar nos 70.6% do Sonnet 5.5 Max, você paga US$ 12.54/tarefa, mais caro que o Opus 5.5 Max. Em capability bruta, o Opus 5.5 Xhigh (66.4% por US$ 7.35) é mais racional.

Acima: a comparação direta publicada pela Anthropic. Os dois painéis mostram a mesma tarefa de código sendo executada, Sonnet 5.5 itera menos, entrega mais limpo, gasta menos tokens por resultado.
Preço: a tabela completa
Preços oficiais no dia 28 de setembro de 2026, em dólares por milhão de tokens. Comparados lado a lado com a concorrência:
| Modelo | Input | Output | Cache read | Cache write (5min) | Cache write (1h) | Batch |
|---|---|---|---|---|---|---|
| Sonnet 5.5 | US$ 2 | US$ 10 | US$ 0.20 | US$ 2.50 | US$ 4.00 | US$ 1 / US$ 5 |
| Sonnet 5 (anterior) | US$ 2 | US$ 10 | US$ 0.20 | US$ 2.50 | — | US$ 1 / US$ 5 |
| Opus 5.5 | US$ 4 | US$ 20 | US$ 0.20 | US$ 5.00 | US$ 8.00 | US$ 2 / US$ 10 |
| Opus 5 (anterior) | US$ 5 | US$ 25 | US$ 0.50 | US$ 6.25 | — | — |
| GPT-6 Sol (referência) | US$ 2 | US$ 10 | US$ 0.20 | US$ 2.50 | — | — |
| GPT-6 Astra (referência) | US$ 10 | US$ 50 | US$ 0.50 | — | — | — |
| GPT-6 Luna (referência) | US$ 0.10 | US$ 0.50 | US$ 0.01 | — | — | — |
Per-token, o Sonnet 5.5 mantém o preço do Sonnet 5, mas usa até 30% menos tokens por tarefa. É esse delta, mais o cache read igual ao Opus (10% do preço do input), que derruba o custo real.
Onde o Sonnet 5.5 brilha (e onde o Opus ainda manda)
A própria Anthropic, no [blog oficial do Addy Osmani](https://claude.dev/blog/building-with-claude-sonnet-5-5/), montou a tabela de “use Sonnet 5.5 quando… use Opus 5.5 quando…”. Aqui está a versão honesta:
| Tarefa | Modelo recomendado |
|---|---|
| Bug fix e iteração rápida em features | Sonnet 5.5 |
| Desenvolvimento de alto volume | Sonnet 5.5 |
| Documentos, slides, planilhas polidos (one-pagers, diagramas, edits) | Sonnet 5.5 |
| Tarefas agentivas bem-definidas e repetíveis (investigação, review, drafting) | Sonnet 5.5 |
| Coding agentivo de longo horizonte com julgamento crítico | Opus 5.5 |
| Problemas mais difíceis que exigem mais inteligência bruta | Opus 5.5 |
Em produção, isso se traduz em três casos de uso canônicos para o Sonnet 5.5:
- Agentes internos de ticket/CRM/Zendesk: a [Zendesk](https://claude.dev/blog/building-with-claude-sonnet-5-5/) mediu 20% mais rápido em tickets reais, com menos tokens.
- Code review automatizado em PRs: a [CodeRabbit](https://www.anthropic.com/claude-sonnet-5-5) está migrando o pipeline principal para Sonnet 5.5.
- Slides e one-pagers: o Sonnet 5.5 “tem olho para design” segundo a Anthropic. O tester interno citou um deck de earnings review que saiu “pronto para enviar” no primeiro draft.
A [Epic Games](https://www.anthropic.com/claude-sonnet-5-5) foi mais longe: o COO Daniel Vogel disse que o Sonnet 5.5 “segurou a barra de qualidade que você esperaria de uma tier mais alta” em auditoria de system design e review de data flow, gerenciando dezenas de milhares de linhas de código de arquitetura de gameplay, com respostas mais rápidas em tarefas de múltiplas horas.
Como acessar e o que muda na sua conta
O modelo já está no ar em todos os canais:
- Claude API:
claude-sonnet-5-5 - Amazon Bedrock:
anthropic.claude-sonnet-5-5 - Claude Platform on AWS:
claude-sonnet-5-5 - Google Cloud Vertex AI:
claude-sonnet-5-5 - Microsoft Foundry:
claude-sonnet-5-5(Global Standard only)
No Claude Code (versão 2.1.284+), o alias sonnet já resolve para o 5.5 na Claude API. Effort default é medium, contexto nativo de 1M tokens, output máximo de 128k (até 300k via Message Batches API com header beta output-300k-2026-03-24). Thinking vem ligado por padrão (adaptive thinking). Para desligar thinking upfront, use between_tools setting, o antigo thinking: {type: "disabled"} quebra.
Cutoff de conhecimento: junho de 2026. Tokenizer idêntico ao Sonnet 5, quem tem código que conta tokens via estimativa pode manter.
As 5 mudanças que vão te pegar desprevenido
- Cuidado com
content[0].text. Sonnet 5.5 pensa por padrão, então a primeira resposta começa com um blocothinking. Código que lêcontent[0].textquebra silenciosamente. Itera por tipo de bloco:for block in response.content: if block.type == "text": print(block.text) elif block.type == "thinking": # log separado se quiser auditar raciocínio pass between_toolssubstitui “no thinking”. A setting antigathinking: {type: "disabled"}está deprecada. Migre parabetween_toolsantes de subir.- Rate limits separados do Sonnet 5. Quem já tinha tier 4 no Sonnet 5 não ganha tier 4 no 5.5 automaticamente, provisione cedo, o tráfego de migração vai saturar.
- Cache mínimo mudou: agora exige 512 tokens cacheáveis (era 1024 no Sonnet 5). Isso é bom, prompts médios vão cachear mais vezes.
- Cyber safeguards ligados. É o primeiro Sonnet com cyber safeguards equivalentes ao Opus. Tarefas de pentest e exploit writing de risco alto caem para Sonnet 5 como fallback. Aplicações legítimas de segurança passam normal.
E o Haiku 5.5?
Nas próximas semanas. A Anthropic disse “coming weeks” no anúncio do Opus 5.5 em 22 de setembro e repetiu hoje. É o modelo de alta-volume e baixo custo, alvo é substituir a atual opção de preço baixo (GPT-6 Luna está em US$ 0.10/0.50 por milhão; Haiku 5.5 provavelmente entra nessa faixa ou ligeiramente acima). Esperado: latência < 1s no primeiro token, jan/2027 confirmado de release por pistas no CDN.
O que isso significa de verdade
- OpenAI perdeu a janela de narrativa. O GPT-6 Sol, que era o mid-tier mais falado do ano, ficou para trás em capability-per-dollar, 37.3% no Terminal-Bench 4.0 a US$ 7.89/tarefa vs 70.6% do Sonnet 5.5 a US$ 12.54. Em capability bruta por dólar (aproximação grosseira), o Sonnet 5.5 entrega 5x mais capability por dólar. A Anthropic virou o jogo do mid-tier em 6 dias.
- O “Opus tax” está sob ameaça. Antes do Sonnet 5.5, a justificativa para pagar US$ 4/20 do Opus era “é muito mais inteligente”. Agora o Sonnet 5.5 empata em GDPval-AA, vence em Terminal-Bench, perde só em FrontierCode Max e nos modos de pensamento profundo. Para 80% das aplicações que estão pagando Opus, Sonnet 5.5 é dinheiro queimado a menos. Recomendar Opus agora exige justificar onde o cuidado crítico do Opus faz diferença real.
- O “30% mais barato” é real, mas dependente do perfil de uso. Quem tem prompts longos com muita cache hit vai economizar menos que quem faz tarefas curtas em loop. Quem fazia Sonnet 5 a US$ 100/mês em batch vai fazer Sonnet 5.5 a ~US$ 70/mês na mesma workload. Quem fazia Opus a US$ 500/mês vai fazer Sonnet 5.5 a US$ 200-250 com capability equivalente, essa é a economia que vai aparecer no Q4 das empresas.
- Cursor, CodeRabbit, Zendesk e Epic não endorsam por caridade. As citações no release são de empresas que estão trocando produção de fato. Quando Epic diz que gerenciou “dezenas de milhares de linhas” com o Sonnet 5.5, está dizendo que o modelo aguenta codebase enterprise real. Isso é o endosso mais valioso que um lançamento pode ter.
- A corrida da Anthropic agora é dePricing, não deCapability. Opus 5.5 já era Fable-class. Sonnet 5.5 é Opus-class a metade do custo. A próxima jogada da Anthropic vai ser Haiku 5.5 (preço) e Mythos 5.1 (modelo de fronteira), não um Sonnet 6. A guerra de IA de late 2026 virou commoditização do mid-tier, e quem vai perder dinheiro é quem ainda paga Opus por tarefas que o Sonnet 5.5 resolve.
Veredito
É o melhor mid-tier de IA já lançado. Ponto. Em capability, custo e velocidade, não há nada no mercado que se compare na faixa de US$ 2/10 por milhão de tokens. Em coding agentivo, ele bate o modelo mais caro da própria casa. Em knowledge work, empata com o Opus 5.5 em GDPval-AA e perde por uma margem quase irrelevante.
Se você está usando Opus 5.5 para tarefas de coding agentivo, migre hoje para Sonnet 5.5 em Medium ou High effort, você economiza entre 35% e 75% por tarefa com perda desprezível de qualidade. Se está usando GPT-5.6 ou GPT-6 Sol, a troca é ainda mais óbvia: capability 2x a 2.5x mais alta no Terminal-Bench, preço idêntico, latência menor.
Se está usando Sonnet 5 e achando que 10.3% no Terminal-Bench era normal, você estava sendo roubado. Migre, mantenha o preço, ganhe 6.85x mais capability.
O único motivo real para continuar pagando Opus 5.5 agora é se você precisa de sustained judgment em problemas abertos de múltiplas horas, system design de altíssimo risco, auditoria de segurança adversarial, decisões arquiteturais onde uma alucinação custa caro. Para todo o resto, Sonnet 5.5 é a nova referência.
Links e referências
- [Introducing Claude Sonnet 5.5 (Anthropic, página oficial)](https://www.anthropic.com/claude-sonnet-5-5)
- [Building with Claude Sonnet 5.5 (Claude Developer Blog, Addy Osmani)](https://claude.dev/blog/building-with-claude-sonnet-5-5/)
- [Claude Sonnet 5.5 System Card (PDF)](https://www-cdn.anthropic.com/870c8f525702625d2c62fc6dd04c857e3250bec1/Claude%20Sonnet%205.5%20System%20Card.pdf)
- [Anthropic Sonnet 5.5 model documentation (Platform)](https://platform.claude.com/docs/en/models/sonnet-5-5/overview)
- [Artificial Analysis: Claude Sonnet 5.5 intelligence/performance data](https://artificialanalysis.ai/models/releases/claude-sonnet-5-5)
- [Handy AI: Model Drop, Claude Sonnet 5.5 (Substack)](https://handyai.substack.com/p/model-drop-claude-sonnet-55)
- [The Decoder: Sonnet 5.5 nearly matches Opus 5.5 on benchmarks](https://the-decoder.com/anthropics-claude-sonnet-5-5-nearly-matches-opus-5-5-on-benchmarks-while-costing-up-to-30-percent-less-per-task/)
- [TechCrunch: Anthropic releases Sonnet 5.5, “cheaper, faster work partner”](https://techcrunch.com/2026/09/28/anthropic-releases-sonnet-5-5-which-it-calls-a-significantly-cheaper-faster-work-partner/)
- [The Verge: Anthropic is launching Claude Sonnet 5.5](https://www.theverge.com/ai-artificial-intelligence/1001591/anthropic-is-launching-claude-sonnet-5-5)
- [SiliconANGLE: Anthropic debuts Claude Sonnet 5.5 running 30% faster](https://siliconangle.com/2026/09/28/anthropic-debuts-claude-sonnet-5-5-running-30-faster-than-the-previous-generation-ai-model/)
- [AWS Blog: Introducing Claude Sonnet 5.5 on AWS](https://aws.amazon.com/blogs/machine-learning/introducing-claude-sonnet-5-5-on-aws/)
Disclaimer: benchmarks acima são self-reported pela Anthropic no release oficial e no System Card, com confirmações pontuais do Artificial Analysis e do Handy AI Substack. Onde há divergência entre fontes, a tabela principal usa o número do release oficial e a observação é anotada. Benchmarks sintéticos não capturam todos os aspectos de um modelo em produção, o veredito final é seu.