
Ontem, 7 de outubro de 2026, a Anthropic lançou o Claude Haiku 5.5, o terceiro modelo da família 5.5 em pouco mais de duas semanas. O número que viralizou foi o preço: segundo a própria Anthropic, o novo Haiku custa cerca de 75% menos para rodar do que o Haiku 4.5. Mas, como analista, o que me interessa é a pergunta que vem depois. Se a IA fica mais barata a cada mês, por que tanta empresa continua sem enxergar retorno?
Venho acompanhando esse movimento aqui no blog. Nesta semana o Google cortou pela metade o preço da imagem no Nano Banana 2.1, e em agosto o Gemini 3.7 Flash chegou com preço introdutório 50% menor que o do antecessor. Agora é a vez da Anthropic baixar o preço dos seus modelos pequenos.
O Que Mudou no Haiku 5.5
O Haiku 5.5 cobra US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por milhão de saída para prompts de até 100 mil tokens. O Haiku 4.5 custava US$ 1 e US$ 5. Isso é 90% a menos no preço de lista para prompts curtos. Acima de 100 mil tokens a tabela sobe para US$ 0,50 e US$ 2,50, o que ainda é metade do preço anterior. A Anthropic informa que cerca de 90% das requisições ao Haiku 4.5 ficavam abaixo do limite de 100 mil tokens, e estima uma economia média de 75% depois de considerar o tamanho das requisições e as mudanças na contagem de tokens.
É o primeiro Haiku com controle de nível de esforço, com janela de contexto de 1 milhão de tokens e foco declarado em tarefas repetitivas de alto volume, como classificação, resumo, extração de informação e trabalho de subagente para modelos maiores. O modelo está disponível na API da Anthropic, no Amazon Bedrock, no Google Cloud e no Microsoft Foundry.
Os Números, Com a Ressalva de Sempre
No OSWorld 2.1, benchmark de uso de computador, o Haiku 5.5 marcou 72,4% no subconjunto offline, contra 15,7% do Haiku 4.5 e 48,9% do GPT-6 Luna, o modelo da OpenAI na mesma faixa de preço de lista para prompts curtos. No Terminal-Bench 4.0, foram 39,2% contra 16,4% do Luna. A Anthropic reporta que o Haiku 5.5 supera o Luna em todos os testes em que os dois aparecem na tabela dela. Para dar escala, o Sonnet 5.5 marca 83,9% nesse mesmo teste e, segundo a tabela divulgada no lançamento, custa US$ 2 na entrada, vinte vezes mais que o Haiku 5.5.
A ressalva é a de sempre: esses números vêm da tabela da própria Anthropic, e o teste do OSWorld usou um subconjunto de 82 tarefas offline. Até onde encontrei, ainda não há replicação independente. Vale tratar como uma promessa forte, não como fato consolidado.
A Outra Metade do Anúncio: Cache do Sonnet 5.5 Pela Metade
No mesmo dia, a Anthropic cortou pela metade o preço de leitura de cache do Sonnet 5.5, de US$ 0,20 para US$ 0,10 por milhão de tokens. O cache pesa muito no custo de agentes que reutilizam contexto, e a empresa estima uma economia de cerca de 20% em cargas típicas de agentes, variando conforme o quanto de contexto armazenado a aplicação reaproveita. Também anunciou créditos mensais de API para assinantes dos planos Team e Max.
O Preço Caiu. O Retorno Subiu? Depende de Quem Mede
Aqui está o ponto que quero deixar claro. Preço por token menor não é a mesma coisa que retorno maior. A queda de custo só vira ROI para quem sabe quanto gasta, em quê e com qual resultado. E é exatamente aí que a maioria das empresas brasileiras trava: a pesquisa da Zappts que analisei aqui mostrou que 55,1% das empresas não têm mapeamento estruturado de retorno sobre IA, e que só 13,8% escalaram agentes.
A matéria da CIO Magazine que comentei aqui mostrou que o período de carência dos conselhos para IA sem métrica acabou, e que o orçamento de IA sem resultado atrelado é o que está em risco. Com o Haiku 5.5, o argumento de que IA é cara demais para escalar perde força, e quem continua sem resultado vai ter que explicar o problema por outro caminho, que quase sempre passa por processo, dado ou governança.
Onde o Haiku 5.5 Faz Sentido na Prática
O princípio que defendi no texto sobre SLMs continua valendo: usar o modelo certo para cada tarefa. Uma arquitetura em camadas deixa um modelo pequeno e barato cuidando do volume rotineiro, como classificar tickets, extrair campos de documentos, resumir conversas e preparar o trabalho de agentes maiores, enquanto um modelo mais caro, como o Sonnet ou o Opus, fica reservado para o raciocínio difícil. O Jev, que analisei em setembro, segue a mesma lógica para decisões ainda mais simples, sem gerar texto.
Um exemplo hipotético, só para dimensionar: uma operação que processa 1 bilhão de tokens de entrada por mês em tarefas curtas pagaria cerca de US$ 1.000 com a tabela do Haiku 4.5 e cerca de US$ 100 com a do Haiku 5.5, antes do ajuste de tokenização que a própria Anthropic já embute na estimativa média de 75%. A diferença é real, mas só aparece no seu caixa se alguém acompanhar o gasto mês a mês.
O Que Eu Faria Nesta Semana
Primeiro, mapearia quais tarefas da sua operação são repetitivas, de alto volume e com resposta curta, porque são as candidatas naturais a um modelo pequeno. Segundo, testaria o Haiku 5.5 contra o modelo que você usa hoje com o seu próprio material, em vez de confiar na tabela do fornecedor, porque a tabela é do fornecedor. Terceiro, mediria antes e depois: custo por tarefa concluída, tempo e taxa de erro. Sem essa linha de base, a queda de preço vira apenas uma boa notícia que não aparece no resultado.
A pergunta que fica para qualquer liderança é direta: se a mesma tarefa de IA custa hoje, em média, um quarto do que custava no modelo anterior, a sua empresa já sabe quanto gasta com IA, em quais tarefas e com qual resultado, ou vai deixar a queda de preço passar sem que ela apareça no seu caixa?
Alexandre Guimarães
Especialista em Inteligência Artificial e Transformação Digital
Gostou do artigo?
Entre em contato para discutir como podemos ajudar sua empresa com Inteligência Artificial e Transformação Digital.