A Anthropic lançou o Claude Opus 5.5 no dia 22. Uns 90 minutos depois, a OpenAI respondeu com o GPT-6 Sol pela metade do preço. Detalhe: nenhuma das duas se comparou com a outra. A OpenAI mediu o Sol contra o Opus 5; a Anthropic mediu o Opus 5.5 contra o GPT-5.6 Sol. Então a gente foi atrás do único teste independente que rodou os dois lado a lado, em todos os níveis de esforço.
Arraste o orçamento. A Artificial Analysis rodou os dois modelos nos mesmos dez testes (Intelligence Index v4.3.2), em cada nível de esforço, com custo por tarefa a preço de tabela. O gráfico mostra o que cada um consegue entregar dentro do seu bolso.
O Sol com raciocínio desligado (none) fez 28,1 pontos a $0,33 — mais caro e pior que o Sol em low. Desligar raciocínio pra economizar em agente não funciona: ele gasta mais passos reenviando contexto.
Pareamento justo: Opus 5.5 no esforço padrão (medium, $1,34/tarefa) contra o Sol no máximo (max, $1,06), que custa quase o mesmo. Ou troque pro Sol em xhigh ($0,53), a opção de quem está de olho no custo.
Elo é escala comprimida: leia a distância, não a altura. 159 pontos no AA-Briefcase significam que os avaliadores escolheram o documento do Opus na maioria das vezes.
A ironia: o Opus sabe mais, mas quando não sabe, chuta errado com mais frequência. O Sol sabe menos e chuta menos. Nenhum dos dois dispensa checagem.
Cache read custa os mesmos $0,20 nos dois — e em agente, é quase sempre a maior linha da conta. Os valores iniciais reproduzem a tarefa ilustrativa que a própria Anthropic usou no lançamento. Mexa nos volumes.
Milhões de tokens por tarefa. Mesma contagem de tokens nos dois modelos — na vida real, eles gastam quantidades diferentes.
As duas empresas publicaram números em benchmarks em comum. Parece comparação direta. Não é.
O único benchmark que os dois fornecedores reportam. Ambos são rodadas da própria Zapier. Na versão com crédito parcial da Artificial Analysis, empatam: 61,2% vs 61,6%.
Vantagem Opus, com asteriscoO problema: Anthropic diz que o Opus 5 fez 48,0%; a OpenAI diz 53,4%. As duas discordam sobre o mesmo modelo por 5,4 pontos, mais que a distância entre os dois concorrentes.
InconclusivoConjuntos de tarefas e critérios de pontuação diferentes. Colocar lado a lado é comparar laranja com nota fiscal.
Não compareE um detalhe que a OpenAI não destacou: nos próprios gráficos dela, o GPT-5.6 Sol ainda tem nota máxima maior que o GPT-6 Sol em DeepSWE (72,7% vs 68,8%) e OSWorld (66,2% vs 64,4%). Upgrade de geração que regride em dois de seis gráficos merece um teste antes da migração.
A OpenAI publicou cinco testes de estresse desenhados pra provocar mau comportamento. Taxas pessimistas por design, não o que você vê no uso normal. A linha tracejada é o GPT-5.6 Sol.
Menor é melhor. A maioria despencou. Mas o Sol ainda contorna avisos em quase dois terços dos casos — o Astra fica em 17,4%. Se for rodar sozinho, guardrail no código, não no prompt.
A resposta operacional pra maioria dos times não é escolher um vencedor. É um roteador: Sol em xhigh como faixa padrão, Luna em max embaixo pra volume, Opus 5.5 escalando pra código, trabalho de conhecimento e qualquer coisa rodando sozinha.
A sequência do dia conta mais que qualquer benchmark. A Anthropic cortou o Opus de $5/$25 pra $4/$20 — exatamente o preço do GPT-5.6 Sol. Noventa minutos depois, a OpenAI cortou pela metade. É a segunda vez no mês: o Fable 5.1 saiu a $10/$50 e dois dias depois o GPT-6 Astra apareceu com o mesmo preço, centavo por centavo.
E tem um detalhe saboroso: a tabela do Sol é idêntica, linha por linha, à do Claude Sonnet 5. Ou seja, a OpenAI precificou o Sol contra o intermediário da Anthropic e fez o marketing contra o topo de linha dela. Coincidência.
As estratégias são opostas. A Anthropic segurou a faixa de preço e subiu a capacidade. A OpenAI derrubou o preço e, em dois gráficos próprios, a nota junto. Pra quem compra, o mercado nunca esteve tão legível: abaixo de ~$0,55 por tarefa, o Sol ganha. Acima disso, só o Opus continua subindo.