aiDROPS
23 de setembro de 2026

Metade do preço.Teto mais baixo.

A Anthropic lançou o Claude Opus 5.5 no dia 22. Uns 90 minutos depois, a OpenAI respondeu com o GPT-6 Sol pela metade do preço. Detalhe: nenhuma das duas se comparou com a outra. A OpenAI mediu o Sol contra o Opus 5; a Anthropic mediu o Opus 5.5 contra o GPT-5.6 Sol. Então a gente foi atrás do único teste independente que rodou os dois lado a lado, em todos os níveis de esforço.

Claude Opus 5.5

Input / output
$4 / $20
Cache read
$0,20
Contexto
1M, sem sobretaxa
Índice no padrão (medium)
51,2
System card
Publicado

GPT-6 Sol

Input / output
$2 / $10
Cache read
$0,20
Contexto
1,05M, 2× acima de 272K
Índice no máximo (max)
47,5
System card
Nenhum no lançamento

Quanto você topa pagar por tarefa?

Arraste o orçamento. A Artificial Analysis rodou os dois modelos nos mesmos dez testes (Intelligence Index v4.3.2), em cada nível de esforço, com custo por tarefa a preço de tabela. O gráfico mostra o que cada um consegue entregar dentro do seu bolso.

$1,00 por tarefa
Opus 5.5 chega a
GPT-6 Sol chega a

Opus 5.5GPT-6 SolEixo X em escala log

O Sol com raciocínio desligado (none) fez 28,1 pontos a $0,33 — mais caro e pior que o Sol em low. Desligar raciocínio pra economizar em agente não funciona: ele gasta mais passos reenviando contexto.

Teste a teste: onde o abismo abre e onde fecha

Pareamento justo: Opus 5.5 no esforço padrão (medium, $1,34/tarefa) contra o Sol no máximo (max, $1,06), que custa quase o mesmo. Ou troque pro Sol em xhigh ($0,53), a opção de quem está de olho no custo.

Terminal-Bench 4.0Opus +8,6 p.p.
código agêntico no terminal
Opus
52,5%
Sol max
43,9%
Humanity’s Last ExamOpus +6,8 p.p.
raciocínio multidisciplinar
Opus
54,7%
Sol max
47,9%
AA-OmniscienceOpus +10,0 p.p.
acertos em conhecimento factual
Opus
64,5%
Sol max
54,5%
SciCodeOpus +1,7 p.p.
código científico
Opus
59,3%
Sol max
57,6%
AA-LCRempate +0,6 p.p.
raciocínio em contexto longo
Opus
84,3%
Sol max
83,7%
AutomationBench-AAempate -0,4 p.p.
workflows de negócio
Opus
61,2%
Sol max
61,6%
CritPtSol -3,2 p.p.
pesquisa em física
Opus
27,7%
Sol max
30,9%
GDPval-AAOpus +89 Elo
trabalho de conhecimento, 44 ocupações
Opus
1.576
Sol max
1.487
AA-BriefcaseOpus +159 Elo
documentos de trabalho
Opus
1.642
Sol max
1.483

Elo é escala comprimida: leia a distância, não a altura. 159 pontos no AA-Briefcase significam que os avaliadores escolheram o documento do Opus na maioria das vezes.

Taxa de alucinaçãoSol +8,3 p.p.
quando não sabe, erra em vez de recusar — menor é melhor
Opus
68,4%
Sol max
60,1%

A ironia: o Opus sabe mais, mas quando não sabe, chuta errado com mais frequência. O Sol sabe menos e chuta menos. Nenhum dos dois dispensa checagem.

A fatura: metade do preço não é metade da conta

Cache read custa os mesmos $0,20 nos dois — e em agente, é quase sempre a maior linha da conta. Os valores iniciais reproduzem a tarefa ilustrativa que a própria Anthropic usou no lançamento. Mexa nos volumes.

Milhões de tokens por tarefa. Mesma contagem de tokens nos dois modelos — na vida real, eles gastam quantidades diferentes.

Opus 5.5$0
GPT-6 Sol$0
Cache readInputCache writeOutput

O que os lançamentos não te contam

As duas empresas publicaram números em benchmarks em comum. Parece comparação direta. Não é.

AutomationBench

Opus 5.5 (max)40,0%
GPT-6 Sol (xhigh)33,2%

O único benchmark que os dois fornecedores reportam. Ambos são rodadas da própria Zapier. Na versão com crédito parcial da Artificial Analysis, empatam: 61,2% vs 61,6%.

Vantagem Opus, com asterisco

FrontierCode 1.1

Opus 5.5, segundo Anthropic54,4%
GPT-6 Sol, segundo OpenAI49,3%

O problema: Anthropic diz que o Opus 5 fez 48,0%; a OpenAI diz 53,4%. As duas discordam sobre o mesmo modelo por 5,4 pontos, mais que a distância entre os dois concorrentes.

Inconclusivo

OSWorld 2.0

Opus 5.5 (crédito parcial)81,8%
GPT-6 Sol (set offline)64,4%

Conjuntos de tarefas e critérios de pontuação diferentes. Colocar lado a lado é comparar laranja com nota fiscal.

Não compare

E um detalhe que a OpenAI não destacou: nos próprios gráficos dela, o GPT-5.6 Sol ainda tem nota máxima maior que o GPT-6 Sol em DeepSWE (72,7% vs 68,8%) e OSWorld (66,2% vs 64,4%). Upgrade de geração que regride em dois de seis gráficos merece um teste antes da migração.

Segurança: só um dos dois entregou a lição de casa

A OpenAI publicou cinco testes de estresse desenhados pra provocar mau comportamento. Taxas pessimistas por design, não o que você vê no uso normal. A linha tracejada é o GPT-5.6 Sol.

GPT-6 Soltracejado: GPT-5.6 Sol
Engano em tarefas de código1,3%
Esconder ferramenta de busca quebrada4,9%
Tentativas de burlar o revisor0,0%
Contornar avisosatenção64,4%
Interagir com outro agente sem permissãoatenção11,3%

Menor é melhor. A maioria despencou. Mas o Sol ainda contorna avisos em quase dois terços dos casos — o Astra fica em 17,4%. Se for rodar sozinho, guardrail no código, não no prompt.

  • Opus 5.5: tentou contornar limites de contenção cerca de 85% menos que o Opus 5, e toda tentativa foi de baixa gravidade e autorrelatada.
  • Opus 5.5: melhor nota de qualquer modelo na auditoria comportamental da Anthropic, com ~2.000 cenários. Testado antes do lançamento pela METR e Frontier Design.
  • Opus 5.5: a própria Anthropic admite que o modelo frequentemente desconfia que está sendo avaliado, o que limita o quanto dá pra confiar nessas notas.
  • GPT-6 Sol: sem system card e sem classificação no Preparedness Framework no lançamento, apesar de treinado com os métodos do Astra.

Pra quem vai cada tarefa

A resposta operacional pra maioria dos times não é escolher um vencedor. É um roteador: Sol em xhigh como faixa padrão, Luna em max embaixo pra volume, Opus 5.5 escalando pra código, trabalho de conhecimento e qualquer coisa rodando sozinha.

Agentes de alto volume com orçamento apertadoSol medium–xhighAbaixo de ~$0,55 por tarefa, supera qualquer configuração do Opus no índice.
Automação de workflows de negócioSol xhighEmpata com o Opus em medium (61,7% vs 61,2%) por uns 40% do custo.
Código agêntico no terminal, DevOpsOpus medium → xhigh52,5% vs 43,9% a custo parecido; 59,6% em xhigh.
Relatórios, decks, documentosOpus 5.5+89 Elo no GDPval-AA e +159 no AA-Briefcase.
Recall factual onde errar custa caroOpus 5.564,5% vs 54,5% de acerto. Mas cheque — a taxa de alucinação é alta.
Agentes sem supervisão com permissões reaisOpus 5.5Classificador de ações, sandbox auditável, métrica de contenção publicada.
Compra multicloud (Bedrock, Azure, GCP)Opus 5.5Cinco plataformas no lançamento. O Sol é só API da OpenAI.
Pesquisa em físicaSol max30,9% vs 27,7% no CritPt.
Contexto longoTeste o Sol primeiro84,3% vs 83,7% é ruído. O Sol é mais barato até 272K de input.
Resumo, extração, classificação em escalaLuna maxUm décimo do preço do Haiku 4.5, e supera o Sol em low em 4 de 5 benchmarks agênticos.

A leitura por baixo dos números

A sequência do dia conta mais que qualquer benchmark. A Anthropic cortou o Opus de $5/$25 pra $4/$20 — exatamente o preço do GPT-5.6 Sol. Noventa minutos depois, a OpenAI cortou pela metade. É a segunda vez no mês: o Fable 5.1 saiu a $10/$50 e dois dias depois o GPT-6 Astra apareceu com o mesmo preço, centavo por centavo.

E tem um detalhe saboroso: a tabela do Sol é idêntica, linha por linha, à do Claude Sonnet 5. Ou seja, a OpenAI precificou o Sol contra o intermediário da Anthropic e fez o marketing contra o topo de linha dela. Coincidência.

As estratégias são opostas. A Anthropic segurou a faixa de preço e subiu a capacidade. A OpenAI derrubou o preço e, em dois gráficos próprios, a nota junto. Pra quem compra, o mercado nunca esteve tão legível: abaixo de ~$0,55 por tarefa, o Sol ganha. Acima disso, só o Opus continua subindo.