OpenAI e Anthropic: qual modelo compra mais inteligência?
GPT-5.6 e Claude em setembro de 2026 — preço, esforço, benchmarks e o que realmente vale a pena.
A comparação mais útil não é “qual empresa venceu?”. É: qual modelo entrega o resultado necessário com menos tokens, tempo, falhas e dinheiro? A resposta muda conforme o trabalho.
O que foi comparado
Usei as linhas públicas atuais das duas empresas, separando assinatura de chat de API. Os preços abaixo são API, em USD por milhão de tokens (MTok), e não representam o valor fixo de ChatGPT Plus, Claude Pro ou Claude Max.
A família OpenAI analisada é GPT-5.6 Sol, Terra e Luna. A família Anthropic inclui Claude Fable 5.1 e Fable 5 para a faixa mais capaz, Claude Opus 5, Sonnet 5 e Haiku 4.5. Fable/Mythos são variantes voltadas a trabalhos de raciocínio e segurança mais exigentes; Mythos tem disponibilidade limitada e não é uma opção geral de assinatura.
As linhas, de cima para baixo
| Faixa | OpenAI | Anthropic | Uso típico |
|---|---|---|---|
| Nova fronteira | GPT-6 Astra | Claude Fable 5.1 / Fable 5 | Trabalho end-to-end, computador, ciência |
| Máxima capacidade anterior | GPT-5.6 Sol | Claude Fable 5.1 / Fable 5 | Pesquisa difícil, decisões, agentes longos |
| Frontier utilizável no dia a dia | GPT-5.6 Sol com esforço menor | Claude Opus 5 | Código complexo, análise, documentos |
| Equilíbrio | GPT-5.6 Terra | Claude Sonnet 5 | Modelo padrão, coding e automação |
| Volume e velocidade | GPT-5.6 Luna | Claude Haiku 4.5 | Classificação, subagentes, tarefas rotineiras |
A nomenclatura não é perfeitamente simétrica: Sol/Terra/Luna são tiers explícitos da OpenAI; Opus/Sonnet/Haiku são famílias da Anthropic, enquanto Fable e Mythos ocupam faixas especiais de capacidade e acesso.
Preços atuais da API
| Modelo | Entrada | Saída | Contexto | Posição prática |
|---|---|---|---|---|
| GPT-6 Astra | $10 | $50 | 1,05M | Nova fronteira; esforço low → max |
| GPT-5.6 Sol | $4 | $20 | 1,05M | Flagship OpenAI; esforço none → max |
| GPT-5.6 Terra | $2 | $12 | 1,05M | Equilíbrio; equivalente ao tier mini anterior |
| GPT-5.6 Luna | $0,20 | $1,20 | 1,05M | Alto volume e custo mínimo |
| Claude Fable 5.1 | $10 | $50 | 1M | Raciocínio e agentes de horizonte longo |
| Claude Opus 5 | $5 | $25 | 1M | Agentes complexos e trabalho empresarial |
| Claude Sonnet 5 | $2 | $10 | 1M | Melhor equilíbrio Anthropic |
| Claude Haiku 4.5 | $1 | $5 | 200K | Rápido, barato e ainda bastante capaz |
Os preços não contam a história inteira. Ambas oferecem cache de prompt; a OpenAI cobra cache write a 1,25× a entrada e dá desconto forte para cache hit, enquanto a Anthropic expõe cache de 5 minutos, 1 hora e hits. Batch reduz custo para processamento assíncrono. Fast mode aumenta a conta para reduzir latência. O modo de processamento pode importar mais que trocar de modelo.
Benchmarks que ajudam — e os que enganam
Benchmarks são evidência, não oráculo. Resultados mudam com prompt, harness, número de tentativas, orçamento de raciocínio, ferramentas e data. O estudo da Artificial Analysis é particularmente útil porque publica custo por tarefa e compara as APIs; ainda assim, usa avaliações próprias e não substitui teste no seu workload.
Comparação independente: Opus 5 max vs Sol max
| Avaliação | Claude Opus 5 | GPT-5.6 Sol | Leitura |
|---|---|---|---|
| Artificial Analysis Intelligence Index | 51 | 47 | Opus lidera no agregado |
| AA-Briefcase v1.1 | 1673 | 1487 | Opus melhor em trabalho analítico completo |
| GDPval-AA v2.1 | 1708 | 1588 | Opus melhor em trabalho profissional |
| AutomationBench-AA | 57% | 60% | Sol ligeiramente à frente |
| Terminal-Bench 4.0 | 49% | 40% | Opus melhor em terminal |
| SciCode | 56% | 57% | Empate prático |
| AA-LCR v1.1 | 79% | 84% | Sol melhor neste teste de contexto longo |
| Custo por tarefa | $5,86 | $1,99 | Sol custa cerca de um terço |
| Velocidade de saída | 60,7 tok/s | 69,5 tok/s | Sol gera mais rápido |
Conclusão do quadro: Opus 5 compra mais qualidade média em tarefas agentic longas; Sol compra uma qualidade próxima com custo por tarefa muito menor e maior velocidade de saída. “Melhor” depende de o erro custar mais do que a diferença de preço.
O que a OpenAI reporta
A OpenAI posiciona Sol como flagship e afirma liderança em coding-agent, BrowseComp e OSWorld 2.0. Na sua tabela, Sol marca 62,6% em OSWorld 2.0 e 90,4% em BrowseComp; Terra marca 50,2% e 87,5%; Luna, 45,6% e 83,3%. Em GPQA Diamond, os números publicados são 94,6%, 92,9% e 92,3%, respectivamente.
Esses resultados mostram algo importante: Luna não é simplesmente “Sol barato”. Ela mantém muita capacidade, mas perde bastante em tarefas que exigem contexto longo, autonomia e raciocínio de fronteira. Em compensação, seu preço é radicalmente menor.
O que a Anthropic reporta
A Anthropic posiciona Opus 5 como seu modelo mais forte de uso geral, Sonnet 5 como combinação de velocidade e inteligência, e Haiku 4.5 como pequeno e rápido. Sonnet 5 é descrito como próximo de Opus 4.8 em algumas tarefas com preço menor; Haiku 4.5 reporta 73,3% em SWE-bench Verified sob uma metodologia própria e afirma atingir 90% do desempenho de Sonnet 4.5 em uma avaliação de coding agent da Augment.
Opus 5 mantém o preço de Opus 4.8, mas a Anthropic afirma que melhora desempenho e eficiência. A Artificial Analysis encontrou Opus 5 no topo de AA-Briefcase: 1720 Elo em max, contra 1574 de Fable 5, com custo por tarefa 20% menor que Fable. É um resultado forte, mas continua sendo uma avaliação específica de trabalho agentic e conhecimento.
Esforço: o botão que muda a economia
Comparar apenas nomes é um erro. GPT-5.6 Sol aceita esforço de none, low, medium, high, xhigh e max. Claude usa esforço adaptativo em vários modelos. Mais esforço tende a elevar qualidade e consumo de tokens — não é uma propriedade metafísica do modelo, é compute cobrado na prática.
No ChatGPT, porém, a conta aparece como cota da assinatura, não como fatura por token. As mensagens de Sol consomem muito mais do orçamento que as de Luna. Por isso uma troca de modelo pode aumentar drasticamente a duração prática do plano sem mudar o preço mensal.
Luna max contra Sol low/medium: a hipótese que procede
Você viu a tese correta, mas ela precisa de números e de uma distinção importante: Sol low e Sol medium não são a mesma coisa. Na comparação da Artificial Analysis v4.3.2, Luna max marcou 37 no Intelligence Index; Sol low marcou 33 e Sol medium, 39.
| Comparação | Índice | Custo por tarefa | Tempo por tarefa | Leitura |
|---|---|---|---|---|
| Luna max | 37 | $0,18 | 240 s | Mais inteligência que Sol low |
| Sol low | 33 | $0,26 | 58 s | Mais rápido, mas pior no agregado |
| Sol medium | 39 | $0,50 | 122 s | Quase empatado com Luna, 2,8× mais caro |
Portanto, a afirmação “Luna max perde pouco para Sol no esforço mínimo” é forte quando o comparador é Sol medium: 37 contra 39, diferença de 2 pontos. Contra Sol low, Luna max não perde; ganha 4 pontos no índice. A troca vem com uma assimetria: Luna usa muito mais tokens de raciocínio e demora mais para começar, enquanto Sol low/medium responde muito mais cedo.
GPT-6 Astra: o novo topo da OpenAI
Astra não é apenas um Sol com mais esforço. É uma nova geração, com contexto de 1,05 milhão de tokens, saída máxima de 128 mil, janela de conhecimento de 30/04/2026 e esforço low, medium, high, xhigh e max. O preço padrão da API é $10 por MTok de entrada e $50 por MTok de saída; cache read custa $1 e cache write $12,50. Batch e Flex ficam em 50% do Standard; Fast mode, em 2×.
Na prática, Astra compra três coisas: melhor uso do computador e do navegador, maior eficiência de tokens e melhor persistência em tarefas longas. A OpenAI afirma que ele alcança 59,3% no Agents’ Last Exam, contra 55,5% do Opus 5 e 53,6% do Sol; no Terminal-Bench 4.0, reporta 57,9%, contra 37,3% do Sol e 55,8% do Fable 5.1.
| Modelo | AA Intelligence | Coding Agent | Custo por tarefa | Resumo |
|---|---|---|---|---|
| GPT-6 Astra max | 53 | 62 | $3,26 | Empata Fable 5.1; muito eficiente em tokens |
| GPT-5.6 Sol max | 47 | 55 | ≈ $1,99 | Mais barato e forte em apresentação |
| Claude Fable 5.1 max | 53 | 62 | $7,63 | Mesmo topo, cerca de 2,3× o custo de Astra |
| Claude Opus 5 max | 51 | 60 | ≈ $6 | Excelente agente, mais caro por tarefa |
A Artificial Analysis também encontrou queda forte de alucinação de Astra em relação a Sol no seu AA-Omniscience e cerca de 90 pontos de ganho no AA-Briefcase, mas observou queda em GDPval-AA. Isso importa: Astra parece melhor para tarefas longas, computador e engenharia; Sol ainda pode produzir apresentações mais atraentes. Nenhum gráfico autoriza declarar um vencedor universal.
Astra vale a diferença? Para código agentic, browser/computer use, ciência e tarefas que atravessam várias janelas de contexto, provavelmente sim. Para conversa comum, escrita, pequenos patches e automação em volume, não: Sol, Terra e Luna preservam muito mais orçamento.
ChatGPT Plus, Claude Pro e Claude Max
| Produto | O que importa | Não confundir com |
|---|---|---|
| ChatGPT Plus | Acesso a GPT-5.6, com cotas; Sol consome mais, Luna muito menos | API OpenAI, que é faturada separadamente |
| Claude Pro | Acesso ao Claude com limite por janela e por capacidade | Claude API, que tem cobrança própria |
| Claude Max 5× | $100/mês; cinco vezes a capacidade por sessão do Pro | Uso ilimitado; há limites de sessão e semanais |
| Claude Max 20× | $200/mês; vinte vezes a capacidade por sessão do Pro | API incluída; não está incluída |
A Anthropic informa que Max 5× e 20× têm limites por sessão que reiniciam a cada cinco horas e também limite semanal. A OpenAI publica faixas de uso para Sol, Terra e Luna no Codex/ChatGPT, mas a cota efetiva depende do produto, do tipo de tarefa e do momento. Portanto, “dura mais” é uma afirmação válida para Luna em igualdade de tarefa, mas não uma promessa de número fixo de mensagens.
Recomendação por tipo de trabalho
| Trabalho | Primeira escolha | Escalar quando |
|---|---|---|
| Conversas e tarefas gerais | GPT-5.6 Terra ou Claude Sonnet 5 | O problema exigir julgamento raro |
| Código bem especificado, testes e refactors rotineiros | GPT-5.6 Luna ou Claude Haiku 4.5 | O agente ficar preso ou errar integração |
| Codificação agentic longa | Claude Opus 5 ou GPT-5.6 Sol | Use benchmark local; harness pesa muito |
| Pesquisa, documentos, planilhas e apresentações | GPT-5.6 Sol / Claude Opus 5 | Escolha pelo formato e qualidade do artefato |
| Classificação, extração e subagentes | GPT-5.6 Luna / Claude Haiku 4.5 | Escalar só os casos ambíguos |
| Segurança e trabalho de alto risco | Sol ou Opus 5, com revisão humana | Nunca terceirizar decisão operacional crítica |
Veredito
Melhor custo-benefício geral: GPT-5.6 Terra e Claude Sonnet 5. Astra também entra na conversa em esforço baixo quando a tarefa precisa da arquitetura do modelo novo, não apenas de mais tokens.
Melhor valor na fronteira: GPT-6 Astra. Ele custa 2,5× o Sol por token, mas a Artificial Analysis mediu custo por tarefa apenas cerca de 15% maior no Coding Agent Index, com 7 pontos a mais; no Intelligence Index, empatou Fable 5.1 a cerca de 40% do custo. Sol continua sendo um excelente ponto intermediário e ainda é mais barato.
Melhor economia: GPT-5.6 Luna. Não é a melhor em tudo, mas a diferença de preço é tão grande que permite uma política sensata: Luna primeiro, Terra/Sonnet quando a tarefa tem ambiguidade, Sol/Astra/Opus apenas quando o impacto justifica.
Minha política recomendada para você: mantenha Astra para código agentic, browser, ciência e tarefas que exigem contexto persistente; Sol max para decisões difíceis e apresentações; teste Sol medium/high em tarefas normais; use Luna max para volume, preparação, busca estruturada, testes e subproblemas. No Claude, a política equivalente é Opus 5 para o núcleo difícil, Sonnet 5 como padrão e Haiku 4.5 como força de trabalho barata.
Limites e nível de confiança
- Confirmado: nomes, preços de API, contexto, modos de esforço e posicionamento nas páginas oficiais consultadas em 21/09/2026.
- Confirmado com ressalva: números da Artificial Analysis; são medições independentes, com metodologia própria e custo ponderado por tarefa.
- Provável, não garantido: a recomendação de qual modelo “parece melhor” para o seu trabalho. O seu prompt, ferramentas, cache e tolerância a erro podem inverter a ordem.
- Não comparável diretamente: cotas de ChatGPT Plus e Claude Max. São economias de produto, não preços de tokens.
Fontes consultadas
- OpenAI — GPT-5.6, lançamento e tabelas de avaliação.
- OpenAI — price-performance frontier, preços atuais de Terra e Luna e Fast mode.
- OpenAI — GPT-6 Astra, lançamento, benchmarks e disponibilidade.
- OpenAI — GPT-6 Astra API, especificações, esforço e preço.
- OpenAI — GPT-5.6 Sol, especificações, esforço e preço da API.
- OpenAI — GPT-5.6 Terra e GPT-5.6 Luna.
- Anthropic — Claude Opus 5, capacidade e eficiência.
- Anthropic — Claude Sonnet 5 e Claude Haiku 4.5.
- Anthropic — preços da API e Claude Max.
- Artificial Analysis — Opus 5 vs GPT-5.6 Sol, comparação independente.
- Artificial Analysis — Luna max vs Sol low e Luna max vs Sol medium, comparação de esforço e custo.
- Artificial Analysis — benchmarking GPT-6 Astra, índices de inteligência e coding agent.
Preços, cotas e benchmarks mudam. Esta página é um retrato datado da consulta, não um contrato com nenhum laboratório.