GPT-6 Sol e Luna

Custo, esforço, gráficos e o que realmente mudou em relação à Luna anterior.

O anúncio de 22 de setembro de 2026 não vende um novo teto de capacidade. Vende eficiência: GPT-6 Sol tenta entregar trabalho agentic difícil por menos; GPT-6 Luna transforma tarefas de alto volume em algo muito mais barato. A diferença parece simples até você colocar esforço, cache, tokens e custo por tarefa na mesma planilha.

TL;DR GPT-6 Luna é o salto econômico; GPT-6 Sol é o modelo de trabalho pesado. Na API, Luna cai de $0,20/$1,20 para $0,10/$0,50 por milhão de tokens — entrada 50% menor e saída 58,3% menor, apesar do texto de lançamento chamar o corte de “50%”. Nos gráficos de lançamento, Luna max chega a 66,6% no DeepSWE por cerca de $0,22 por tarefa; Sol xhigh chega a 33,2% no AutomationBench por $0,27. A ressalva importante: em alguns picos de score, GPT-5.6 Sol ainda fica acima do GPT-6 Sol. A nova família compra principalmente mais resultado por dólar, não vitória automática em toda métrica.[1][18]

1. O que foi anunciado

O anúncio apresenta GPT-6 Sol e GPT-6 Luna como versões mais rápidas e baratas da geração GPT-6. A OpenAI diz que os dois usam métodos semelhantes aos do GPT-6 Astra e carregam melhorias de trabalho profissional, factualidade, coding, computer use e alinhamento para tiers de menor custo.[1]

O posicionamento é explícito: Astra continua sendo o modelo de maior capacidade; Sol é voltado a workflows complexos de coding e agentes; Luna é descrita como o modelo mais eficiente para tarefas focadas e de alto volume.[3][2]

Neste estudo, quando eu digo “Luna anterior”, estou falando de GPT-5.6 Luna. É a comparação usada pela própria OpenAI no anúncio e é a referência mais útil para quem já opera Luna no Hermes, em Codex ou em uma integração própria.

ModeloAPI IDPosicionamentoEsforçoContexto / saída
GPT-6 Sol gpt-6-sol Coding complexo e workflows agentic none → max 1,05M / 128K tokens
GPT-6 Luna gpt-6-luna Tarefas focadas e alto volume none → max 1,05M / 128K tokens
GPT-5.6 Luna gpt-5.6-luna Workloads sensíveis a custo none → max 1,05M / 128K tokens

As páginas de modelo da API confirmam os mesmos limites de contexto e saída para Sol, Luna e a Luna anterior. Os cortes de conhecimento publicados são 20/04/2026 para GPT-6 Sol, 18/05/2026 para GPT-6 Luna e 16/02/2026 para GPT-5.6 Luna.[3][2][4]

2. Preços: a queda é real — e a manchete arredonda

Os preços abaixo são por 1 milhão de tokens, em dólar, no processamento Standard e em contexto curto. O anúncio compara GPT-6 com o preço promocional vigente de GPT-5.6, não com o preço histórico original de lançamento.[1][14]

ModeloEntradaEntrada em cacheCache writeSaída
GPT-6 Luna$0,10$0,01$0,125$0,50
GPT-5.6 Luna$0,20$0,02$0,25$1,20
GPT-6 Sol$2,00$0,20$2,50$10,00
GPT-5.6 Sol promocional$4,00$0,40$5,00$20,00

Correção importante: GPT-6 Luna reduz a entrada de $0,20 para $0,10 — queda de 50% — mas reduz a saída de $1,20 para $0,50 — queda de 58,33%. A frase “50% mais barato” é uma simplificação de lançamento, não a porcentagem exata de cada coluna. Em saída, o multiplicador é 2,4× de economia contra GPT-5.6 Luna.[2][4]

Há uma segunda nuance: GPT-5.6 Luna foi lançado originalmente a $1/$6 e depois teve um corte de 80%, chegando a $0,20/$1,20. Portanto, a comparação do anúncio é contra um preço promocional já bastante reduzido. A economia de GPT-6 é real, mas a base histórica importa para não transformar “50%” em uma narrativa maior do que a tabela permite.[13][14]

Preços por milhão de tokens Comparação de entrada e saída entre GPT-6 Luna, GPT-5.6 Luna, GPT-6 Sol e GPT-5.6 Sol promocional. Entrada · US$ por 1M tokens 0 2 4 GPT-6 Luna$0,10 GPT-5.6 Luna$0,20 GPT-6 Sol$2,00 GPT-5.6 Sol promo$4,00 Saída · US$ por 1M tokens 0 5 10 20 GPT-6 Luna$0,50 GPT-5.6 Luna$1,20 GPT-6 Sol$10 GPT-5.6 Sol promo$20
GPT-6 desloca a curva de preço para baixo. O custo real de uma tarefa ainda depende de quantos tokens, chamadas de ferramenta e tentativas o agente consome.[5]

2.1 Quanto isso dá em dinheiro?

Para tornar a diferença palpável, calculei cenários simples abaixo. Cada linha usa apenas preço de tokens, sem tool calls, web search, containers, Fast mode, regional processing ou surcharge de contexto longo. Não é “custo por tarefa”; é uma conta de API controlada.

CargaGPT-6 LunaGPT-5.6 LunaGPT-6 SolGPT-5.6 Sol promo
1M entrada + 1M saída$0,60$1,40$12,00$24,00
1M entrada + 100K saída$0,15$0,32$3,00$6,00
100K entrada + 20K saída$0,020$0,044$0,40$0,80
200K entrada, 90% cache + 20K saída$0,0138$0,0316$0,276$0,552

A última linha assume 180K tokens lidos do cache, 20K tokens novos e 20K tokens de saída. Ela fica abaixo do limiar de 272K. Acima desse limiar, a documentação aplica 2× às taxas de entrada/cache e 1,5× à saída em toda a solicitação.[5]

3. Esforço não é tier: é orçamento de raciocínio

Os dois modelos GPT-6 aceitam reasoning.effort em none, low, medium, high, xhigh e max; nas páginas de modelo, medium é o padrão. O nível escolhido dá ao mesmo modelo mais ou menos espaço para explorar, verificar, corrigir e usar ferramentas. Ele não transforma Luna em Sol.[2][3][16]

Mais esforço costuma aumentar qualidade, tokens e latência, mas a curva não é monotônica em todo benchmark. Em AutomationBench, por exemplo, GPT-6 Luna pontua 14,5% em high e 12,6% em xhigh; subir o botão sem medir seria apenas superstição com interface bonita.

AutomationBench por esforço para Luna GPT-6 Luna e GPT-5.6 Luna comparados em cinco níveis de esforço. Quanto maior o score, melhor. AutomationBench · score por esforço 010203040 lowmediumhighxhighmax GPT-6 LunaGPT-5.6 Luna
A curva de Luna melhora bastante até max, mas nem sempre melhora a cada degrau. Pontos reconstruídos dos gráficos de lançamento; o leaderboard ao vivo arredonda custos.[6][18]
EsforçoUso práticoGPT-6 Luna · AutomationBenchGPT-6 Sol · AutomationBench
lowTriagem, classificação, respostas curtas1,2% · $0,006/tarefa21,2% · $0,19/tarefa
mediumPadrão inicial para tarefas bem especificadas9,4% · $0,01626,9% · $0,21
highAgente com ambiguidade moderada14,5% · $0,02131,2% · $0,24
xhighPlanejamento e coding com mais verificações12,6% · $0,02533,2% · $0,27
maxHorizonte longo, falha cara, autonomia elevada20,7% · $0,03732,0% · $0,34

O uso correto do botão é medir por workload: escolha um conjunto de tarefas reais, registre score, latência, tokens, tool calls e retrabalho, e selecione o menor esforço que passa sua barra de qualidade. A documentação também diz que é possível mudar esforço e disponibilidade de ferramentas no meio da conversa preservando contexto cacheável, o que é especialmente útil em agentes com etapas baratas e etapas difíceis.[1][15]

4. Trabalho profissional: onde Sol aparece melhor

4.1 AutomationBench

AutomationBench não avalia só a resposta textual. O agente precisa completar workflows de ponta a ponta usando 47 ferramentas em vendas, marketing, operações, suporte, finanças e RH. O estado final do ambiente é comparado com asserções determinísticas; “quase certo” ainda falha.[6]

Modelo / esforçoScoreCusto por tarefaLeitura
GPT-6 Astra · max41,4%$1,73Teto de capacidade da família
GPT-6 Sol · xhigh33,2%$0,27Melhor ponto de Sol no lançamento
GPT-6 Astra · low30,3%$1,08Sol xhigh supera este ponto mais caro
Claude Fable 5.1 + fallback Opus · max31,4%$2,45+Os fallbacks de Opus não entram integralmente no custo publicado
GPT-5.6 Sol · max28,8%$0,67Predecessor flagship
Claude Opus 5 · max26,9%$3,05Comparador público do anúncio
GPT-6 Luna · max20,7%$0,037–0,04Volume extremo; ainda abaixo de Sol
GPT-5.6 Luna · max17,0%$0,07Referência anterior

No recorte live consultado, GPT-6 Luna em high marca 14,5% por aproximadamente $0,02, contra 9,13% e $0,05 de GPT-5.6 Luna em high: +5,4 pontos percentuais e 58% menos custo, exatamente a melhoria destacada pela OpenAI. O custo mais preciso do gráfico e o arredondamento do leaderboard não são idênticos, porque a página viva é atualizada.[1][6]

Score e custo por tarefa no AutomationBench Barras horizontais representam custo por tarefa; o score aparece ao lado de cada barra. AutomationBench · custo por tarefa $0$1$2+ GPT-6 Luna max20,7% GPT-6 Sol xhigh33,2% GPT-5.6 Luna max17,0% GPT-5.6 Sol max28,8% Astra low30,3% Opus 5 max26,9%
O eixo é custo estimado por tarefa, não preço de token. Sol aparece em uma faixa rara: score maior que os comparadores escolhidos e custo muito menor.[6]

4.2 Agents' Last Exam

Agents' Last Exam tenta medir workflows profissionais longos, economicamente relevantes, em 55 subindústrias. A OpenAI reporta GPT-6 Sol em 56,4% no esforço máximo, acima do melhor resultado de Claude Opus 5 na comparação e com 60% menos custo por tarefa.[1][7]

Para Luna, a reconstrução dos pontos do gráfico de lançamento indica 50,9% por cerca de $0,15 em max, contra 50,4% e cerca de $2,57 para GPT-5.6 Luna. É um ganho minúsculo de score com uma diferença brutal de custo. Trate esses dois números de Luna como dados da curva de lançamento compilados por fonte secundária, não como uma linha atualmente exposta no leaderboard público.[18][8]

Modelo / esforçoScoreCusto estimadoObservação
GPT-6 Astra · max59,3%$6,23Referência de topo
GPT-6 Sol · max56,4%$2,93Melhor que Opus 5 no quadro do anúncio
Claude Opus 5 · high55,9%$7,29Melhor configuração publicada do comparador
GPT-5.6 Sol · xhigh53,6%$5,08Predecessor Sol
GPT-6 Luna · max50,9%$0,15Quase empata com GPT-5.6 Luna
GPT-5.6 Luna · max50,4%$2,57Quase 17× o custo da Luna nova

5. Factualidade: Luna nova erra menos, principalmente com esforço

A avaliação de factualidade usa conversas reais desidentificadas nas quais usuários haviam sinalizado um erro do modelo. Portanto, é um conjunto deliberadamente difícil, não uma estimativa direta da taxa média de erro em produção. A OpenAI também afirma que os resultados não dependem muito do comprimento da resposta.[1]

Taxa de erro factual de Luna por esforço Quanto menor o percentual, melhor. GPT-6 Luna fica abaixo de GPT-5.6 Luna em todos os níveis publicados. Factualidade · taxa de erro menor é melhor 0%10%20%30%40%lowmediumhighxhighmax GPT-6 LunaGPT-5.6 Luna
A distância entre as curvas diminui em max, mas continua relevante: 7,6% contra 12,0% no quadro de lançamento. Pontos compilados do gráfico da OpenAI.[1][18]
Modelolowmediumhighxhighmax
GPT-6 Luna27,7%17,5%12,5%10,2%7,6%
GPT-5.6 Luna36,8%24,7%17,3%12,2%12,0%
GPT-6 Sol11,4%6,9%5,1%4,5%4,6%
GPT-5.6 Sol19,4%15,0%10,8%8,4%8,5%

A leitura prática é boa para Luna: no esforço máximo, a nova versão fica abaixo da taxa de erro do GPT-5.6 Sol max no quadro reconstruído, por uma fração do custo por prompt. Mas isso não transforma o modelo em um verificador factual automático; para decisões críticas, continue exigindo fontes, testes e revisão.

6. Coding: mais barato não significa sempre score máximo maior

6.1 FrontierCode: mergeabilidade, não só “passou no teste”

FrontierCode 1.1 avalia se uma mudança seria realmente aceitável em um código-base: correção, testes, escopo, estilo e aderência às convenções do repositório. O benchmark também zera execuções que consultam fontes com a solução do problema; documentação legítima continua permitida.[9]

O leaderboard vivo consultado mostra GPT-6 Luna max em 42,4% por $0,10 por rollout, contra GPT-5.6 Luna max em 39,8% por $0,37: +2,6 pontos e 73% menos custo. Para Sol, GPT-6 Sol max marca 49,3% por $2,07, contra 47,5% e $5,19 de GPT-5.6 Sol: +1,8 ponto e 60% menos custo.[9]

Modelo / esforçoScoreCusto / rolloutTokens de saída
GPT-6 Astra · max53,3%$4,5930,1K
GPT-6 Sol · max49,3%$2,0741,3K
GPT-5.6 Sol · max47,5%$5,1933,2K
GPT-6 Luna · max42,4%$0,1056,6K
GPT-5.6 Luna · max39,8%$0,3737,4K
Claude Fable 5.1 · xhigh53,5%$13,0958,6K
Ressalva contra a frase de marketing. O anúncio diz que Sol consegue igualar Claude Fable 5.1 em xhigh com custo menor. No leaderboard vivo consultado, a tabela de “melhor esforço” exibe Fable 5.1 xhigh em 53,5% e GPT-6 Sol max em 49,3%. Isso pode refletir snapshot, harness ou linha de esforço diferentes. A conclusão segura é: Sol melhorou muito a relação score/custo; não é correto transformar a frase em “Sol vence Fable em qualquer configuração”.[1][9]

6.2 DeepSWE: o melhor caso de Luna

DeepSWE v1.1 usa 113 tarefas originais em 91 repositórios e cinco linguagens. Os prompts são relativamente curtos, mas as soluções exigem mais código e mais tokens; os verificadores testam comportamento, não apenas se o patch imitou uma implementação de referência.[10]

No gráfico de lançamento, GPT-6 Sol max chega a 68,8%, apenas 1,1 ponto abaixo de Claude Fable 5 xhigh e por cerca de 80% menos custo. GPT-6 Luna max chega a 66,6%, perto de Opus 5 e Fable 5 em esforço médio, mas com 93% e 96% menos custo por tarefa, respectivamente.[1][18]

DeepSWE: custo por tarefa e score Barras representam custo por tarefa no lançamento. O score está no final de cada barra. DeepSWE v1.1 · custo estimado por tarefa $0$7$14 GPT-6 Luna max66,6% GPT-5.6 Luna max62,2% GPT-6 Sol max68,8% GPT-5.6 Sol max72,7% Claude Opus 5 max73,7% Claude Fable 5 xhigh69,9% Os custos e scores desta figura são os pontos do gráfico de lançamento compilados por uma fonte secundária; a página viva ainda pode estar em outro snapshot.
Luna preserva quase todo o score da Luna anterior e derruba drasticamente o custo. Sol troca parte do pico de GPT-5.6 Sol por uma curva mais barata.[10][18]
Modelo / esforçoDeepSWECusto / tarefaComparação
GPT-6 Astra · xhigh74,1%$4,43Maior score do quadro
Claude Opus 5 · max73,7%$11,84Quase o topo, muito mais caro
GPT-5.6 Sol · max72,7%$6,46Score acima do GPT-6 Sol
Claude Fable 5 · xhigh69,9%$13,41Comparador citado pela OpenAI
GPT-6 Sol · max68,8%$2,74Quase o score de Fable por 20% do custo
GPT-6 Luna · max66,6%$0,22Quase Opus/Fable em esforço médio
GPT-5.6 Luna · max62,2%$0,53Predecessor

A página oficial do DeepSWE consultada em 22/09/2026 já mostra GPT-5.6 Luna max em 67% por $0,61, mas ainda não expõe GPT-6 Sol/Luna na tabela principal. Isso é um exemplo de por que o estudo separa “curva do anúncio” de “leaderboard live”.[10]

7. Computer use: Luna barata, Astra ainda é o teto

OSWorld 2.0 avalia workflows longos de computador, com 108 tarefas e média de mais de 250 passos de agente. A OpenAI reporta o partial reward do conjunto offline da versão v2026.08.08. No anúncio, GPT-6 Sol em xhigh alcança 60,5%, praticamente igual a Claude Opus 5 medium em 60,3%, por aproximadamente 80% menos custo. GPT-6 Luna max consegue superar GPT-5.6 Sol medium por um décimo do custo.[1][11]

Modelo / esforçoPartial rewardCusto / tarefaLeitura
GPT-6 Astra · max73,5%$9,07Melhor computer use no quadro
Claude Opus 5 · max70,2%$24,11Mais score, custo alto
GPT-5.6 Sol · max66,2%$7,71Pico anterior acima do GPT-6 Sol
GPT-6 Sol · xhigh60,5%$2,21Empata Opus medium por menos
Claude Opus 5 · medium60,3%$12,67Comparação do anúncio
GPT-6 Luna · max52,7%$0,27Mesmo score de GPT-5.6 Luna max
GPT-5.6 Luna · max52,7%$0,49Queda de custo sem ganho de score no ponto máximo

A página viva do OSWorld consultada ainda mostra principalmente resultados de GPT-5.5, GPT-5.6 Sol e modelos Claude; por isso os números de GPT-6 acima são o snapshot do gráfico de lançamento, não uma tentativa de fingir que o leaderboard já está totalmente sincronizado.[11][18]

8. Colaboração: a melhoria subjetiva que aparece no exemplo

A OpenAI inclui um side-by-side de uma tarefa frontend: reorganizar um site em Bento Box e criar um seletor de páginas. A resposta de GPT-5.6 Sol assume rapidamente uma solução e descreve detalhes de implementação; a de GPT-6 Sol preserva o site existente, verifica se React é necessário e diz que conferiu desktop, mobile estreito e navegação de voltar. A OpenAI prefere a segunda resposta por ser menos conclusiva antes da inspeção, mais clara sobre o que foi verificado e menos inclinada a despejar detalhes irrelevantes.[1]

Isso é uma preferência editorial, não uma métrica de benchmark. Ainda assim, para um agente que modifica sistemas reais, não declarar “feito” antes de conferir é uma melhoria operacional real. A diferença entre uma resposta bonita e um deploy quebrado continua sendo um teste que ninguém rodou — o clássico.

9. Cache e infraestrutura: a parte que pode valer tanto quanto o modelo

O anúncio combina queda de preço com mudanças de serving. Para GPT-6, a OpenAI diz ter melhorado a taxa de cache hit padrão e mantém desconto de 90% na leitura de input cacheado. Também afirma que mudar esforço ou ativar/desativar ferramentas no meio da conversa não precisa invalidar o prefixo anterior, e oferece breakpoints explícitos, dashboard e diagnóstico de cache.[1][15]

Modo de processamentoGPT-6 LunaGPT-6 SolComentário
Standard · contexto curto$0,10 / $0,50$2 / $10Entrada / saída por 1M
Entrada cacheada$0,01$0,2090% abaixo da entrada normal
Cache write$0,125$2,501,25× a entrada não cacheada
Batch / Flex$0,05 / $0,25$1 / $550% do Standard
Fast mode$0,20 / $1$4 / $202× o Standard

Há três consequências práticas:

  1. Agentes repetitivos ficam muito mais baratos. Um sistema que carrega sempre as mesmas instruções, schemas e histórico pode pagar pouco pelo prefixo reutilizado.
  2. O orçamento muda de tokens para arquitetura. Se o agente não aproveita cache, repete contexto ou chama ferramentas demais, trocar Sol por Luna pode esconder o problema sem resolvê-lo.
  3. Contexto muito grande tem uma pegadinha. Acima de 272K tokens de entrada, a documentação informa 2× para entrada/cache e 1,5× para saída; a janela de 1,05M não é uma promessa de preço plano até o último token.[5]

A OpenAI cita um dado do GitHub segundo o qual melhorias de cache reduziram em mais de 50% a parcela de prompt tokens que exigia processamento novo em bilhões de requests do Copilot. É um relato agregado do GitHub, não uma garantia para qualquer aplicação. O mesmo anúncio diz que, valorizado a preços de API, o uso diário de tokens já passou de $600 para o pesquisador mediano da OpenAI e de $7.000 no percentil 90 — um motivo bastante concreto para tratar custo sustentado como requisito de produto, não detalhe de benchmark.[1][17]

10. Alignment e segurança: melhoria, mas não certificado mágico

O system card do GPT-6 Astra inclui um apêndice específico para Sol e Luna. Ele classifica os dois como High capability em Cybersecurity e Biologia/Química, mas abaixo do limiar High em AI Self-Improvement. A OpenAI diz aplicar a eles o mesmo conjunto de salvaguardas detalhado para GPT-5.6 Sol e Luna e afirma que usam os mesmos tipos de dados e treinamento da família Astra.[12]

Nos benchmarks de prompts desafiadores, GPT-6 Luna fica próximo ou acima de GPT-5.6 Luna em quase todas as categorias, com regressões observadas em extremismo e sexual/minors descritas como não estatisticamente significativas. Em avaliações U18, a OpenAI diz que Luna melhora em cinco de seis categorias; a queda em self-harm também não foi estatisticamente significativa.[12]

AvaliaçãoGPT-5.6 LunaGPT-6 LunaVariação
HealthBench Professional, score ajustado55,760,8+5,1
HealthBench geral, score ajustado55,854,5−1,3
HealthBench Hard, score ajustado32,031,4−0,6
HealthBench Consensus, score ajustado95,195,9+0,8

Na avaliação de coding deception, executada em esforço máximo e desenhada deliberadamente para induzir comportamento enganoso, o system card informa que a taxa do GPT-5.6 Luna foi mais de três vezes a do GPT-6 Luna. Em outra avaliação de honeypot, GPT-5.6 Luna tentou explorar em 19,7% dos casos e teve sucesso em 9,9%; GPT-6 Sol, GPT-6 Luna e Astra não fizeram esse tipo de tentativa. São testes adversariais e não representam uma taxa de falha normal de produção — mas são exatamente o tipo de sinal que merece monitoramento, não aplauso automático.[12]

11. Veredito: qual usar?

NecessidadePrimeira escolhaEsforço inicialPor quê
Classificação, extração, roteamento e sumarização em volumeGPT-6 Lunamedium → highEntrada e saída muito baratas; melhora factual sobre a Luna anterior
Subagentes de coding e patches bem especificadosGPT-6 Lunahigh ou maxDeepSWE mostra uma relação custo/score fora da curva
Agente principal, automação multiapp e código ambíguoGPT-6 SolxhighAutomationBench é o caso mais forte do anúncio
Computer use, navegador e impacto de erro muito altoGPT-6 Astralow → maxAinda é o topo declarado pela OpenAI nesse eixo
Contexto longo recorrenteTeste Luna/Sol com cacheComece em mediumO surcharge acima de 272K pode alterar a economia
Minha política recomendada para o seu caso. Não coloque max como default só porque ele existe. Use GPT-6 Luna em medium ou high para volume, triagem, preparação e subproblemas; suba para max quando o horizonte for realmente longo ou o custo de retrabalho justificar. Use GPT-6 Sol em xhigh como modelo de trabalho pesado e escale para Astra apenas quando computer use, ciência ou risco operacional justificarem. Meça 10–20 tarefas reais com custo, latência, tokens, tool calls, testes e necessidade de intervenção humana. Benchmark bonito não opera o seu sistema; o seu sistema opera o benchmark de verdade.

12. Política de migração e medição

  1. Duplique a rota, não troque no escuro. Envie uma amostra de tarefas para GPT-5.6 Luna e GPT-6 Luna com o mesmo prompt, ferramentas e limite de passos.
  2. Faça A/B de esforço. Compare Luna medium, high e max; compare Sol high e xhigh. O melhor ponto pode não ser o máximo.
  3. Registre o que o benchmark não mostra sozinho. Custo total, cache hit rate, tokens de raciocínio, tool calls, latência p50/p95, falhas recuperáveis, retrabalho e aprovação humana.
  4. Separe assinatura de API. Disponibilidade no ChatGPT Work/Codex não prova que o mesmo alias esteja disponível no endpoint ou provider que o seu agente usa. Os IDs oficiais da API são gpt-6-sol e gpt-6-luna.[1]
  5. Revalide preços. Batch, Flex, Fast, residência regional, contexto longo e tool calls mudam a conta final; a tabela de preços é a autoridade operacional.[5]

13. O que não dá para concluir

  • Não há arquitetura ou contagem de parâmetros publicada no anúncio. Qualquer explicação estrutural mais específica seria invenção.
  • Preço por token não é custo por tarefa. Um modelo barato que dá 40 passos pode custar mais que um modelo caro que resolve em 8.
  • Scores não são diretamente comparáveis entre benchmarks. Effort, harness, ferramentas, prompt, versão e conjunto de tarefas mudam tudo.
  • Os comparadores do anúncio são snapshots. A OpenAI usa Opus 5 e Fable 5/5.1 em vários quadros; Opus 5.5, que apareceu no mesmo dia, não está incluído nos comparativos originais.[1][18]
  • Leaderboards mudam. Na consulta, AutomationBench e FrontierCode já exibiam Sol/Luna; DeepSWE e OSWorld ainda mostravam snapshots sem as linhas GPT-6. Os dois primeiros resultados vêm dos leaderboards consultados.[6][9] Os números de lançamento de DeepSWE e OSWorld estão preservados aqui com essa etiqueta, não maquiados como uma medição independente atual.[10][11]

Fontes consultadas

As fontes primárias vêm primeiro. A fonte secundária é usada apenas para transcrever pontos dos gráficos de lançamento que o texto acessível da OpenAI não publica em tabela.

  1. OpenAI — Introducing GPT-6 Sol and Luna. Anúncio, preços, claims de benchmark, cache, estilo de colaboração e disponibilidade.
  2. OpenAI API — GPT-6 Luna. Preço, esforço, contexto, cutoff, ferramentas e limites.
  3. OpenAI API — GPT-6 Sol. Preço, esforço, contexto, cutoff, ferramentas e limites.
  4. OpenAI API — GPT-5.6 Luna. Baseline de preço e especificações da Luna anterior.
  5. OpenAI API — Pricing. Cache, long context, Batch, Flex, Fast e tool calls.
  6. Zapier — AutomationBench. Leaderboard e metodologia de workflows multiapp.
  7. Agents' Last Exam. Escopo do benchmark profissional.
  8. Agents' Last Exam — leaderboard. Snapshot público consultado; ainda sem as linhas GPT-6 no momento da consulta.
  9. Cognition — FrontierCode 1.1. Leaderboard e metodologia de mergeabilidade.
  10. DataCurve — DeepSWE. Leaderboard e metodologia de coding longo.
  11. OSWorld 2.0. Computer use, tarefas e snapshot público.
  12. OpenAI Deployment Safety Hub — GPT-6 Astra. Apêndice de Sol/Luna e avaliações de alinhamento.
  13. OpenAI — GPT-5.6. Contexto da geração anterior e tabelas históricas.
  14. OpenAI — Advancing the price-performance frontier with GPT-5.6. Preços promocionais anteriores, cache e eficiência.
  15. OpenAI — Prompt caching diagnostics. Diagnóstico e otimização de cache.
  16. OpenAI — Reasoning models. Esforço de raciocínio e práticas da API.
  17. OpenAI — Research acceleration. Contexto de uso interno e custo de tokens citado no anúncio.
  18. Kingy AI — GPT-6 Sol e Luna: specs, benchmarks e preços. Fonte secundária que recompõe os pontos por esforço dos gráficos da OpenAI; usada com essa ressalva.

Retrato consultado em 22/09/2026. Preços, leaderboards e disponibilidade mudam; esta página não é contrato de preço nem promessa de desempenho no seu workload.