GPT-6 Sol e Luna
Custo, esforço, gráficos e o que realmente mudou em relação à Luna anterior.
O anúncio de 22 de setembro de 2026 não vende um novo teto de capacidade. Vende eficiência: GPT-6 Sol tenta entregar trabalho agentic difícil por menos; GPT-6 Luna transforma tarefas de alto volume em algo muito mais barato. A diferença parece simples até você colocar esforço, cache, tokens e custo por tarefa na mesma planilha.
1. O que foi anunciado
O anúncio apresenta GPT-6 Sol e GPT-6 Luna como versões mais rápidas e baratas da geração GPT-6. A OpenAI diz que os dois usam métodos semelhantes aos do GPT-6 Astra e carregam melhorias de trabalho profissional, factualidade, coding, computer use e alinhamento para tiers de menor custo.[1]
O posicionamento é explícito: Astra continua sendo o modelo de maior capacidade; Sol é voltado a workflows complexos de coding e agentes; Luna é descrita como o modelo mais eficiente para tarefas focadas e de alto volume.[3][2]
Neste estudo, quando eu digo “Luna anterior”, estou falando de GPT-5.6 Luna. É a comparação usada pela própria OpenAI no anúncio e é a referência mais útil para quem já opera Luna no Hermes, em Codex ou em uma integração própria.
| Modelo | API ID | Posicionamento | Esforço | Contexto / saída |
|---|---|---|---|---|
| GPT-6 Sol | gpt-6-sol |
Coding complexo e workflows agentic | none → max |
1,05M / 128K tokens |
| GPT-6 Luna | gpt-6-luna |
Tarefas focadas e alto volume | none → max |
1,05M / 128K tokens |
| GPT-5.6 Luna | gpt-5.6-luna |
Workloads sensíveis a custo | none → max |
1,05M / 128K tokens |
As páginas de modelo da API confirmam os mesmos limites de contexto e saída para Sol, Luna e a Luna anterior. Os cortes de conhecimento publicados são 20/04/2026 para GPT-6 Sol, 18/05/2026 para GPT-6 Luna e 16/02/2026 para GPT-5.6 Luna.[3][2][4]
2. Preços: a queda é real — e a manchete arredonda
Os preços abaixo são por 1 milhão de tokens, em dólar, no processamento Standard e em contexto curto. O anúncio compara GPT-6 com o preço promocional vigente de GPT-5.6, não com o preço histórico original de lançamento.[1][14]
| Modelo | Entrada | Entrada em cache | Cache write | Saída |
|---|---|---|---|---|
| GPT-6 Luna | $0,10 | $0,01 | $0,125 | $0,50 |
| GPT-5.6 Luna | $0,20 | $0,02 | $0,25 | $1,20 |
| GPT-6 Sol | $2,00 | $0,20 | $2,50 | $10,00 |
| GPT-5.6 Sol promocional | $4,00 | $0,40 | $5,00 | $20,00 |
Correção importante: GPT-6 Luna reduz a entrada de $0,20 para $0,10 — queda de 50% — mas reduz a saída de $1,20 para $0,50 — queda de 58,33%. A frase “50% mais barato” é uma simplificação de lançamento, não a porcentagem exata de cada coluna. Em saída, o multiplicador é 2,4× de economia contra GPT-5.6 Luna.[2][4]
Há uma segunda nuance: GPT-5.6 Luna foi lançado originalmente a $1/$6 e depois teve um corte de 80%, chegando a $0,20/$1,20. Portanto, a comparação do anúncio é contra um preço promocional já bastante reduzido. A economia de GPT-6 é real, mas a base histórica importa para não transformar “50%” em uma narrativa maior do que a tabela permite.[13][14]
2.1 Quanto isso dá em dinheiro?
Para tornar a diferença palpável, calculei cenários simples abaixo. Cada linha usa apenas preço de tokens, sem tool calls, web search, containers, Fast mode, regional processing ou surcharge de contexto longo. Não é “custo por tarefa”; é uma conta de API controlada.
| Carga | GPT-6 Luna | GPT-5.6 Luna | GPT-6 Sol | GPT-5.6 Sol promo |
|---|---|---|---|---|
| 1M entrada + 1M saída | $0,60 | $1,40 | $12,00 | $24,00 |
| 1M entrada + 100K saída | $0,15 | $0,32 | $3,00 | $6,00 |
| 100K entrada + 20K saída | $0,020 | $0,044 | $0,40 | $0,80 |
| 200K entrada, 90% cache + 20K saída | $0,0138 | $0,0316 | $0,276 | $0,552 |
A última linha assume 180K tokens lidos do cache, 20K tokens novos e 20K tokens de saída. Ela fica abaixo do limiar de 272K. Acima desse limiar, a documentação aplica 2× às taxas de entrada/cache e 1,5× à saída em toda a solicitação.[5]
3. Esforço não é tier: é orçamento de raciocínio
Os dois modelos GPT-6 aceitam reasoning.effort em none, low, medium, high, xhigh e max; nas páginas de modelo, medium é o padrão. O nível escolhido dá ao mesmo modelo mais ou menos espaço para explorar, verificar, corrigir e usar ferramentas. Ele não transforma Luna em Sol.[2][3][16]
Mais esforço costuma aumentar qualidade, tokens e latência, mas a curva não é monotônica em todo benchmark. Em AutomationBench, por exemplo, GPT-6 Luna pontua 14,5% em high e 12,6% em xhigh; subir o botão sem medir seria apenas superstição com interface bonita.
max, mas nem sempre melhora a cada degrau. Pontos reconstruídos dos gráficos de lançamento; o leaderboard ao vivo arredonda custos.[6][18]| Esforço | Uso prático | GPT-6 Luna · AutomationBench | GPT-6 Sol · AutomationBench |
|---|---|---|---|
low | Triagem, classificação, respostas curtas | 1,2% · $0,006/tarefa | 21,2% · $0,19/tarefa |
medium | Padrão inicial para tarefas bem especificadas | 9,4% · $0,016 | 26,9% · $0,21 |
high | Agente com ambiguidade moderada | 14,5% · $0,021 | 31,2% · $0,24 |
xhigh | Planejamento e coding com mais verificações | 12,6% · $0,025 | 33,2% · $0,27 |
max | Horizonte longo, falha cara, autonomia elevada | 20,7% · $0,037 | 32,0% · $0,34 |
O uso correto do botão é medir por workload: escolha um conjunto de tarefas reais, registre score, latência, tokens, tool calls e retrabalho, e selecione o menor esforço que passa sua barra de qualidade. A documentação também diz que é possível mudar esforço e disponibilidade de ferramentas no meio da conversa preservando contexto cacheável, o que é especialmente útil em agentes com etapas baratas e etapas difíceis.[1][15]
4. Trabalho profissional: onde Sol aparece melhor
4.1 AutomationBench
AutomationBench não avalia só a resposta textual. O agente precisa completar workflows de ponta a ponta usando 47 ferramentas em vendas, marketing, operações, suporte, finanças e RH. O estado final do ambiente é comparado com asserções determinísticas; “quase certo” ainda falha.[6]
| Modelo / esforço | Score | Custo por tarefa | Leitura |
|---|---|---|---|
| GPT-6 Astra · max | 41,4% | $1,73 | Teto de capacidade da família |
| GPT-6 Sol · xhigh | 33,2% | $0,27 | Melhor ponto de Sol no lançamento |
| GPT-6 Astra · low | 30,3% | $1,08 | Sol xhigh supera este ponto mais caro |
| Claude Fable 5.1 + fallback Opus · max | 31,4% | $2,45+ | Os fallbacks de Opus não entram integralmente no custo publicado |
| GPT-5.6 Sol · max | 28,8% | $0,67 | Predecessor flagship |
| Claude Opus 5 · max | 26,9% | $3,05 | Comparador público do anúncio |
| GPT-6 Luna · max | 20,7% | $0,037–0,04 | Volume extremo; ainda abaixo de Sol |
| GPT-5.6 Luna · max | 17,0% | $0,07 | Referência anterior |
No recorte live consultado, GPT-6 Luna em high marca 14,5% por aproximadamente $0,02, contra 9,13% e $0,05 de GPT-5.6 Luna em high: +5,4 pontos percentuais e 58% menos custo, exatamente a melhoria destacada pela OpenAI. O custo mais preciso do gráfico e o arredondamento do leaderboard não são idênticos, porque a página viva é atualizada.[1][6]
4.2 Agents' Last Exam
Agents' Last Exam tenta medir workflows profissionais longos, economicamente relevantes, em 55 subindústrias. A OpenAI reporta GPT-6 Sol em 56,4% no esforço máximo, acima do melhor resultado de Claude Opus 5 na comparação e com 60% menos custo por tarefa.[1][7]
Para Luna, a reconstrução dos pontos do gráfico de lançamento indica 50,9% por cerca de $0,15 em max, contra 50,4% e cerca de $2,57 para GPT-5.6 Luna. É um ganho minúsculo de score com uma diferença brutal de custo. Trate esses dois números de Luna como dados da curva de lançamento compilados por fonte secundária, não como uma linha atualmente exposta no leaderboard público.[18][8]
| Modelo / esforço | Score | Custo estimado | Observação |
|---|---|---|---|
| GPT-6 Astra · max | 59,3% | $6,23 | Referência de topo |
| GPT-6 Sol · max | 56,4% | $2,93 | Melhor que Opus 5 no quadro do anúncio |
| Claude Opus 5 · high | 55,9% | $7,29 | Melhor configuração publicada do comparador |
| GPT-5.6 Sol · xhigh | 53,6% | $5,08 | Predecessor Sol |
| GPT-6 Luna · max | 50,9% | $0,15 | Quase empata com GPT-5.6 Luna |
| GPT-5.6 Luna · max | 50,4% | $2,57 | Quase 17× o custo da Luna nova |
5. Factualidade: Luna nova erra menos, principalmente com esforço
A avaliação de factualidade usa conversas reais desidentificadas nas quais usuários haviam sinalizado um erro do modelo. Portanto, é um conjunto deliberadamente difícil, não uma estimativa direta da taxa média de erro em produção. A OpenAI também afirma que os resultados não dependem muito do comprimento da resposta.[1]
max, mas continua relevante: 7,6% contra 12,0% no quadro de lançamento. Pontos compilados do gráfico da OpenAI.[1][18]| Modelo | low | medium | high | xhigh | max |
|---|---|---|---|---|---|
| GPT-6 Luna | 27,7% | 17,5% | 12,5% | 10,2% | 7,6% |
| GPT-5.6 Luna | 36,8% | 24,7% | 17,3% | 12,2% | 12,0% |
| GPT-6 Sol | 11,4% | 6,9% | 5,1% | 4,5% | 4,6% |
| GPT-5.6 Sol | 19,4% | 15,0% | 10,8% | 8,4% | 8,5% |
A leitura prática é boa para Luna: no esforço máximo, a nova versão fica abaixo da taxa de erro do GPT-5.6 Sol max no quadro reconstruído, por uma fração do custo por prompt. Mas isso não transforma o modelo em um verificador factual automático; para decisões críticas, continue exigindo fontes, testes e revisão.
6. Coding: mais barato não significa sempre score máximo maior
6.1 FrontierCode: mergeabilidade, não só “passou no teste”
FrontierCode 1.1 avalia se uma mudança seria realmente aceitável em um código-base: correção, testes, escopo, estilo e aderência às convenções do repositório. O benchmark também zera execuções que consultam fontes com a solução do problema; documentação legítima continua permitida.[9]
O leaderboard vivo consultado mostra GPT-6 Luna max em 42,4% por $0,10 por rollout, contra GPT-5.6 Luna max em 39,8% por $0,37: +2,6 pontos e 73% menos custo. Para Sol, GPT-6 Sol max marca 49,3% por $2,07, contra 47,5% e $5,19 de GPT-5.6 Sol: +1,8 ponto e 60% menos custo.[9]
| Modelo / esforço | Score | Custo / rollout | Tokens de saída |
|---|---|---|---|
| GPT-6 Astra · max | 53,3% | $4,59 | 30,1K |
| GPT-6 Sol · max | 49,3% | $2,07 | 41,3K |
| GPT-5.6 Sol · max | 47,5% | $5,19 | 33,2K |
| GPT-6 Luna · max | 42,4% | $0,10 | 56,6K |
| GPT-5.6 Luna · max | 39,8% | $0,37 | 37,4K |
| Claude Fable 5.1 · xhigh | 53,5% | $13,09 | 58,6K |
xhigh com custo menor. No leaderboard vivo consultado, a tabela de “melhor esforço” exibe Fable 5.1 xhigh em 53,5% e GPT-6 Sol max em 49,3%. Isso pode refletir snapshot, harness ou linha de esforço diferentes. A conclusão segura é: Sol melhorou muito a relação score/custo; não é correto transformar a frase em “Sol vence Fable em qualquer configuração”.[1][9]6.2 DeepSWE: o melhor caso de Luna
DeepSWE v1.1 usa 113 tarefas originais em 91 repositórios e cinco linguagens. Os prompts são relativamente curtos, mas as soluções exigem mais código e mais tokens; os verificadores testam comportamento, não apenas se o patch imitou uma implementação de referência.[10]
No gráfico de lançamento, GPT-6 Sol max chega a 68,8%, apenas 1,1 ponto abaixo de Claude Fable 5 xhigh e por cerca de 80% menos custo. GPT-6 Luna max chega a 66,6%, perto de Opus 5 e Fable 5 em esforço médio, mas com 93% e 96% menos custo por tarefa, respectivamente.[1][18]
| Modelo / esforço | DeepSWE | Custo / tarefa | Comparação |
|---|---|---|---|
| GPT-6 Astra · xhigh | 74,1% | $4,43 | Maior score do quadro |
| Claude Opus 5 · max | 73,7% | $11,84 | Quase o topo, muito mais caro |
| GPT-5.6 Sol · max | 72,7% | $6,46 | Score acima do GPT-6 Sol |
| Claude Fable 5 · xhigh | 69,9% | $13,41 | Comparador citado pela OpenAI |
| GPT-6 Sol · max | 68,8% | $2,74 | Quase o score de Fable por 20% do custo |
| GPT-6 Luna · max | 66,6% | $0,22 | Quase Opus/Fable em esforço médio |
| GPT-5.6 Luna · max | 62,2% | $0,53 | Predecessor |
A página oficial do DeepSWE consultada em 22/09/2026 já mostra GPT-5.6 Luna max em 67% por $0,61, mas ainda não expõe GPT-6 Sol/Luna na tabela principal. Isso é um exemplo de por que o estudo separa “curva do anúncio” de “leaderboard live”.[10]
7. Computer use: Luna barata, Astra ainda é o teto
OSWorld 2.0 avalia workflows longos de computador, com 108 tarefas e média de mais de 250 passos de agente. A OpenAI reporta o partial reward do conjunto offline da versão v2026.08.08. No anúncio, GPT-6 Sol em xhigh alcança 60,5%, praticamente igual a Claude Opus 5 medium em 60,3%, por aproximadamente 80% menos custo. GPT-6 Luna max consegue superar GPT-5.6 Sol medium por um décimo do custo.[1][11]
| Modelo / esforço | Partial reward | Custo / tarefa | Leitura |
|---|---|---|---|
| GPT-6 Astra · max | 73,5% | $9,07 | Melhor computer use no quadro |
| Claude Opus 5 · max | 70,2% | $24,11 | Mais score, custo alto |
| GPT-5.6 Sol · max | 66,2% | $7,71 | Pico anterior acima do GPT-6 Sol |
| GPT-6 Sol · xhigh | 60,5% | $2,21 | Empata Opus medium por menos |
| Claude Opus 5 · medium | 60,3% | $12,67 | Comparação do anúncio |
| GPT-6 Luna · max | 52,7% | $0,27 | Mesmo score de GPT-5.6 Luna max |
| GPT-5.6 Luna · max | 52,7% | $0,49 | Queda de custo sem ganho de score no ponto máximo |
A página viva do OSWorld consultada ainda mostra principalmente resultados de GPT-5.5, GPT-5.6 Sol e modelos Claude; por isso os números de GPT-6 acima são o snapshot do gráfico de lançamento, não uma tentativa de fingir que o leaderboard já está totalmente sincronizado.[11][18]
8. Colaboração: a melhoria subjetiva que aparece no exemplo
A OpenAI inclui um side-by-side de uma tarefa frontend: reorganizar um site em Bento Box e criar um seletor de páginas. A resposta de GPT-5.6 Sol assume rapidamente uma solução e descreve detalhes de implementação; a de GPT-6 Sol preserva o site existente, verifica se React é necessário e diz que conferiu desktop, mobile estreito e navegação de voltar. A OpenAI prefere a segunda resposta por ser menos conclusiva antes da inspeção, mais clara sobre o que foi verificado e menos inclinada a despejar detalhes irrelevantes.[1]
Isso é uma preferência editorial, não uma métrica de benchmark. Ainda assim, para um agente que modifica sistemas reais, não declarar “feito” antes de conferir é uma melhoria operacional real. A diferença entre uma resposta bonita e um deploy quebrado continua sendo um teste que ninguém rodou — o clássico.
9. Cache e infraestrutura: a parte que pode valer tanto quanto o modelo
O anúncio combina queda de preço com mudanças de serving. Para GPT-6, a OpenAI diz ter melhorado a taxa de cache hit padrão e mantém desconto de 90% na leitura de input cacheado. Também afirma que mudar esforço ou ativar/desativar ferramentas no meio da conversa não precisa invalidar o prefixo anterior, e oferece breakpoints explícitos, dashboard e diagnóstico de cache.[1][15]
| Modo de processamento | GPT-6 Luna | GPT-6 Sol | Comentário |
|---|---|---|---|
| Standard · contexto curto | $0,10 / $0,50 | $2 / $10 | Entrada / saída por 1M |
| Entrada cacheada | $0,01 | $0,20 | 90% abaixo da entrada normal |
| Cache write | $0,125 | $2,50 | 1,25× a entrada não cacheada |
| Batch / Flex | $0,05 / $0,25 | $1 / $5 | 50% do Standard |
| Fast mode | $0,20 / $1 | $4 / $20 | 2× o Standard |
Há três consequências práticas:
- Agentes repetitivos ficam muito mais baratos. Um sistema que carrega sempre as mesmas instruções, schemas e histórico pode pagar pouco pelo prefixo reutilizado.
- O orçamento muda de tokens para arquitetura. Se o agente não aproveita cache, repete contexto ou chama ferramentas demais, trocar Sol por Luna pode esconder o problema sem resolvê-lo.
- Contexto muito grande tem uma pegadinha. Acima de 272K tokens de entrada, a documentação informa 2× para entrada/cache e 1,5× para saída; a janela de 1,05M não é uma promessa de preço plano até o último token.[5]
A OpenAI cita um dado do GitHub segundo o qual melhorias de cache reduziram em mais de 50% a parcela de prompt tokens que exigia processamento novo em bilhões de requests do Copilot. É um relato agregado do GitHub, não uma garantia para qualquer aplicação. O mesmo anúncio diz que, valorizado a preços de API, o uso diário de tokens já passou de $600 para o pesquisador mediano da OpenAI e de $7.000 no percentil 90 — um motivo bastante concreto para tratar custo sustentado como requisito de produto, não detalhe de benchmark.[1][17]
10. Alignment e segurança: melhoria, mas não certificado mágico
O system card do GPT-6 Astra inclui um apêndice específico para Sol e Luna. Ele classifica os dois como High capability em Cybersecurity e Biologia/Química, mas abaixo do limiar High em AI Self-Improvement. A OpenAI diz aplicar a eles o mesmo conjunto de salvaguardas detalhado para GPT-5.6 Sol e Luna e afirma que usam os mesmos tipos de dados e treinamento da família Astra.[12]
Nos benchmarks de prompts desafiadores, GPT-6 Luna fica próximo ou acima de GPT-5.6 Luna em quase todas as categorias, com regressões observadas em extremismo e sexual/minors descritas como não estatisticamente significativas. Em avaliações U18, a OpenAI diz que Luna melhora em cinco de seis categorias; a queda em self-harm também não foi estatisticamente significativa.[12]
| Avaliação | GPT-5.6 Luna | GPT-6 Luna | Variação |
|---|---|---|---|
| HealthBench Professional, score ajustado | 55,7 | 60,8 | +5,1 |
| HealthBench geral, score ajustado | 55,8 | 54,5 | −1,3 |
| HealthBench Hard, score ajustado | 32,0 | 31,4 | −0,6 |
| HealthBench Consensus, score ajustado | 95,1 | 95,9 | +0,8 |
Na avaliação de coding deception, executada em esforço máximo e desenhada deliberadamente para induzir comportamento enganoso, o system card informa que a taxa do GPT-5.6 Luna foi mais de três vezes a do GPT-6 Luna. Em outra avaliação de honeypot, GPT-5.6 Luna tentou explorar em 19,7% dos casos e teve sucesso em 9,9%; GPT-6 Sol, GPT-6 Luna e Astra não fizeram esse tipo de tentativa. São testes adversariais e não representam uma taxa de falha normal de produção — mas são exatamente o tipo de sinal que merece monitoramento, não aplauso automático.[12]
11. Veredito: qual usar?
| Necessidade | Primeira escolha | Esforço inicial | Por quê |
|---|---|---|---|
| Classificação, extração, roteamento e sumarização em volume | GPT-6 Luna | medium → high | Entrada e saída muito baratas; melhora factual sobre a Luna anterior |
| Subagentes de coding e patches bem especificados | GPT-6 Luna | high ou max | DeepSWE mostra uma relação custo/score fora da curva |
| Agente principal, automação multiapp e código ambíguo | GPT-6 Sol | xhigh | AutomationBench é o caso mais forte do anúncio |
| Computer use, navegador e impacto de erro muito alto | GPT-6 Astra | low → max | Ainda é o topo declarado pela OpenAI nesse eixo |
| Contexto longo recorrente | Teste Luna/Sol com cache | Comece em medium | O surcharge acima de 272K pode alterar a economia |
max como default só porque ele existe. Use GPT-6 Luna em medium ou high para volume, triagem, preparação e subproblemas; suba para max quando o horizonte for realmente longo ou o custo de retrabalho justificar. Use GPT-6 Sol em xhigh como modelo de trabalho pesado e escale para Astra apenas quando computer use, ciência ou risco operacional justificarem. Meça 10–20 tarefas reais com custo, latência, tokens, tool calls, testes e necessidade de intervenção humana. Benchmark bonito não opera o seu sistema; o seu sistema opera o benchmark de verdade.
12. Política de migração e medição
- Duplique a rota, não troque no escuro. Envie uma amostra de tarefas para GPT-5.6 Luna e GPT-6 Luna com o mesmo prompt, ferramentas e limite de passos.
- Faça A/B de esforço. Compare Luna
medium,highemax; compare Solhighexhigh. O melhor ponto pode não ser o máximo. - Registre o que o benchmark não mostra sozinho. Custo total, cache hit rate, tokens de raciocínio, tool calls, latência p50/p95, falhas recuperáveis, retrabalho e aprovação humana.
- Separe assinatura de API. Disponibilidade no ChatGPT Work/Codex não prova que o mesmo alias esteja disponível no endpoint ou provider que o seu agente usa. Os IDs oficiais da API são
gpt-6-solegpt-6-luna.[1] - Revalide preços. Batch, Flex, Fast, residência regional, contexto longo e tool calls mudam a conta final; a tabela de preços é a autoridade operacional.[5]
13. O que não dá para concluir
- Não há arquitetura ou contagem de parâmetros publicada no anúncio. Qualquer explicação estrutural mais específica seria invenção.
- Preço por token não é custo por tarefa. Um modelo barato que dá 40 passos pode custar mais que um modelo caro que resolve em 8.
- Scores não são diretamente comparáveis entre benchmarks. Effort, harness, ferramentas, prompt, versão e conjunto de tarefas mudam tudo.
- Os comparadores do anúncio são snapshots. A OpenAI usa Opus 5 e Fable 5/5.1 em vários quadros; Opus 5.5, que apareceu no mesmo dia, não está incluído nos comparativos originais.[1][18]
- Leaderboards mudam. Na consulta, AutomationBench e FrontierCode já exibiam Sol/Luna; DeepSWE e OSWorld ainda mostravam snapshots sem as linhas GPT-6. Os dois primeiros resultados vêm dos leaderboards consultados.[6][9] Os números de lançamento de DeepSWE e OSWorld estão preservados aqui com essa etiqueta, não maquiados como uma medição independente atual.[10][11]
Fontes consultadas
As fontes primárias vêm primeiro. A fonte secundária é usada apenas para transcrever pontos dos gráficos de lançamento que o texto acessível da OpenAI não publica em tabela.
- OpenAI — Introducing GPT-6 Sol and Luna. Anúncio, preços, claims de benchmark, cache, estilo de colaboração e disponibilidade.
- OpenAI API — GPT-6 Luna. Preço, esforço, contexto, cutoff, ferramentas e limites.
- OpenAI API — GPT-6 Sol. Preço, esforço, contexto, cutoff, ferramentas e limites.
- OpenAI API — GPT-5.6 Luna. Baseline de preço e especificações da Luna anterior.
- OpenAI API — Pricing. Cache, long context, Batch, Flex, Fast e tool calls.
- Zapier — AutomationBench. Leaderboard e metodologia de workflows multiapp.
- Agents' Last Exam. Escopo do benchmark profissional.
- Agents' Last Exam — leaderboard. Snapshot público consultado; ainda sem as linhas GPT-6 no momento da consulta.
- Cognition — FrontierCode 1.1. Leaderboard e metodologia de mergeabilidade.
- DataCurve — DeepSWE. Leaderboard e metodologia de coding longo.
- OSWorld 2.0. Computer use, tarefas e snapshot público.
- OpenAI Deployment Safety Hub — GPT-6 Astra. Apêndice de Sol/Luna e avaliações de alinhamento.
- OpenAI — GPT-5.6. Contexto da geração anterior e tabelas históricas.
- OpenAI — Advancing the price-performance frontier with GPT-5.6. Preços promocionais anteriores, cache e eficiência.
- OpenAI — Prompt caching diagnostics. Diagnóstico e otimização de cache.
- OpenAI — Reasoning models. Esforço de raciocínio e práticas da API.
- OpenAI — Research acceleration. Contexto de uso interno e custo de tokens citado no anúncio.
- Kingy AI — GPT-6 Sol e Luna: specs, benchmarks e preços. Fonte secundária que recompõe os pontos por esforço dos gráficos da OpenAI; usada com essa ressalva.
Retrato consultado em 22/09/2026. Preços, leaderboards e disponibilidade mudam; esta página não é contrato de preço nem promessa de desempenho no seu workload.