Sol, Terra e Luna no Hermes

Qualidade, esforço e custo: qual modelo merece a próxima tarefa?

Você está usando GPT-5.6 Luna em esforço max dentro do Hermes, com uma assinatura ChatGPT Plus de US$ 20/mês. A pergunta certa não é apenas “qual modelo é melhor?”. É: qual combinação entrega qualidade suficiente sem transformar cada tarefa em um incêndio de quota?

TL;DR Sim: Terra é um upgrade plausível sobre Luna. Para testar no Hermes, comece com gpt-5.6-terra em xhigh. Use Terra max para tarefas realmente difíceis, não como padrão para tudo. Mantenha Luna em esforço menor para tarefas rotineiras e auxiliares. Trocar Luna por Terra não deve fazer a quota durar mais: as estimativas oficiais do Codex dão mais mensagens para Luna, enquanto benchmarks independentes mostram que Terra compra qualidade adicional a um custo maior.

Veredito rápido

  • Melhor qualidade: Sol continua sendo a camada flagship; Terra fica no meio; Luna é a camada rápida e econômica. Essa é a própria definição de posicionamento da OpenAI, não um apelido inventado pelo Hermes.[3]
  • Melhor troca para você: Terra xhigh é o primeiro candidato a substituir Luna max em coding, debugging, arquitetura e pesquisa com ferramentas. A evidência é favorável, mas não universal: um benchmark pode preferir Luna em uma subcategoria.
  • Qualidade máxima sem sair do Plus: Terra max é a opção intermediária antes de Sol max. O preço é mais uso por tarefa, mais latência e provavelmente menos folga na quota.
  • Mais folga na assinatura: Luna em medium ou high, contexto curto e prompts bem especificados. max em todas as mensagens é luxo; luxo recorrente costuma aparecer na fatura de quota.
Minha recomendação para o seu Hermes. Não altere o default ainda. Faça um A/B de 10 a 12 tarefas reais com Luna max, Terra xhigh e, para as mais difíceis, Terra max. Se Terra xhigh reduzir retrabalho e manter os testes passando, ele vira o modelo de trabalho pesado; Luna fica com o volume; Sol fica reservado para falhas difíceis e decisões de alto impacto.

1. O que são Sol, Terra e Luna?

Os nomes oficiais são gpt-5.6-sol, gpt-5.6-terra e gpt-5.6-luna. O número representa a geração; os nomes representam tiers de capacidade duráveis. Sol é o flagship, Terra é o modelo de trabalho que equilibra inteligência e custo, e Luna é o modelo otimizado para workloads sensíveis a custo e alto volume.[24][25][26]

Tier Posicionamento oficial Onde faz sentido Risco operacional
Sol Flagship; raciocínio e coding mais exigentes Ambiguidade alta, arquitetura crítica, investigação difícil Consome mais quota, demora mais e é desperdício em tarefas triviais
Terra Workhorse de produção e julgamento sólido Coding diário, debugging, relatórios, análise e decisões técnicas Melhor qualidade, mas menor capacidade de volume que Luna
Luna Rápido, econômico e otimizado para alto volume Extração, classificação, automação, triagem e coding focado Pode perder profundidade em problemas longos ou ambíguos

A tabela é uma leitura operacional da posição de cada tier. “Melhor” depende do objetivo: qualidade por tarefa e volume disponível são objetivos diferentes.[3][6]

2. O que o ChatGPT Plus realmente cobre

O Plus custa US$ 20/mês e inclui Codex nos clientes web, CLI e extensão de IDE, além da família GPT-5.6 — Sol, Terra e Luna — no fluxo Codex.[6] A assinatura ChatGPT e a cobrança da API são camadas diferentes: a documentação do Plus diz explicitamente que uso da API é separado, e a página de billing confirma sistemas e históricos de cobrança independentes.[28][31]

Há uma distinção importante de superfície: no ChatGPT padrão, Terra e Luna não são selecionáveis; conforme o plano, eles ficam disponíveis em Work e Codex. No Codex, a tabela oficial lista Sol, Terra e Luna para Plus, Pro, Business e Enterprise.[29]

A página oficial do Codex publica faixas aproximadas de mensagens locais por janela de cinco horas para o Plus: Sol: 10–100, Terra: 25–200 e Luna: 250–2.000. São estimativas, não um contrato de throughput. Limites semanais adicionais podem existir.[6]

Depois do limite incluído, a OpenAI documenta créditos como adicional pay-as-you-go para recursos suportados, incluindo Codex no Plus/Pro. Isso estende o uso da assinatura, mas continua separado do saldo de API.[30]

Modelo Plus · mensagens locais / 5h Leitura prática
GPT-5.6 Sol 10–100 Qualidade premium; pouca folga para volume
GPT-5.6 Terra 25–200 Meio-termo de qualidade e capacidade
GPT-5.6 Luna 250–2.000 Alto volume; melhor candidato para auxiliares

A OpenAI também diz que Codex, ChatGPT Work, ChatGPT para Excel e Workspace Agents compartilham a mesma franquia quando aplicável; o consumo depende do modelo, local da tarefa, complexidade, contexto, raciocínio, velocidade e ferramentas.[5] Portanto, “uso só no Hermes” não significa automaticamente “um pedido simples por mensagem”. Contexto grande e tool use podem ser o elefante na sala, só que com logs.

3. Como isso aparece no Hermes

Esta instalação foi inspecionada em 24/08/2026. O estado real é:

model.default:          gpt-5.6-luna-900k
model.provider:         openai-codex
model.base_url:         https://chatgpt.com/backend-api/codex
agent.reasoning_effort: max
agent.reasoning_overrides: {}
config check:           OK

Na API, as três páginas oficiais listam uma janela de contexto de 1.050.000 tokens e máximo de 128.000 tokens de saída.[24][25][26] O cache de contexto do Hermes, porém, registra gpt-5.6-luna, gpt-5.6-terra e gpt-5.6-sol com 272.000 tokens e o alias gpt-5.6-luna-900k com 900.000 tokens. Isso é capacidade de runtime do harness, não prova de que a janela grande seja gratuita ou que o limite de cobrança da OpenAI tenha mudado. A página de preços separa explicitamente contexto curto e longo.[2]

Camada Valor confirmado O que não concluir
Modelo padrão gpt-5.6-luna-900k Que o alias é um tier oficial separado
Provider openai-codex via OAuth/backend Codex Que o uso é cobrado como API padrão
Esforço max Que Luna se transforma em Terra; esforço compra mais trabalho do mesmo modelo
API OpenAI 1,05M contexto · 128K saída máxima Que esse número seja automaticamente a janela do Hermes/ChatGPT
Delegação Modelo/provider/effort vazios; herança habilitada; até 10 filhos concorrentes Que três agentes Hermes são exatamente o ultra do Codex

No Hermes, o esforço é uma substituição por execução: --reasoning none|minimal|low|medium|high|xhigh|max|ultra. O próprio CLI instalado confirma que --model, --reasoning e --usage-file podem ser usados em uma execução única sem alterar o default persistente. O arquivo JSON registra custo estimado, tokens, modelo e chamadas de API — útil para A/B.

Na API, reasoning.effort é um controle independente de modo: níveis menores favorecem velocidade e menor uso de tokens; níveis maiores podem melhorar planejamento e qualidade, com mais latência e consumo. Os valores suportados são dependentes do modelo e não devem ser tratados como equivalentes entre API, Codex, ChatGPT e Hermes.[27]

No Codex oficial, max dá mais tempo que xhigh para explorar, checar e revisar; ultra coordena quatro agentes em paralelo por padrão. Já delegate_task é a camada de orquestração do Hermes: cada filho tem contexto e terminal isolados. Não são conceitos idênticos.[3][8][23]

O ponto que costuma drenar a quota. O default está em max, e vários auxiliares locais — visão, extração web, compressão, skills, aprovação, MCP, títulos, triagem, kanban, perfil, curator e monitor — também estão apontados para openai-codex com Luna. Isso é uma fotografia da configuração, não uma prova de como a OpenAI contabiliza cada chamada; mas mostra por que reduzir apenas o modelo principal pode não resolver tudo.

4. Performance: o que os benchmarks dizem

Não existe um ranking único de “inteligência”. Benchmarks medem tarefas diferentes, usam harnesses diferentes e podem fixar esforços diferentes. A leitura abaixo separa resultado publicado pela OpenAI de medição independente.

4.1 Tabela oficial da OpenAI

A tabela da OpenAI coloca Sol acima de Terra e Luna em várias avaliações profissionais e de coding. São resultados reportados pelo fornecedor; use-os como posicionamento e sinal de capacidade, não como garantia para o seu repositório ou para o seu prompt.[3]

Benchmark Sol Terra Luna O que mede
Agents' Last Exam 52,7% 50,4% 50,3% Conhecimento e raciocínio profissional
Artificial Analysis Intelligence Index v4.1 58,9 55,0 51,2 Índice composto
Coding Agent Index v1.1 80,0 77,4 74,6 Coding com agente
SWE-Bench Pro 64,6% 63,4% 62,7% Issues de software resolvidas
Terminal-Bench 2.1 88,8% 87,4% 84,7% Tarefas em terminal

4.2 LiveBench: comparação direta em esforço máximo

Na captura consultada em 24/08/2026, o LiveBench lista variantes Max Effort diretamente. O ranking geral foi Sol 81,0, Terra 77,9 e Luna 73,6. Terra ficou 4,3 pontos acima de Luna no total e 6,5 pontos acima em Agentic Coding; porém Luna marcou 82,9 em Coding contra 78,2 de Terra. Ou seja: Terra é melhor no conjunto dessa medição, não em todas as colunas.[17]

LiveBench · Max Effort Sol Terra Luna
Overall 81,0 77,9 73,6
Coding 83,9 78,2 82,9
Agentic Coding 56,2 54,9 48,4
Custo por tarefa bem-sucedida US$ 0,515 US$ 0,352 US$ 0,169

O custo do LiveBench é custo estimado por tarefa bem-sucedida em uma avaliação de API. Não é o saldo da sua assinatura Plus e não deve ser convertido diretamente em “mensagens restantes”.

4.3 Artificial Analysis: qualidade versus custo

O Artificial Analysis Intelligence Index v4.1 combina nove avaliações de matemática, ciência, coding, agentes e raciocínio. A metodologia é independente, mas predominantemente textual e em inglês; o site também estima custo por tarefa, velocidade e latência.[19][20]

Variante Index Custo por tarefa Leitura
Sol · max61US$ 0,96Qualidade máxima; caro
Terra · max57US$ 0,51Salto importante sobre Luna; ainda bem mais barato que Sol
Luna · max52US$ 0,05Excelente economia; não é o topo de qualidade
Sol · xhigh59US$ 0,64Quase o topo com menor custo que max
Terra · xhigh53US$ 0,31Candidato de equilíbrio
Luna · xhigh50US$ 0,03Volume com custo mínimo

Nesta fonte, Terra xhigh passa Luna max por pouco no índice — 53 contra 52 —, mas a estimativa de custo por tarefa é cerca de 6,2 vezes maior. Terra max sobe para 57, com custo aproximadamente 10,2 vezes maior que Luna max. Isso não é uma razão para nunca usar Terra; é uma razão para não usá-lo em tarefas que Luna já resolve bem.[18][19]

4.4 Arena: preferência humana e harness

O Arena é útil para perceber preferência humana em respostas e para observar o efeito do harness. Na fotografia de 21/08/2026, no Text Arena em xhigh, Sol ficou em 16º com 1482±5, Terra em 44º com 1465±5 e Luna em 63º com 1451±5. No Code Arena WebDev, Sol ficou em 7º com 1619±8, Terra em 27º com 1520±9 e Luna em 29º com 1518±9.[15][16]

O Arena mostra preferência agregada em tarefas abertas; não é uma taxa de testes passando em um repositório real. O WebDev inclui fluxos agentic e tool use, mas continua sendo um ambiente específico. Use-o para detectar tendência, não para substituir o seu A/B.[14]

4.5 Sites que vale acompanhar

  • LiveBench: tarefas objetivas, atualização periódica e categorias de raciocínio, coding e análise; bom para comparação direta por esforço.[17]
  • Artificial Analysis: índice composto, custo por tarefa, velocidade, latência e variantes de esforço; bom para enxergar o trade-off.[18][19][20]
  • Arena: votos de preferência em texto e coding; bom para qualidade percebida e efeito do harness.[14][15][16]
  • SWE-bench: issues de software resolvidas por agentes; exige atenção à variante, ao conjunto de tarefas e ao harness. A leaderboard não deve ser lida como nota universal do modelo.[11]
  • LiveCodeBench e Terminal-Bench: coding executável e tarefas de terminal; são mais próximos do trabalho do Hermes do que perguntas de múltipla escolha, mas ainda não reproduzem seu repositório, regras, MCPs e permissões.[21][3]

5. Custos: API, assinatura e a redução recente

A tabela oficial atual da API é por um milhão de tokens. Ela serve para comparar a economia relativa entre tiers; não é uma fatura do seu Plus.

Modelo Input curto Input em cache Output curto Input longo Output longo
gpt-5.6-solUS$ 4,00US$ 0,40US$ 20,00US$ 8,00US$ 30,00
gpt-5.6-terraUS$ 2,00US$ 0,20US$ 12,00US$ 4,00US$ 18,00
gpt-5.6-lunaUS$ 0,20US$ 0,02US$ 1,20US$ 0,40US$ 1,80

Batch e Flex aparecem na tabela oficial com aproximadamente metade do preço standard; modos rápidos têm preço próprio. Cache write custa mais que input comum e cache read recebe desconto grande. Confira a tabela antes de montar processamento offline: modo de execução pode importar mais que a troca de tier.[2]

As páginas oficiais dos modelos também fixam um limiar importante: prompts com mais de 272K tokens de entrada recebem multiplicador de 2× no input e 1,5× no output para a requisição inteira.[24][25][26]

Um exemplo calculado, apenas para dar escala: uma tarefa com 100 mil tokens de entrada e 20 mil tokens de saída, em contexto curto e sem cache, custaria aproximadamente US$ 0,80 em Sol, US$ 0,44 em Terra e US$ 0,044 em Luna na API standard. Para o mesmo volume, Terra é 50% do input de Sol e 60% do output; Luna é 5% do input e 6% do output.[2]

5.1 A redução recente, sem marketing nebuloso

Comparando a tabela de preços anunciada no lançamento com a tabela standard atual, a queda é verificável. Isso é uma comparação entre duas páginas oficiais; não é uma reconstrução de cada mudança intermediária.

Modelo Lançamento · input/output Atual · input/output Queda calculada
SolUS$ 5 / US$ 30US$ 4 / US$ 2020% input · 33,3% output
TerraUS$ 2,50 / US$ 15US$ 2 / US$ 1220% input · 20% output
LunaUS$ 1 / US$ 6US$ 0,20 / US$ 1,2080% input · 80% output

A tabela de lançamento e a tabela atual têm funções diferentes: a primeira prova o ponto de partida publicado; a segunda é a referência operacional para preços de API hoje. A página oficial de Sol informa que o preço promocional de US$ 4/20 está disponível pelo menos até 21/11/2026.[2][3][24]

6. Política de uso recomendada

Tipo de tarefa Modelo Esforço inicial Por quê
Extração, classificação, resumo curto, formatação Luna low–medium Volume e baixa latência
Coding normal, testes, debugging delimitado, pesquisa Terra high–xhigh Mais julgamento sem pagar Sol
Arquitetura difícil, investigação ambígua, falha cara Terra max Upgrade de qualidade dentro do Plus
Incidente crítico, segurança, decisão de alto impacto Sol xhigh–max Qualidade antes de quota
Compressão, visão, títulos, triagem e automação auxiliar Luna low–medium Não gastar Terra para trabalho de bastidor
A resposta direta à sua pergunta. Se você quer tentar um modelo “melhor” que Luna max, use Terra xhigh como candidato de equilíbrio e Terra max como upgrade de qualidade. Não recomendo Terra high como substituto universal: no Artificial Analysis, Terra high ficou abaixo de Luna max no índice daquela fotografia. Isso é exatamente por que esforço e tier precisam ser testados juntos, não tratados como uma escada simples.[18]

7. Como fazer um A/B sem gastar a assinatura à toa

  1. Separe 10–12 tarefas reais e recorrentes: bug com teste, refactor, investigação, deploy, documentação, arquitetura e uma tarefa de contexto longo.
  2. Congele o estado do repositório e use o mesmo prompt, mesmos arquivos, mesmas ferramentas e mesma janela de contexto. Para alterações, prefira worktrees separados.
  3. Rode cada tarefa em Luna max e Terra xhigh. Rode Terra max apenas nas tarefas difíceis ou nas quais os dois primeiros divergirem.
  4. Registre: passou nos testes, quantidade de retrabalho, completude, tool calls, latência, tokens e se precisou de nova tentativa.
  5. Escolha pelo custo total até chegar a uma solução aceitável, não pelo modelo que escreveu a resposta mais bonita. O modelo que exige três correções é só um estagiário caro com boa prosa.

A/B de uma tarefa sem alterar o default persistente

hermes -z "MESMA TAREFA" \
  -m gpt-5.6-luna \
  --reasoning max \
  --usage-file /tmp/luna-max.json

hermes -z "MESMA TAREFA" \
  -m gpt-5.6-terra \
  --reasoning xhigh \
  --usage-file /tmp/terra-xhigh.json

hermes -z "MESMA TAREFA DIFÍCIL" \
  -m gpt-5.6-terra \
  --reasoning max \
  --usage-file /tmp/terra-max.json

O --usage-file é o instrumento local para comparar as execuções. Para saber a quota remota de verdade, use o dashboard de uso do Codex ou /status em uma sessão Codex; o próprio Help Center recomenda essas telas quando o limite se aproxima.[5][9]

8. O que a telemetria local sugere

O Hermes registra uso local, mas isso não é uma fatura da OpenAI. Ainda assim, a fotografia de 18–24/08/2026 explica por que a sensação de quota apertada é plausível:

181 sessões · 3.823 mensagens · 2.313 tool calls
16.199.947 input tokens · 1.197.579 output tokens
164.405.142 total tokens reportados pelo Hermes

Modelos: 181 sessões em gpt-5.6-luna
Plataformas: desktop 31 sessões / 127.302.092 tokens
             cron    145 sessões /   5.507.383 tokens
             subagent  3 sessões /   4.182.725 tokens

Esforço persistente: max
Auxiliares: provider openai-codex com Luna em várias funções

O número importante não é “quantos prompts você enviou”. São sessões longas, contexto carregado, ferramentas, compressões e agentes auxiliares. Em uma assinatura, reduzir o esforço padrão e rotear tarefas simples para Luna tende a preservar mais capacidade do que trocar tudo para Terra max. Se a prioridade for qualidade, Terra xhigh é um experimento razoável; se a prioridade for durar mais, Luna precisa deixar de viver em max.

Conclusão

A melhor decisão para o seu perfil não é escolher um único campeão. É adotar uma política de roteamento:

  • Luna low/medium/high para volume, automações e tarefas já bem definidas;
  • Terra xhigh para o trabalho técnico principal, depois de um A/B honesto;
  • Terra max quando o problema merece tempo extra e Luna falha ou exige retrabalho;
  • Sol max para o pequeno conjunto de tarefas em que errar custa mais que a quota.

Portanto: sim, você provavelmente consegue resultados melhores com Terra em um esforço apropriado. O ponto de partida recomendado é Terra xhigh, não Terra max global. A assinatura Plus compra acesso às três camadas no Codex, mas não elimina limites; o melhor uso é reservar capacidade cara para onde ela produz diferença mensurável.[5][6]

Fontes e método

A pesquisa combinou documentação oficial da OpenAI, estado real desta instalação do Hermes e comparadores independentes. Números de benchmark foram mantidos com a variante de esforço e a data quando disponíveis. Preços de API são referência de custo relativo; não foram tratados como cobrança do Plus.

  1. Model guidance | OpenAI API [1]
  2. Pricing | OpenAI API [2]
  3. GPT-5.6: Frontier intelligence that scales with your ambition [3]
  4. GPT-5.6 Sol Model | OpenAI API [24]
  5. GPT-5.6 Terra Model | OpenAI API [25]
  6. GPT-5.6 Luna Model | OpenAI API [26]
  7. Reasoning models | OpenAI API [27]
  8. Using Codex with your ChatGPT plan [5]
  9. Pricing | ChatGPT Codex [6]
  10. What is ChatGPT Plus? | OpenAI Help Center [28]
  11. GPT-5.6 in ChatGPT | OpenAI Help Center [29]
  12. Using Credits for Flexible Usage in ChatGPT [30]
  13. Managing Billing Settings on ChatGPT Web and Platform [31]
  14. GPT-5.6 in ChatGPT [7]
  15. Models | ChatGPT Codex [8]
  16. Codex CLI [9]
  17. SWE-bench Leaderboards [11]
  18. Hermes Agent providers [12]
  19. Hermes Agent configuration [13]
  20. Hermes Agent documentation index [22]
  21. Hermes Agent delegation [23]
  22. How Arena Works [14]
  23. Arena Text Leaderboard [15]
  24. Arena Code WebDev Leaderboard [16]
  25. LiveBench [17]
  26. Artificial Analysis LLM Leaderboard [18]
  27. Artificial Analysis Intelligence Index [19]
  28. Artificial Analysis Intelligence Benchmarking Methodology [20]
  29. LiveCodeBench Benchmark Leaderboard [21]

Estado local verificado via hermes --help, hermes config get, hermes config check, hermes insights, ~/.hermes/config.yaml e ~/.hermes/context_length_cache.yaml em 24/08/2026. Nenhuma credencial foi incluída nesta página.