Sol, Terra e Luna no Hermes
Qualidade, esforço e custo: qual modelo merece a próxima tarefa?
Você está usando GPT-5.6 Luna em esforço max dentro do Hermes, com uma assinatura ChatGPT Plus de US$ 20/mês. A pergunta certa não é apenas “qual modelo é melhor?”. É: qual combinação entrega qualidade suficiente sem transformar cada tarefa em um incêndio de quota?
gpt-5.6-terra em xhigh. Use Terra max para tarefas realmente difíceis, não como padrão para tudo. Mantenha Luna em esforço menor para tarefas rotineiras e auxiliares. Trocar Luna por Terra não deve fazer a quota durar mais: as estimativas oficiais do Codex dão mais mensagens para Luna, enquanto benchmarks independentes mostram que Terra compra qualidade adicional a um custo maior.
Veredito rápido
- Melhor qualidade: Sol continua sendo a camada flagship; Terra fica no meio; Luna é a camada rápida e econômica. Essa é a própria definição de posicionamento da OpenAI, não um apelido inventado pelo Hermes.[3]
- Melhor troca para você: Terra
xhighé o primeiro candidato a substituir Lunamaxem coding, debugging, arquitetura e pesquisa com ferramentas. A evidência é favorável, mas não universal: um benchmark pode preferir Luna em uma subcategoria. - Qualidade máxima sem sair do Plus: Terra
maxé a opção intermediária antes de Solmax. O preço é mais uso por tarefa, mais latência e provavelmente menos folga na quota. - Mais folga na assinatura: Luna em
mediumouhigh, contexto curto e prompts bem especificados.maxem todas as mensagens é luxo; luxo recorrente costuma aparecer na fatura de quota.
1. O que são Sol, Terra e Luna?
Os nomes oficiais são gpt-5.6-sol, gpt-5.6-terra e gpt-5.6-luna. O número representa a geração; os nomes representam tiers de capacidade duráveis. Sol é o flagship, Terra é o modelo de trabalho que equilibra inteligência e custo, e Luna é o modelo otimizado para workloads sensíveis a custo e alto volume.[24][25][26]
| Tier | Posicionamento oficial | Onde faz sentido | Risco operacional |
|---|---|---|---|
| Sol | Flagship; raciocínio e coding mais exigentes | Ambiguidade alta, arquitetura crítica, investigação difícil | Consome mais quota, demora mais e é desperdício em tarefas triviais |
| Terra | Workhorse de produção e julgamento sólido | Coding diário, debugging, relatórios, análise e decisões técnicas | Melhor qualidade, mas menor capacidade de volume que Luna |
| Luna | Rápido, econômico e otimizado para alto volume | Extração, classificação, automação, triagem e coding focado | Pode perder profundidade em problemas longos ou ambíguos |
A tabela é uma leitura operacional da posição de cada tier. “Melhor” depende do objetivo: qualidade por tarefa e volume disponível são objetivos diferentes.[3][6]
2. O que o ChatGPT Plus realmente cobre
O Plus custa US$ 20/mês e inclui Codex nos clientes web, CLI e extensão de IDE, além da família GPT-5.6 — Sol, Terra e Luna — no fluxo Codex.[6] A assinatura ChatGPT e a cobrança da API são camadas diferentes: a documentação do Plus diz explicitamente que uso da API é separado, e a página de billing confirma sistemas e históricos de cobrança independentes.[28][31]
Há uma distinção importante de superfície: no ChatGPT padrão, Terra e Luna não são selecionáveis; conforme o plano, eles ficam disponíveis em Work e Codex. No Codex, a tabela oficial lista Sol, Terra e Luna para Plus, Pro, Business e Enterprise.[29]
A página oficial do Codex publica faixas aproximadas de mensagens locais por janela de cinco horas para o Plus: Sol: 10–100, Terra: 25–200 e Luna: 250–2.000. São estimativas, não um contrato de throughput. Limites semanais adicionais podem existir.[6]
Depois do limite incluído, a OpenAI documenta créditos como adicional pay-as-you-go para recursos suportados, incluindo Codex no Plus/Pro. Isso estende o uso da assinatura, mas continua separado do saldo de API.[30]
| Modelo | Plus · mensagens locais / 5h | Leitura prática |
|---|---|---|
| GPT-5.6 Sol | 10–100 | Qualidade premium; pouca folga para volume |
| GPT-5.6 Terra | 25–200 | Meio-termo de qualidade e capacidade |
| GPT-5.6 Luna | 250–2.000 | Alto volume; melhor candidato para auxiliares |
A OpenAI também diz que Codex, ChatGPT Work, ChatGPT para Excel e Workspace Agents compartilham a mesma franquia quando aplicável; o consumo depende do modelo, local da tarefa, complexidade, contexto, raciocínio, velocidade e ferramentas.[5] Portanto, “uso só no Hermes” não significa automaticamente “um pedido simples por mensagem”. Contexto grande e tool use podem ser o elefante na sala, só que com logs.
3. Como isso aparece no Hermes
Esta instalação foi inspecionada em 24/08/2026. O estado real é:
model.default: gpt-5.6-luna-900k
model.provider: openai-codex
model.base_url: https://chatgpt.com/backend-api/codex
agent.reasoning_effort: max
agent.reasoning_overrides: {}
config check: OK
Na API, as três páginas oficiais listam uma janela de contexto de 1.050.000 tokens e máximo de 128.000 tokens de saída.[24][25][26] O cache de contexto do Hermes, porém, registra gpt-5.6-luna, gpt-5.6-terra e gpt-5.6-sol com 272.000 tokens e o alias gpt-5.6-luna-900k com 900.000 tokens. Isso é capacidade de runtime do harness, não prova de que a janela grande seja gratuita ou que o limite de cobrança da OpenAI tenha mudado. A página de preços separa explicitamente contexto curto e longo.[2]
| Camada | Valor confirmado | O que não concluir |
|---|---|---|
| Modelo padrão | gpt-5.6-luna-900k |
Que o alias é um tier oficial separado |
| Provider | openai-codex via OAuth/backend Codex |
Que o uso é cobrado como API padrão |
| Esforço | max |
Que Luna se transforma em Terra; esforço compra mais trabalho do mesmo modelo |
| API OpenAI | 1,05M contexto · 128K saída máxima | Que esse número seja automaticamente a janela do Hermes/ChatGPT |
| Delegação | Modelo/provider/effort vazios; herança habilitada; até 10 filhos concorrentes | Que três agentes Hermes são exatamente o ultra do Codex |
No Hermes, o esforço é uma substituição por execução: --reasoning none|minimal|low|medium|high|xhigh|max|ultra. O próprio CLI instalado confirma que --model, --reasoning e --usage-file podem ser usados em uma execução única sem alterar o default persistente. O arquivo JSON registra custo estimado, tokens, modelo e chamadas de API — útil para A/B.
Na API, reasoning.effort é um controle independente de modo: níveis menores favorecem velocidade e menor uso de tokens; níveis maiores podem melhorar planejamento e qualidade, com mais latência e consumo. Os valores suportados são dependentes do modelo e não devem ser tratados como equivalentes entre API, Codex, ChatGPT e Hermes.[27]
No Codex oficial, max dá mais tempo que xhigh para explorar, checar e revisar; ultra coordena quatro agentes em paralelo por padrão. Já delegate_task é a camada de orquestração do Hermes: cada filho tem contexto e terminal isolados. Não são conceitos idênticos.[3][8][23]
max, e vários auxiliares locais — visão, extração web, compressão, skills, aprovação, MCP, títulos, triagem, kanban, perfil, curator e monitor — também estão apontados para openai-codex com Luna. Isso é uma fotografia da configuração, não uma prova de como a OpenAI contabiliza cada chamada; mas mostra por que reduzir apenas o modelo principal pode não resolver tudo.
4. Performance: o que os benchmarks dizem
Não existe um ranking único de “inteligência”. Benchmarks medem tarefas diferentes, usam harnesses diferentes e podem fixar esforços diferentes. A leitura abaixo separa resultado publicado pela OpenAI de medição independente.
4.1 Tabela oficial da OpenAI
A tabela da OpenAI coloca Sol acima de Terra e Luna em várias avaliações profissionais e de coding. São resultados reportados pelo fornecedor; use-os como posicionamento e sinal de capacidade, não como garantia para o seu repositório ou para o seu prompt.[3]
| Benchmark | Sol | Terra | Luna | O que mede |
|---|---|---|---|---|
| Agents' Last Exam | 52,7% | 50,4% | 50,3% | Conhecimento e raciocínio profissional |
| Artificial Analysis Intelligence Index v4.1 | 58,9 | 55,0 | 51,2 | Índice composto |
| Coding Agent Index v1.1 | 80,0 | 77,4 | 74,6 | Coding com agente |
| SWE-Bench Pro | 64,6% | 63,4% | 62,7% | Issues de software resolvidas |
| Terminal-Bench 2.1 | 88,8% | 87,4% | 84,7% | Tarefas em terminal |
4.2 LiveBench: comparação direta em esforço máximo
Na captura consultada em 24/08/2026, o LiveBench lista variantes Max Effort diretamente. O ranking geral foi Sol 81,0, Terra 77,9 e Luna 73,6. Terra ficou 4,3 pontos acima de Luna no total e 6,5 pontos acima em Agentic Coding; porém Luna marcou 82,9 em Coding contra 78,2 de Terra. Ou seja: Terra é melhor no conjunto dessa medição, não em todas as colunas.[17]
| LiveBench · Max Effort | Sol | Terra | Luna |
|---|---|---|---|
| Overall | 81,0 | 77,9 | 73,6 |
| Coding | 83,9 | 78,2 | 82,9 |
| Agentic Coding | 56,2 | 54,9 | 48,4 |
| Custo por tarefa bem-sucedida | US$ 0,515 | US$ 0,352 | US$ 0,169 |
O custo do LiveBench é custo estimado por tarefa bem-sucedida em uma avaliação de API. Não é o saldo da sua assinatura Plus e não deve ser convertido diretamente em “mensagens restantes”.
4.3 Artificial Analysis: qualidade versus custo
O Artificial Analysis Intelligence Index v4.1 combina nove avaliações de matemática, ciência, coding, agentes e raciocínio. A metodologia é independente, mas predominantemente textual e em inglês; o site também estima custo por tarefa, velocidade e latência.[19][20]
| Variante | Index | Custo por tarefa | Leitura |
|---|---|---|---|
| Sol · max | 61 | US$ 0,96 | Qualidade máxima; caro |
| Terra · max | 57 | US$ 0,51 | Salto importante sobre Luna; ainda bem mais barato que Sol |
| Luna · max | 52 | US$ 0,05 | Excelente economia; não é o topo de qualidade |
| Sol · xhigh | 59 | US$ 0,64 | Quase o topo com menor custo que max |
| Terra · xhigh | 53 | US$ 0,31 | Candidato de equilíbrio |
| Luna · xhigh | 50 | US$ 0,03 | Volume com custo mínimo |
Nesta fonte, Terra xhigh passa Luna max por pouco no índice — 53 contra 52 —, mas a estimativa de custo por tarefa é cerca de 6,2 vezes maior. Terra max sobe para 57, com custo aproximadamente 10,2 vezes maior que Luna max. Isso não é uma razão para nunca usar Terra; é uma razão para não usá-lo em tarefas que Luna já resolve bem.[18][19]
4.4 Arena: preferência humana e harness
O Arena é útil para perceber preferência humana em respostas e para observar o efeito do harness. Na fotografia de 21/08/2026, no Text Arena em xhigh, Sol ficou em 16º com 1482±5, Terra em 44º com 1465±5 e Luna em 63º com 1451±5. No Code Arena WebDev, Sol ficou em 7º com 1619±8, Terra em 27º com 1520±9 e Luna em 29º com 1518±9.[15][16]
O Arena mostra preferência agregada em tarefas abertas; não é uma taxa de testes passando em um repositório real. O WebDev inclui fluxos agentic e tool use, mas continua sendo um ambiente específico. Use-o para detectar tendência, não para substituir o seu A/B.[14]
4.5 Sites que vale acompanhar
- LiveBench: tarefas objetivas, atualização periódica e categorias de raciocínio, coding e análise; bom para comparação direta por esforço.[17]
- Artificial Analysis: índice composto, custo por tarefa, velocidade, latência e variantes de esforço; bom para enxergar o trade-off.[18][19][20]
- Arena: votos de preferência em texto e coding; bom para qualidade percebida e efeito do harness.[14][15][16]
- SWE-bench: issues de software resolvidas por agentes; exige atenção à variante, ao conjunto de tarefas e ao harness. A leaderboard não deve ser lida como nota universal do modelo.[11]
- LiveCodeBench e Terminal-Bench: coding executável e tarefas de terminal; são mais próximos do trabalho do Hermes do que perguntas de múltipla escolha, mas ainda não reproduzem seu repositório, regras, MCPs e permissões.[21][3]
5. Custos: API, assinatura e a redução recente
A tabela oficial atual da API é por um milhão de tokens. Ela serve para comparar a economia relativa entre tiers; não é uma fatura do seu Plus.
| Modelo | Input curto | Input em cache | Output curto | Input longo | Output longo |
|---|---|---|---|---|---|
gpt-5.6-sol | US$ 4,00 | US$ 0,40 | US$ 20,00 | US$ 8,00 | US$ 30,00 |
gpt-5.6-terra | US$ 2,00 | US$ 0,20 | US$ 12,00 | US$ 4,00 | US$ 18,00 |
gpt-5.6-luna | US$ 0,20 | US$ 0,02 | US$ 1,20 | US$ 0,40 | US$ 1,80 |
Batch e Flex aparecem na tabela oficial com aproximadamente metade do preço standard; modos rápidos têm preço próprio. Cache write custa mais que input comum e cache read recebe desconto grande. Confira a tabela antes de montar processamento offline: modo de execução pode importar mais que a troca de tier.[2]
As páginas oficiais dos modelos também fixam um limiar importante: prompts com mais de 272K tokens de entrada recebem multiplicador de 2× no input e 1,5× no output para a requisição inteira.[24][25][26]
Um exemplo calculado, apenas para dar escala: uma tarefa com 100 mil tokens de entrada e 20 mil tokens de saída, em contexto curto e sem cache, custaria aproximadamente US$ 0,80 em Sol, US$ 0,44 em Terra e US$ 0,044 em Luna na API standard. Para o mesmo volume, Terra é 50% do input de Sol e 60% do output; Luna é 5% do input e 6% do output.[2]
5.1 A redução recente, sem marketing nebuloso
Comparando a tabela de preços anunciada no lançamento com a tabela standard atual, a queda é verificável. Isso é uma comparação entre duas páginas oficiais; não é uma reconstrução de cada mudança intermediária.
| Modelo | Lançamento · input/output | Atual · input/output | Queda calculada |
|---|---|---|---|
| Sol | US$ 5 / US$ 30 | US$ 4 / US$ 20 | 20% input · 33,3% output |
| Terra | US$ 2,50 / US$ 15 | US$ 2 / US$ 12 | 20% input · 20% output |
| Luna | US$ 1 / US$ 6 | US$ 0,20 / US$ 1,20 | 80% input · 80% output |
A tabela de lançamento e a tabela atual têm funções diferentes: a primeira prova o ponto de partida publicado; a segunda é a referência operacional para preços de API hoje. A página oficial de Sol informa que o preço promocional de US$ 4/20 está disponível pelo menos até 21/11/2026.[2][3][24]
6. Política de uso recomendada
| Tipo de tarefa | Modelo | Esforço inicial | Por quê |
|---|---|---|---|
| Extração, classificação, resumo curto, formatação | Luna | low–medium |
Volume e baixa latência |
| Coding normal, testes, debugging delimitado, pesquisa | Terra | high–xhigh |
Mais julgamento sem pagar Sol |
| Arquitetura difícil, investigação ambígua, falha cara | Terra | max |
Upgrade de qualidade dentro do Plus |
| Incidente crítico, segurança, decisão de alto impacto | Sol | xhigh–max |
Qualidade antes de quota |
| Compressão, visão, títulos, triagem e automação auxiliar | Luna | low–medium |
Não gastar Terra para trabalho de bastidor |
max, use Terra xhigh como candidato de equilíbrio e Terra max como upgrade de qualidade. Não recomendo Terra high como substituto universal: no Artificial Analysis, Terra high ficou abaixo de Luna max no índice daquela fotografia. Isso é exatamente por que esforço e tier precisam ser testados juntos, não tratados como uma escada simples.[18]
7. Como fazer um A/B sem gastar a assinatura à toa
- Separe 10–12 tarefas reais e recorrentes: bug com teste, refactor, investigação, deploy, documentação, arquitetura e uma tarefa de contexto longo.
- Congele o estado do repositório e use o mesmo prompt, mesmos arquivos, mesmas ferramentas e mesma janela de contexto. Para alterações, prefira worktrees separados.
- Rode cada tarefa em Luna max e Terra xhigh. Rode Terra max apenas nas tarefas difíceis ou nas quais os dois primeiros divergirem.
- Registre: passou nos testes, quantidade de retrabalho, completude, tool calls, latência, tokens e se precisou de nova tentativa.
- Escolha pelo custo total até chegar a uma solução aceitável, não pelo modelo que escreveu a resposta mais bonita. O modelo que exige três correções é só um estagiário caro com boa prosa.
hermes -z "MESMA TAREFA" \
-m gpt-5.6-luna \
--reasoning max \
--usage-file /tmp/luna-max.json
hermes -z "MESMA TAREFA" \
-m gpt-5.6-terra \
--reasoning xhigh \
--usage-file /tmp/terra-xhigh.json
hermes -z "MESMA TAREFA DIFÍCIL" \
-m gpt-5.6-terra \
--reasoning max \
--usage-file /tmp/terra-max.json
O --usage-file é o instrumento local para comparar as execuções. Para saber a quota remota de verdade, use o dashboard de uso do Codex ou /status em uma sessão Codex; o próprio Help Center recomenda essas telas quando o limite se aproxima.[5][9]
8. O que a telemetria local sugere
O Hermes registra uso local, mas isso não é uma fatura da OpenAI. Ainda assim, a fotografia de 18–24/08/2026 explica por que a sensação de quota apertada é plausível:
181 sessões · 3.823 mensagens · 2.313 tool calls
16.199.947 input tokens · 1.197.579 output tokens
164.405.142 total tokens reportados pelo Hermes
Modelos: 181 sessões em gpt-5.6-luna
Plataformas: desktop 31 sessões / 127.302.092 tokens
cron 145 sessões / 5.507.383 tokens
subagent 3 sessões / 4.182.725 tokens
Esforço persistente: max
Auxiliares: provider openai-codex com Luna em várias funções
O número importante não é “quantos prompts você enviou”. São sessões longas, contexto carregado, ferramentas, compressões e agentes auxiliares. Em uma assinatura, reduzir o esforço padrão e rotear tarefas simples para Luna tende a preservar mais capacidade do que trocar tudo para Terra max. Se a prioridade for qualidade, Terra xhigh é um experimento razoável; se a prioridade for durar mais, Luna precisa deixar de viver em max.
Conclusão
A melhor decisão para o seu perfil não é escolher um único campeão. É adotar uma política de roteamento:
- Luna low/medium/high para volume, automações e tarefas já bem definidas;
- Terra xhigh para o trabalho técnico principal, depois de um A/B honesto;
- Terra max quando o problema merece tempo extra e Luna falha ou exige retrabalho;
- Sol max para o pequeno conjunto de tarefas em que errar custa mais que a quota.
Portanto: sim, você provavelmente consegue resultados melhores com Terra em um esforço apropriado. O ponto de partida recomendado é Terra xhigh, não Terra max global. A assinatura Plus compra acesso às três camadas no Codex, mas não elimina limites; o melhor uso é reservar capacidade cara para onde ela produz diferença mensurável.[5][6]
Fontes e método
A pesquisa combinou documentação oficial da OpenAI, estado real desta instalação do Hermes e comparadores independentes. Números de benchmark foram mantidos com a variante de esforço e a data quando disponíveis. Preços de API são referência de custo relativo; não foram tratados como cobrança do Plus.
- Model guidance | OpenAI API [1]
- Pricing | OpenAI API [2]
- GPT-5.6: Frontier intelligence that scales with your ambition [3]
- GPT-5.6 Sol Model | OpenAI API [24]
- GPT-5.6 Terra Model | OpenAI API [25]
- GPT-5.6 Luna Model | OpenAI API [26]
- Reasoning models | OpenAI API [27]
- Using Codex with your ChatGPT plan [5]
- Pricing | ChatGPT Codex [6]
- What is ChatGPT Plus? | OpenAI Help Center [28]
- GPT-5.6 in ChatGPT | OpenAI Help Center [29]
- Using Credits for Flexible Usage in ChatGPT [30]
- Managing Billing Settings on ChatGPT Web and Platform [31]
- GPT-5.6 in ChatGPT [7]
- Models | ChatGPT Codex [8]
- Codex CLI [9]
- SWE-bench Leaderboards [11]
- Hermes Agent providers [12]
- Hermes Agent configuration [13]
- Hermes Agent documentation index [22]
- Hermes Agent delegation [23]
- How Arena Works [14]
- Arena Text Leaderboard [15]
- Arena Code WebDev Leaderboard [16]
- LiveBench [17]
- Artificial Analysis LLM Leaderboard [18]
- Artificial Analysis Intelligence Index [19]
- Artificial Analysis Intelligence Benchmarking Methodology [20]
- LiveCodeBench Benchmark Leaderboard [21]
Estado local verificado via hermes --help, hermes config get, hermes config check, hermes insights, ~/.hermes/config.yaml e ~/.hermes/context_length_cache.yaml em 24/08/2026. Nenhuma credencial foi incluída nesta página.