Skip to content
אצלי
Go back

Benchmarks de IA, modelos abertos e o custo real de 200 mil tokens

Dois pentes de memória RAM lado a lado sobre uma superfície cinza de concreto, separados por uma régua de aço graduada em centímetros. À esquerda, um G.SKILL Trident Z RGB com dissipador escovado em preto e prata; à direita, um Netac com dissipador espelhado que reflete a luz do ambiente
Foto de Andrey Matveev na Pexels

Atualização: 7 de setembro de 2026.

No post anterior, Apps com AI (system prompts) e benchmarks de LLMs, listei três referências: ARC Prize, SWE-bench e CodeClash. Desde então, a quantidade de leaderboards cresceu bastante, e ficou mais difícil responder a uma pergunta simples: qual modelo é melhor?

A resposta depende do teste. Um modelo pode liderar em programação e perder em matemática, uso de ferramentas, escrita, visão ou custo. Por isso, o primeiro erro é tratar um ranking isolado como se fosse uma tabela definitiva da inteligência de uma LLM.

Onde comparar modelos de IA

A lista abaixo está ordenada por reconhecimento, cobertura e frequência de atualização. A ordem não significa que o primeiro site seja melhor para todos os casos.

Também vale acompanhar os repositórios oficiais dos benchmarks. Leaderboards mudam, modelos saem do ar, mantenedores atualizam prompts e os próprios fornecedores submetem parte dos resultados. Um número sem versão, data, agente, nível de raciocínio e custo não é uma comparação completa.

Modelos fechados versus modelos de pesos abertos

Modelo fechado é aquele cujo peso, dados de treinamento ou método completo não estão disponíveis. O usuário normalmente acessa uma API ou aplicativo hospedado pela empresa. Claude, GPT e Gemini são exemplos dessa categoria, embora cada empresa divulgue quantidades diferentes de informação.

Modelo de pesos abertos disponibiliza os pesos para download, execução local ou hospedagem por terceiros. Isso não significa automaticamente que os dados de treinamento, o código de treinamento e toda a documentação estejam abertos. Por isso, “open source” costuma ser usado de forma imprecisa. “Pesos abertos” é uma descrição mais segura para modelos como DeepSeek, Qwen, Llama e gpt-oss.

A diferença prática fica assim:

Os resultados recentes mostram uma distância menor do que o marketing costuma sugerir. No Aider Polyglot, por exemplo, um teste de 225 problemas registrou Claude Opus 4 com 32k de thinking em 72,0%, DeepSeek R1-0528 em 71,4%, Qwen3 235B A22B sem thinking em 59,6% e gpt-oss-120b com esforço de raciocínio alto em 41,8%. As configurações fazem parte do resultado: o mesmo Opus 4 sem thinking cai para 70,7%, e o R1 original, anterior ao 0528, fica em 56,9%. As diferenças são de 0,6 ponto entre Opus e DeepSeek, 12,4 pontos entre Opus e Qwen e 30,2 pontos entre Opus e gpt-oss-120b.

Os resultados vieram de datas, versões e configurações diferentes, então o que dá para tirar dali é limitado: em algumas tarefas um modelo aberto empata na prática com um fechado, em outras fica bastante atrás. A distância real precisa ser medida benchmark por benchmark.

O próprio Artificial Analysis separa modelos Proprietary, Open Weights e Open Weights com restrições comerciais, além de oferecer custo por tarefa. Essa separação é melhor do que colocar todos os modelos abertos em um único grupo, porque Qwen, DeepSeek, Llama, gpt-oss e modelos locais menores têm capacidades e licenças muito diferentes.

Minha assinatura e o mesmo harness

Minha referência pessoal hoje é uma assinatura anual do Claude, mantida desde 2024. Também uso o OpenCode Go e o Abacus.AI, ambos a US$ 10 por mês.

No OpenCode Go, a página oficial lista 27 modelos, misturando pesos abertos e proprietários. Alguns deles:

O plano não conta requisições: mede o uso em dólares, ao preço por token de cada modelo, com teto de US$ 12 por janela de cinco horas, US$ 30 por semana e US$ 60 por mês. A página promete cerca de seis vezes o valor da assinatura em uso para a maioria dos modelos, com multiplicadores menores para os mais recentes ou já descontados. Isso não é uma unidade universal de tokens, então não dá para converter direto em cota de API sem consultar a conta.

Na página pública do ChatLLM da Abacus.AI, os modelos e produtos destacados são:

A lista da Abacus é dinâmica e a própria página aponta para um FAQ com mais de cem modelos e modalidades. Portanto, esta é a lista visível publicamente no momento da captura, não uma promessa de que todos estarão disponíveis com a mesma cota em qualquer conta ou região.

A marca do provedor importa menos do que o que fica constante entre elas. Com a minha ai-md-stack, o harness, as premissas de execução, as skills e o agente global são os mesmos. Trocar Claude por um modelo do OpenCode Go ou da Abacus muda o motor, mas preserva o ambiente de teste.

Sem isso, mudar de uma vez o modelo, o prompt, as ferramentas, as regras do agente e a forma de avaliar o resultado significa comparar produtos inteiros com configurações diferentes, não modelos.

Ainda assim, o harness não elimina todas as diferenças. Cada provedor pode aplicar system prompts próprios, truncar contexto, alterar parâmetros, limitar raciocínio, usar roteamento interno ou filtrar ferramentas. O resultado é uma comparação controlada, não um experimento perfeitamente idêntico.

Quanto custariam 200 mil tokens?

A conta abaixo assume 100 mil tokens de entrada e 100 mil tokens de saída. É uma simulação simples para tornar os preços comparáveis. Em uma tarefa real, o agente pode consumir muito mais entrada do que saída, repetir chamadas, usar cache, gerar tokens de raciocínio e fazer várias chamadas de ferramenta.

Para cada modelo, a fórmula é:

custo = (100.000 / 1.000.000 × preço de entrada) + (100.000 / 1.000.000 × preço de saída)

Usando preços públicos de API em setembro de 2026, na faixa de contexto padrão de cada modelo e sem descontos de cache:

Do topo ao fim da lista são quase cem vezes de diferença na mesma tarefa. A DeepSeek cobra por horário desde agosto de 2026, e os modelos Pro do Google e da OpenAI mudam de faixa de preço acima de um certo contexto, então o mesmo trabalho pode custar o dobro dependendo de quando e de quão cheio o contexto vai.

Os valores acima são o preço de API, não o valor da assinatura. Dentro de Claude, OpenCode Go e Abacus.AI, a tarefa não gera uma cobrança adicional de US$ 6,00 ou US$ 0,062. Ela consome a cota, o teto de uso da janela, os créditos ou os multiplicadores definidos pelo plano.

O custo de US$ 10 mensais de um plano precisa ser comparado com a quantidade de trabalho permitida, não com um único preço de API. Se uma assinatura de US$ 10 permitir uma tarefa que custaria US$ 6 em API, ela já entregou mais da metade do preço mensal em uma única execução. Só que essa mesma tarefa comeria metade do teto de US$ 12 da janela de cinco horas do OpenCode Go. O preço marginal continua existindo, só que aparece como limite de uso, não como boleto separado.

Tokens visíveis e tokens faturados também não são a mesma coisa. Um agente pode enviar o mesmo arquivo várias vezes, receber tokens de raciocínio que não aparecem na resposta final e repetir uma etapa após uma falha. Por isso, 200 mil tokens na interface não necessariamente significam 200 mil tokens cobrados pelo provedor.

O que os benchmarks mostram

A evidência atual não sustenta nem “abertos venceram fechados” nem “fechados são sempre superiores”.

Em vez de perguntar qual LLM ganhou o ranking, hoje eu pergunto qual modelo resolve a minha classe de tarefas, com o meu agente, dentro do meu orçamento e com uma diferença de qualidade que justifique o custo.


Share this post on:

Previous Post
A ilusão do buffet livre de IA e o mito do modelo definitivo
Next Post
My AI setup: Claude, Abacus, and OpenCode