A pergunta “qual IA escreve o melhor código?” não tem uma resposta única — e os próprios leaderboards oficiais provam isso. O mesmo modelo muda de posição conforme o agente que o executa, o custo por tarefa e a versão do benchmark.
No ranking mais recente do Terminal-Bench 2.1, o Claude Code com Fable 5 lidera com 83,8% de acerto (dados de julho de 2026), à frente do Codex com GPT-5.5, com 83,1% (Terminal-Bench 2.1 — Leaderboard oficial, 2026). Mas o mesmo modelo Fable 5 cai para 80,4% quando roda em outro agente — o que mostra que a resposta depende tanto da ferramenta quanto do modelo.
Este levantamento reúne 48 dados verificáveis extraídos direto dos leaderboards oficiais do Terminal-Bench e do SWE-bench, além de um estudo acadêmico revisando a confiabilidade desses testes. Nenhum número vem de blog ou agregador. Todos têm data, porque score de benchmark envelhece rápido: os líderes de fevereiro já não são os de julho.
Resposta rápida: qual IA escreve o melhor código em 2026?
Se você precisa citar poucos números, estes são os mais fortes — e cada um responde a uma pergunta diferente:
| Pergunta | Resposta (com fonte) | Fonte |
|---|---|---|
| Maior acerto atual em tarefas de terminal | 83,8% — Claude Code com Fable 5 | Terminal-Bench 2.1, jul/2026 |
| Vice-líder atual | 83,1% — Codex com GPT-5.5 | Terminal-Bench 2.1, jul/2026 |
| Maior acerto no SWE-bench Verified com harness neutro | 76,8% — Claude 4.5 Opus (raciocínio alto) | SWE-bench Verified (mini-SWE-agent), fev/2026 |
| Variação do mesmo modelo só trocando o agente | 58,0% a 76,4% — Claude Opus 4.6 | Terminal-Bench 2.0, 2026 |
| Melhor custo por rodada entre os líderes | 79,3% por US$ 134 — Cursor CLI com Grok 4.5 | Terminal-Bench 2.1, jul/2026 |
| Rodada mais cara do topo | 83,1% por US$ 2.059 — Codex com GPT-5.5 | Terminal-Bench 2.1, jul/2026 |
| Patches errados marcados como corretos no SWE-bench | 345, afetando 24,4% das entradas do Verified | UTBoost (arXiv 2506.09289), 2026 |
- O líder atual é o Fable 5 com Claude Code: 83,8% no Terminal-Bench 2.1, dado de julho de 2026.
- O agente vale tanto quanto o modelo: o mesmo Claude Opus 4.6 varia de 58% a 76% no mesmo benchmark só trocando o harness.
- Score de vendor é inflado por scaffolding: no harness neutro do SWE-bench, o topo fica em 76,8%, abaixo dos ~88% frequentemente divulgados.
- Custo varia mais de 15x: a rodada do Codex com GPT-5.5 custou US$ 2.059; a do Cursor CLI com Grok 4.5 custou US$ 134 por um resultado quase igual.
- Peso aberto alcançou o fechado: MiniMax, GLM-5, Kimi e DeepSeek já estão na faixa de 70%+.
- Os benchmarks têm furo documentado: 345 patches errados passaram como corretos no SWE-bench Verified.
- Todo número aqui tem data: os líderes mudam a cada modelo novo, e há pelo menos um lançamento por mês.
Como citar este levantamento
Se você usar estes dados em artigo, relatório, apresentação ou material comercial, cite assim:
> ViniEnsina. “Qual IA Escreve o Melhor Código em 2026: O Que os Benchmarks Mostram”. Coleta e curadoria de leaderboards oficiais, 2026.
Quando citar um número específico, prefira mencionar também a fonte original e a data. Exemplo: “Segundo o leaderboard oficial do Terminal-Bench 2.1 (julho de 2026), citado pelo ViniEnsina, o Claude Code com Fable 5 lidera com 83,8%.”
O ranking atual: Terminal-Bench 2.1
O Terminal-Bench mede tarefas de linha de comando: gerenciar pacotes, compilar, usar git, configurar servidor, manipular arquivos e escrever shell script. A versão 2.1 é a mais recente e mais difícil, e o ranking é sempre de agente + modelo, porque o benchmark testa o conjunto trabalhando. Os dados abaixo são do leaderboard oficial, com a data de submissão de cada entrada.
Leitura rápida: doze melhores combinações de agente e modelo no Terminal-Bench 2.1, consultado em julho de 2026.
| Agente | Modelo | Acerto | Data |
|---|---|---|---|
| Claude Code | Fable 5 | 83,8% | 07/06/2026 |
| Codex | GPT-5.5 | 83,1% | 01/05/2026 |
| Terminus 2 | Fable 5 | 80,4% | 05/06/2026 |
| Cursor CLI | Grok 4.5 | 79,3% | 09/07/2026 |
| Claude Code | Opus 4.8 | 78,9% | 09/07/2026 |
| Codex | GPT-5.6 Terra | 78,4% | 11/07/2026 |
| Terminus 2 | GPT-5.5 | 78,0% | 01/05/2026 |
| mini-SWE-agent | Muse Spark 1.1 | 76,2% | 09/07/2026 |
| Codex | GPT-5.6 Luna | 75,7% | 11/07/2026 |
| Claude Code | Sonnet 5 | 74,6% | 09/07/2026 |
| Terminus 2 | Gemini 3 Pro | 73,9% | 01/05/2026 |
| Claude Code | Opus 4.7 | 68,9% | 01/05/2026 |
Por que não existe um número único: o efeito do harness
A maior confusão nos comparativos de IA para código vem de tratar o score como propriedade do modelo. Ele não é. O score é do conjunto modelo + agente + tarefa. O agente — também chamado de harness ou scaffolding — é o programa que dá ao modelo acesso ao terminal, aos arquivos e às ferramentas. Trocar o agente muda o resultado tanto quanto trocar o modelo.
O efeito aparece já no ranking atual: o Fable 5 faz 83,8% com o Claude Code e 80,4% com o Terminus 2; o GPT-5.5 faz 83,1% com o Codex e 78,0% com o Terminus 2. Mas a demonstração mais clara vem da versão anterior do benchmark, o Terminal-Bench 2.0, que teve muito mais submissões por modelo. Abaixo, todas as entradas são do Claude Opus 4.6, no mesmo teste, mudando só o agente.
Leitura rápida: mesmo modelo, agentes diferentes, um único benchmark oficial (Terminal-Bench 2.0, a versão com mais submissões por modelo).
| Agente | Modelo | Acerto | Fonte |
|---|---|---|---|
| Meta-Harness (Stanford IRIS) | Claude Opus 4.6 | 76,4% | Terminal-Bench 2.0, 2026 |
| Capy | Claude Opus 4.6 | 75,3% | Terminal-Bench 2.0, 2026 |
| Terminus-KIRA | Claude Opus 4.6 | 74,7% | Terminal-Bench 2.0, 2026 |
| TongAgents | Claude Opus 4.6 | 71,9% | Terminal-Bench 2.0, 2026 |
| Droid (Factory) | Claude Opus 4.6 | 69,9% | Terminal-Bench 2.0, 2026 |
| Mux (Coder) | Claude Opus 4.6 | 66,5% | Terminal-Bench 2.0, 2026 |
| Terminus 2 | Claude Opus 4.6 | 62,9% | Terminal-Bench 2.0, 2026 |
| Claude Code (Anthropic) | Claude Opus 4.6 | 58,0% | Terminal-Bench 2.0, 2026 |
A comparação justa: SWE-bench Verified com o mesmo harness
O Terminal-Bench mistura agentes, então não isola o modelo. Para comparar modelos de forma limpa, é preciso fixar o agente e variar só o modelo. É o que o leaderboard oficial do SWE-bench Verified faz: roda todos os modelos com o mesmo mini-SWE-agent, um harness de código aberto com cerca de 100 linhas de Python. O ponto fraco é a atualização: esse leaderboard padronizado ainda está no corte de fevereiro de 2026 e não inclui os modelos mais recentes. É, ainda assim, a melhor comparação maçã com maçã disponível.
Leitura rápida: 500 tarefas do SWE-bench Verified, todos os modelos no mesmo harness mini-SWE-agent, corte de fevereiro de 2026.
| Modelo | % resolvido | Custo médio/tarefa | Fonte |
|---|---|---|---|
| Claude 4.5 Opus (raciocínio alto) | 76,8% | US$ 0,75 | SWE-bench Verified, fev/2026 |
| Gemini 3 Flash (raciocínio alto) | 75,8% | US$ 0,36 | SWE-bench Verified, fev/2026 |
| MiniMax M2.5 (raciocínio alto) | 75,8% | US$ 0,07 | SWE-bench Verified, fev/2026 |
| Claude Opus 4.6 | 75,6% | US$ 0,55 | SWE-bench Verified, fev/2026 |
| GPT-5.2 Codex | 72,8% | US$ 0,45 | SWE-bench Verified, fev/2026 |
| GLM-5 (raciocínio alto) | 72,8% | US$ 0,53 | SWE-bench Verified, fev/2026 |
| GPT-5.2 (raciocínio alto) | 72,8% | US$ 0,47 | SWE-bench Verified, fev/2026 |
| Claude 4.5 Sonnet (raciocínio alto) | 71,4% | US$ 0,66 | SWE-bench Verified, fev/2026 |
| Kimi K2.5 (raciocínio alto) | 70,8% | US$ 0,15 | SWE-bench Verified, fev/2026 |
| DeepSeek V3.2 (raciocínio alto) | 70,0% | US$ 0,45 | SWE-bench Verified, fev/2026 |
| Gemini 3 Pro | 69,6% | US$ 0,96 | SWE-bench Verified, fev/2026 |
| Claude 4.5 Haiku (raciocínio alto) | 66,6% | US$ 0,33 | SWE-bench Verified, fev/2026 |
| GPT-5 Mini | 56,2% | US$ 0,05 | SWE-bench Verified, fev/2026 |
O ranking muda quando você olha o custo
Score alto não conta a história toda. O Terminal-Bench 2.1 registra o custo total de cada rodada do benchmark, e a diferença é enorme: os líderes em acerto estão entre os mais caros de rodar, enquanto opções quase tão boas custam uma fração.
Leitura rápida: custo total para rodar o Terminal-Bench 2.1 completo, por combinação de agente e modelo, julho de 2026.
| Agente + Modelo | Acerto | Custo da rodada | Fonte |
|---|---|---|---|
| Cursor CLI + Grok 4.5 | 79,3% | US$ 134,09 | Terminal-Bench 2.1, jul/2026 |
| mini-SWE-agent + Muse Spark 1.1 | 76,2% | US$ 198,05 | Terminal-Bench 2.1, jul/2026 |
| Codex + GPT-5.6 Luna | 75,7% | US$ 241,45 | Terminal-Bench 2.1, jul/2026 |
| Claude Code + Opus 4.8 | 78,9% | US$ 286,94 | Terminal-Bench 2.1, jul/2026 |
| Claude Code + Fable 5 | 83,8% | US$ 552,67 | Terminal-Bench 2.1, jul/2026 |
| Codex + GPT-5.5 | 83,1% | US$ 2.059,19 | Terminal-Bench 2.1, jul/2026 |
Peso aberto alcançou o proprietário
Um dos dados mais relevantes de 2026 não é qual modelo lidera, e sim quem chegou ao pelotão de frente. Modelos de peso aberto — que você pode baixar e rodar — aparecem lado a lado com os proprietários no mesmo harness neutro do SWE-bench Verified.
Leitura rápida: modelos de peso aberto e seus acertos no SWE-bench Verified com mini-SWE-agent, corte de fevereiro de 2026.
| Modelo (peso aberto) | % resolvido | Custo/tarefa | Fonte |
|---|---|---|---|
| MiniMax M2.5 | 75,8% | US$ 0,07 | SWE-bench Verified, fev/2026 |
| GLM-5 | 72,8% | US$ 0,53 | SWE-bench Verified, fev/2026 |
| Kimi K2.5 | 70,8% | US$ 0,15 | SWE-bench Verified, fev/2026 |
| DeepSeek V3.2 | 70,0% | US$ 0,45 | SWE-bench Verified, fev/2026 |
Os benchmarks têm furos: como ler os números com ceticismo
Nenhum destes rankings deve ser lido como verdade absoluta. Estudos acadêmicos que auditaram o SWE-bench encontraram problemas concretos de metodologia, e os próprios fabricantes reconhecem contaminação de dados. Um score alto pode significar competência real ou apenas memorização.
Leitura rápida: limitações documentadas dos benchmarks de código mais usados.
| Problema | Detalhe | Fonte |
|---|---|---|
| Testes insuficientes ou incorretos | 345 patches errados marcados como aprovados | UTBoost (arXiv 2506.09289), 2026 |
| Fração do Verified afetada | 24,4% das entradas | UTBoost (arXiv 2506.09289), 2026 |
| Fração do Lite afetada | 40,9% das entradas | UTBoost (arXiv 2506.09289), 2026 |
| Mudanças de posição após correção | 11 no Verified, 18 no Lite | UTBoost (arXiv 2506.09289), 2026 |
| Saturação do benchmark | Os melhores modelos se agrupam perto do teto, reduzindo o poder de distinção | SWE-bench Verified, 2026 |
Qual IA escreve o melhor código em números: tabela completa
Consolidação das principais métricas do artigo para consulta e citação rápida.
| Estatística | Valor | Fonte |
|---|---|---|
| Líder atual do Terminal-Bench 2.1 | 83,8% (Claude Code + Fable 5) | Terminal-Bench 2.1, jul/2026 |
| Vice-líder atual | 83,1% (Codex + GPT-5.5) | Terminal-Bench 2.1, jul/2026 |
| Melhor Anthropic da geração Opus atual | 78,9% (Claude Code + Opus 4.8) | Terminal-Bench 2.1, jul/2026 |
| Melhor modelo GPT-5.6 | 78,4% (Codex + GPT-5.6 Terra) | Terminal-Bench 2.1, jul/2026 |
| Líder do SWE-bench Verified (harness neutro) | 76,8% (Claude 4.5 Opus) | SWE-bench Verified, fev/2026 |
| Variação do Claude Opus 4.6 por agente | 58,0% a 76,4% | Terminal-Bench 2.0, 2026 |
| Rodada mais barata do topo | US$ 134 (Cursor CLI + Grok 4.5, 79,3%) | Terminal-Bench 2.1, jul/2026 |
| Rodada mais cara do topo | US$ 2.059 (Codex + GPT-5.5, 83,1%) | Terminal-Bench 2.1, jul/2026 |
| Melhor custo-benefício (harness neutro) | MiniMax M2.5: 75,8% a US$ 0,07/tarefa | SWE-bench Verified, fev/2026 |
| Melhor modelo de peso aberto | 75,8% — MiniMax M2.5 | SWE-bench Verified, fev/2026 |
| Distância entre 1º e 10º no SWE-bench Verified | 6,8 pontos percentuais | SWE-bench Verified, fev/2026 |
| Instâncias do SWE-bench Verified | 500 tarefas filtradas por humanos | SWE-bench Verified, 2026 |
| Tamanho do mini-SWE-agent | ~100 linhas de Python | SWE-bench, 2026 |
| Patches errados aprovados no SWE-bench | 345 | UTBoost (arXiv 2506.09289), 2026 |
| Entradas do Verified afetadas | 24,4% | UTBoost (arXiv 2506.09289), 2026 |
| Entradas do Lite afetadas | 40,9% | UTBoost (arXiv 2506.09289), 2026 |
| Fabricantes no top 6 do Terminal-Bench 2.1 | 4 (Anthropic, OpenAI, xAI, Meta) | Terminal-Bench 2.1, jul/2026 |
O que os dados significam para quem programa no Brasil
A conclusão prática é que não existe uma resposta única, e perseguir o “modelo campeão” é o caminho errado. O topo do ranking atual reúne quatro fabricantes em menos de 15 pontos de distância, e a escolha inteligente depende de três variáveis que o marketing esconde: o agente que você usa, o custo por tarefa e o tipo de trabalho.
Para o dia a dia, isso significa que trocar de agente pode render mais que trocar de modelo, e que um modelo aberto ou barato resolve a maior parte das tarefas por uma fração do preço. O modelo topo de linha se justifica em problemas difíceis; para o resto, pagar por ele é desperdício.
E vale o ceticismo: como um quarto das entradas do benchmark mais citado teve resultado corrigido por auditoria, o melhor teste continua sendo o seu próprio — instalar a ferramenta e rodá-la nas suas tarefas reais por alguns dias antes de assinar o plano mais caro.
Perguntas frequentes
Qual IA escreve o melhor código em 2026?
No ranking mais recente, o Terminal-Bench 2.1 (julho de 2026), o topo é o Claude Code com Fable 5, a 83,8%, seguido do Codex com GPT-5.5, a 83,1%. No SWE-bench Verified com harness neutro, o líder é o Claude 4.5 Opus, a 76,8% (corte de fevereiro). A resposta muda conforme o benchmark, o agente e se você considera o custo.
Por que os scores divulgados pelos fabricantes são mais altos?
Porque cada fabricante usa seu próprio scaffolding, otimizado para o teste. No SWE-bench Verified com o mini-SWE-agent, um harness neutro e igual para todos, os números caem: o topo fica em 76,8% em vez dos cerca de 88% frequentemente divulgados.
O que é um harness ou agente nesse contexto?
É o programa que conecta o modelo ao terminal, aos arquivos e às ferramentas de desenvolvimento. O mesmo modelo obtém resultados muito diferentes com agentes diferentes: o Claude Opus 4.6 variou de 58,0% a 76,4% no Terminal-Bench só trocando o agente.
Modelo de peso aberto já compete com Claude e GPT para código?
Sim. No SWE-bench Verified com harness neutro, o MiniMax M2.5 atinge 75,8%, a um ponto do melhor modelo proprietário (76,8%), e por cerca de um décimo do custo por tarefa. GLM-5, Kimi K2.5 e DeepSeek V3.2 também aparecem na faixa de 70%.
Dá para confiar nos benchmarks de código?
Com ressalvas. Um estudo acadêmico (UTBoost) encontrou 345 patches errados aprovados no SWE-bench, afetando 24,4% das entradas do Verified e mudando 11 posições. Há ainda contaminação de treino. Use os scores como indício, não como veredito, e teste na sua própria tarefa.
Qual combinação tem o melhor custo-benefício para código?
Pelo Terminal-Bench 2.1, o Cursor CLI com Grok 4.5 resolve 79,3% pela rodada mais barata entre os líderes (US$ 134), contra os US$ 2.059 do Codex com GPT-5.5. Para a maioria das tarefas, uma combinação barata com score próximo do topo é a escolha economicamente racional.
Metodologia
Os dados foram coletados em 20 de julho de 2026 diretamente dos leaderboards oficiais do Terminal-Bench (tbench.ai) e do SWE-bench (swebench.com), além do artigo acadêmico UTBoost (arXiv). O ranking principal usa o Terminal-Bench 2.1, com as datas de submissão indo até 11 de julho de 2026. Os dados de comparação com harness neutro vêm do SWE-bench Verified via mini-SWE-agent, cujo corte oficial mais recente é de fevereiro de 2026 e ainda não inclui os modelos mais novos; a data está indicada em cada tabela. O Terminal-Bench 2.0 é citado apenas para ilustrar o efeito do harness, por ter mais submissões por modelo. Nenhum número foi obtido de blogs ou agregadores, e valores citados por terceiros sem fonte oficial rastreável foram descartados. Benchmarks de IA mudam com frequência: os líderes de hoje não serão os de amanhã. Esta página é revisada trimestralmente.
Fontes consultadas
- Terminal-Bench 2.1 — Official Leaderboard, 2026
- SWE-bench — Official Leaderboards (Verified, via mini-SWE-agent), 2026
- UTBoost: Rigorous Evaluation of Coding Agents on SWE-Bench (arXiv 2506.09289), 2026
- Aider — Polyglot Coding Leaderboard (metodologia), 2026
Última atualização: julho de 2026. Para citar este relatório: viniensina.com.br/melhor-ia-para-programar-2026/
