Benchmark / live data

Stealth Models Benchmark: comparativo de modelos stealth

Quanto custa, em tokens e em dinheiro, resolver bugs reais com modelos stealth gratuitos, e como eles se comparam a referências pagas. Os números são medianas por rodada, convertidas pelo preço de um modelo pago equivalente.

Última atualização
Modelos com resultado
5
Rodadas válidas
75
Combinações
10
Resultados finaisBateria de 04.10.2026

Stealth Models Intelligence Index

Média simples das cinco provas — acurácia do AA-Omniscience, Humanity’s Last Exam, SciCode, Terminal-Bench 2.1 e SWE-bench Verified Mini. Prova pendente fica fora da média daquele modelo e a barra sai hachurada. Referências pagas vão em contorno. Subconjuntos pequenos e uma rodada: leia faixas, não posições.

62
57
53
53
42
DeepSeek V4.1 Flash · referencereferência paga
Big Picklestealth
Fledge Alphastealth
Space Bunnystealth
GLM 5.3 Flash · referencereferência paga
  • modelo stealth
  • uma prova pendente
  • referência paga
Stealth Models Intelligence Index
ModeloÍndiceOmni. acurácia (n=100)HLE (n=100)SciCode (n=20)TB 2.1 (n=14)SWE-Mini (n=20)USD total
DeepSeek V4.1 Flash · reference6252%23%51%100%85%US$ 1.0382
Big Pickle5764%38%44%71%65%US$ 1.3568
Fledge Alpha5337%23%52%79%75%US$ 2.1794
Space Bunny5357%28%40%64%75%US$ 1.2950
GLM 5.3 Flash · reference4252%20%41%36%60%US$ 2.4814
Resultados finaisBateria de 02.10.20263 repetições por tarefaOpenCode 2.0.14 · Cline 3.0.65 · Command Code 1.66.0

Bench de harness

Mesmo modelo, harness variando (e, onde o modelo só existe em um harness, o inverso). Cinco bugs injetados no pallets/jinja (911 testes), três repetições por par, ordem embaralhada, perfis limpos e correção contra a suíte original restaurada.

  • Melhor · Resolvidas100%Fledge Alpha · OpenCode e mais 3 empatadas
  • Melhor · USD/tarefaUS$ 0.0042Space Bunny · OpenCode
  • Melhor · Contexto133,141Space Bunny · OpenCode
  • Melhor · Cache89%Fledge Alpha · OpenCode e mais 2 empatadas
Rodadas resolvidasmaior é melhor

Rodadas em que a suíte original, restaurada, passou. Timeout com a correção já gravada conta como resolvida.

Fledge Alpha · OpenCode100%Space Bunny · OpenCode100%Space Bunny · Cline100%Space Bunny · Command Code100%Big Pickle · OpenCode80%
Custo por tarefa (USD, mediana)menor é melhor

Tokens medidos convertidos pelo preço de referência: entrada nova, leitura de cache e saída cobradas separadamente.

Space Bunny · OpenCodeUS$ 0.0042Big Pickle · OpenCodeUS$ 0.0045Fledge Alpha · OpenCodeUS$ 0.0056Space Bunny · ClineUS$ 0.0129Space Bunny · Command CodeUS$ 0.0491
Custo por tarefa resolvida (USD)menor é melhor

Custo total da bateria dividido pelas rodadas resolvidas. Pune quem gasta e não resolve.

Space Bunny · OpenCodeUS$ 0.0046Fledge Alpha · OpenCodeUS$ 0.0070Big Pickle · OpenCodeUS$ 0.0093Space Bunny · ClineUS$ 0.0296Space Bunny · Command CodeUS$ 0.0678
Contexto total por tarefa (tokens, mediana)menor é melhor

Entrada não-cacheada mais leitura de cache: o que de fato trafega até o modelo.

Space Bunny · OpenCode133,141Space Bunny · Cline138,614Fledge Alpha · OpenCode154,236Big Pickle · OpenCode157,299Space Bunny · Command Code596,086
Taxa de cache (mediana)maior é melhor

Leitura de cache sobre o contexto total. Explica quase toda a diferença de custo: ler do cache custa 50× menos que entrada nova.

Fledge Alpha · OpenCode89%Space Bunny · OpenCode89%Big Pickle · OpenCode89%Space Bunny · Command Code48%Space Bunny · Cline45%
Scaffolding (tokens do primeiro request)menor é melhor

System prompt mais definições de ferramenta, antes de qualquer trabalho. É o imposto fixo de toda tarefa.

Space Bunny · Cline5,953Big Pickle · OpenCode6,557Space Bunny · OpenCode6,564Fledge Alpha · OpenCode7,713Space Bunny · Command Code23,468
Resolvidas × USD/tarefamelhor: canto superior esquerdo
Space Bunny · OpenCodeFledge Alpha · OpenCodeSpace Bunny · ClineSpace Bunny · Command CodeBig Pickle · OpenCode
Bench de harness: resultados completos
ModeloHarnessRodadasResolvidasUSD/tarefaP25–P75USD/resolvidaContextoCacheScaffoldingSaídaToolsTurnosTempo
Space BunnyOpenCode1515/15US$ 0.0042US$ 0.0029–US$ 0.0055US$ 0.0046133,14189%6,5641,3381710150 s
Big PickleOpenCode1512/15US$ 0.0045US$ 0.0031–US$ 0.0093US$ 0.0093157,29989%6,5571,4811612170 s
Fledge AlphaOpenCode1515/15US$ 0.0056US$ 0.0030–US$ 0.0079US$ 0.0070154,23689%7,7131,302131247 s
Space BunnyCline1515/15US$ 0.0129US$ 0.0087–US$ 0.0506US$ 0.0296138,61445%5,9531,1108837 s
Space BunnyCommand Code1515/15US$ 0.0491US$ 0.0418–US$ 0.0727US$ 0.0678596,08648%23,4681,807131159 s
Custo mediano por tarefa (USD) e rodadas resolvidas
Combinaçãosandbox.pylexer.pyruntime.pyloaders.pycompiler.py
Big Pickle · OpenCodeUS$ 0.00443/3US$ 0.00603/3US$ 0.00213/3US$ 0.00303/3US$ 0.01700/3
Fledge Alpha · OpenCodeUS$ 0.00283/3US$ 0.00723/3US$ 0.00283/3US$ 0.00383/3US$ 0.01703/3
Space Bunny · OpenCodeUS$ 0.00283/3US$ 0.00613/3US$ 0.00343/3US$ 0.00373/3US$ 0.00713/3
Space Bunny · ClineUS$ 0.00793/3US$ 0.07893/3US$ 0.01133/3US$ 0.00953/3US$ 0.05463/3
Space Bunny · Command CodeUS$ 0.03913/3US$ 0.06563/3US$ 0.03533/3US$ 0.04913/3US$ 0.12273/3

Incerteza: Três repetições por tarefa, 15 rodadas por combinação. As barras mostram a mediana; o traço fino, o intervalo interquartil (P25–P75) entre as rodadas. Diferenças menores que esse intervalo não devem ser lidas como vantagem.

  • Bateria v2, isolada: rodadas fora da árvore do bench, perfil novo por rodada e auditoria automática de escape. Rodadas que saíram do workspace seriam excluídas e contadas; nesta bateria foram 0.
  • O Pixel Canary ficou de fora: o preview encerrou antes da bateria isolada, e a bateria v1 dele não pôde ser refeita.
Resultados finaisBateria de 04.10.20261 repetição por tarefaExecutado via OpenCode 1.18.33Juiz: opencode-go/gpt-5.6-lunaSemente dos subconjuntos: 20261002

Suíte de inteligência e coding

Suíte reduzida, no estilo dos índices do Artificial Analysis, com subconjuntos sorteados uma vez com semente fixa. Os modelos stealth rodam ao lado de duas referências pagas.

  • Melhor · Omniscience+43Big Pickle
  • Melhor · HLE38%Big Pickle
  • Melhor · TB 2.1100%DeepSeek V4.1 Flash
  • Melhor · SWE-Mini85%DeepSeek V4.1 Flash
AA-Omniscience: índicemaior é melhor

100 × (corretas − incorretas) / 100 perguntas. Vai de −100 a 100: errar custa ponto; abster-se ou não responder, não.

Big Pickle+43Space Bunny+29DeepSeek V4.1 Flash (referência)+29GLM 5.3 Flash (referência)+20Fledge Alpha−5
AA-Omniscience: taxa de alucinaçãomenor é melhor

Incorretas sobre tudo que não foi acerto (parciais, incorretas, abstenções e itens sem resposta): quanto o modelo inventa quando não sabe.

DeepSeek V4.1 Flash (referência)48%Big Pickle58%Space Bunny65%Fledge Alpha67%GLM 5.3 Flash (referência)67%
Humanity's Last Exam: acuráciamaior é melhor

Acurácia sobre as 100 questões de texto do subconjunto. Questão sem resposta conta como erro.

Big Pickle38%Space Bunny28%Fledge Alpha23%DeepSeek V4.1 Flash (referência)23%GLM 5.3 Flash (referência)20%
SciCode: subproblemas resolvidosmaior é melhor

Subproblemas corretos sobre o total dos 20 problemas. Problema sem resposta conta com todos os passos errados.

Fledge Alpha52%DeepSeek V4.1 Flash (referência)51%Big Pickle44%GLM 5.3 Flash (referência)41%Space Bunny40%
Terminal-Bench 2.1: recompensa médiamaior é melhor

Fração das 14 tarefas aprovadas pelo verificador da própria tarefa. Rede aberta, como no benchmark oficial.

DeepSeek V4.1 Flash (referência)100%Fledge Alpha79%Big Pickle71%Space Bunny64%GLM 5.3 Flash (referência)36%
SWE-bench Verified Mini: resolvidasmaior é melhor

Fração das tarefas aprovadas pelos testes do repositório. Rede restrita ao gateway do modelo e auditoria de cópia do patch oficial.

DeepSeek V4.1 Flash (referência)85%Fledge Alpha75%Space Bunny75%Big Pickle65%GLM 5.3 Flash (referência)60%
Custo da suíte (USD)menor é melhor

Tokens do modelo avaliado (sem o juiz) ao preço de referência, somados em todos os testes.

DeepSeek V4.1 Flash (referência)US$ 1.0382Space BunnyUS$ 1.2950Big PickleUS$ 1.3568Fledge AlphaUS$ 2.1794GLM 5.3 Flash (referência)US$ 2.4814
SWE-Mini × USD totalmelhor: canto superior esquerdo
DeepSeek V4.1 FlashSpace BunnyFledge AlphaBig PickleGLM 5.3 Flash
Suíte de inteligência e coding: resultados completos
ModeloOmniscience (n=100)Omni. acurácia (n=100)Alucinação (n=100)HLE (n=100)SciCode (n=20)TB 2.1 (n=14)SWE-Mini (n=20)USD total
Big Pickle+4364%58%38%44%71%65%US$ 1.3568
Space Bunny+2957%65%28%40%64%75%US$ 1.2950
DeepSeek V4.1 Flash · reference+2952%48%23%51%100%85%US$ 1.0382
GLM 5.3 Flash · reference+2052%67%20%41%36%60%US$ 2.4814
Fledge Alpha−537%67%23%52%79%75%US$ 2.1794

Incerteza: Subconjuntos pequenos (14 a 100 itens por teste) e uma repetição: com 20 itens, cada tarefa vale 5 pontos percentuais. Use os números para separar faixas, não para ordenar modelos próximos.

  • Item sem resposta conta contra o modelo. Quando o modelo gasta o tempo (900 s) ou o teto de raciocínio sem emitir resposta, o item entra no denominador: erro no HLE e no SciCode, não tentado no Omniscience. Itens sem resposta: Fledge Alpha: Omniscience 1, HLE 28; Space Bunny: Omniscience 1, HLE 35, SciCode 1; DeepSeek V4.1 Flash: Omniscience 5; GLM 5.3 Flash: Omniscience 4, HLE 7, SciCode 3.
  • SWE-Mini com rede restrita. Com a rede aberta os agentes copiavam a correção publicada no GitHub (em uma tarefa, as 44 linhas do patch oficial apareceram idênticas); esses trials foram descartados. Sob a allowlist, até dois terços dos trials de cada modelo ainda tentaram buscar a correção na web; todas as tentativas foram bloqueadas e a auditoria não encontrou cópia.
  • Fledge Alpha rodou fora do servidor da bateria, porque o modelo não é oferecido na Alemanha. As perguntas e o SWE-Mini rodaram em uma máquina no Brasil e o Terminal-Bench em uma máquina nos Estados Unidos, com as mesmas regras, a mesma rede restrita e a mesma auditoria.
  • Hardware diferente entre modelos. As tarefas com agente das referências pagas e do Big Pickle rodaram em um servidor de 16 núcleos; o Terminal-Bench do Fledge Alpha e do Space Bunny rodou em uma máquina de 4 núcleos, e o SWE-Mini do Fledge Alpha e as 4 últimas tarefas do Big Pickle em uma máquina de 6 núcleos. Os tetos de tempo são os mesmos.
  • Uma repetição por item e subconjuntos pequenos: uma tarefa do Terminal-Bench vale 7 pontos percentuais e uma do SWE-Mini vale 5.

Metodologia e limitações

Este benchmark nasceu para catalogar os modelos stealth que aparecem de graça por uma semana nos harnesses de código e depois somem. Os números das tabelas e gráficos acima vêm de um arquivo de dados atualizado a cada bateria; esta seção explica como eles são produzidos e o que não medem.

Bench de harness: modelo fixo, harness variando

Quase toda comparação de harness mistura duas variáveis: troca o harness e o modelo ao mesmo tempo. Aqui o modelo é fixo e o harness (OpenCode, Cline, Command Code) é a única coisa que muda. O alvo é o pallets/jinja, pinado num commit, com cinco bugs injetados em módulos distintos (sandbox, lexer, runtime, loaders, compiler), escolhidos para que o sintoma fique longe da causa. Bug injetado derrota memorização: o modelo não resolve de cabeça.

Cada rodada recebe uma cópia descartável do repositório, sem histórico git, e um perfil limpo do harness contendo só a credencial: sem MCP, skills, plugins ou memória. A correção é avaliada com a pasta de testes restaurada de uma cópia pristina, e qualquer alteração em testes é detectada. São três repetições por par tarefa × harness, em ordem embaralhada com semente fixa, para que a carga da API ao longo do dia não vire diferença de harness.

A métrica principal não é taxa de acerto, que empata entre agentes convergidos, mas custo e contexto por tarefa resolvida. Modelos stealth custam zero, então os tokens medidos são convertidos pelo preço de um modelo pago de referência (indicado nas notas), para responder “quanto isso custaria num modelo equivalente”. Reportamos contexto total (entrada não cacheada mais leitura de cache) e taxa de cache, nunca tokens de entrada crus: dois harnesses que pareciam diferir 9× mandavam o mesmo contexto, com aproveitamento de cache diferente.

Isolamento e auditoria

Uma primeira bateria foi descartada inteira. Os diretórios das rodadas ficavam dentro do repositório do benchmark, e os agentes subiram dois níveis, leram a definição exata dos bugs injetados e compararam o código com a cópia sem bug. O placar medía a capacidade de achar o gabarito. Desde então cada rodada roda fora da árvore do benchmark, com nome aleatório, e o log bruto é auditado automaticamente: uma rodada que alcança o repositório do benchmark é excluída das métricas e contada à parte.

Suíte de inteligência e coding

Para cobrir outras vertentes, uma suíte reduzida inspirada nos índices do Artificial Analysis roda com os mesmos modelos: AA-Omniscience (conhecimento factual e alucinação), Humanity’s Last Exam (raciocínio acadêmico), SciCode (programação científica), Terminal-Bench 2.1 (uso de terminal) e SWE-bench Verified Mini (correção de bugs em repositórios reais). Os subconjuntos são sorteados uma vez, com semente fixa, e são os mesmos para todos os modelos. Nos testes de perguntas e respostas o modelo não tem acesso a ferramentas; nos testes com agente, cada tarefa roda no próprio container, e no SWE-bench a rede do agente fica restrita ao gateway do modelo, porque a correção de cada tarefa está pública no GitHub. A correção usa um modelo-juiz pago, diferente dos avaliados, no Omniscience e no HLE; nos demais, testes automatizados.

Limitações

  • Tempo não é comparável. Cada harness fala com o modelo pelo seu próprio gateway, e houve rodadas com minutos de fila do provedor. Trate o tempo como indicativo.
  • Harness limpo não é harness real. Sem MCP e skills, um harness que depende delas joga em desvantagem. O que se mede é o custo de base.
  • Tarefas são correção pontual, não feature nova nem requisito ambíguo.
  • Preview muda. Stealth em preview é ajustado durante a janela, e alguns saem do ar antes do prazo anunciado. Os números valem para a data indicada em cada seção.
  • Subconjuntos pequenos. Na suíte, 100 questões dão uma margem de erro em torno de ±8 pontos; 14 a 20 tarefas com agente, margem maior. Os números separam modelos com diferença clara, não desempatam modelos parecidos, e não são comparáveis aos do Artificial Analysis, que usa outros subconjuntos, harness e juiz.
  • Disponibilidade por região. Alguns stealth são bloqueados em certos países; quando um modelo não roda no servidor do benchmark, isso é indicado nas notas da seção.

A metodologia completa, com as armadilhas encontradas e como cada uma foi resolvida, está em duas páginas: a do bench de harness e a da suíte de inteligência e coding. As análises saem como posts no blog; a da suíte é Modelos stealth do OpenCode: testei 3 em 5 benchmarks.

Notas

  1. Custos convertidos pelo preço do DeepSeek V4.1 Flash, por milhão de tokens: US$ 0.150 de entrada, US$ 0.600 de saída e US$ 0.003 de leitura de cache. Preço de primeira mão da DeepSeek, conferido em 26/09/2026.
  2. Bench de harness: 75 rodadas válidas em 5 combinações; 0 excluídas por sair do workspace. Valores são medianas por combinação.
  3. Suíte de inteligência e coding, itens por teste: Omniscience 100, HLE 100, SciCode 20, TB 2.1 14, SWE-Mini 20.
  4. Modelos stealth em preview custam zero, então o custo informado pelo harness não serve para comparar. Todo valor em dólar é o que os tokens medidos custariam no modelo de referência.
  5. Metodologia completa e limitações