Benchmark / live data
Stealth Models Benchmark: comparativo de modelos stealth
Quanto custa, em tokens e em dinheiro, resolver bugs reais com modelos stealth gratuitos, e como eles se comparam a referências pagas. Os números são medianas por rodada, convertidas pelo preço de um modelo pago equivalente.
- Última atualização
- Modelos com resultado
- 5
- Rodadas válidas
- 75
- Combinações
- 10
Stealth Models Intelligence Index
Média simples das cinco provas — acurácia do AA-Omniscience, Humanity’s Last Exam, SciCode, Terminal-Bench 2.1 e SWE-bench Verified Mini. Prova pendente fica fora da média daquele modelo e a barra sai hachurada. Referências pagas vão em contorno. Subconjuntos pequenos e uma rodada: leia faixas, não posições.
- modelo stealth
- uma prova pendente
- referência paga
| Modelo | Índice | Omni. acurácia (n=100) | HLE (n=100) | SciCode (n=20) | TB 2.1 (n=14) | SWE-Mini (n=20) | USD total |
|---|---|---|---|---|---|---|---|
| DeepSeek V4.1 Flash · reference | 62 | 52% | 23% | 51% | 100% | 85% | US$ 1.0382 |
| Big Pickle | 57 | 64% | 38% | 44% | 71% | 65% | US$ 1.3568 |
| Fledge Alpha | 53 | 37% | 23% | 52% | 79% | 75% | US$ 2.1794 |
| Space Bunny | 53 | 57% | 28% | 40% | 64% | 75% | US$ 1.2950 |
| GLM 5.3 Flash · reference | 42 | 52% | 20% | 41% | 36% | 60% | US$ 2.4814 |
Bench de harness
Mesmo modelo, harness variando (e, onde o modelo só existe em um harness, o inverso). Cinco bugs injetados no pallets/jinja (911 testes), três repetições por par, ordem embaralhada, perfis limpos e correção contra a suíte original restaurada.
- Melhor · Resolvidas100%Fledge Alpha · OpenCode e mais 3 empatadas
- Melhor · USD/tarefaUS$ 0.0042Space Bunny · OpenCode
- Melhor · Contexto133,141Space Bunny · OpenCode
- Melhor · Cache89%Fledge Alpha · OpenCode e mais 2 empatadas
Rodadas em que a suíte original, restaurada, passou. Timeout com a correção já gravada conta como resolvida.
Tokens medidos convertidos pelo preço de referência: entrada nova, leitura de cache e saída cobradas separadamente.
Custo total da bateria dividido pelas rodadas resolvidas. Pune quem gasta e não resolve.
Entrada não-cacheada mais leitura de cache: o que de fato trafega até o modelo.
Leitura de cache sobre o contexto total. Explica quase toda a diferença de custo: ler do cache custa 50× menos que entrada nova.
System prompt mais definições de ferramenta, antes de qualquer trabalho. É o imposto fixo de toda tarefa.
| Modelo | Harness | Rodadas | Resolvidas | USD/tarefa | P25–P75 | USD/resolvida | Contexto | Cache | Scaffolding | Saída | Tools | Turnos | Tempo |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Space Bunny | OpenCode | 15 | 15/15 | US$ 0.0042 | US$ 0.0029–US$ 0.0055 | US$ 0.0046 | 133,141 | 89% | 6,564 | 1,338 | 17 | 10 | 150 s |
| Big Pickle | OpenCode | 15 | 12/15 | US$ 0.0045 | US$ 0.0031–US$ 0.0093 | US$ 0.0093 | 157,299 | 89% | 6,557 | 1,481 | 16 | 12 | 170 s |
| Fledge Alpha | OpenCode | 15 | 15/15 | US$ 0.0056 | US$ 0.0030–US$ 0.0079 | US$ 0.0070 | 154,236 | 89% | 7,713 | 1,302 | 13 | 12 | 47 s |
| Space Bunny | Cline | 15 | 15/15 | US$ 0.0129 | US$ 0.0087–US$ 0.0506 | US$ 0.0296 | 138,614 | 45% | 5,953 | 1,110 | 8 | 8 | 37 s |
| Space Bunny | Command Code | 15 | 15/15 | US$ 0.0491 | US$ 0.0418–US$ 0.0727 | US$ 0.0678 | 596,086 | 48% | 23,468 | 1,807 | 13 | 11 | 59 s |
| Combinação | sandbox.py | lexer.py | runtime.py | loaders.py | compiler.py |
|---|---|---|---|---|---|
| Big Pickle · OpenCode | US$ 0.00443/3 | US$ 0.00603/3 | US$ 0.00213/3 | US$ 0.00303/3 | US$ 0.01700/3 |
| Fledge Alpha · OpenCode | US$ 0.00283/3 | US$ 0.00723/3 | US$ 0.00283/3 | US$ 0.00383/3 | US$ 0.01703/3 |
| Space Bunny · OpenCode | US$ 0.00283/3 | US$ 0.00613/3 | US$ 0.00343/3 | US$ 0.00373/3 | US$ 0.00713/3 |
| Space Bunny · Cline | US$ 0.00793/3 | US$ 0.07893/3 | US$ 0.01133/3 | US$ 0.00953/3 | US$ 0.05463/3 |
| Space Bunny · Command Code | US$ 0.03913/3 | US$ 0.06563/3 | US$ 0.03533/3 | US$ 0.04913/3 | US$ 0.12273/3 |
Incerteza: Três repetições por tarefa, 15 rodadas por combinação. As barras mostram a mediana; o traço fino, o intervalo interquartil (P25–P75) entre as rodadas. Diferenças menores que esse intervalo não devem ser lidas como vantagem.
- Bateria v2, isolada: rodadas fora da árvore do bench, perfil novo por rodada e auditoria automática de escape. Rodadas que saíram do workspace seriam excluídas e contadas; nesta bateria foram 0.
- O Pixel Canary ficou de fora: o preview encerrou antes da bateria isolada, e a bateria v1 dele não pôde ser refeita.
Suíte de inteligência e coding
Suíte reduzida, no estilo dos índices do Artificial Analysis, com subconjuntos sorteados uma vez com semente fixa. Os modelos stealth rodam ao lado de duas referências pagas.
- Melhor · Omniscience+43Big Pickle
- Melhor · HLE38%Big Pickle
- Melhor · TB 2.1100%DeepSeek V4.1 Flash
- Melhor · SWE-Mini85%DeepSeek V4.1 Flash
100 × (corretas − incorretas) / 100 perguntas. Vai de −100 a 100: errar custa ponto; abster-se ou não responder, não.
Incorretas sobre tudo que não foi acerto (parciais, incorretas, abstenções e itens sem resposta): quanto o modelo inventa quando não sabe.
Acurácia sobre as 100 questões de texto do subconjunto. Questão sem resposta conta como erro.
Subproblemas corretos sobre o total dos 20 problemas. Problema sem resposta conta com todos os passos errados.
Fração das 14 tarefas aprovadas pelo verificador da própria tarefa. Rede aberta, como no benchmark oficial.
Fração das tarefas aprovadas pelos testes do repositório. Rede restrita ao gateway do modelo e auditoria de cópia do patch oficial.
Tokens do modelo avaliado (sem o juiz) ao preço de referência, somados em todos os testes.
| Modelo | Omniscience (n=100) | Omni. acurácia (n=100) | Alucinação (n=100) | HLE (n=100) | SciCode (n=20) | TB 2.1 (n=14) | SWE-Mini (n=20) | USD total |
|---|---|---|---|---|---|---|---|---|
| Big Pickle | +43 | 64% | 58% | 38% | 44% | 71% | 65% | US$ 1.3568 |
| Space Bunny | +29 | 57% | 65% | 28% | 40% | 64% | 75% | US$ 1.2950 |
| DeepSeek V4.1 Flash · reference | +29 | 52% | 48% | 23% | 51% | 100% | 85% | US$ 1.0382 |
| GLM 5.3 Flash · reference | +20 | 52% | 67% | 20% | 41% | 36% | 60% | US$ 2.4814 |
| Fledge Alpha | −5 | 37% | 67% | 23% | 52% | 79% | 75% | US$ 2.1794 |
Incerteza: Subconjuntos pequenos (14 a 100 itens por teste) e uma repetição: com 20 itens, cada tarefa vale 5 pontos percentuais. Use os números para separar faixas, não para ordenar modelos próximos.
- Item sem resposta conta contra o modelo. Quando o modelo gasta o tempo (900 s) ou o teto de raciocínio sem emitir resposta, o item entra no denominador: erro no HLE e no SciCode, não tentado no Omniscience. Itens sem resposta: Fledge Alpha: Omniscience 1, HLE 28; Space Bunny: Omniscience 1, HLE 35, SciCode 1; DeepSeek V4.1 Flash: Omniscience 5; GLM 5.3 Flash: Omniscience 4, HLE 7, SciCode 3.
- SWE-Mini com rede restrita. Com a rede aberta os agentes copiavam a correção publicada no GitHub (em uma tarefa, as 44 linhas do patch oficial apareceram idênticas); esses trials foram descartados. Sob a allowlist, até dois terços dos trials de cada modelo ainda tentaram buscar a correção na web; todas as tentativas foram bloqueadas e a auditoria não encontrou cópia.
- Fledge Alpha rodou fora do servidor da bateria, porque o modelo não é oferecido na Alemanha. As perguntas e o SWE-Mini rodaram em uma máquina no Brasil e o Terminal-Bench em uma máquina nos Estados Unidos, com as mesmas regras, a mesma rede restrita e a mesma auditoria.
- Hardware diferente entre modelos. As tarefas com agente das referências pagas e do Big Pickle rodaram em um servidor de 16 núcleos; o Terminal-Bench do Fledge Alpha e do Space Bunny rodou em uma máquina de 4 núcleos, e o SWE-Mini do Fledge Alpha e as 4 últimas tarefas do Big Pickle em uma máquina de 6 núcleos. Os tetos de tempo são os mesmos.
- Uma repetição por item e subconjuntos pequenos: uma tarefa do Terminal-Bench vale 7 pontos percentuais e uma do SWE-Mini vale 5.
Metodologia e limitações
Este benchmark nasceu para catalogar os modelos stealth que aparecem de graça por uma semana nos harnesses de código e depois somem. Os números das tabelas e gráficos acima vêm de um arquivo de dados atualizado a cada bateria; esta seção explica como eles são produzidos e o que não medem.
Bench de harness: modelo fixo, harness variando
Quase toda comparação de harness mistura duas variáveis: troca o harness e o modelo ao mesmo tempo. Aqui o modelo é fixo e o harness (OpenCode, Cline, Command Code) é a única coisa que muda. O alvo é o pallets/jinja, pinado num commit, com cinco bugs injetados em módulos distintos (sandbox, lexer, runtime, loaders, compiler), escolhidos para que o sintoma fique longe da causa. Bug injetado derrota memorização: o modelo não resolve de cabeça.
Cada rodada recebe uma cópia descartável do repositório, sem histórico git, e um perfil limpo do harness contendo só a credencial: sem MCP, skills, plugins ou memória. A correção é avaliada com a pasta de testes restaurada de uma cópia pristina, e qualquer alteração em testes é detectada. São três repetições por par tarefa × harness, em ordem embaralhada com semente fixa, para que a carga da API ao longo do dia não vire diferença de harness.
A métrica principal não é taxa de acerto, que empata entre agentes convergidos, mas custo e contexto por tarefa resolvida. Modelos stealth custam zero, então os tokens medidos são convertidos pelo preço de um modelo pago de referência (indicado nas notas), para responder “quanto isso custaria num modelo equivalente”. Reportamos contexto total (entrada não cacheada mais leitura de cache) e taxa de cache, nunca tokens de entrada crus: dois harnesses que pareciam diferir 9× mandavam o mesmo contexto, com aproveitamento de cache diferente.
Isolamento e auditoria
Uma primeira bateria foi descartada inteira. Os diretórios das rodadas ficavam dentro do repositório do benchmark, e os agentes subiram dois níveis, leram a definição exata dos bugs injetados e compararam o código com a cópia sem bug. O placar medía a capacidade de achar o gabarito. Desde então cada rodada roda fora da árvore do benchmark, com nome aleatório, e o log bruto é auditado automaticamente: uma rodada que alcança o repositório do benchmark é excluída das métricas e contada à parte.
Suíte de inteligência e coding
Para cobrir outras vertentes, uma suíte reduzida inspirada nos índices do Artificial Analysis roda com os mesmos modelos: AA-Omniscience (conhecimento factual e alucinação), Humanity’s Last Exam (raciocínio acadêmico), SciCode (programação científica), Terminal-Bench 2.1 (uso de terminal) e SWE-bench Verified Mini (correção de bugs em repositórios reais). Os subconjuntos são sorteados uma vez, com semente fixa, e são os mesmos para todos os modelos. Nos testes de perguntas e respostas o modelo não tem acesso a ferramentas; nos testes com agente, cada tarefa roda no próprio container, e no SWE-bench a rede do agente fica restrita ao gateway do modelo, porque a correção de cada tarefa está pública no GitHub. A correção usa um modelo-juiz pago, diferente dos avaliados, no Omniscience e no HLE; nos demais, testes automatizados.
Limitações
- Tempo não é comparável. Cada harness fala com o modelo pelo seu próprio gateway, e houve rodadas com minutos de fila do provedor. Trate o tempo como indicativo.
- Harness limpo não é harness real. Sem MCP e skills, um harness que depende delas joga em desvantagem. O que se mede é o custo de base.
- Tarefas são correção pontual, não feature nova nem requisito ambíguo.
- Preview muda. Stealth em preview é ajustado durante a janela, e alguns saem do ar antes do prazo anunciado. Os números valem para a data indicada em cada seção.
- Subconjuntos pequenos. Na suíte, 100 questões dão uma margem de erro em torno de ±8 pontos; 14 a 20 tarefas com agente, margem maior. Os números separam modelos com diferença clara, não desempatam modelos parecidos, e não são comparáveis aos do Artificial Analysis, que usa outros subconjuntos, harness e juiz.
- Disponibilidade por região. Alguns stealth são bloqueados em certos países; quando um modelo não roda no servidor do benchmark, isso é indicado nas notas da seção.
A metodologia completa, com as armadilhas encontradas e como cada uma foi resolvida, está em duas páginas: a do bench de harness e a da suíte de inteligência e coding. As análises saem como posts no blog; a da suíte é Modelos stealth do OpenCode: testei 3 em 5 benchmarks.
Notas
- Custos convertidos pelo preço do DeepSeek V4.1 Flash, por milhão de tokens: US$ 0.150 de entrada, US$ 0.600 de saída e US$ 0.003 de leitura de cache. Preço de primeira mão da DeepSeek, conferido em 26/09/2026.
- Bench de harness: 75 rodadas válidas em 5 combinações; 0 excluídas por sair do workspace. Valores são medianas por combinação.
- Suíte de inteligência e coding, itens por teste: Omniscience 100, HLE 100, SciCode 20, TB 2.1 14, SWE-Mini 20.
- Modelos stealth em preview custam zero, então o custo informado pelo harness não serve para comparar. Todo valor em dólar é o que os tokens medidos custariam no modelo de referência.
- Metodologia completa e limitações
Assinatura
Receba as próximas baterias por e-mail.