Olá amigos e amigas! Nas últimas semanas eu medi quanto cada modelo stealth do OpenCode custa pra resolver um bug. Faltava a outra metade da pergunta: o que cada um sabe e consegue fazer?
Então montei uma suíte reduzida, inspirada nos índices do Artificial Analysis, e passei os três stealth do tier grátis por ela: Big Pickle, Space Bunny e Fledge Alpha. Do lado, duas referências pagas e baratas: DeepSeek V4.1 Flash e GLM-5.3-Flash. Foram 5 testes e 254 itens por modelo, tudo pelo OpenCode 1.18.33.
Já adianto: nenhum dos três grátis bate a referência paga mais barata quando o trabalho é de agente. Mas um deles sabe mais que todo mundo, e a parte mais interessante nem é o placar. É o que os modelos fizeram quando deixei a internet aberta.
1. Os cinco testes da suíte
| teste | o que mede | tamanho |
|---|---|---|
| AA-Omniscience | conhecimento e alucinação | 100 perguntas |
| Humanity’s Last Exam | raciocínio difícil, só texto | 100 perguntas |
| SciCode | código científico em passos | 20 problemas |
| Terminal-Bench 2.1 | tarefas de terminal com agente | 14 tarefas |
| SWE-bench Verified Mini | correção de bugs reais | 20 tarefas |
Os subconjuntos foram sorteados uma vez, com semente fixa, e são os mesmos pra todo mundo. Nas perguntas, o modelo responde sem ferramentas e um modelo-juiz pago corrige. Nos testes com agente, cada tarefa roda no próprio container e o verificador da tarefa dá a nota.
É uma suíte reduzida: subconjunto pequeno e uma repetição só. Ela separa modelos com diferença grande e não desempata modelos parecidos. Os detalhes, com as 16 armadilhas que encontrei no caminho, estão na página de metodologia.
2. O resultado dos modelos stealth, de uma vez
| modelo | Omniscience (índice) | HLE | SciCode | Terminal-Bench | SWE-Mini | US$ |
|---|---|---|---|---|---|---|
| Big Pickle | +43 | 38% | 44% | 71% | 65% | 1,36 |
| Space Bunny | +29 | 28% | 40% | 64% | 75% | 1,30 |
| Fledge Alpha | −5 | 23% | 52% | 79% | 75% | 2,18 |
| DeepSeek V4.1 Flash (ref.) | +29 | 23% | 51% | 100% | 85% | 1,04 |
| GLM-5.3-Flash (ref.) | +20 | 20% | 41% | 36% | 60% | 2,48 |
A última coluna é o custo de todos os tokens do modelo na suíte, convertido pelo preço do DeepSeek V4.1 Flash. Os stealth custam zero no tier grátis; a conversão serve pra colocar todo mundo na mesma régua.
Três leituras rápidas. O DeepSeek, que é pago e barato, ganha as duas provas com agente e ainda custa menos. O Big Pickle é o que mais sabe. E o Fledge Alpha programa bem, mas erra fato.
3. Conhecimento: quem sabe e quem inventa
O AA-Omniscience faz 100 perguntas factuais e tem uma regra que eu adoro: errar custa ponto, e dizer “não sei” não custa nada. O índice é certas menos erradas.
| modelo | índice | acurácia | alucinação | sem resposta |
|---|---|---|---|---|
| Big Pickle | +43 | 64% | 58% | 0 |
| Space Bunny | +29 | 57% | 65% | 1 |
| DeepSeek V4.1 Flash | +29 | 52% | 48% | 5 |
| GLM-5.3-Flash | +20 | 52% | 67% | 4 |
| Fledge Alpha | −5 | 37% | 67% | 1 |
Calma que eu explico a coluna de alucinação. Ela pega tudo o que o modelo não acertou e pergunta: em quantas dessas vezes ele respondeu errado em vez de admitir que não sabia? O DeepSeek é o mais contido, com menos da metade. O Fledge, o GLM e o Space Bunny inventam em cerca de dois terços.
O Fledge Alpha acertou 37 e errou 42. É o único com índice negativo: errou mais do que acertou. Pra qualquer uso que dependa de fato, é o pior dos cinco, com folga.
4. Raciocínio: o modelo que pensa e não responde
Humanity’s Last Exam: acurácia
100 questões só de texto, 900 segundos por questão. Quanto maior, melhor.
Aqui apareceu uma coisa que eu não esperava. O Space Bunny e o Fledge não devolveram resposta em um terço das questões. Eles gastaram os 15 minutos raciocinando e não emitiram nada.
Se eu contasse só o que eles responderam, teriam 43% e 32%. Mas não responder é um resultado do modelo, então conto sobre as 100, como o Artificial Analysis faz. O Big Pickle respondeu todas e acertou 38. É a maior distância entre um stealth e as referências na suíte inteira.
5. Código científico: empate na frente
| modelo | passos corretos | problemas inteiros |
|---|---|---|
| Fledge Alpha | 52% | 4 de 20 |
| DeepSeek V4.1 Flash | 51% | 4 de 20 |
| Big Pickle | 44% | 1 de 20 |
| GLM-5.3-Flash | 41% | 2 de 20 |
| Space Bunny | 40% | 1 de 20 |
No SciCode cada problema é dividido em passos, e a nota é a fração de passos cujo código passa nos testes oficiais. Fledge e DeepSeek empatam na frente. Resolver o problema inteiro continua raro pra todo mundo: no máximo 4 de 20.
6. Tarefas de terminal: a referência gabaritou
Terminal-Bench 2.1: tarefas resolvidas
14 tarefas com agente, rede aberta, teto de tempo de cada tarefa.
O DeepSeek resolveu as 14. O GLM-5.3-Flash foi a surpresa negativa: uma referência paga que ficou atrás dos três modelos grátis, com quatro estouros de tempo.
Entre os stealth, Fledge, Big Pickle e Space Bunny estão a uma ou duas tarefas um do outro. Com 14 tarefas, isso é empate técnico.
7. Bugs reais: o SWE-bench e a internet aberta
SWE-bench Verified Mini: bugs resolvidos
20 tarefas, teto de 3000 segundos, rede restrita ao gateway do modelo.
Essa é a parte que eu mais queria contar. Os bugs do SWE-bench são públicos, e a correção de cada um está no GitHub. Numa janela de duas horas em que a rede ficou aberta por engano meu, os agentes foram lá buscar. Em uma tarefa, as 44 linhas do patch oficial apareceram idênticas no patch do agente.
Descartei esses resultados e refiz tudo com a rede restrita: o agente só alcança o gateway do modelo. E aí veio o detalhe: os modelos continuaram tentando. Abriam o repositório no navegador interno, chamavam a API de issues, faziam busca na web. Dependendo do modelo, isso aconteceu em um quarto a dois terços das tarefas. Todas as tentativas foram bloqueadas, e a auditoria de similaridade com o patch oficial não achou cópia.
A lição vale pra qualquer benchmark que você ler por aí: um número de SWE-bench medido com a rede aberta não diz o que parece dizer.
8. O perfil de cada modelo
Big Pickle. O mais completo dos stealth em conhecimento e raciocínio, e o único que nunca deixou pergunta sem resposta. Nas tarefas com agente fica no meio no terminal e é o stealth mais fraco no SWE-Mini.
Space Bunny. Empata como melhor stealth no SWE-Mini, tem bom conhecimento (igual ao DeepSeek) e é o que mais trava em pergunta difícil: 35 questões do HLE sem resposta.
Fledge Alpha. Perfil de programador. Empata na frente no SciCode, é o segundo no Terminal-Bench e resolve 75% do SWE-Mini. Mas tem o pior conhecimento factual e também trava no HLE.
DeepSeek V4.1 Flash. A referência a bater. Ganha as duas provas com agente, empata na frente no SciCode, alucina menos e custa menos.
GLM-5.3-Flash. O mais caro e o mais fraco nas tarefas com agente.
9. O que esse teste não diz
É uma repetição só, com subconjuntos pequenos. Uma tarefa do Terminal-Bench vale 7 pontos percentuais e uma do SWE-Mini vale 5. A tabela separa faixas, não ordena modelos próximos.
As máquinas não foram as mesmas. O Fledge Alpha não é oferecido na Alemanha, onde fica o meu servidor, e eu não uso VPN pra contornar isso. As perguntas e o SWE-Mini dele rodaram numa máquina aqui no Brasil, e o Terminal-Bench numa máquina nos Estados Unidos. Parte do Space Bunny e as últimas tarefas do Big Pickle também rodaram fora do servidor. As regras, os tetos de tempo, a rede restrita e a auditoria foram os mesmos.
Modelo stealth muda sem aviso. O que eu medi é o que respondia por cada nome entre 2 e 4 de outubro de 2026.
E os números não são comparáveis aos do Artificial Analysis, que usa outros subconjuntos, outro harness e outro juiz.
10. Meu veredito
Pra trabalho com agente, nenhum dos três modelos grátis substitui a referência paga mais barata. O DeepSeek V4.1 Flash foi melhor no Terminal-Bench e no SWE-Mini e custou menos. Entre os grátis, o Fledge Alpha é o mais forte em código: lidera no Terminal-Bench e no SciCode e empata com o Space Bunny na correção de bugs.
Pra perguntas, o Big Pickle é o melhor dos cinco, pagos incluídos. E o Fledge Alpha não deve ser usado onde o fato importa.
Todos os números, com gráficos por teste, estão no Stealth Models Benchmark. Se você quer saber quanto cada harness cobra pelo mesmo modelo, esse é o assunto do comparativo entre OpenCode, Cline e Command Code.
11. Perguntas frequentes
O que é um modelo stealth?
É um modelo em preview anônimo e gratuito, que aparece no catálogo de um harness de código sem nome de fabricante e costuma sumir depois de algumas semanas. Big Pickle, Space Bunny e Fledge Alpha estavam no tier grátis do OpenCode no começo de outubro de 2026.
Qual é o melhor modelo stealth do OpenCode?
Depende do uso. Pra perguntas e raciocínio, o Big Pickle (índice +43 no Omniscience e 38% no HLE). Pra código, o Fledge Alpha (79% no Terminal-Bench, 52% no SciCode e 75% no SWE-Mini). O Space Bunny também resolve 75% do SWE-Mini.
Os modelos grátis são melhores que os pagos baratos?
Nas tarefas com agente, não. O DeepSeek V4.1 Flash resolveu 14 de 14 no Terminal-Bench e 17 de 20 no SWE-Mini, mais que qualquer stealth. Em conhecimento e raciocínio, o Big Pickle ficou na frente dos dois pagos.
Por que a rede fica restrita no SWE-bench?
Porque a correção de cada bug está pública no GitHub. Com a rede aberta, os agentes buscaram e copiaram o patch oficial. Com a rede restrita ao gateway do modelo, eles ainda tentaram, mas todas as tentativas foram bloqueadas.
Esses números são comparáveis aos do Artificial Analysis?
Não. A suíte usa subconjuntos menores, uma repetição, o OpenCode como harness e outro modelo-juiz. Ela serve pra comparar os modelos entre si, nas mesmas condições.
De graça eles são bons. Só não são melhores que o barato.
Abraços, Fellipe Soares
Assinatura
Receba os próximos artigos por e-mail.