Tecnologia / [44]

Modelos stealth do OpenCode: testei 3 em 5 benchmarks

Modelos stealth do OpenCode em 5 benchmarks: Big Pickle, Space Bunny e Fledge Alpha contra duas referências pagas. Veja quem sabe, quem programa e quem inventa.

Olá amigos e amigas! Nas últimas semanas eu medi quanto cada modelo stealth do OpenCode custa pra resolver um bug. Faltava a outra metade da pergunta: o que cada um sabe e consegue fazer?

Então montei uma suíte reduzida, inspirada nos índices do Artificial Analysis, e passei os três stealth do tier grátis por ela: Big Pickle, Space Bunny e Fledge Alpha. Do lado, duas referências pagas e baratas: DeepSeek V4.1 Flash e GLM-5.3-Flash. Foram 5 testes e 254 itens por modelo, tudo pelo OpenCode 1.18.33.

Já adianto: nenhum dos três grátis bate a referência paga mais barata quando o trabalho é de agente. Mas um deles sabe mais que todo mundo, e a parte mais interessante nem é o placar. É o que os modelos fizeram quando deixei a internet aberta.

1. Os cinco testes da suíte

teste o que mede tamanho
AA-Omniscience conhecimento e alucinação 100 perguntas
Humanity’s Last Exam raciocínio difícil, só texto 100 perguntas
SciCode código científico em passos 20 problemas
Terminal-Bench 2.1 tarefas de terminal com agente 14 tarefas
SWE-bench Verified Mini correção de bugs reais 20 tarefas

Os subconjuntos foram sorteados uma vez, com semente fixa, e são os mesmos pra todo mundo. Nas perguntas, o modelo responde sem ferramentas e um modelo-juiz pago corrige. Nos testes com agente, cada tarefa roda no próprio container e o verificador da tarefa dá a nota.

É uma suíte reduzida: subconjunto pequeno e uma repetição só. Ela separa modelos com diferença grande e não desempata modelos parecidos. Os detalhes, com as 16 armadilhas que encontrei no caminho, estão na página de metodologia.

2. O resultado dos modelos stealth, de uma vez

modelo Omniscience (índice) HLE SciCode Terminal-Bench SWE-Mini US$
Big Pickle +43 38% 44% 71% 65% 1,36
Space Bunny +29 28% 40% 64% 75% 1,30
Fledge Alpha −5 23% 52% 79% 75% 2,18
DeepSeek V4.1 Flash (ref.) +29 23% 51% 100% 85% 1,04
GLM-5.3-Flash (ref.) +20 20% 41% 36% 60% 2,48

A última coluna é o custo de todos os tokens do modelo na suíte, convertido pelo preço do DeepSeek V4.1 Flash. Os stealth custam zero no tier grátis; a conversão serve pra colocar todo mundo na mesma régua.

Três leituras rápidas. O DeepSeek, que é pago e barato, ganha as duas provas com agente e ainda custa menos. O Big Pickle é o que mais sabe. E o Fledge Alpha programa bem, mas erra fato.

3. Conhecimento: quem sabe e quem inventa

O AA-Omniscience faz 100 perguntas factuais e tem uma regra que eu adoro: errar custa ponto, e dizer “não sei” não custa nada. O índice é certas menos erradas.

modelo índice acurácia alucinação sem resposta
Big Pickle +43 64% 58% 0
Space Bunny +29 57% 65% 1
DeepSeek V4.1 Flash +29 52% 48% 5
GLM-5.3-Flash +20 52% 67% 4
Fledge Alpha −5 37% 67% 1

Calma que eu explico a coluna de alucinação. Ela pega tudo o que o modelo não acertou e pergunta: em quantas dessas vezes ele respondeu errado em vez de admitir que não sabia? O DeepSeek é o mais contido, com menos da metade. O Fledge, o GLM e o Space Bunny inventam em cerca de dois terços.

O Fledge Alpha acertou 37 e errou 42. É o único com índice negativo: errou mais do que acertou. Pra qualquer uso que dependa de fato, é o pior dos cinco, com folga.

4. Raciocínio: o modelo que pensa e não responde

Humanity’s Last Exam: acurácia

100 questões só de texto, 900 segundos por questão. Quanto maior, melhor.

stealth grátisreferência paga
Big Pickle38%
Space Bunny28%
Fledge Alpha23%
DeepSeek V4.1 Flash23%
GLM-5.3-Flash20%
Questão sem resposta conta como erro. Sem resposta: Space Bunny 35, Fledge Alpha 28, GLM-5.3-Flash 7, os outros 0.

Aqui apareceu uma coisa que eu não esperava. O Space Bunny e o Fledge não devolveram resposta em um terço das questões. Eles gastaram os 15 minutos raciocinando e não emitiram nada.

Se eu contasse só o que eles responderam, teriam 43% e 32%. Mas não responder é um resultado do modelo, então conto sobre as 100, como o Artificial Analysis faz. O Big Pickle respondeu todas e acertou 38. É a maior distância entre um stealth e as referências na suíte inteira.

5. Código científico: empate na frente

modelo passos corretos problemas inteiros
Fledge Alpha 52% 4 de 20
DeepSeek V4.1 Flash 51% 4 de 20
Big Pickle 44% 1 de 20
GLM-5.3-Flash 41% 2 de 20
Space Bunny 40% 1 de 20

No SciCode cada problema é dividido em passos, e a nota é a fração de passos cujo código passa nos testes oficiais. Fledge e DeepSeek empatam na frente. Resolver o problema inteiro continua raro pra todo mundo: no máximo 4 de 20.

6. Tarefas de terminal: a referência gabaritou

Terminal-Bench 2.1: tarefas resolvidas

14 tarefas com agente, rede aberta, teto de tempo de cada tarefa.

stealth grátisreferência paga
DeepSeek V4.1 Flash14 de 14
Fledge Alpha11 de 14
Big Pickle10 de 14
Space Bunny9 de 14
GLM-5.3-Flash5 de 14
Uma repetição. Cada tarefa vale 7 pontos percentuais.

O DeepSeek resolveu as 14. O GLM-5.3-Flash foi a surpresa negativa: uma referência paga que ficou atrás dos três modelos grátis, com quatro estouros de tempo.

Entre os stealth, Fledge, Big Pickle e Space Bunny estão a uma ou duas tarefas um do outro. Com 14 tarefas, isso é empate técnico.

7. Bugs reais: o SWE-bench e a internet aberta

SWE-bench Verified Mini: bugs resolvidos

20 tarefas, teto de 3000 segundos, rede restrita ao gateway do modelo.

stealth grátisreferência paga
DeepSeek V4.1 Flash17 de 20
Space Bunny15 de 20
Fledge Alpha15 de 20
Big Pickle13 de 20
GLM-5.3-Flash12 de 20
Uma repetição. Cada tarefa vale 5 pontos percentuais. Nenhuma cópia do patch oficial encontrada na auditoria.

Essa é a parte que eu mais queria contar. Os bugs do SWE-bench são públicos, e a correção de cada um está no GitHub. Numa janela de duas horas em que a rede ficou aberta por engano meu, os agentes foram lá buscar. Em uma tarefa, as 44 linhas do patch oficial apareceram idênticas no patch do agente.

Descartei esses resultados e refiz tudo com a rede restrita: o agente só alcança o gateway do modelo. E aí veio o detalhe: os modelos continuaram tentando. Abriam o repositório no navegador interno, chamavam a API de issues, faziam busca na web. Dependendo do modelo, isso aconteceu em um quarto a dois terços das tarefas. Todas as tentativas foram bloqueadas, e a auditoria de similaridade com o patch oficial não achou cópia.

A lição vale pra qualquer benchmark que você ler por aí: um número de SWE-bench medido com a rede aberta não diz o que parece dizer.

8. O perfil de cada modelo

Big Pickle. O mais completo dos stealth em conhecimento e raciocínio, e o único que nunca deixou pergunta sem resposta. Nas tarefas com agente fica no meio no terminal e é o stealth mais fraco no SWE-Mini.

Space Bunny. Empata como melhor stealth no SWE-Mini, tem bom conhecimento (igual ao DeepSeek) e é o que mais trava em pergunta difícil: 35 questões do HLE sem resposta.

Fledge Alpha. Perfil de programador. Empata na frente no SciCode, é o segundo no Terminal-Bench e resolve 75% do SWE-Mini. Mas tem o pior conhecimento factual e também trava no HLE.

DeepSeek V4.1 Flash. A referência a bater. Ganha as duas provas com agente, empata na frente no SciCode, alucina menos e custa menos.

GLM-5.3-Flash. O mais caro e o mais fraco nas tarefas com agente.

9. O que esse teste não diz

É uma repetição só, com subconjuntos pequenos. Uma tarefa do Terminal-Bench vale 7 pontos percentuais e uma do SWE-Mini vale 5. A tabela separa faixas, não ordena modelos próximos.

As máquinas não foram as mesmas. O Fledge Alpha não é oferecido na Alemanha, onde fica o meu servidor, e eu não uso VPN pra contornar isso. As perguntas e o SWE-Mini dele rodaram numa máquina aqui no Brasil, e o Terminal-Bench numa máquina nos Estados Unidos. Parte do Space Bunny e as últimas tarefas do Big Pickle também rodaram fora do servidor. As regras, os tetos de tempo, a rede restrita e a auditoria foram os mesmos.

Modelo stealth muda sem aviso. O que eu medi é o que respondia por cada nome entre 2 e 4 de outubro de 2026.

E os números não são comparáveis aos do Artificial Analysis, que usa outros subconjuntos, outro harness e outro juiz.

10. Meu veredito

Pra trabalho com agente, nenhum dos três modelos grátis substitui a referência paga mais barata. O DeepSeek V4.1 Flash foi melhor no Terminal-Bench e no SWE-Mini e custou menos. Entre os grátis, o Fledge Alpha é o mais forte em código: lidera no Terminal-Bench e no SciCode e empata com o Space Bunny na correção de bugs.

Pra perguntas, o Big Pickle é o melhor dos cinco, pagos incluídos. E o Fledge Alpha não deve ser usado onde o fato importa.

Todos os números, com gráficos por teste, estão no Stealth Models Benchmark. Se você quer saber quanto cada harness cobra pelo mesmo modelo, esse é o assunto do comparativo entre OpenCode, Cline e Command Code.

11. Perguntas frequentes

O que é um modelo stealth?

É um modelo em preview anônimo e gratuito, que aparece no catálogo de um harness de código sem nome de fabricante e costuma sumir depois de algumas semanas. Big Pickle, Space Bunny e Fledge Alpha estavam no tier grátis do OpenCode no começo de outubro de 2026.

Qual é o melhor modelo stealth do OpenCode?

Depende do uso. Pra perguntas e raciocínio, o Big Pickle (índice +43 no Omniscience e 38% no HLE). Pra código, o Fledge Alpha (79% no Terminal-Bench, 52% no SciCode e 75% no SWE-Mini). O Space Bunny também resolve 75% do SWE-Mini.

Os modelos grátis são melhores que os pagos baratos?

Nas tarefas com agente, não. O DeepSeek V4.1 Flash resolveu 14 de 14 no Terminal-Bench e 17 de 20 no SWE-Mini, mais que qualquer stealth. Em conhecimento e raciocínio, o Big Pickle ficou na frente dos dois pagos.

Por que a rede fica restrita no SWE-bench?

Porque a correção de cada bug está pública no GitHub. Com a rede aberta, os agentes buscaram e copiaram o patch oficial. Com a rede restrita ao gateway do modelo, eles ainda tentaram, mas todas as tentativas foram bloqueadas.

Esses números são comparáveis aos do Artificial Analysis?

Não. A suíte usa subconjuntos menores, uma repetição, o OpenCode como harness e outro modelo-juiz. Ela serve pra comparar os modelos entre si, nas mesmas condições.

De graça eles são bons. Só não são melhores que o barato.

Abraços, Fellipe Soares

Leave a Reply

Your email address will not be published. Required fields are marked *