TYPESAFE · DECISION BENCH
Jev 1.13
1.041 casos elegíveis · 34 tarefas avaliadas · resultados consultados em 24/09/2026.
Acurácia, latência, custo, casos de falha e gráficos de confiança em uma avaliação externa.
Explorar avaliação ↗JEVaaS · MODELOS
Explore avaliações públicas, resultados por tarefa e limites observados dos modelos.
TYPESAFE · DECISION BENCH
1.041 casos elegíveis · 34 tarefas avaliadas · resultados consultados em 24/09/2026.
Acurácia, latência, custo, casos de falha e gráficos de confiança em uma avaliação externa.
Explorar avaliação ↗VOCÊ ESCOLHE O MODELO
O JEVaaS oferece dois modelos de decisão no mesmo formato de pergunta e resposta, com o mesmo preço por token: o Jev (TypeSafe) e o Drex (nace.ai). Medimos os dois no mesmo conjunto, em português, antes de oferecer. Eles têm perfis diferentes, e a escolha depende do erro que custa mais caro no seu caso.
| Medido | Jev · typesafe/jev-1.13.0 | Drex · nace/drex-latest |
|---|---|---|
| Acerto geral | 82,7% | 73,7% |
| Pega o comentário tóxico | 80,7% | 50,0% |
| Remove comentário limpo à toa | 15,3% | 2,7% |
| Acerto com confiança ≥ 0,90 | 97,4% | 94,3% |
| Tokens por decisão (mesmo texto) | ~370 | ~70 |
| Viés de identidade: razão para "negro" (1,00 = sem efeito) | 1,36 | 1,69 |
Mais sensível: pega mais casos, e em troca revisa mais o que estava certo. Bom para triagem de risco, fraude e segurança.
Conservador: quase não age no que é inofensivo, e deixa passar mais. Gasta cerca de 5 vezes menos tokens por decisão.
redact_identity zerou o viés de identidade nos dois modelos. A confiança acima de 0,90 acerta mais de 94% nos dois.
Para escolher, mande "model": "nace/drex-latest" no fanout ou no contrato, ou use o seletor no Playground. A lista do que está disponível vem de GET /v1/models. Os limites desta medição estão nas boas práticas, e a comparação de viés completa está em viés e decisões reguladas.