---
title: "Nove lugares para usar Jev no lugar de um LLM"
description: "O guia visual do ByteByteGo mapeia nove decisões que hoje pagam o preço de um LLM de fronteira — roteamento, guardrails, triagem, reranking, evals — e as fontes oficiais da TypeSafe explicam o modelo de decisões tipadas por trás delas."
canonical: "https://ronanrodrigo.dev/notes/jev-use-cases"
markdown: "https://ronanrodrigo.dev/notes/jev-use-cases.md"
last-updated: "2026-09-23"
---
## Top 9 lugares para usar Jev

O guia visual do ByteByteGo parte de uma constatação econômica: o Jev é o primeiro System One Model da TypeSafe AI e custa cerca de 100x menos que um LLM de fronteira em latência e dinheiro. Isso reabre casos de uso que normalmente são descartados por serem lentos ou caros demais para um modelo grande. Os nove lugares apontados são:

- **Roteamento de modelo:** o Jev lê o prompt e decide para qual LLM (pequeno, médio ou grande) ele deve ir.
- **Guardrails:** detectar injeção, abuso ou pedido fora de política antes de o texto chegar ao LLM.
- **Gating de tool calls:** classificar a chamada de ferramenta de um agente em uma categoria de permissão — permitir, perguntar ou negar.
- **Triagem de caixa de entrada:** separar volumes grandes de e-mail em responder agora, depois ou arquivar (1.500 e-mails ≈ 3 centavos).
- **Reranking:** pontuar passagens contra a consulta para ordená-las por relevância.
- **Evals de LLM:** julgar a saída de um LLM e devolver uma nota numa faixa, em vez de escrever uma análise.
- **Rotulagem em massa:** aplicar uma decisão sobre milhões de linhas de uma tabela grande, no estilo map-reduce.
- **Controle em tempo real:** loops que precisam de decisão a cada poucos milissegundos, como jogos, bots e trading.
- **Portão de confiança:** agir acima de 0,9, pedir confirmação entre 0,5 e 0,9 e chamar um humano abaixo disso — com o limiar definido pelo código, não pelo modelo.

A conclusão do autor é uma divisão de trabalho: o LLM gera, o Jev decide em volta.

[Post original com o guia visual](https://www.linkedin.com/posts/alexxubyte_systemdesign-coding-interviewtips-activity-7508552421099499521-ZNcC)

## A fonte primária: System One Models e o Jev

O anúncio da TypeSafe descreve a motivação em uma frase: modelos são sobre-humanos em conversa há anos, mas a automação não veio. O Jev foi treinado com RLCD (Reinforcement Learning for Calibrated Decisions), não com preferência humana, e abre mão de gerar strings: entra estado não estruturado, saem valores tipados e probabilidades calibradas. Sem texto, não há parsing, e a empresa afirma que erros de tipo são impossíveis por construção.

Números publicados: entrada a US$ 0,042 por milhão de tokens, saída gratuita, resposta entre 70 ms e 500 ms — contra 3 a 329 segundos dos modelos de fronteira. A calibração é o argumento central: confiança mais alta significa acurácia mais alta, o que é pré-requisito para automatizar de fato uma tarefa.

[Introducing System One Models and Jev](https://typesafe.ai/blog/introducing-system-one-models-and-jev)

## Primitivas tipadas e composição em código

A documentação reduz a API a três primitivas, cada uma com um tipo de pergunta e um tipo de resposta: Choice (escolher uma opção de uma lista e devolver a distribuição de probabilidades), Score (nota em uma rubrica) e Noul (a afirmação é verdadeira? resposta entre 0 e 1). As três podem ser misturadas numa única chamada, avaliadas em paralelo e em isolamento sobre o mesmo estado — adicionar perguntas quase não muda o tempo de resposta.

A orientação de arquitetura é decompor: em vez de pedir "avalie este pitch", perguntar separadamente sobre mercado, viabilidade técnica e diferenciação, e combinar os resultados com lógica no código. Quando a prioridade muda, muda-se um coeficiente em vez de reescrever um prompt.

[Documentação da TypeSafe](https://docs.typesafe.ai/introduction)

## Workflow evals: estrutura ganha de prompt

A TypeSafe publicou uma avaliação de workflows em que todos os modelos rodam o mesmo código, com as decisões decompostas em perguntas Noul, Choice e Score, e o resultado comparado à média dos modelos mais caros usados como referência. Quatro tarefas servem de base: incidentes de segurança, observabilidade de traços de agente, processamento de faturas e atendimento ao cliente.

O achado reportado é duplo: a mesma política escrita como workflow é mais precisa, mais barata e mais rápida em todos os modelos, e o Jev aparece sozinho na fronteira de Pareto ao longo de quase duas ordens de magnitude.

[Workflow evals](https://evals.typesafe.ai/)
