Saltar al contenido

Noticias de IA

El modelo de IA Jev está hecho para decidir, no para escribir prosa

El modelo de IA Jev devuelve probabilidades calibradas en vez de prosa, y ofrece a los desarrolladores una vía más barata para enrutamiento, controles de seguridad y clasificación.

Abstract software decision engine with branching paths, probability nodes, and glowing gates.
En esta página

La mayoría de productos de IA todavía tratan el lenguaje como la interfaz universal: envía un prompt, recibe texto, analiza el texto y cruza los dedos para que el análisis aguante. TechCrunch informó el 18 de septiembre de 2026 de que TypeSafe AI está probando otro camino con Jev, un modelo basado en transformers creado por Diogo Almeida, exinvestigador de OpenAI, que no produce prosa en absoluto. Produce probabilidades: lo que la empresa llama «decisiones calibradas».

Parece un pequeño cambio de interfaz. No lo es. Según TechCrunch, Almeida ayudó a crear ChatGPT y trabajó en aprendizaje por refuerzo con feedback humano; después dejó OpenAI dos años antes del reportaje para fundar TypeSafe AI. Su argumento es directo: los modelos se han vuelto muy buenos con el lenguaje humano, pero la automatización suele necesitar otra cosa. Los ordenadores no necesitan un párrafo encantador. Necesitan una decisión, una puntuación, una ruta, una puerta de sí o no, o una etiqueta de clase en la que el software pueda confiar lo suficiente como para actuar.

TypeSafe AI describe Jev como un nuevo modelo basado en transformers, pero no como un gran modelo de lenguaje. En lugar de generar tokens de texto, devuelve probabilidades sobre salidas que los desarrolladores definen de antemano. TechCrunch afirma que TypeSafe llama a estas salidas «decisiones calibradas».

Según el reportaje, ese diseño tiene tres consecuencias inmediatas.

Primero, el modelo se posiciona como una opción más barata y rápida que usar un LLM general para trabajos de clasificación. TechCrunch informa de que los tokens de salida de Jev son gratuitos y de que sus tokens de entrada se miden por miles de millones, no por millones.

Segundo, el espacio de salida está restringido. Si un desarrollador define de antemano las posibles salidas, el modelo no puede responder con un párrafo fluido pero inesperado. TechCrunch dice que TypeSafe presenta esto como una forma de evitar la alucinación. La versión práctica es más limitada: Jev puede seguir equivocándose, pero debería equivocarse dentro de un conjunto conocido de opciones, con una probabilidad asociada.

Tercero, esa probabilidad forma parte del producto, no es algo añadido a posteriori. Armin Ronacher, CTO de Earendil, dijo a TechCrunch que Jev «delega un poco el problema de la alucinación en el usuario». Si un resultado vuelve con un 50 %, la aplicación podría ignorarlo. Si vuelve con un 95 %, la aplicación podría actuar.

Esa distinción importa. Mucha automatización con IA no se rompe porque un modelo nunca sea útil, sino porque el software no puede saber cuándo el modelo simplemente está adivinando. Los desarrolladores a menudo intentan recuperar la confianza pidiendo a un LLM que se explique, que vote consigo mismo o que emita JSON estructurado. Jev se presenta como un modelo en el que la puntuación de confianza es el punto central.

Por qué los desarrolladores están prestando atención

Enlace a la sección: Por qué los desarrolladores están prestando atención

TechCrunch informa de que el interés de los desarrolladores fue lo bastante alto como para que TypeSafe AI perdiera brevemente la capacidad de atender a usuarios desde su API. El artículo sitúa el atractivo inicial de Jev en la automatización de software: desarrolladores que usan inteligencia dentro del código, no como interfaz de chat.

Dos ejemplos del reportaje muestran la forma de esa demanda.

Pranit Sharma, ingeniero de software en Vercel, dijo a TechCrunch que Vercel había utilizado un modelo de OpenAI para ejecutar un clasificador que revisaba comandos por seguridad. Cuando Vercel sustituyó Luna de OpenAI por Jev, Sharma afirmó que obtuvo resultados entre cinco y 18 veces más rápido y con mayor precisión.

Nikhil Mudholkar, CTO de Bryo AI, probó Jev frente a Gemini para clasificar correos empresariales, según TechCrunch. En su prueba, Gemini fue ligeramente más preciso, pero entre 10 y 20 veces más caro. Mudholkar destacó las puntuaciones de confianza de Jev y dijo que era «el único que devuelve una probabilidad real», lo que lo hacía útil para automatizar flujos de trabajo.

No son benchmarks amplios. Son pruebas de desarrolladores recogidas en el reportaje, en contextos concretos, con detalles controlados por quienes las ejecutaron. Pero apuntan a una categoría real: casos en los que el trabajo no es «escribe la respuesta», sino «elige la rama correcta».

Algunos ejemplos:

TareaLo que necesita el software
Revisión de seguridad de comandosPermitir, bloquear, escalar
Clasificación de correos empresarialesVentas, soporte, facturación, spam
Monitorización de agentesSeguro, sospechoso, intento de jailbreak
Enrutamiento de modelosModelo barato, modelo potente, revisión humana
Triaje de flujos de trabajoContinuar, reintentar, pedir aprobación

Muchos equipos resuelven hoy esto con prompts para LLM más salidas estructuradas. Ese enfoque puede funcionar, sobre todo si se combina con esquemas, reintentos y validación. Pero sigue gastando presupuesto de LLM en una tarea que quizá no requiera generación de lenguaje.

Si las primeras afirmaciones sobre Jev se sostienen fuera de los ejemplos que TechCrunch recoge, encaja en el mismo espacio de diseño práctico que las llamadas a herramientas y las salidas estructuradas: convertir el comportamiento del modelo en contratos que el software pueda consumir.

Uno de los usos más interesantes del reportaje de TechCrunch no es sustituir a los LLM, sino decidir cuándo usarlos.

Ronacher dijo a TechCrunch que Jev podría ser útil para el enrutamiento de modelos: predecir si una carga de trabajo determinada necesita un modelo concreto. Usar un LLM para tomar esa decisión puede salir caro. Un modelo más barato y rápido que devuelve una puntuación calibrada podría situarse delante de una pila de modelos y decidir adónde debe ir cada solicitud.

Es un problema conocido para cualquiera que construya con varios modelos. El modelo más potente no siempre es necesario. El modelo más barato no siempre es seguro. Algunos prompts necesitan razonamiento de contexto largo; otros necesitan un clasificador rápido; otros necesitan una imagen, voz o una herramienta de recuperación. Un router tiene que estimar el trabajo antes de gastar el presupuesto.

Aquí también es importante la forma de Jev. Un router no necesita un ensayo sobre por qué un prompt es difícil. Necesita una decisión como:

  • enviar a un modelo pequeño;
  • enviar a un modelo frontier;
  • recuperar documentos primero;
  • pedir aprobación humana;
  • rechazar por no ser seguro.

Eso se parece más a la estimación de probabilidades que a una conversación. El problema central del enrutamiento es práctico más que retórico: la parte valiosa suele ser elegir la capacidad adecuada al precio adecuado, no simplemente llamar al modelo más grande disponible.

Jev sugiere que el enrutamiento en sí puede convertirse en una carga de trabajo de IA con modelos especializados detrás.

Controles de seguridad sin otro agente completo

Enlace a la sección: Controles de seguridad sin otro agente completo

TechCrunch también informa de que Almeida ve Jev como una herramienta para monitorizar trazas de agentes LLM y evitar jailbreaks. El argumento de coste es sencillo. Si cada acción de un agente debe ser comprobada por otro LLM completo, la capa de seguridad puede volverse cara. Si un modelo de decisión más pequeño puede marcar comportamientos sospechosos de forma barata, más aplicaciones podrán permitirse una monitorización continua.

Esto no elimina las partes difíciles de la seguridad de agentes. Un clasificador necesita etiquetas bien definidas. Necesita ejemplos. Necesita umbrales. Necesita una política para lo que ocurre cuando la confianza es baja. Y si la acción es lo bastante sensible, una puntuación de probabilidad no debería sustituir al juicio humano.

Pero la arquitectura es limpia:

  1. un agente propone o da un paso;
  2. un modelo de decisión puntúa el paso;
  3. el sistema bloquea, permite, registra o escala;
  4. una persona revisa solo los casos que necesitan revisión humana.

Se parece mucho a cómo los sistemas de producción ya piensan sobre el riesgo. Los sistemas de pagos, fraude, spam y abuso suelen operar mediante umbrales y rutas de escalado. Los agentes de IA empiezan a necesitar el mismo patrón.

Para los equipos que crean flujos de trabajo autónomos, la lección no es «sustituye tu trabajo de seguridad por Jev». Es que la seguridad puede separarse de la generación. Puedes diseñar agentes que usen un modelo para actuar, otro modelo o clasificador para monitorizar, y una capa de aprobación humana para acciones irreversibles. El mismo principio aparece en las aprobaciones con intervención humana y en sistemas multiagente donde un componente comprueba a otro antes de que el trabajo continúe.

La arquitectura sigue siendo parcialmente opaca. TechCrunch dice que Almeida es «reservado» sobre el funcionamiento interno de Jev, mientras que observadores externos sospechan que está construido sobre un LLM de pesos abiertos. TypeSafe AI llama a Jev un «modelo System One»: un modelo optimizado para decisiones rápidas, similares a la intuición, en lugar de razonamiento explícito, con un diseño más estrecho ajustado a la tarea.

Almeida dijo a TechCrunch que Jev se entrena exclusivamente con datos sintéticos mediante una técnica que llama «aprendizaje por refuerzo a partir de decisiones calibradas». También dijo que TypeSafe AI apostó pronto por crear todos sus propios datos. Describió parte de la empresa como un laboratorio centrado en «datos sintéticos bien entendidos estadísticamente».

Hay suficiente para entender la tesis del producto, pero no para evaluar de forma independiente el método de entrenamiento. Por el reportaje de TechCrunch no sabemos cómo se mide la calibración, qué robustez tiene fuera de distribución, cómo gestiona el modelo entradas adversarias ni cómo cambia el rendimiento entre dominios.

Esas preguntas importan porque la probabilidad solo es útil cuando está calibrada. Si un modelo dice 95 % y acierta aproximadamente el 95 % de las veces en condiciones similares, los desarrolladores pueden construir políticas alrededor. Si el número es solo una salida con forma de confianza, se convierte en otra cosa que validar.

Una evaluación sensata probaría no solo la precisión, sino también curvas de calibración, comportamiento de abstención, rendimiento por umbral y coste con tráfico real. Para equipos que ya ejecutan evaluaciones de modelos, Jev pertenecería al mismo banco de pruebas que el LLM al que podría sustituir o monitorizar.

Jev toma su nombre de William Stanley Jevons, el economista del siglo XIX asociado a la paradoja de Jevons: cuando un recurso se vuelve más eficiente de usar, el consumo total puede subir en lugar de bajar. Almeida dijo a TechCrunch que TypeSafe AI espera que una inteligencia más barata dé lugar a «software inteligente por todas partes», más parecido al internet temprano que a un mundo dominado solo por «mega apps».

Esa es la tesis estratégica. Si la inteligencia se vuelve lo bastante barata como para colocarla dentro de flujos de control corrientes, los desarrolladores pueden dejar de reservar la IA para chatbots y grandes experiencias agénticas. En su lugar, pequeñas decisiones aparecen por todas partes: en colas, paneles de administración, flujos de atención al cliente, comprobaciones de despliegue, sistemas de mensajería y pipelines de datos.

Sería un cambio significativo. La interfaz de la era ChatGPT ha sido el chat. Jev apunta hacia la inferencia embebida: decisiones invisibles, estrechas y frecuentes que hacen que el software se adapte en tiempo real.

Para quienes construyen, el movimiento práctico es hacer inventario de los lugares donde ahora pides a un LLM general que haga un trabajo acotado. Clasificación, enrutamiento, extracción, ranking, moderación y escalado son los candidatos obvios. Algunos seguirán necesitando un LLM. Algunos quizá se gestionen mejor con reglas. Algunos pueden justificar un modelo de decisión especializado si la economía encaja.

Si tu flujo de trabajo implica procesar muchas filas, mensajes, tickets o eventos, la pregunta se vuelve más clara: ¿necesitas texto generado o necesitas una decisión fiable a escala? Es la misma línea económica que hay detrás del procesamiento por lotes con IA y de muchos sistemas de automatización en producción.

El dato importante no es que Jev sea «mejor que los LLM». El reportaje de TechCrunch no demuestra eso, y los ejemplos son demasiado estrechos para llegar a esa conclusión. El dato importante es que los desarrolladores están mostrando interés por un modelo diseñado para decisiones de software más que para conversación humana.

Eso debería cambiar cómo los equipos plantean la arquitectura de IA.

Usa LLM donde importen el lenguaje, el razonamiento, la síntesis y el uso de herramientas. Usa salidas estructuradas cuando necesites un contrato. Usa recuperación cuando la respuesta dependa de conocimiento privado o cambiante. Usa aprobación humana cuando las acciones sean sensibles. Y observa la clase emergente de modelos de decisión para los lugares donde las probabilidades son más útiles que la prosa.

Jev puede seguir siendo un producto especializado, o sus competidores pueden moverse en la misma dirección general. Ronacher dijo a TechCrunch que espera que otros lo sigan, pero eso no significa necesariamente clones directos de Jev; podría significar más sistemas construidos alrededor de decisiones estrechas basadas en probabilidades en lugar de generación de texto abierta. En cualquier caso, es una señal útil: la próxima ola de infraestructura de IA puede tratar menos de hacer que un modelo hable mejor y más de dar al software piezas de inteligencia más baratas, más pequeñas y más medibles.

La conclusión práctica tiene menos que ver con sustituir LLM y más con elegir la forma de modelo adecuada para cada decisión.

  • Jev se describe como un modelo basado en transformers que devuelve probabilidades sobre salidas predefinidas en lugar de generar prosa.
  • El modelo se presenta para decisiones de software acotadas como clasificación, enrutamiento, moderación, escalado y comprobaciones de seguridad.
  • Las pruebas de desarrolladores recogidas sugieren que Jev puede ser más rápido o barato que los LLM generales en algunos flujos de clasificación estrechos, pero no son benchmarks amplios.
  • Las probabilidades calibradas podrían ayudar a las aplicaciones a decidir cuándo actuar, abstenerse, escalar o llamar a un modelo más potente.
  • Los builders deberían evaluar sistemas tipo Jev con precisión, calibración, comportamiento por umbral, abstención, robustez y coste con tráfico real.

Estas preguntas cubren cómo funciona el modelo de IA Jev, en qué se diferencia de un LLM general y dónde pueden encajar las decisiones basadas en probabilidades en los sistemas de software. También resumen qué deberían evaluar los equipos antes de usar modelos tipo Jev en producción.

Jev es un modelo de TypeSafe AI que se describe como basado en transformers, pero no como un gran modelo de lenguaje. En lugar de escribir texto, devuelve probabilidades sobre salidas que los desarrolladores definen de antemano.

¿En qué se diferencia Jev de un gran modelo de lenguaje?

Enlace a la sección: ¿En qué se diferencia Jev de un gran modelo de lenguaje?

Un LLM general genera tokens de lenguaje, mientras que Jev está diseñado para elegir entre salidas predefinidas y adjuntar una probabilidad. Eso lo hace más adecuado para decisiones de software que para conversación abierta.

¿Por qué los desarrolladores están interesados en Jev?

Enlace a la sección: ¿Por qué los desarrolladores están interesados en Jev?

Los desarrolladores están interesados porque muchas cargas de trabajo de IA necesitan una rama, etiqueta o decisión de seguridad fiable en lugar de un párrafo. TechCrunch informó de pruebas iniciales en las que Jev fue más barato o rápido en casos de uso de clasificación concretos.

El artículo analiza casos de uso como la revisión de seguridad de comandos, la clasificación de correos empresariales, la monitorización de agentes, el enrutamiento de modelos, el triaje de flujos de trabajo y los controles de seguridad para agentes LLM.

¿Qué deberían evaluar los equipos antes de usar Jev?

Enlace a la sección: ¿Qué deberían evaluar los equipos antes de usar Jev?

Los equipos deberían probar más que la precisión. Deberían medir la calibración, el rendimiento por umbral, el comportamiento de abstención, la robustez fuera del dominio de entrenamiento, las entradas adversarias y el coste con tráfico real.


Creado por

David Vicente Campos

Fundador de NeuraLIA Labs y cofundador de MyRealFood

Soy ingeniero informático por la Universidad de León. Cofundé MyRealFood, donde como CTO construí la app que millones de personas han usado para comer mejor, y fundé NeuraLIA Labs, donde desarrollo productos de inteligencia artificial. Aquí escribo sobre lo que he tenido que entender por el camino, tal y como me habría gustado que me lo explicaran.

Más sobre el autor

Publicado por NeuraLIA Labs.

Recibe nuevas publicaciones en tu bandeja

Noticias de IA, guías y novedades del producto — un email breve cuando publiquemos algo que merezca tu tiempo.

Abstract agent runtime sorting documents, memory blocks and pointer nodes inside a bounded context frame.
context-engineering14 min de lectura

Ingeniería de contexto para agentes de IA de largo alcance

Los agentes de larga ejecución no fallan solo porque la ventana sea pequeña. Fallan cuando los archivos, las salidas de herramientas y el historial obsoleto desplazan la tarea que el agente debía terminar.

Abstract network of glowing AI agent nodes forming a recursive loop in a dark research setting.
ai safety14 min de lectura

Automejora recursiva: por qué preocupa a los investigadores de IA

La preocupación más seria en torno a la automejora recursiva no son las respuestas extrañas de un chatbot. Son agentes que coordinan, optimizan métricas y ayudan a construir los siguientes modelos, una inquietud reflejada en informes de WIRED, MIT Technology Review, CNBC y The Guardian.

¿Listo para dejar que elija LIA?

Crea con todos los modelos de IA en un mismo sitio. Empieza gratis hoy.