Naar inhoud springen

AI-nieuws

Jev AI-model is gebouwd voor beslissingen, niet voor proza

Het Jev AI-model geeft gekalibreerde waarschijnlijkheden terug in plaats van proza, waardoor developers goedkoper kunnen routeren, guardrails bouwen en classificeren.

Abstract software decision engine with branching paths, probability nodes, and glowing gates.
Op deze pagina

De meeste AI-producten behandelen taal nog steeds als de universele interface: stuur een prompt, ontvang tekst, parse de tekst en hoop dat die parse standhoudt. TechCrunch meldde op 18 september 2026 dat TypeSafe AI met Jev een andere route probeert: een op transformers gebaseerd model van voormalig OpenAI-onderzoeker Diogo Almeida dat helemaal geen proza uitvoert. Het geeft waarschijnlijkheden terug: wat het bedrijf ‘gekalibreerde beslissingen’ noemt.

Dat klinkt als een kleine interfacewijziging. Dat is het niet. Volgens TechCrunch hielp Almeida mee aan de bouw van ChatGPT en werkte hij aan reinforcement learning from human feedback, waarna hij OpenAI twee jaar vóór het rapport verliet om TypeSafe AI op te richten. Zijn argument is helder: modellen zijn heel goed geworden in menselijke taal, maar automatisering heeft vaak iets anders nodig. Computers hebben geen charmante alinea nodig. Ze hebben een beslissing, een score, een route, een ja-of-nee-poort of een klasselabel nodig dat software genoeg kan vertrouwen om erop te handelen.

TypeSafe AI beschrijft Jev als een nieuw op transformers gebaseerd model, maar niet als een large language model. In plaats van teksttokens te genereren, geeft het waarschijnlijkheden terug over outputs die developers vooraf definiëren. TechCrunch zegt dat TypeSafe deze outputs ‘gekalibreerde beslissingen’ noemt.

Volgens het rapport heeft dat ontwerp drie directe gevolgen.

Ten eerste wordt het model gepositioneerd als goedkoper en sneller dan het gebruik van een algemene LLM voor classificatieachtig werk. TechCrunch meldt dat Jev’s outputtokens gratis zijn en dat inputtokens per miljard worden afgerekend, niet per miljoen.

Ten tweede is de outputruimte begrensd. Als een developer de mogelijke outputs vooraf definieert, kan het model niet antwoorden met een vloeiende maar onverwachte alinea. TechCrunch zegt dat TypeSafe dit presenteert als een manier om hallucinaties te vermijden. De praktische versie is smaller: Jev kan nog steeds fout zitten, maar zou fout moeten zitten binnen een bekende set keuzes, met een waarschijnlijkheid eraan gekoppeld.

Ten derde is die waarschijnlijkheid onderdeel van het product, geen bijzaak. Armin Ronacher, CTO van Earendil, vertelde TechCrunch dat Jev ‘het hallucinatieprobleem een klein beetje aan de gebruiker delegeert’. Als een resultaat terugkomt met 50%, kan de applicatie het negeren. Komt het terug met 95%, dan kan de applicatie actie ondernemen.

Dat onderscheid is belangrijk. Veel AI-automatisering breekt niet omdat een model nooit nuttig is, maar omdat software niet kan zien wanneer het model slechts gokt. Developers proberen vertrouwen vaak terug te winnen door een LLM te vragen zichzelf uit te leggen, met zichzelf te stemmen of gestructureerde JSON uit te voeren. Jev wordt gepitcht als een model waarbij de vertrouwensscore juist het punt is.

TechCrunch meldt dat de interesse van developers zo groot was dat TypeSafe AI kortstondig niet langer gebruikers via zijn API kon bedienen. Het artikel plaatst Jev’s vroege aantrekkingskracht rond softwareautomatisering: developers die intelligentie in code gebruiken, niet als chatinterface.

Twee voorbeelden in het rapport laten zien hoe die vraag eruitziet.

Pranit Sharma, software-engineer bij Vercel, vertelde TechCrunch dat Vercel een OpenAI-model had gebruikt voor een classifier die commando’s op veiligheid beoordeelde. Toen Vercel OpenAI’s Luna verving door Jev, zei Sharma dat het vijf tot 18 keer sneller resultaten kreeg en met hogere nauwkeurigheid.

Nikhil Mudholkar, CTO van Bryo AI, testte Jev volgens TechCrunch tegen Gemini voor het classificeren van zakelijke e-mails. In zijn test was Gemini iets nauwkeuriger, maar 10 tot 20 keer duurder. Mudholkar benadrukte Jev’s vertrouwensscores en zei dat het ‘de enige was die een echte waarschijnlijkheid teruggeeft’, waardoor het bruikbaar was voor het automatiseren van workflows.

Dat zijn geen brede benchmarks. Het zijn gerapporteerde developertests, in specifieke settings, met details die worden bepaald door de mensen die ze uitvoeren. Maar ze wijzen op een echte categorie: gevallen waarin de taak niet ‘schrijf het antwoord’ is, maar ‘kies de juiste vertakking’.

Voorbeelden zijn:

TaakWat de software nodig heeft
Veiligheidscontrole van commando’sToestaan, blokkeren, escaleren
Classificatie van zakelijke e-mailsSales, support, facturatie, spam
AgentmonitoringVeilig, verdacht, jailbreakpoging
ModelrouteringGoedkoop model, sterk model, menselijke review
WorkflowtriageDoorgaan, opnieuw proberen, om goedkeuring vragen

Veel teams lossen dit nu op met LLM-prompts plus gestructureerde outputs. Die aanpak kan werken, vooral in combinatie met schema’s, retries en validatie. Maar er wordt nog steeds LLM-budget uitgegeven aan een taak die mogelijk geen taalgeneratie vereist.

Als Jev’s vroege claims buiten de voorbeelden blijven staan die TechCrunch rapporteerde, past het in dezelfde praktische ontwerpruimte als tool calling en gestructureerde outputs: modelgedrag omzetten in contracten die software kan gebruiken.

Een van de interessantste toepassingen in het rapport van TechCrunch is niet het vervangen van LLM’s, maar bepalen wanneer je ze gebruikt.

Ronacher vertelde TechCrunch dat Jev nuttig kan zijn voor modelroutering: voorspellen of een bepaalde workload een specifiek model nodig heeft. Een LLM gebruiken om die beslissing te nemen kan duur zijn. Een goedkoper, sneller model dat een gekalibreerde score teruggeeft, kan vóór een modelstack staan en bepalen waar elk verzoek naartoe moet.

Dat is een vertrouwd probleem voor iedereen die met meerdere modellen bouwt. Het sterkste model is niet altijd nodig. Het goedkoopste model is niet altijd veilig. Sommige prompts hebben redeneren met lange context nodig; andere hebben een snelle classifier nodig; weer andere hebben een afbeelding, stem of retrieval-tool nodig. Een router moet de taak inschatten voordat het budget wordt uitgegeven.

Ook hier is Jev’s vorm belangrijk. Een router heeft geen essay nodig over waarom een prompt moeilijk is. Hij heeft een beslissing nodig zoals:

  • stuur naar een klein model;
  • stuur naar een frontier-model;
  • haal eerst documenten op;
  • vraag om menselijke goedkeuring;
  • wijs af als onveilig.

Dat ligt dichter bij waarschijnlijkheidsinschatting dan bij gesprek. Het kernprobleem van routering is praktisch in plaats van retorisch: de waarde zit vaak in het kiezen van de juiste capaciteit tegen de juiste prijs, niet simpelweg in het aanroepen van het grootste beschikbare model.

Jev suggereert dat routering zelf een AI-workload kan worden met gespecialiseerde modellen erachter.

TechCrunch meldt ook dat Almeida Jev ziet worden gebruikt om traces van LLM-agents te monitoren en jailbreaks te voorkomen. Het kostenargument is eenvoudig. Als elke agentactie door nog een volledige LLM moet worden gecontroleerd, kan de veiligheidslaag duur worden. Als een kleiner beslissingsmodel verdacht gedrag goedkoop kan markeren, kunnen meer applicaties zich continue monitoring veroorloven.

Dit haalt de moeilijke onderdelen van agentveiligheid niet weg. Een classifier heeft goed gedefinieerde labels nodig. Hij heeft voorbeelden nodig. Hij heeft drempels nodig. Hij heeft beleid nodig voor wat er gebeurt wanneer het vertrouwen laag is. En als de actie gevoelig genoeg is, mag een waarschijnlijkheidsscore menselijk oordeel niet vervangen.

Maar de architectuur is helder:

  1. een agent stelt een stap voor of voert die uit;
  2. een beslissingsmodel scoort de stap;
  3. het systeem blokkeert, staat toe, logt of escaleert;
  4. een mens beoordeelt alleen de gevallen die menselijke review nodig hebben.

Dat ligt dicht bij hoe productiesystemen al over risico nadenken. Betalingssystemen, fraudedetectiesystemen, spamsystemen en misbruiksystemen werken vaak met drempels en escalatiepaden. AI-agents beginnen hetzelfde patroon nodig te hebben.

Voor teams die autonome workflows bouwen, is de les niet ‘vervang je veiligheidswerk door Jev’. Het is dat veiligheid kan worden gescheiden van generatie. Je kunt agents ontwerpen die één model gebruiken om te handelen, een ander model of een classifier om te monitoren, en een laag voor menselijke goedkeuring voor onomkeerbare acties. Hetzelfde principe zie je terug in human-in-the-loop-goedkeuringen en in multi-agentsystemen waarin één component een andere controleert voordat het werk doorgaat.

De architectuur blijft deels ondoorzichtig. TechCrunch zegt dat Almeida ‘weinig loslaat’ over Jev’s interne werking, terwijl externe waarnemers vermoeden dat het is gebouwd bovenop een open-weight LLM. TypeSafe AI noemt Jev een ‘System One-model’: een model dat is geoptimaliseerd voor snelle, intuïtieachtige beslissingen in plaats van expliciet redeneren, met een smaller ontwerp dat bij de taak past.

Almeida vertelde TechCrunch dat Jev uitsluitend wordt getraind op synthetische data met een techniek die hij ‘reinforcement learning from calibrated decisions’ noemt. Hij zei ook dat TypeSafe AI vroeg inzette op het maken van al zijn eigen data. Hij omschreef een deel van het bedrijf als een lab dat gericht is op ‘statistisch goed begrepen synthetische data’.

Daarmee is er genoeg om de productthese te begrijpen, maar niet genoeg om de trainingsmethode onafhankelijk te beoordelen. Uit het TechCrunch-rapport weten we niet hoe kalibratie wordt gemeten, hoe robuust die buiten de distributie is, hoe het model omgaat met adversarial inputs of hoe prestaties per domein veranderen.

Die vragen zijn belangrijk, omdat waarschijnlijkheid alleen nuttig is wanneer die gekalibreerd is. Als een model 95% zegt en onder vergelijkbare omstandigheden ongeveer 95% van de tijd gelijk heeft, kunnen developers er beleid omheen bouwen. Als het getal alleen maar een output in de vorm van vertrouwen is, wordt het weer iets dat gevalideerd moet worden.

Een zinnige evaluatie zou niet alleen nauwkeurigheid testen, maar ook kalibratiecurves, onthoudingsgedrag, drempelprestaties en kosten onder echt verkeer. Voor teams die al modelevaluaties draaien, hoort Jev in dezelfde testopstelling als de LLM die het mogelijk vervangt of monitort.

Jev is genoemd naar William Stanley Jevons, de 19e-eeuwse econoom die wordt geassocieerd met de Jevons-paradox: wanneer een hulpbron efficiënter wordt om te gebruiken, kan het totale verbruik stijgen in plaats van dalen. Almeida vertelde TechCrunch dat TypeSafe AI verwacht dat goedkopere intelligentie leidt tot ‘slimme software overal’, meer zoals het vroege internet dan een wereld die alleen wordt gedomineerd door ‘mega-apps’.

Dat is de strategische claim. Als intelligentie goedkoop genoeg wordt om in gewone control flow te plaatsen, reserveren developers AI misschien niet langer voor chatbots en grote agentic ervaringen. In plaats daarvan verschijnen overal kleine beslissingen: in wachtrijen, adminpanelen, klantenserviceworkflows, deploymentchecks, berichtensystemen en datapipelines.

Dat zou een betekenisvolle verschuiving zijn. De interface van het ChatGPT-tijdperk was chat. Jev wijst richting embedded inference: onzichtbare, smalle, frequente beslissingen die software in realtime laten aanpassen.

Voor bouwers is de praktische stap om te inventariseren waar je nu een algemene LLM vraagt om een begrensde taak te doen. Classificatie, routering, extractie, ranking, moderatie en escalatie zijn de voor de hand liggende kandidaten. Sommige hebben misschien nog steeds een LLM nodig. Sommige kunnen beter met regels worden afgehandeld. Sommige rechtvaardigen misschien een gespecialiseerd beslissingsmodel als de economische logica klopt.

Als je workflow veel rijen, berichten, tickets of events verwerkt, wordt de vraag scherper: heb je gegenereerde tekst nodig, of heb je een betrouwbare beslissing op schaal nodig? Dat is dezelfde economische lijn achter AI-batchverwerking en veel productie-automatiseringssystemen.

Het belangrijke feit is niet dat Jev ‘beter is dan LLM’s’. Het TechCrunch-rapport toont dat niet aan, en de voorbeelden zijn te smal voor die conclusie. Het belangrijke feit is dat developers interesse tonen in een model dat is gevormd voor softwarebeslissingen in plaats van menselijke conversatie.

Dat zou moeten veranderen hoe teams AI-architectuur framen.

Gebruik LLM’s waar taal, redeneren, synthese en toolgebruik belangrijk zijn. Gebruik gestructureerde outputs wanneer je een contract nodig hebt. Gebruik retrieval wanneer het antwoord afhangt van private of veranderende kennis. Gebruik menselijke goedkeuring wanneer acties gevoelig zijn. En volg de opkomende klasse beslissingsmodellen voor plekken waar waarschijnlijkheden nuttiger zijn dan proza.

Jev kan een gespecialiseerd product blijven, of concurrenten kunnen dezelfde algemene richting op gaan. Ronacher vertelde TechCrunch dat hij verwacht dat anderen volgen, maar dat betekent niet per se directe Jev-klonen; het kan ook meer systemen betekenen die zijn gebouwd rond smalle, waarschijnlijkheidsgebaseerde beslissingen in plaats van open tekstgeneratie. Hoe dan ook is het een nuttig signaal: de volgende golf AI-infrastructuur draait misschien minder om één model beter laten praten, en meer om software goedkopere, kleinere en beter meetbare stukjes intelligentie te geven.

De praktische conclusie gaat minder over het vervangen van LLM’s en meer over het kiezen van de juiste modelvorm voor elke beslissing.

  • Jev wordt beschreven als een op transformers gebaseerd model dat waarschijnlijkheden over vooraf gedefinieerde outputs teruggeeft in plaats van proza te genereren.
  • Het model wordt gepitcht voor begrensde softwarebeslissingen zoals classificatie, routering, moderatie, escalatie en veiligheidschecks.
  • Gerapporteerde developertests suggereren dat Jev in sommige smalle classificatieworkflows sneller of goedkoper kan zijn dan algemene LLM’s, maar dat zijn geen brede benchmarks.
  • Gekalibreerde waarschijnlijkheden kunnen applicaties helpen beslissen wanneer ze moeten handelen, zich onthouden, escaleren of een sterker model aanroepen.
  • Bouwers moeten Jev-achtige systemen evalueren op nauwkeurigheid, kalibratie, drempelgedrag, onthouding, robuustheid en kosten onder echt verkeer.

Deze vragen behandelen hoe het Jev AI-model werkt, hoe het verschilt van een algemene LLM en waar waarschijnlijkheidsgebaseerde beslissingen in softwaresystemen passen. Ze schetsen ook wat teams moeten evalueren voordat ze Jev-achtige modellen in productie gebruiken.

Jev is een model van TypeSafe AI dat wordt beschreven als op transformers gebaseerd, maar niet als een large language model. In plaats van tekst te schrijven, geeft het waarschijnlijkheden terug over outputs die developers vooraf definiëren.

Waarin verschilt Jev van een large language model?

Link naar de sectie: Waarin verschilt Jev van een large language model?

Een algemene LLM genereert taaltokens, terwijl Jev is ontworpen om te kiezen tussen vooraf gedefinieerde outputs en daar een waarschijnlijkheid aan te koppelen. Daardoor is het geschikter voor softwarebeslissingen dan voor open gesprekken.

Waarom zijn developers geïnteresseerd in Jev?

Link naar de sectie: Waarom zijn developers geïnteresseerd in Jev?

Developers zijn geïnteresseerd omdat veel AI-workloads een betrouwbare vertakking, label of veiligheidsbeslissing nodig hebben in plaats van een alinea. TechCrunch rapporteerde vroege tests waarin Jev goedkoper of sneller was in specifieke classificatie-usecases.

Het artikel bespreekt usecases zoals veiligheidscontrole van commando’s, classificatie van zakelijke e-mails, agentmonitoring, modelroutering, workflowtriage en guardrails voor LLM-agents.

Wat moeten teams evalueren voordat ze Jev gebruiken?

Link naar de sectie: Wat moeten teams evalueren voordat ze Jev gebruiken?

Teams moeten meer testen dan nauwkeurigheid. Ze moeten kalibratie, drempelprestaties, onthoudingsgedrag, robuustheid buiten het trainingsdomein, adversarial inputs en kosten onder echt verkeer meten.


Gemaakt door

David Vicente Campos

Oprichter van NeuraLIA Labs en medeoprichter van MyRealFood

Ik ben informatica-ingenieur, afgestudeerd aan de Universiteit van León. Ik was medeoprichter van MyRealFood, waar ik als CTO de app bouwde die miljoenen mensen hebben gebruikt om beter te eten, en ik heb NeuraLIA Labs opgericht, waar ik AI-producten bouw. Hier schrijf ik over wat ik onderweg heb moeten begrijpen, zoals ik wou dat iemand het mij had uitgelegd.

Meer over de auteur

Gepubliceerd door NeuraLIA Labs.

Ontvang nieuwe posts in je inbox

AI-nieuws, gidsen en productupdates — een korte mail wanneer we iets publiceren dat je tijd waard is.

Abstract agent runtime sorting documents, memory blocks and pointer nodes inside a bounded context frame.
context-engineering11 min leestijd

Context-engineering voor langlopende AI-agenten

Langlopende agenten falen niet alleen omdat het venster klein is. Ze falen wanneer bestanden, tool-outputs en verouderde geschiedenis de taak verdringen die de agent moest afronden.

Abstract network of glowing AI agent nodes forming a recursive loop in a dark research setting.
ai safety11 min leestijd

Recursieve zelfverbetering: waarom AI-onderzoekers zich zorgen maken

De scherpere zorg rond recursieve zelfverbetering gaat niet over vreemde chatbot-antwoorden. Het gaat om agenten die coördineren, metrics optimaliseren en helpen de volgende modellen te bouwen — een zorg die terugkomt in berichtgeving van WIRED, MIT Technology Review, CNBC en The Guardian.

Klaar om LIA te laten kiezen?

Bouw met elk AI-model op één plek — begin vandaag nog gratis.