Spring til indhold

AI-nyheder

Jev AI-modellen er bygget til beslutninger, ikke prosa

Jev AI-modellen returnerer kalibrerede sandsynligheder i stedet for prosa og giver udviklere en billigere vej til routing, sikkerhedsbarrierer og klassificering.

Abstract software decision engine with branching paths, probability nodes, and glowing gates.
På denne side

De fleste AI-produkter behandler stadig sprog som den universelle grænseflade: send en prompt, modtag tekst, parse teksten, og håb, at parsingen holder. TechCrunch rapporterede den 18. september 2026, at TypeSafe AI forsøger sig med en anden vej med Jev, en transformer-baseret model fra den tidligere OpenAI-forsker Diogo Almeida, som slet ikke outputter prosa. Den outputter sandsynligheder: det, virksomheden kalder »kalibrerede beslutninger«.

Det lyder som en lille ændring i grænsefladen. Det er det ikke. Ifølge TechCrunch var Almeida med til at bygge ChatGPT og arbejdede med reinforcement learning from human feedback, før han forlod OpenAI to år før rapporten for at starte TypeSafe AI. Hans argument er kontant: Modeller er blevet meget gode til menneskeligt sprog, men automatisering har ofte brug for noget andet. Computere har ikke brug for et charmerende afsnit. De har brug for en beslutning, en score, en rute, en ja-eller-nej-port eller en klasseetiket, som software kan stole nok på til at handle ud fra.

Jev beskrives af TypeSafe AI som en ny transformer-baseret model, men ikke en stor sprogmodel. I stedet for at generere tekst-tokens returnerer den sandsynligheder over outputs, som udviklere definerer på forhånd. TechCrunch siger, at TypeSafe kalder disse outputs »kalibrerede beslutninger«.

Ifølge rapporten har det design tre umiddelbare konsekvenser.

For det første positioneres modellen som billigere og hurtigere end at bruge en generel LLM til klassificeringsopgaver. TechCrunch rapporterer, at Jevs output-tokens er gratis, og at dens input-tokens afregnes pr. milliard, ikke pr. million.

For det andet er output-rummet begrænset. Hvis en udvikler definerer de mulige outputs på forhånd, kan modellen ikke svare med et flydende, men uventet afsnit. TechCrunch siger, at TypeSafe fremstiller dette som en måde at undgå hallucination på. Den praktiske version er mere snæver: Jev kan stadig tage fejl, men den bør tage fejl inden for et kendt sæt valgmuligheder, med en sandsynlighed knyttet til svaret.

For det tredje er sandsynligheden en del af produktet, ikke en eftertanke. Armin Ronacher, CTO hos Earendil, fortalte TechCrunch, at Jev »delegerer hallucinationsproblemet en lille smule til brugeren«. Hvis et resultat kommer tilbage med 50 %, kan applikationen ignorere det. Hvis det kommer tilbage med 95 %, kan applikationen handle.

Den forskel betyder noget. Meget AI-automatisering går ikke i stykker, fordi en model aldrig er nyttig, men fordi software ikke kan se, hvornår modellen bare gætter. Udviklere forsøger ofte at genvinde tillid ved at bede en LLM forklare sig selv, stemme med sig selv eller udsende struktureret JSON. Jev præsenteres som en model, hvor tillidsscoren er selve pointen.

TechCrunch rapporterer, at udviklerinteressen var høj nok til, at TypeSafe AI kortvarigt mistede evnen til at betjene brugere fra sin API. Artiklen rammesætter Jevs tidlige appel omkring softwareautomatisering: udviklere, der bruger intelligens inde i kode, ikke som en chatgrænseflade.

To eksempler i rapporten viser formen på den efterspørgsel.

Pranit Sharma, softwareingeniør hos Vercel, fortalte TechCrunch, at Vercel havde brugt en OpenAI-model til at køre en klassifikator, der gennemgik kommandoer for sikkerhed. Da Vercel erstattede OpenAI’s Luna med Jev, sagde Sharma, at de fik resultater fem til 18 gange hurtigere og med højere nøjagtighed.

Nikhil Mudholkar, CTO hos Bryo AI, testede ifølge TechCrunch Jev mod Gemini til klassificering af forretningsmails. I hans test var Gemini en smule mere nøjagtig, men 10 til 20 gange dyrere. Mudholkar fremhævede Jevs tillidsscorer og sagde, at det var »den eneste, der giver en reel sandsynlighed tilbage«, hvilket gjorde den nyttig til at automatisere workflows.

Det er ikke brede benchmarks. Det er rapporterede udviklertests i specifikke miljøer, med detaljer kontrolleret af dem, der kørte testene. Men de peger på en reel kategori: tilfælde, hvor opgaven ikke er »skriv svaret«, men »vælg den rigtige gren«.

Eksempler omfatter:

OpgaveHvad softwaren har brug for
Sikkerhedsgennemgang af kommandoerTillad, bloker, eskaler
Klassificering af forretningsmailsSalg, support, fakturering, spam
AgentovervågningSikker, mistænkelig, jailbreak-forsøg
ModelroutingBillig model, stærk model, menneskelig gennemgang
Workflow-triageFortsæt, prøv igen, bed om godkendelse

Mange teams løser i dag dette med LLM-prompts plus strukturerede outputs. Den tilgang kan fungere, især når den kombineres med skemaer, retries og validering. Men den bruger stadig LLM-budget på en opgave, der måske ikke kræver sproggenerering.

Hvis Jevs tidlige påstande holder uden for de eksempler, TechCrunch rapporterede, passer den ind i det samme praktiske designrum som værktøjskald og strukturerede outputs: at gøre modeladfærd til kontrakter, som software kan forbruge.

En af de mest interessante anvendelser i TechCrunchs rapport er ikke at erstatte LLM’er, men at beslutte, hvornår de skal bruges.

Ronacher fortalte TechCrunch, at Jev kunne være nyttig til modelrouting: at forudsige, om en given workload har brug for en specifik model. At bruge en LLM til at træffe den beslutning kan være dyrt. En billigere og hurtigere model, der returnerer en kalibreret score, kunne ligge foran en modelstack og beslutte, hvor hver forespørgsel skal sendes hen.

Det er et velkendt problem for alle, der bygger med flere modeller. Den stærkeste model er ikke altid nødvendig. Den billigste model er ikke altid sikker. Nogle prompts kræver ræsonnement med lang kontekst; andre kræver en hurtig klassifikator; andre kræver et billede, en stemme eller et retrieval-værktøj. En router skal estimere opgaven, før budgettet bruges.

Det er også her, Jevs form er vigtig. En router har ikke brug for et essay om, hvorfor en prompt er svær. Den har brug for en beslutning som:

  • send til en lille model;
  • send til en frontier-model;
  • hent dokumenter først;
  • bed om menneskelig godkendelse;
  • afvis som usikker.

Det er tættere på sandsynlighedsestimering end samtale. Det centrale routingproblem er praktisk snarere end retorisk: Den værdifulde del er ofte at vælge den rigtige kapabilitet til den rigtige pris, ikke bare at kalde den største tilgængelige model.

Jev antyder, at routing i sig selv kan blive en AI-workload med specialiserede modeller bag sig.

Sikkerhedsbarrierer uden endnu en fuld agent

Link til afsnittet: Sikkerhedsbarrierer uden endnu en fuld agent

TechCrunch rapporterer også, at Almeida ser Jev blive brugt til at overvåge traces fra LLM-agenter og forhindre jailbreaks. Omkostningsargumentet er ligetil. Hvis hver agenthandling skal tjekkes af endnu en fuld LLM, kan sikkerhedslaget blive dyrt. Hvis en mindre beslutningsmodel billigt kan markere mistænkelig adfærd, får flere applikationer råd til kontinuerlig overvågning.

Det fjerner ikke de svære dele af agentsikkerhed. En klassifikator har brug for veldefinerede etiketter. Den har brug for eksempler. Den har brug for tærskler. Den har brug for en politik for, hvad der sker, når tilliden er lav. Og hvis handlingen er følsom nok, bør en sandsynlighedsscore ikke erstatte menneskelig dømmekraft.

Men arkitekturen er ren:

  1. en agent foreslår eller tager et skridt;
  2. en beslutningsmodel scorer skridtet;
  3. systemet blokerer, tillader, logger eller eskalerer;
  4. et menneske gennemgår kun de tilfælde, der kræver menneskelig gennemgang.

Det er tæt på, hvordan produktionssystemer allerede tænker om risiko. Betalingssystemer, svindelsystemer, spamsystemer og misbrugssystemer opererer ofte gennem tærskler og eskaleringsveje. AI-agenter begynder at have brug for det samme mønster.

For teams, der bygger autonome workflows, er læren ikke »erstat jeres sikkerhedsarbejde med Jev«. Det er, at sikkerhed kan adskilles fra generering. Du kan designe agenter, der bruger én model til at handle, en anden model eller klassifikator til at overvåge og et lag med menneskelig godkendelse til irreversible handlinger. Det samme princip ses i godkendelser med menneske i løkken og i multi-agent-systemer, hvor én komponent tjekker en anden, før arbejdet fortsætter.

Arkitekturen er stadig delvist uigennemsigtig. TechCrunch siger, at Almeida er »fåmælt« om Jevs indre mekanismer, mens eksterne observatører mistænker, at den er bygget oven på en open-weight LLM. TypeSafe AI kalder Jev en »System One-model«: en model optimeret til hurtige, intuitionslignende beslutninger snarere end eksplicit ræsonnement, med et smallere design tilpasset opgaven.

Almeida fortalte TechCrunch, at Jev udelukkende trænes på syntetiske data ved hjælp af en teknik, han kalder »reinforcement learning from calibrated decisions«. Han sagde også, at TypeSafe AI tidligt satsede på at lave alle sine egne data. Han beskrev en del af virksomheden som et laboratorium med fokus på »statistisk velforståede syntetiske data«.

Der er nok til at forstå produktets tese, men ikke nok til uafhængigt at vurdere træningsmetoden. Ud fra TechCrunch-rapporten ved vi ikke, hvordan kalibrering måles, hvor robust den er uden for distributionen, hvordan modellen håndterer adversarial inputs, eller hvordan performance ændrer sig på tværs af domæner.

De spørgsmål betyder noget, fordi sandsynlighed kun er nyttig, når den er kalibreret. Hvis en model siger 95 % og har ret omtrent 95 % af tiden under lignende forhold, kan udviklere bygge politikker omkring den. Hvis tallet bare er et output formet som tillid, bliver det endnu en ting, der skal valideres.

En fornuftig evaluering ville ikke kun teste nøjagtighed, men også kalibreringskurver, abstentionsadfærd, tærskelperformance og omkostninger under reel trafik. For teams, der allerede kører modelevalueringer, hører Jev hjemme i den samme testramme som den LLM, den måske skal erstatte eller overvåge.

Jev er opkaldt efter William Stanley Jevons, økonomen fra det 19. århundrede, der forbindes med Jevons paradoks: Når en ressource bliver mere effektiv at bruge, kan det samlede forbrug stige i stedet for at falde. Almeida fortalte TechCrunch, at TypeSafe AI forventer, at billigere intelligens vil føre til »smart software overalt«, mere som det tidlige internet end en verden domineret udelukkende af »mega-apps«.

Det er den strategiske påstand. Hvis intelligens bliver billig nok til at placere inde i almindelige kontrolflows, kan udviklere holde op med at reservere AI til chatbots og store agentbaserede oplevelser. I stedet dukker små beslutninger op overalt: i køer, administrationspaneler, kundesupport-workflows, deployment-tjek, beskedsystemer og datapipelines.

Det ville være et meningsfuldt skift. ChatGPT-æraens grænseflade har været chat. Jev peger mod indlejret inferens: usynlige, smalle, hyppige beslutninger, der får software til at tilpasse sig i realtid.

For buildere er det praktiske skridt at kortlægge de steder, hvor du i dag beder en generel LLM om at udføre en afgrænset opgave. Klassificering, routing, udtræk, rangering, moderering og eskalering er de oplagte kandidater. Nogle har måske stadig brug for en LLM. Nogle håndteres måske bedre med regler. Nogle kan retfærdiggøre en specialiseret beslutningsmodel, hvis økonomien holder.

Hvis dit workflow involverer behandling af mange rækker, beskeder, tickets eller events, bliver spørgsmålet skarpere: Har du brug for genereret tekst, eller har du brug for en pålidelig beslutning i skala? Det er den samme økonomiske linje bag AI-batchbehandling og mange produktionssystemer til automatisering.

Det vigtige faktum er ikke, at Jev er »bedre end LLM’er«. TechCrunch-rapporten fastslår ikke det, og eksemplerne er for snævre til den konklusion. Det vigtige faktum er, at udviklere viser interesse for en model formet til softwarebeslutninger snarere end menneskelig samtale.

Det bør ændre, hvordan teams rammesætter AI-arkitektur.

Brug LLM’er, hvor sprog, ræsonnement, syntese og værktøjsbrug betyder noget. Brug strukturerede outputs, når du har brug for en kontrakt. Brug retrieval, når svaret afhænger af privat eller skiftende viden. Brug menneskelig godkendelse, når handlinger er følsomme. Og hold øje med den nye klasse af beslutningsmodeller for steder, hvor sandsynligheder er mere nyttige end prosa.

Jev kan forblive et specialiseret produkt, eller konkurrenter kan bevæge sig i samme overordnede retning. Ronacher fortalte TechCrunch, at han forventer, at andre vil følge efter, men det betyder ikke nødvendigvis direkte Jev-kloner; det kan betyde flere systemer bygget omkring snævre, sandsynlighedsbaserede beslutninger i stedet for åben tekstgenerering. Uanset hvad er det et nyttigt signal: Den næste bølge af AI-infrastruktur handler måske mindre om at få én model til at tale bedre og mere om at give software billigere, mindre og mere målbare stykker intelligens.

Den praktiske konklusion handler mindre om at erstatte LLM’er og mere om at vælge den rigtige modelform til hver beslutning.

  • Jev beskrives som en transformer-baseret model, der returnerer sandsynligheder over foruddefinerede outputs i stedet for at generere prosa.
  • Modellen præsenteres til afgrænsede softwarebeslutninger som klassificering, routing, moderering, eskalering og sikkerhedstjek.
  • Rapporterede udviklertests antyder, at Jev kan være hurtigere eller billigere end generelle LLM’er i nogle snævre klassificeringsworkflows, men de er ikke brede benchmarks.
  • Kalibrerede sandsynligheder kan hjælpe applikationer med at beslutte, hvornår de skal handle, afstå, eskalere eller kalde en stærkere model.
  • Buildere bør evaluere Jev-lignende systemer med nøjagtighed, kalibrering, tærskeladfærd, abstention, robusthed og omkostninger under reel trafik.

Disse spørgsmål dækker, hvordan Jev AI-modellen fungerer, hvordan den adskiller sig fra en generel LLM, og hvor sandsynlighedsbaserede beslutninger kan passe ind i softwaresystemer. De skitserer også, hvad teams bør evaluere, før de bruger Jev-lignende modeller i produktion.

Jev er en model fra TypeSafe AI, der beskrives som transformer-baseret, men ikke som en stor sprogmodel. I stedet for at skrive tekst returnerer den sandsynligheder over outputs, som udviklere definerer på forhånd.

Hvordan adskiller Jev sig fra en stor sprogmodel?

Link til afsnittet: Hvordan adskiller Jev sig fra en stor sprogmodel?

En generel LLM genererer sprog-tokens, mens Jev er designet til at vælge mellem foruddefinerede outputs og knytte en sandsynlighed til. Det gør den bedre egnet til softwarebeslutninger end til åbne samtaler.

Udviklere er interesserede, fordi mange AI-workloads har brug for en pålidelig gren, et label eller en sikkerhedsbeslutning snarere end et afsnit. TechCrunch rapporterede om tidlige tests, hvor Jev var billigere eller hurtigere i specifikke klassificeringscases.

Artiklen diskuterer use cases som sikkerhedsgennemgang af kommandoer, klassificering af forretningsmails, agentovervågning, modelrouting, workflow-triage og sikkerhedsbarrierer for LLM-agenter.

Hvad bør teams evaluere, før de bruger Jev?

Link til afsnittet: Hvad bør teams evaluere, før de bruger Jev?

Teams bør teste mere end nøjagtighed. De bør måle kalibrering, tærskelperformance, abstentionsadfærd, robusthed uden for træningsdomænet, adversarial inputs og omkostninger under reel trafik.


Skabt af

David Vicente Campos

Grundlægger af NeuraLIA Labs og medstifter af MyRealFood

Jeg er dataingeniør fra Universitetet i León. Jeg var med til at stifte MyRealFood, hvor jeg som CTO byggede den app, som millioner af mennesker har brugt til at spise bedre, og jeg grundlagde NeuraLIA Labs, hvor jeg bygger AI-produkter. Her skriver jeg om det, jeg har måttet forstå undervejs, sådan som jeg ville ønske, nogen havde forklaret det for mig.

Mere om forfatteren

Udgivet af NeuraLIA Labs.

Få nye indlæg i din indbakke

AI-nyheder, guides og produktopdateringer — en kort mail, når vi udgiver noget, der er værd at bruge tid på.

Vil du hellere have beskeder? De samme indlæg, her:WhatsApp-fællesskab (åbnes i en ny fane)Telegram-kanal (åbnes i en ny fane)
Abstract agent runtime sorting documents, memory blocks and pointer nodes inside a bounded context frame.
context-engineering11 min læsning

Kontekstteknik til langsigtede AI-agenter

Langvarige agenter fejler ikke kun, fordi vinduet er lille. De fejler, når filer, tool-outputs og forældet historik fortrænger den opgave, agenten skulle færdiggøre.

Abstract network of glowing AI agent nodes forming a recursive loop in a dark research setting.
ai safety11 min læsning

Rekursiv selvforbedring: derfor bekymrer AI-forskere sig

Den skarpere bekymring omkring rekursiv selvforbedring handler ikke om mærkelige chatbot-svar. Den handler om agenter, der koordinerer, optimerer metrikker og hjælper med at bygge de næste modeller — en bekymring, der afspejles i dækning fra WIRED, MIT Technology Review, CNBC og The Guardian.

Klar til at lade LIA vælge for dig?

Byg med alle AI-modeller ét sted — kom gratis i gang i dag.