Lewati ke konten

Berita AI

Model AI Jev dibuat untuk keputusan, bukan prosa

Model AI Jev mengembalikan probabilitas terkalibrasi alih-alih prosa, memberi developer jalur yang lebih murah untuk perutean, guardrail, dan klasifikasi.

Abstract software decision engine with branching paths, probability nodes, and glowing gates.
Di halaman ini

Sebagian besar produk AI masih memperlakukan bahasa sebagai antarmuka universal: kirim prompt, terima teks, parsing teksnya, lalu berharap hasil parsing tetap valid. TechCrunch melaporkan pada 18 September 2026 bahwa TypeSafe AI mencoba jalur berbeda dengan Jev, model berbasis transformer dari mantan peneliti OpenAI Diogo Almeida yang sama sekali tidak menghasilkan prosa. Model ini menghasilkan probabilitas: sesuatu yang disebut perusahaan sebagai “keputusan terkalibrasi.”

Itu terdengar seperti perubahan antarmuka kecil. Padahal bukan. Menurut TechCrunch, Almeida membantu membangun ChatGPT dan bekerja pada reinforcement learning from human feedback, lalu meninggalkan OpenAI dua tahun sebelum laporan itu untuk memulai TypeSafe AI. Argumennya lugas: model sudah menjadi sangat baik dalam bahasa manusia, tetapi otomasi sering membutuhkan hal lain. Komputer tidak membutuhkan paragraf yang memikat. Komputer membutuhkan keputusan, skor, rute, gerbang ya-atau-tidak, atau label kelas yang cukup bisa dipercaya software untuk ditindaklanjuti.

Jev dideskripsikan oleh TypeSafe AI sebagai model baru berbasis transformer, tetapi bukan large language model. Alih-alih menghasilkan token teks, Jev mengembalikan probabilitas atas output yang ditentukan developer sebelumnya. TechCrunch mengatakan TypeSafe menyebut output ini “keputusan terkalibrasi.”

Menurut laporan tersebut, desain ini punya tiga konsekuensi langsung.

Pertama, model ini diposisikan sebagai lebih murah dan lebih cepat daripada menggunakan LLM umum untuk pekerjaan bergaya klasifikasi. TechCrunch melaporkan bahwa token output Jev gratis dan token inputnya dihitung per miliar, bukan per juta.

Kedua, ruang output dibatasi. Jika developer mendefinisikan kemungkinan output sejak awal, model tidak bisa merespons dengan paragraf yang fasih tetapi tidak terduga. TechCrunch mengatakan TypeSafe mempresentasikan ini sebagai cara untuk menghindari halusinasi. Versi praktisnya lebih sempit: Jev tetap bisa salah, tetapi seharusnya salah di dalam kumpulan pilihan yang diketahui, dengan probabilitas yang menyertainya.

Ketiga, probabilitas itu adalah bagian dari produk, bukan pemikiran belakangan. Armin Ronacher, CTO Earendil, mengatakan kepada TechCrunch bahwa Jev “sedikit mendelegasikan masalah halusinasi kepada pengguna.” Jika hasil kembali pada 50%, aplikasi mungkin mengabaikannya. Jika kembali pada 95%, aplikasi mungkin mengambil tindakan.

Perbedaan itu penting. Banyak otomasi AI gagal bukan karena model tidak pernah berguna, melainkan karena software tidak bisa mengetahui kapan model hanya menebak. Developer sering mencoba memulihkan keyakinan dengan meminta LLM menjelaskan dirinya, melakukan voting dengan dirinya sendiri, atau mengeluarkan JSON terstruktur. Jev diposisikan sebagai model yang menjadikan skor keyakinan sebagai inti.

TechCrunch melaporkan bahwa minat developer cukup tinggi hingga TypeSafe AI sempat kehilangan kemampuan untuk melayani pengguna dari API-nya. Artikel tersebut membingkai daya tarik awal Jev di sekitar otomasi software: developer menggunakan kecerdasan di dalam kode, bukan sebagai antarmuka chat.

Dua contoh dalam laporan tersebut menunjukkan bentuk permintaannya.

Pranit Sharma, software engineer di Vercel, mengatakan kepada TechCrunch bahwa Vercel telah menggunakan model OpenAI untuk menjalankan classifier yang meninjau perintah demi keamanan. Ketika Vercel mengganti Luna dari OpenAI dengan Jev, Sharma mengatakan hasilnya lima hingga 18 kali lebih cepat dan dengan akurasi lebih tinggi.

Nikhil Mudholkar, CTO Bryo AI, menguji Jev melawan Gemini untuk mengklasifikasikan email bisnis, menurut TechCrunch. Dalam pengujiannya, Gemini sedikit lebih akurat, tetapi 10 hingga 20 kali lebih mahal. Mudholkar menyoroti skor keyakinan Jev, dengan mengatakan bahwa Jev adalah “satu-satunya yang mengembalikan probabilitas sungguhan,” sehingga berguna untuk mengotomatiskan workflow.

Itu bukan benchmark luas. Itu adalah pengujian developer yang dilaporkan, dalam pengaturan spesifik, dengan detail yang dikendalikan oleh orang-orang yang menjalankannya. Namun semuanya menunjuk ke kategori nyata: kasus ketika pekerjaannya bukan “tulis jawabannya,” tetapi “pilih cabang yang tepat.”

Contohnya meliputi:

TugasYang dibutuhkan software
Tinjauan keamanan perintahIzinkan, blokir, eskalasi
Klasifikasi email bisnisPenjualan, dukungan, penagihan, spam
Pemantauan agenAman, mencurigakan, upaya jailbreak
Perutean modelModel murah, model kuat, tinjauan manusia
Triase workflowLanjutkan, coba lagi, minta persetujuan

Banyak tim saat ini menyelesaikan hal ini dengan prompt LLM plus output terstruktur. Pendekatan itu bisa berhasil, terutama ketika dipasangkan dengan skema, percobaan ulang, dan validasi. Namun pendekatan itu tetap menghabiskan anggaran LLM untuk tugas yang mungkin tidak membutuhkan pembuatan bahasa.

Jika klaim awal Jev terbukti di luar contoh yang dilaporkan TechCrunch, model ini masuk ke ruang desain praktis yang sama dengan tool calling dan output terstruktur: mengubah perilaku model menjadi kontrak yang bisa dikonsumsi software.

Salah satu penggunaan paling menarik dalam laporan TechCrunch bukanlah mengganti LLM, melainkan memutuskan kapan harus menggunakannya.

Ronacher mengatakan kepada TechCrunch bahwa Jev bisa berguna untuk perutean model: memprediksi apakah beban kerja tertentu membutuhkan model spesifik. Menggunakan LLM untuk membuat keputusan itu bisa mahal. Model yang lebih murah dan lebih cepat yang mengembalikan skor terkalibrasi dapat ditempatkan di depan stack model dan memutuskan ke mana setiap permintaan harus dikirim.

Ini adalah masalah yang familier bagi siapa pun yang membangun dengan banyak model. Model terkuat tidak selalu diperlukan. Model termurah tidak selalu aman. Sebagian prompt membutuhkan penalaran konteks panjang; yang lain membutuhkan classifier cepat; yang lain membutuhkan alat gambar, suara, atau retrieval. Router harus memperkirakan pekerjaan sebelum menghabiskan anggaran.

Di sinilah bentuk Jev juga penting. Router tidak membutuhkan esai tentang mengapa sebuah prompt sulit. Router membutuhkan keputusan seperti:

  • kirim ke model kecil;
  • kirim ke model frontier;
  • ambil dokumen terlebih dahulu;
  • minta persetujuan manusia;
  • tolak karena tidak aman.

Itu lebih dekat ke estimasi probabilitas daripada percakapan. Masalah inti perutean bersifat praktis, bukan retoris: bagian yang bernilai sering kali adalah memilih kemampuan yang tepat pada harga yang tepat, bukan sekadar memanggil model terbesar yang tersedia.

Jev mengisyaratkan bahwa perutean itu sendiri dapat menjadi workload AI dengan model khusus di belakangnya.

TechCrunch juga melaporkan bahwa Almeida melihat Jev digunakan untuk memantau jejak agen LLM dan mencegah jailbreak. Argumen biayanya sederhana. Jika setiap tindakan agen harus diperiksa oleh LLM penuh lainnya, lapisan keamanan bisa menjadi mahal. Jika model keputusan yang lebih kecil dapat menandai perilaku mencurigakan dengan murah, lebih banyak aplikasi dapat membiayai pemantauan berkelanjutan.

Ini tidak menghapus bagian sulit dari keamanan agen. Classifier membutuhkan label yang terdefinisi dengan baik. Ia membutuhkan contoh. Ia membutuhkan ambang batas. Ia membutuhkan kebijakan untuk apa yang terjadi ketika keyakinan rendah. Dan jika tindakannya cukup sensitif, skor probabilitas tidak seharusnya menggantikan penilaian manusia.

Namun arsitekturnya bersih:

  1. agen mengusulkan atau mengambil langkah;
  2. model keputusan memberi skor pada langkah tersebut;
  3. sistem memblokir, mengizinkan, mencatat, atau mengeskalasi;
  4. manusia hanya meninjau kasus yang membutuhkan tinjauan manusia.

Itu dekat dengan cara sistem produksi sudah memikirkan risiko. Sistem pembayaran, sistem fraud, sistem spam, dan sistem penyalahgunaan sering beroperasi melalui ambang batas dan jalur eskalasi. Agen AI mulai membutuhkan pola yang sama.

Bagi tim yang membangun workflow otonom, pelajarannya bukan “ganti pekerjaan keamananmu dengan Jev.” Pelajarannya adalah bahwa keamanan dapat dipisahkan dari generasi. Kamu bisa merancang agen yang menggunakan satu model untuk bertindak, model atau classifier lain untuk memantau, dan lapisan persetujuan manusia untuk tindakan yang tidak dapat dibatalkan. Prinsip yang sama muncul dalam persetujuan human-in-the-loop dan dalam sistem multi-agen ketika satu komponen memeriksa komponen lain sebelum pekerjaan berlanjut.

Apa yang diketahui tentang arsitekturnya

Tautan ke bagian: Apa yang diketahui tentang arsitekturnya

Arsitekturnya masih sebagian buram. TechCrunch mengatakan Almeida “tertutup” soal internal Jev, sementara pengamat luar menduga model ini dibangun di atas LLM open-weight. TypeSafe AI menyebut Jev sebagai “model System One”: model yang dioptimalkan untuk keputusan cepat seperti intuisi, bukan penalaran eksplisit, dengan desain yang lebih sempit dan sesuai dengan tugasnya.

Almeida mengatakan kepada TechCrunch bahwa Jev dilatih secara eksklusif pada data sintetis menggunakan teknik yang ia sebut “reinforcement learning from calibrated decisions.” Ia juga mengatakan TypeSafe AI sejak awal bertaruh untuk membuat semua datanya sendiri. Ia menggambarkan sebagian perusahaan sebagai lab yang berfokus pada “data sintetis yang dipahami dengan baik secara statistik.”

Informasi itu cukup untuk memahami tesis produknya, tetapi belum cukup untuk mengevaluasi metode pelatihannya secara independen. Dari laporan TechCrunch, kita tidak tahu bagaimana kalibrasi diukur, seberapa tangguh model di luar distribusi, bagaimana model menangani input adversarial, atau bagaimana performa berubah di berbagai domain.

Pertanyaan-pertanyaan itu penting karena probabilitas hanya berguna ketika terkalibrasi. Jika model mengatakan 95% dan benar kira-kira 95% dari waktu dalam kondisi serupa, developer bisa membangun kebijakan di sekelilingnya. Jika angkanya hanya output yang berbentuk keyakinan, itu menjadi hal lain yang harus divalidasi.

Evaluasi yang masuk akal akan menguji bukan hanya akurasi, tetapi juga kurva kalibrasi, perilaku abstain, performa ambang batas, dan biaya di bawah traffic nyata. Bagi tim yang sudah menjalankan evaluasi model, Jev seharusnya masuk ke test harness yang sama dengan LLM yang mungkin digantikan atau dipantaunya.

Jev dinamai dari William Stanley Jevons, ekonom abad ke-19 yang dikaitkan dengan paradoks Jevons: ketika sebuah sumber daya menjadi lebih efisien untuk digunakan, total konsumsi dapat naik alih-alih turun. Almeida mengatakan kepada TechCrunch bahwa TypeSafe AI memperkirakan kecerdasan yang lebih murah akan mengarah ke “software pintar di mana-mana,” lebih mirip internet awal daripada dunia yang hanya didominasi oleh “mega app.”

Itulah klaim strategisnya. Jika kecerdasan menjadi cukup murah untuk ditempatkan di dalam control flow biasa, developer mungkin berhenti menyisihkan AI hanya untuk chatbot dan pengalaman agentic besar. Sebaliknya, keputusan kecil muncul di mana-mana: di antrean, panel admin, workflow dukungan pelanggan, pemeriksaan deployment, sistem pesan, dan pipeline data.

Ini akan menjadi pergeseran yang berarti. Antarmuka era ChatGPT adalah chat. Jev mengarah ke inferensi tertanam: keputusan tak terlihat, sempit, dan sering yang membuat software beradaptasi secara real time.

Bagi builder, langkah praktisnya adalah menginventarisasi tempat-tempat ketika kamu saat ini meminta LLM umum melakukan pekerjaan berbatas jelas. Klasifikasi, perutean, ekstraksi, pemeringkatan, moderasi, dan eskalasi adalah kandidat yang jelas. Sebagian mungkin masih membutuhkan LLM. Sebagian mungkin lebih baik ditangani dengan aturan. Sebagian mungkin membenarkan model keputusan khusus jika ekonominya masuk akal.

Jika workflow-mu melibatkan pemrosesan banyak baris, pesan, tiket, atau peristiwa, pertanyaannya menjadi lebih tajam: apakah kamu membutuhkan teks yang dihasilkan, atau keputusan yang andal dalam skala besar? Itulah garis ekonomi yang sama di balik pemrosesan batch AI dan banyak sistem otomasi produksi.

Apa yang sebaiknya builder lakukan berikutnya

Tautan ke bagian: Apa yang sebaiknya builder lakukan berikutnya

Fakta pentingnya bukan bahwa Jev “lebih baik daripada LLM.” Laporan TechCrunch tidak membuktikan itu, dan contohnya terlalu sempit untuk kesimpulan tersebut. Fakta pentingnya adalah bahwa developer menunjukkan minat pada model yang dibentuk untuk keputusan software, bukan percakapan manusia.

Itu seharusnya mengubah cara tim membingkai arsitektur AI.

Gunakan LLM ketika bahasa, penalaran, sintesis, dan penggunaan alat penting. Gunakan output terstruktur ketika kamu membutuhkan kontrak. Gunakan retrieval ketika jawaban bergantung pada pengetahuan privat atau yang berubah. Gunakan persetujuan manusia ketika tindakan bersifat sensitif. Dan perhatikan kelas model keputusan yang sedang muncul untuk tempat ketika probabilitas lebih berguna daripada prosa.

Jev mungkin tetap menjadi produk khusus, atau pesaing mungkin bergerak ke arah umum yang sama. Ronacher mengatakan kepada TechCrunch bahwa ia memperkirakan pihak lain akan mengikuti, tetapi itu tidak selalu berarti clone Jev secara langsung; bisa saja berarti lebih banyak sistem yang dibangun di sekitar keputusan sempit berbasis probabilitas alih-alih generasi teks terbuka. Apa pun itu, ini sinyal yang berguna: gelombang infrastruktur AI berikutnya mungkin bukan tentang membuat satu model berbicara lebih baik, melainkan tentang memberi software potongan kecerdasan yang lebih murah, lebih kecil, dan lebih terukur.

Kesimpulan praktisnya bukan tentang mengganti LLM, melainkan memilih bentuk model yang tepat untuk setiap keputusan.

  • Jev dideskripsikan sebagai model berbasis transformer yang mengembalikan probabilitas atas output yang telah ditentukan, alih-alih menghasilkan prosa.
  • Model ini diposisikan untuk keputusan software berbatas jelas seperti klasifikasi, perutean, moderasi, eskalasi, dan pemeriksaan keamanan.
  • Pengujian developer yang dilaporkan menunjukkan Jev mungkin lebih cepat atau lebih murah daripada LLM umum dalam beberapa workflow klasifikasi yang sempit, tetapi itu bukan benchmark luas.
  • Probabilitas terkalibrasi dapat membantu aplikasi memutuskan kapan harus bertindak, abstain, mengeskalasi, atau memanggil model yang lebih kuat.
  • Builder harus mengevaluasi sistem seperti Jev dengan akurasi, kalibrasi, perilaku ambang batas, abstain, ketangguhan, dan biaya traffic nyata.

Pertanyaan-pertanyaan ini membahas cara kerja model AI Jev, perbedaannya dari LLM umum, dan di mana keputusan berbasis probabilitas dapat cocok dalam sistem software. Pertanyaan ini juga menguraikan apa yang harus dievaluasi tim sebelum menggunakan model seperti Jev di produksi.

Jev adalah model dari TypeSafe AI yang dideskripsikan sebagai berbasis transformer tetapi bukan large language model. Alih-alih menulis teks, Jev mengembalikan probabilitas atas output yang ditentukan developer sebelumnya.

Apa perbedaan Jev dari large language model?

Tautan ke bagian: Apa perbedaan Jev dari large language model?

LLM umum menghasilkan token bahasa, sementara Jev dirancang untuk memilih di antara output yang telah ditentukan dan menyertakan probabilitas. Itu membuatnya lebih cocok untuk keputusan software daripada percakapan terbuka.

Developer tertarik karena banyak workload AI membutuhkan cabang, label, atau keputusan keamanan yang andal, bukan paragraf. TechCrunch melaporkan pengujian awal ketika Jev lebih murah atau lebih cepat dalam kasus penggunaan klasifikasi tertentu.

Artikel ini membahas use case seperti tinjauan keamanan perintah, klasifikasi email bisnis, pemantauan agen, perutean model, triase workflow, dan guardrail untuk agen LLM.

Apa yang harus dievaluasi tim sebelum menggunakan Jev?

Tautan ke bagian: Apa yang harus dievaluasi tim sebelum menggunakan Jev?

Tim harus menguji lebih dari akurasi. Mereka harus mengukur kalibrasi, performa ambang batas, perilaku abstain, ketangguhan di luar domain pelatihan, input adversarial, dan biaya di bawah traffic nyata.


Dibuat oleh

David Vicente Campos

Pendiri NeuraLIA Labs & salah satu pendiri MyRealFood

Saya seorang insinyur komputer lulusan Universitas León. Saya ikut mendirikan MyRealFood, tempat saya sebagai CTO membangun aplikasi yang telah digunakan jutaan orang untuk makan lebih sehat, dan saya mendirikan NeuraLIA Labs, tempat saya membangun produk AI. Di sini saya menulis tentang hal-hal yang harus saya pahami sepanjang perjalanan, sebagaimana dulu saya berharap ada yang menjelaskannya kepada saya.

Selengkapnya tentang penulis

Diterbitkan oleh NeuraLIA Labs.

Dapatkan postingan baru di inbox kamu

Berita AI, panduan, dan update produk — email singkat saat kami menerbitkan sesuatu yang layak kamu baca.

Abstract agent runtime sorting documents, memory blocks and pointer nodes inside a bounded context frame.
context-engineering11 menit baca

Rekayasa konteks untuk agen AI jangka panjang

Agen yang berjalan lama tidak gagal hanya karena window-nya kecil. Mereka gagal ketika file, output tool, dan riwayat lama menggeser tugas yang seharusnya diselesaikan agen.

Abstract network of glowing AI agent nodes forming a recursive loop in a dark research setting.
ai safety11 menit baca

Peningkatan diri rekursif: mengapa peneliti AI khawatir

Kekhawatiran yang lebih tajam seputar peningkatan diri rekursif bukanlah output chatbot yang aneh. Kekhawatirannya adalah agen yang berkoordinasi, mengoptimalkan metrik, dan membantu membangun model berikutnya — sebuah perhatian yang tercermin dalam laporan dari WIRED, MIT Technology Review, CNBC, dan The Guardian.

Siap membiarkan LIA yang memilih?

Berkarya dengan semua model AI dalam satu tempat — mulai gratis hari ini.