ARTICOLO DEL BLOG

Jev TypeSafe: il modello che decide e non parla (cosa ho verificato prima di usarlo)

Jev è il primo modello di TypeSafe che non genera testo: riceve un input e uno schema di domande — sì/no, scelta fra opzioni, punteggio — e restituisce una probabilità per ogni risposta. Costa 0,042 $ per milione di token in input, l’output è gratuito, risponde in una frazione di secondo ed è uscito il 15 settembre 2026. Non sostituisce Claude o GPT: è un decisore da mettere davanti a una coda di informazioni.

Email, ticket, lead, commenti: ovunque oggi una persona, una regex o un modello costoso fanno un lavoro da sì/no. Prima di metterlo davanti alla mia inbox ho ricontrollato uno per uno i numeri che circolano, e ho trovato che il valore sta altrove rispetto ai moltiplicatori.

Che cos’è Jev e in cosa è diverso da un LLM?

TypeSafe lo chiama «System One model», con un riferimento al pensiero veloce di Kahneman: non ragiona a parole, valuta uno stato contro domande tipizzate. La documentazione ufficiale sulle primitive (riletta il 25 settembre 2026) elenca tre tipi di domanda: Noul (una probabilità 0-1 su un’affermazione), Choice (una distribuzione di probabilità su opzioni che definisci tu), Score (un livello su una scala che definisci tu). Nessuna categoria inventata dal modello, nessuna frase in uscita.

La differenza pratica con un modello linguistico è nel contratto: a un LLM chiedi «leggi questa email e dimmi cosa fare», e ricevi un testo da interpretare; a Jev chiedi «questa email merita risposta?» e ricevi 0,90. Sei tu a decidere la soglia. Chi ha provato a fargli scrivere una frase lettera per lettera, come Ryan Vogel nel podcast di Greg Isenberg del 18 settembre, l’ha visto arrancare: non parla, decide.

Il contesto è di 32.000 token per lo stato più la domanda più lunga, 64.000 per la richiesta intera; l’input è solo testo. La versione in produzione è jev-1.13.0, verificata sulla pagina dei modelli il 25 settembre 2026.

Quanto costa Jev davvero?

Il listino, dalla pagina dei modelli (riletta il 25 settembre 2026): 0,042 $ per milione di token in input, output non conteggiato. I limiti dichiarati sono 250.000 token al secondo e 1.200 richieste al minuto, regolati dinamicamente per il volume di richieste. Al 21 settembre l’accesso è su lista d’attesa dalla console TypeSafe, oppure attraverso due gateway che lo hanno messo in produzione: Vercel AI Gateway e Cloudflare Workers AI. Su OpenRouter, contrariamente a quanto dicono alcuni video, al 21 settembre la pagina del modello risponde 404.

Per dare una scala: la demo di Vogel ha passato 1.700 email intere (mittente, oggetto, corpo) con quattro domande ciascuna — categoria, priorità su cinque livelli, spam, «merita risposta» — per 4,2 milioni di token in input. A listino fanno 0,18 $. Un’inbox di un mese, classificata su quattro assi, per il prezzo di un caffè.

I moltiplicatori «400 volte più economico» sono veri?

Dipende da cosa metti al denominatore, e questo è il punto in cui ho smesso di fidarmi dei titoli. Ho rifatto i conti di tre test pubblicati nei giorni dopo il lancio:

  • COCO (canale italiano, video del 19 settembre) misura 380 commenti YouTube con 10 domande ciascuno: 24 secondi, 0,015 € con Jev contro 0,79 € con Gemini 3.8 Flash. Dichiara «52 volte meno». Ma il confronto usa Gemini con il ragionamento acceso: senza, dai suoi stessi numeri, il rapporto scende a circa 21×. Resta enorme; non è 52.
  • Borja Obeso (reel del 20 settembre) mette Jev e Claude Opus 5 sullo stesso orologio: 586 pagine di un sito, 8.790 decisioni sì/no su coppie di link interni, 45 secondi e 0,21 $ per Jev; Opus 5 nello stesso tempo arriva a 21 pagine per 1,43 $. Il costo per pagina (6,8 centesimi contro 0,036) regge; il «21 pagine» è un numero di velocità travestito da capacità, perché la corsa si ferma quando Jev finisce. E «il giro completo con Opus sarebbe costato 43 $» fa 40 $ con la sua stessa proporzione.
  • TypeSafe stessa, citata da Vercel, dichiara «fino a 194 volte più veloce e 445 volte più economico» nelle proprie valutazioni. Il «fino a» è la parola che conta.

I numeri non sono falsi: il rapporto di costo oscilla fra 20× e 200× a seconda di cosa confronti. Il problema è un altro: nessuno di questi test dichiara contro quale verità misura l’accuratezza.

COCO riporta 89 % di accuratezza (96 % tenendo solo le risposte in cui Jev si dice sicuro) contro il 96 % di Gemini — ma se «accuratezza» sia rispetto a etichette umane o rispetto all’altro modello non è detto. Borja conta 139 pagine su 586 in cui Jev ha rifiutato di piazzare un link: è calibrazione o timidezza? Senza trenta coppie giudicate a mano non si sa.

Perché mi interessa: la mia coda costa più di quanto pensassi

Ho due numeri di prima mano, misurati da me, che spiegano perché ho passato un weekend su questo modello.

Il primo è la bolletta. Nel 2026 ho misurato la spesa reale di Claude per i miei sistemi dall’estratto conto, non dalle stime: circa 1.425 € al mese, contro i 258 che risultavano «dichiarati» nei miei stessi registri. Una parte di quella spesa sono decisioni — «questa email è urgente?», «questo lead è caldo?», «questa card merita la mia attenzione?» — pagate a prezzo di modello frontier.

Il secondo è un errore pagato. Il 18 settembre 2026 un avviso di cambio email su un mio account social è finito in priorità P3, cioè in fondo, perché il mio triage Gmail decide con liste di parole chiave: ne ho contate 280 righe fra regex ed elenchi, e nessuna prendeva «email address has been changed».

La cura che ho applicato è stata aggiungere un’altra lista di venti parole. È la cura sbagliata per la classe del guasto: ogni cicatrice aggiunge una keyword, e la prossima email scritta in modo diverso passerà di nuovo. Un classificatore che legge l’email intera contro la domanda «qualcuno ha cambiato qualcosa sui miei account senza di me?» è la classe di strumento che cura la classe del problema.

Dove mettere Jev, e dove no

La domanda giusta è quella che Isenberg fa a Vogel: qual è la coda costosa di informazioni in entrata? Da lì:

Sì, ha sensoNo, non è il suo lavoro
Smistare a volume: email, ticket, lead, commenti, recensioni, candidatureScrivere qualsiasi cosa: risposte, riassunti, testi
Filtrare notizie o feed per rilevanza, con soglia dichiarataCalcoli, conteggi, confronti di date e orari
Instradare un prompt al modello o all’agente giusto (il primo uso dichiarato dai team su Vercel)Decisioni che dipendono dal mondo fuori dall’input: nel podcast, il segnale buy/sell su Bitcoin «does not seem to be doing well»
Verificare l’output di un altro sistema: «questa risposta rispetta i criteri?»Testi lunghi con molto contesto irrilevante
Escalare a un umano ciò che è incerto: la terza uscitaQualunque cosa richieda che il modello spieghi perché

La colonna di destra non è un mio parere: TypeSafe pubblica una pagina di «jaggedness» (revisione del 17 settembre 2026) con nove modalità di fallimento documentate — lettura letterale, matematica, confronti di date, indirezione, stato pieno di dettagli irrilevanti, contenuto ostile, criteri contraddittori, invarianti strutturali, generazione — e scrive che «i livelli di punteggio di jev-1.13 sono deboli nella calibrazione numerica». L’aritmetica resta nel codice.

Una nota per chi lavora in italiano: la documentazione dice che la lingua primaria è l’inglese e che le altre sono gestite «ma non altrettanto bene», con l’invito a testare sul proprio contenuto. COCO l’ha fatto lavorare su 380 commenti italiani con risultati utili; la stessa raccomandazione vale per chiunque: si prova sui propri dati, non ci si fida.

Come si usa in pratica: la forma di un lavoro da Jev

Il reel di Borja è istruttivo per ciò che la didascalia dice e la voce no: «non sta scrivendo, sono 8.790 chiamate sì/no». 586 pagine per 15 candidati ciascuna. La struttura è sempre la stessa, e Jev ne è solo un pezzo:

  1. Codice deterministico genera i candidati. Le 15 pagine più simili, i 20 lead di oggi, le email non lette. Questo pezzo non è AI e decide quanto è buono tutto il resto.
  2. Una domanda per candidato, con criteri scritti. «Questa pagina ha una ragione reale per linkare quella?» Il criterio sposta la probabilità: nel playground di TypeSafe «il cielo è blu» passa dal 98 % al 2 % se scrivi nei criteri che è arancione. Chi scrive lo schema possiede il valore; il modello esegue.
  3. Una soglia, e una terza uscita. Sopra 0,85 agisci, sotto 0,30 scarta, in mezzo lo guarda una persona. COCO chiama quella colonna «guarda tu». Il costo non sparisce: cambia forma, e diventa una coda umana più corta.
  4. Conta i rifiuti e controllane un campione. È il numero che tutte le demo mostrano e nessuna spiega.

In questa forma Jev somiglia ai controlli automatici che ho già in casa — decine di script che rispondono verde o rosso — con una differenza: sa dire «non sono sicuro». Un lint non lo sa fare. È il motivo per cui il primo posto dove lo metterei non è al posto del mio triage, ma davanti, come secondo parere con soglia dichiarata. Vale lo stesso per il lead scoring automatico, che oggi in casa mia è una somma di pesi scritti a mano.

Il test che farò prima di crederci

Non l’ho ancora misurato sui miei dati, e lo scrivo perché è la parte che manca a quasi tutti i contenuti su Jev usciti in questa settimana. Il test è questo, e lo pubblicherò con i numeri:

  1. Passo zero: etichette umane. Una settimana della mia inbox già classificata dal triage a parole chiave (P0-P3), riletta a mano su un campione di 100 email. Senza la verità umana, «accuratezza» vuol dire «accordo con un altro modello». Andrej Karpathy lo dice da un altro fronte: se non puoi valutare, non puoi automatizzare.
  2. Stesso schema a Jev. Quattro domande per email — categoria, priorità, spam, merita risposta — e la domanda che il 18 settembre mi è costata: «qualcuno ha cambiato qualcosa sui miei account?».
  3. Tabella di calibrazione. Per ogni fascia di probabilità, quante volte Jev ha ragione contro le etichette. È l’unico modo per sapere se 90 % vuol dire 90 % o vuol dire «molto». TypeSafe stessa ammette che la calibrazione numerica è debole: ragione in più per misurarla in casa.
  4. Costo e tempo misurati da me, non proiettati. A listino, 100 email intere sono meno di un centesimo.

Se batte le parole chiave sui casi come quello del 18 settembre, entra come secondo parere. Se non le batte, avrò speso un centesimo per saperlo.

Domande frequenti su Jev

Jev sostituisce ChatGPT o Claude? No. Non genera testo. Sostituisce le decisioni da sì/no, scelta o punteggio che oggi fai fare a un modello linguistico, o a una regex, o a una persona.

Quanto costa una decisione? A listino 0,042 $ per milione di token in input, output gratuito. Un’email intera con quattro domande costa circa un centesimo ogni cento email.

È già disponibile? Dal 15 settembre 2026 in accesso anticipato su lista d’attesa presso TypeSafe; in produzione su Vercel AI Gateway e Cloudflare Workers AI. Al 21 settembre non è su OpenRouter.

Funziona in italiano? La documentazione dichiara l’inglese come lingua primaria e invita a testare le altre. Un test pubblico su 380 commenti italiani ha dato risultati utilizzabili; il mio test lo farò sull’italiano della mia inbox.

Quanto è accurato? L’unico numero pubblico è l’89 % di un creator (96 % filtrando per confidenza), senza dichiarare contro quale verità. Non è un dato su cui costruire: è un dato da rifare con etichette proprie.

Può fare calcoli o confrontare date? No, e lo scrive TypeSafe: matematica e confronti di date sono fra le nove modalità di fallimento documentate. Restano nel codice.

Chi c’è dietro? TypeSafe, fondata da Diogo Almeida, co-autore del paper InstructGPT. «Il creatore di ChatGPT» che si legge in giro è un titolo gonfiato da chi lo racconta, non da lui.

Da dove si comincia? Dalla coda: quale flusso di informazioni in entrata ti costa di più in tempo o in token. Poi lo schema, la soglia, la terza uscita, e cento etichette a mano.

Cosa fare adesso

Scegli una coda: l’inbox, i moduli del sito, i commenti sotto i post, i ticket. Prendi cento elementi e classificali a mano con lo schema che vorresti automatizzare: è un’ora di lavoro ed è l’unica cosa che nessun venditore può fare al posto tuo. Poi metti Jev, o qualunque classificatore, davanti a quella coda con una soglia scritta e una terza uscita verso una persona.

Il giorno che la tabella di calibrazione regge, hai spostato una decisione da un modello che costa dollari a uno che costa centesimi per mille — e sai di quanto ti puoi fidare. Se vuoi confrontare il tuo schema con quello che sto costruendo per la mia inbox, scrivimi: il test lo pubblico qui, con i numeri e le etichette. Se invece parti da zero con gli agenti, il punto d’ingresso è l’agente AI per la lead generation con n8n e Claude; e su come si scrive una domanda che decide invece di chiacchierare, il pezzo sul prompt engineering.

Fonti primarie consultate il 21 settembre 2026 e rilette il 25: documentazione TypeSafe (modelli, primitive e jaggedness di jev-1.13; prezzo, versione e limiti riverificati alla seconda lettura), blog Vercel del 18 settembre 2026, documentazione Cloudflare Workers AI. Le misure dei creator citati sono le loro, riportate con la data del video; i due numeri sulla mia spesa e sul mio triage sono misurati da me.

ESPLORA I MIEI SERVIZI

Soluzioni digitali su misura per te.

Personalizzo ogni soluzione digitale per rispondere perfettamente alle tue esigenze. Con il mio servizio Full-Stack Marketing, posiziono il tuo brand online rendendolo funzionante e operativo in una settimana!

DIGITAL MARKETING Blog

Strategie SEO e AI per il Business.

Scopri le ultime tendenze e strategie di digital marketing, SEO e intelligenza artificiale. Consigli pratici per far crescere il tuo business online.