Blog · IA

Jev : le modèle d'IA qui décide au lieu de rédiger

22 sept 202610 min de lecturepar Scroll
Jev : le modèle d'IA qui décide au lieu de rédiger
Sommaire

Lancé en septembre 2026 par TypeSafe AI, Jev ne génère pas de texte : il renvoie des décisions typées et calibrées. Ce que c'est, ce qu'il coûte, et trois cas d'usage.

Jev est un modèle d'intelligence artificielle qui ne rédige rien. On lui envoie un contexte et une série de questions fermées, il renvoie des réponses typées accompagnées de probabilités : une option choisie dans une liste, une note sur une échelle, ou la probabilité qu'une affirmation soit vraie. Il a été lancé mi-septembre 2026 par TypeSafe AI, start-up fondée par Diogo Almeida, ancien chercheur d'OpenAI, qui a levé 40 millions de dollars à cette occasion.

L'idée est simple et elle répond à un vrai problème de production. Quand une application a besoin qu'une IA prenne une décision, par exemple trier un ticket ou valider une extraction, on demande aujourd'hui à un modèle conversationnel de répondre en JSON, puis on espère que le JSON sera valide et que la réponse sera cohérente. Jev supprime cette étape : la sortie est structurée par construction, et elle arrive en une fraction de seconde pour un coût très faible. Voici ce que c'est, ce que ça change, et trois cas d'usage où cela vaut vraiment le détour.

Un modèle « System One » : décider plutôt que générer

TypeSafe range Jev dans une nouvelle catégorie qu'il appelle les modèles « System One », en référence au Système 1 popularisé par Daniel Kahneman dans Système 1 / Système 2 : la pensée rapide et intuitive, par opposition au raisonnement lent et délibéré. Comme un grand modèle de langage, Jev comprend le langage naturel. Mais au lieu de produire du texte, il renvoie des décisions et des probabilités que le code peut consommer directement.

La documentation officielle décrit trois primitives, que l'on peut mélanger dans un même appel.

  • Choice sélectionne une option dans une liste que vous définissez, avec une probabilité par option et un indice de confiance. Exemple : à quelle équipe confier ce ticket, facturation, technique ou compte client.
  • Score positionne le contenu sur une échelle ordonnée que vous décrivez, avec les mêmes probabilités et la même confiance. Exemple : à quel point ce client est-il mécontent, de calme à très frustré.
  • Noul renvoie la probabilité, entre 0 et 1, qu'une affirmation soit vraie. Exemple : ce message contient-il une demande de remboursement.

Chaque question est évaluée en parallèle et isolément, contre le même contexte, que l'éditeur appelle l'état. Ajouter des questions ne dégrade pas les autres réponses. TypeSafe l'a mesuré sur un cas concret : treize questions posées sur l'article Wikipédia consacré au RGPD, soit environ 54 000 caractères. Les poser en un seul appel plutôt qu'en treize appels séparés a été 12,2 fois moins cher et 10 fois plus rapide, sans changement dans les réponses.

Pourquoi c'est différent d'un LLM avec une sortie JSON

La différence tient d'abord à l'entraînement. Les grands modèles de langage conversationnels sont affinés par apprentissage par renforcement à partir de retours humains, la méthode dite RLHF, qui leur apprend à produire les réponses que les gens préfèrent. TypeSafe rappelle dans son introduction technique que Diogo Almeida a co-inventé cette méthode, avant d'en pointer la limite : elle récompense ce qui plaît, ce qui peut encourager la complaisance et les hallucinations formulées avec assurance.

Jev est entraîné autrement, selon une approche que l'éditeur nomme RLCD, pour apprentissage par renforcement orienté vers des décisions calibrées. L'objectif n'est plus de plaire mais d'être calibré : sur un grand nombre de prédictions, les réponses auxquelles le modèle attribue 80 % de probabilité doivent être justes environ 80 % du temps. C'est cette propriété qui rend l'incertitude exploitable par un programme. Une probabilité faible devient un signal pour transmettre le cas à un humain ou à un modèle plus coûteux.

Il faut toutefois lire correctement cette promesse. La calibration est une propriété statistique, mesurée sur des groupes de prédictions : elle ne garantit pas qu'une réponse individuelle soit juste. Une sortie typée garantit le format, pas la vérité. Et quand l'éditeur parle d'un modèle sans hallucination, The Register souligne à juste titre que la comparaison avec un modèle qui génère du texte libre est en partie trompeuse, puisque Jev ne peut par construction répondre que dans l'espace que vous lui avez donné.

Ce que coûte Jev, et à quelle vitesse il répond

Les chiffres publiés sur la page des modèles sont frappants. La version actuelle, jev-1.13, est facturée 0,042 dollar par million de jetons en entrée, et les jetons de sortie sont gratuits. La documentation indique que la plupart des requêtes aboutissent en environ 100 millisecondes, ce qui permet de l'utiliser dans une interface en temps réel. Le contexte accepté est de 64 000 jetons par requête, dont 32 000 pour l'état et la plus longue des questions.

Pour se représenter l'ordre de grandeur, prenons un calcul simple. Une entreprise qui trie 100 000 demandes par mois, à raison d'environ 1 000 jetons par demande en comptant le message, le contexte utile et les questions, consomme 100 millions de jetons. Au tarif affiché, cela représente 4,20 dollars par mois. À ce niveau, le coût d'inférence cesse d'être un critère de décision, ce qui change la façon de concevoir une architecture. Nous détaillions la structure d'un budget IA complet, où le modèle pèse souvent peu, dans notre article sur le coût d'un projet IA.

Deux précautions avant de s'emballer. D'abord, l'éditeur prévient que ses limites de débit s'ajustent dynamiquement face à la demande, ce qui est normal pour un produit lancé il y a une semaine mais mérite d'être pris en compte dans un dimensionnement. Ensuite, l'anglais est la langue d'entraînement principale : les autres langues sont prises en charge, mais pas aussi bien. Pour un usage sur du contenu en français, un test sur vos propres données s'impose avant toute mise en production.

Cas d'usage n° 1 : trier et router les demandes entrantes

C'est le cas le plus immédiat. Un service client, une boîte de réception commerciale ou un formulaire de contact reçoivent des messages de nature très différente. Certains se règlent par une simple recherche en base, d'autres demandent un modèle de langage chargé d'un contexte métier, d'autres encore un humain. Faire passer chaque message par un grand modèle pour savoir de quoi il s'agit coûte cher et prend plusieurs secondes.

Avec Jev, un seul appel pose plusieurs questions en même temps : quelle est l'intention parmi une liste fermée, quel est le niveau de complexité sur une échelle, s'agit-il d'une réclamation, le client mentionne-t-il une résiliation. Le code applique ensuite des règles explicites. Une demande de facture part vers une réponse automatique sans aucun modèle génératif. Une question technique part vers un assistant spécialisé. Une réclamation complexe, ou tout cas où la confiance est basse, part vers un humain.

L'intérêt n'est pas seulement économique. La politique de routage vit dans le code, lisible, testable et modifiable sans réécrire un prompt. Si la direction décide de traiter en priorité les clients à risque de départ, on change un seuil, pas une instruction en langage naturel dont on ne mesure pas les effets de bord. C'est exactement la frontière que nous décrivions entre agent IA et automatisation : le code garde la main, l'IA fournit le jugement ponctuel.

Cas d'usage n° 2 : poser des garde-fous autour d'un assistant IA

Tout assistant conversationnel en production pose la même question : comment empêcher qu'un utilisateur le détourne, et comment vérifier qu'il ne répond pas n'importe quoi. Écrire les règles dans le prompt système, c'est les placer exactement là où une tentative de contournement cherche à passer. Placer un second grand modèle devant le premier double la latence et le coût à chaque échange, et ce second modèle peut lui aussi être manipulé.

Le guide publié par TypeSafe sur les garde-fous propose une autre architecture. Chaque message entrant et chaque réponse sortante passent par un appel Jev qui pose une batterie de questions Noul, une par risque identifié : tentative de contournement des consignes, demande de données personnelles, sujet hors périmètre, propos illicites. Une question Score évalue en plus la gravité du préjudice potentiel. Le code décide alors, selon des seuils que vous fixez, de laisser passer, de mettre en revue, de bloquer ou de rediriger vers le support.

Le bénéfice tient en trois points : des règles écrites à un endroit que vous maîtrisez plutôt qu'enfouies dans les poids d'un modèle tiers, un contrôle qui ajoute une centaine de millisecondes plutôt que plusieurs secondes, et une trace structurée de chaque décision, utile pour comprendre un incident. Les erreurs courantes dans ce domaine sont détaillées dans notre article sur la sécurité des agents IA. Une réserve importante : la documentation reconnaît que la version actuelle peut être influencée par un contenu conçu pour la manipuler. Un garde-fou Jev réduit le risque, il ne dispense pas de tester vos cas limites.

Cas d'usage n° 3 : mieux classer les documents d'un RAG

Un système de RAG, qui fait répondre un modèle à partir de vos documents internes, repose sur une étape souvent négligée : retrouver les bons passages. La recherche rapide, par mots-clés ou par vecteurs, ramène une liste de candidats plausibles, mais elle ne sait pas dire lequel répond vraiment à la question. Si le bon passage arrive en quinzième position, le modèle génératif ne le verra pas, et répondra à côté.

Le reclassement consiste à noter chaque candidat de cette liste courte face à la question, puis à remettre le meilleur en tête. TypeSafe a publié un test sur un jeu de décisions de justice : 3 565 passages, 40 requêtes, une liste courte de 30 candidats par requête produite par une recherche par mots-clés. Avec un reclassement par Jev, le bon passage arrive en première position dans 18 % des cas contre 5 % sans, et figure dans les dix premiers dans 62 % des cas contre 38 %. Le jeu de test est petit et très spécialisé, mais l'écart est net, et le coût de l'étape reste marginal.

Le même principe sert à trier les passages avant de les envoyer au modèle génératif. Moins de contexte inutile, c'est une réponse plus juste, et une facture moins lourde sur le modèle le plus cher de la chaîne.

Ce que Jev ne sait pas faire

TypeSafe publie une liste honnête de ses propres limites connues pour la version 1.13, mise à jour le 17 septembre 2026. Elle mérite d'être lue avant tout projet, parce qu'elle dessine précisément la frontière d'usage.

Jev ne calcule pas : l'arithmétique, les comptages et les comparaisons de dates doivent rester dans le code. Il lit les consignes au pied de la lettre, ce qui oblige à écrire exactement la condition voulue plutôt que de compter sur une interprétation. Il perd en précision quand on le noie sous un contexte trop large et sans rapport avec la question, donc il faut filtrer avant d'envoyer. Il gère mal les questions à double négation ou à plusieurs étapes de raisonnement. Et il ne génère pas de texte : pour rédiger une réponse, un résumé ou du code, un modèle de langage reste l'outil adapté.

Cette liste n'est pas un défaut de communication, c'est un mode d'emploi. Jev est un composant de décision rapide, à placer au bon endroit d'une architecture, pas un remplaçant universel des modèles existants. Nous faisions le même constat à propos d'OpenRouter : la bonne question n'est jamais quel est le meilleur modèle, mais quel modèle pour quelle étape.

Comment l'intégrer sans se tromper

La méthode que recommande l'éditeur, et que nous partageons, consiste à partir du comportement attendu de l'application puis à remonter vers les décisions nécessaires. Tout ce qui est règle connue, calcul ou recherche exacte reste dans le code. Seules les décisions qui demandent une compréhension du langage sont confiées au modèle, sous forme de questions étroites et bien définies.

Trois réflexes font la différence. Découper une décision complexe en plusieurs questions simples, puis les combiner par une formule que vous maîtrisez, plutôt que de demander une note globale. Utiliser la confiance comme second signal pour décider quand agir automatiquement et quand escalader. Et figer la version du modèle dans votre code une fois vos seuils réglés, puisque l'alias jev-latest pointera demain vers une nouvelle version dont les réponses pourront différer.

Côté données, TypeSafe indique ne pas entraîner Jev sur les requêtes et réponses de ses clients, et propose une option sans conservation des données pour les comptes entreprise. Pour des données personnelles ou sensibles, la localisation du traitement et les éventuels transferts hors de l'Union européenne restent à instruire, comme pour n'importe quel fournisseur d'IA.

Ce que nous en retenons

Jev marque une idée plus qu'un produit : toutes les tâches d'IA n'ont pas besoin d'un modèle qui écrit. Une grande partie des automatisations réelles consiste à trier, noter, vérifier et router, et pour ces décisions un modèle rapide, bon marché et calibré est plus adapté qu'un assistant conversationnel à qui l'on demande du JSON.

Le produit a une semaine, ses limites de débit bougent encore et ses performances en français restent à mesurer. Mais sur le routage de demandes, les garde-fous d'assistants et le reclassement de documents, il ouvre des architectures qui étaient jusqu'ici trop lentes ou trop chères pour être raisonnables.

Nous intégrons ce type de composant dans nos projets d'assistants IA connectés à vos données, en commençant toujours par un test sur vos propres cas. Si vous avez un flux de demandes à trier ou un assistant à sécuriser, parlons-en.

Questions fréquentes

Qu'est-ce que Jev de TypeSafe AI ?

Jev est un modèle d'intelligence artificielle lancé en septembre 2026 par TypeSafe AI. Contrairement aux modèles conversationnels, il ne génère pas de texte : il reçoit un contexte et des questions fermées, et renvoie des réponses typées avec des probabilités, sous trois formes appelées Choice, Score et Noul. TypeSafe le présente comme le premier modèle « System One », conçu pour des décisions rapides consommées directement par un programme.

Combien coûte Jev ?

La version jev-1.13 est facturée 0,042 dollar par million de jetons en entrée, et les jetons de sortie sont gratuits. La documentation indique que la plupart des requêtes aboutissent en environ 100 millisecondes, avec un contexte de 64 000 jetons par requête. Les limites de débit sont ajustées dynamiquement par l'éditeur depuis le lancement.

Quelle différence entre Jev et un LLM comme ChatGPT ?

Un grand modèle de langage conversationnel génère du texte et est entraîné à produire les réponses que les humains préfèrent. Jev ne génère pas de texte : il choisit parmi des options, note sur une échelle ou estime la probabilité qu'une affirmation soit vraie, et il est entraîné pour que ses probabilités soient calibrées. Il est adapté au tri, à la vérification et au routage, pas à la rédaction.

Pour quels cas d'usage utiliser Jev ?

Les cas les plus directs sont le tri et le routage de demandes entrantes vers le bon traitement, les garde-fous placés autour d'un assistant IA pour détecter les tentatives de contournement ou les sujets interdits, et le reclassement des documents retrouvés par un système RAG. Dans un test publié par TypeSafe sur des décisions de justice, le reclassement a fait passer le bon passage en première position dans 18 % des cas contre 5 % sans.

Jev fonctionne-t-il en français ?

Oui, mais l'anglais est sa langue d'entraînement principale et celle où sa précision est la meilleure. TypeSafe indique que les autres langues sont prises en charge sans l'être aussi bien, et recommande de tester le modèle sur ses propres contenus avant de s'y fier. Pour un usage en français, un test sur un échantillon représentatif est indispensable avant une mise en production.