Jev explose soudainement : ne sait pas discuter, ne code pas, se contente de juger

By: mp.weixin.qq.com|21/09/2026 00:32:00

Auteur : Zhu Xueying

Ces derniers jours, un modèle d'IA un peu atypique a soudainement fait le buzz.

Il s'appelle Jev.

Il ne sait pas discuter, ne code pas, et ne génère même pas de longues réponses comme ChatGPT. Il ne fait qu'une seule chose : porter des jugements.

Mais ce modèle, qui semble avoir "perdu une grande partie de ses capacités", a soudainement pris d'assaut le cercle des développeurs.

Certaines personnes l'ont utilisé pour analyser 724 publicités en temps réel en 40 secondes, portant le total à 8724 jugements ; d'autres l'ont intégré dans Claude Code pour nettoyer le contexte inutile ; et certains l'ont utilisé comme "arbitre" pour vérifier si les tâches étaient réellement accomplies. LangChain a également commencé à tester Jev en tant qu'évaluateur d'Agent.

Plus impressionnant encore, c'est la vitesse et le coût.

Dans les tests publiés par TypeSafe, Jev a atteint une vitesse maximale d'environ 193,6 fois, avec un coût réduit jusqu'à 444,6 fois. L'entrée de chaque million de tokens ne coûte que 0,042 USD, et la sortie de tokens est même gratuite.

Pourquoi un AI qui semble avoir moins de capacités est-il devenu si populaire ?

Parce qu'à l'ère des Agents, ce dont l'IA a vraiment besoin n'est peut-être pas seulement de "réfléchir profondément", mais aussi de jugements massifs, rapides et bon marché : que faire ensuite, quel outil utiliser, la tâche est-elle vraiment accomplie ? Plus important encore, ces jugements devront à l'avenir être réalisés par l'IA elle-même en arrière-plan, sans qu'une personne doive rester devant l'écran. Ce que Jev vise, ce sont ces petites décisions qui peuvent se produire des millions de fois par jour.

Plus intéressant encore, le fondateur du modèle Jev, Diogo Almeida, a justement participé à RLHF, et maintenant il commence à réfléchir à RLHF : cette méthode d'entraînement qui a rendu ChatGPT utile pourrait ne pas convenir à l'automatisation réelle de l'IA.

Il y a un peu plus d'un mois, Almeida a donné une conférence. En y repensant maintenant, cette conférence était presque le "manuel de pensée" de Jev.

Pourquoi l'IA sait-elle faire des mathématiques avancées, mais pas bien le service client ?

Le parcours de Diogo Almeida est assez particulier.

Il a travaillé chez OpenAI, participant aux travaux sur GPT-4, ChatGPT et InstructGPT/RLHF. En d'autres termes, il a contribué à construire l'une des méthodes d'entraînement les plus importantes des grands modèles d'aujourd'hui.

Mais lors de cette conférence, il a commencé par se moquer de lui-même, se qualifiant comme l'un des rares à "critiquer" ouvertement ChatGPT au sein d'OpenAI.

Le thème de sa conférence était plus direct : Que se passe-t-il après RLHF ?

Diogo a d'abord posé une question qui semble contradictoire.

Les grands modèles d'aujourd'hui peuvent déjà relever des défis mathématiques très difficiles, le code, le raisonnement et divers benchmarks continuent de progresser.

Mais dans de nombreuses entreprises, les humains ne peuvent toujours pas être remplacés.

Par exemple, le service client.

Faire en sorte que l'IA recherche des informations, résume des documents, rédige des réponses, pas de problème.

Mais si l'on demande à l'IA de décider elle-même : cet argent doit-il être remboursé ? Ce client doit-il être indemnisé ?

Les entreprises deviennent soudainement prudentes.

Ces tâches semblent beaucoup plus simples que les mathématiques avancées, pourquoi ne pas oser les confier à l'IA ?

La réponse de Diogo est très simple : L'IA d'aujourd'hui est incroyable pour l'assistance, mais pas pour l'automatisation.

L'IA d'aujourd'hui est très efficace pour vous aider, mais elle n'est pas encore capable de terminer le travail toute seule.

Ces deux choses semblent ne différer que légèrement, mais en réalité, elles sont complètement différentes.

Peu importe la puissance de Claude Code, vous êtes généralement toujours assis devant l'ordinateur. Il écrit du code, vous regardez ; il modifie des fichiers, vous vérifiez ; s'il se trompe, vous lui demandez de corriger.

Ainsi, pour Diogo, Claude Code appartient toujours à l'"ère de l'assistance" ouverte par ChatGPT.

Qu'est-ce que l'automatisation réelle ?

L'humain n'est pas présent.

L'IA juge et exécute par elle-même en arrière-plan, pouvant fonctionner des dizaines de milliers, voire des millions de fois par jour, et vous ne verrez même jamais ce qu'elle a fait.

La question se pose alors : pourquoi l'IA d'aujourd'hui est-elle si intelligente, mais dépend-elle toujours des humains ?

Diogo a pointé du doigt quelque chose qu'il connaît très bien : RLHF.

Lorsque nous entraînons l'IA, nous avons inséré les humains dans le circuit

C'est un peu ironique.

Parce que RLHF est précisément l'une des lignes techniques que Diogo a contribué à promouvoir.

La logique de base de RLHF n'est en fait pas compliquée : collecter les préférences humaines, puis faire en sorte que le modèle corresponde de plus en plus à ces préférences.

Ainsi, Diogo a donné une explication très directe lors de sa conférence : pourquoi les grands modèles d'aujourd'hui ont-ils toujours besoin d'humains dans le circuit ?

Parce que lors de leur entraînement, nous avons littéralement inséré des humains dans ce circuit.

Le modèle apprend dès le départ : quel type de réponse les gens préfèrent ?

Cela explique également une caractéristique que nous connaissons très bien des grands modèles : même s'ils ne savent pas, ils peuvent souvent dire des choses qui semblent très plausibles.

Diogo a donné un exemple très amusant sur place.

Quelqu'un a envoyé à ChatGPT un enregistrement de rots, en lui disant que c'était une musique qu'il avait créée, et lui a demandé de l'évaluer "sincèrement et franchement".

Résultat : ChatGPT a sérieusement complimenté, disant que c'était une musique d'ambiance très sombre et étrange.

Diogo a même résumé cela par une phrase : "L'exagération est une caractéristique."

L'exagération n'est pas un bug, c'est une fonctionnalité.

Pour les produits de chat, cela n'est pas nécessairement fatal. Les utilisateurs sont encore devant l'écran, et peuvent corriger les erreurs.

Mais un système d'automatisation réel est complètement différent.

La machine ne se soucie pas de savoir si votre réponse est agréable à entendre, elle a juste besoin de connaître deux choses : que doit-elle faire, et quel est votre degré de certitude ?

Cela explique également pourquoi Jev, publié un peu plus d'un mois après, semble si atypique.

Donc, Jev ne laisse tout simplement pas l'IA "parler"

Les grands modèles ordinaires, même s'ils n'ont finalement besoin de répondre qu'à "A ou B", doivent souvent passer par le processus de génération de tokens.

Jev a directement supprimé cette partie.

Il fait actuellement principalement trois choses :

  • Noul, répondre Oui ou Non ;

  • Choice, choisir parmi plusieurs options ;

  • Score, évaluer selon des critères.

Puis il retourne directement le jugement et la probabilité.

Il ne vous écrit pas de petits essais, ni ne discute avec vous.

Le délai de bout en bout annoncé officiellement est aussi bas que 70 à 500 millisecondes, ce qui est 20 à 200 fois plus rapide que les modèles de pointe, avec des coûts réduits de 40 à 400 fois.

Mais ce qui est vraiment crucial, ce n'est pas "la rapidité", mais la probabilité qui suit.

Pour cela, TypeSafe a proposé une nouvelle méthode d'entraînement : RLCD, Reinforcement Learning for Calibrated Decisions, apprentissage par renforcement pour des décisions calibrées.

Le problème qu'il veut résoudre est très concret : si l'IA vous dit qu'il y a 80 % de chances que quelque chose se produise, peut-on vraiment faire confiance à ce 80 % ?

Idéalement, un ensemble de choses jugées avec 80 % de probabilité devrait en réalité se produire environ 80 % du temps.

C'est très important dans les systèmes d'automatisation.

99 % de certitude, cela peut être exécuté directement.

51 % de certitude, cela peut être confié à un modèle plus puissant et plus coûteux, ou même à un humain.

Le véritable problème n'est pas que l'IA ne sait pas, mais que l'IA ne sait pas qu'elle ne sait pas.

Ainsi, ce que Jev veut vraiment changer, c'est l'objet de la sortie de l'IA.

Les réponses générées par ChatGPT étaient principalement destinées à être lues par des humains. Les jugements et probabilités fournis par Jev sont destinés à être directement utilisés par des logiciels.

À l'ère des Agents, il se pourrait que ce dont nous avons besoin ne soit pas un cerveau plus grand

Cela explique également pourquoi Jev est devenu populaire maintenant.

Parce qu'une fois que les Agents fonctionnent réellement, ils produiront une multitude de petits jugements :

Quel outil appeler ensuite ? Quel bouton cliquer sur cette page web ? Cette information est-elle encore utile ? La tâche est-elle vraiment accomplie ? Les résultats doivent-ils être vérifiés à nouveau ?

Ces questions, prises individuellement, ne sont pas difficiles, mais un Agent peut avoir besoin de porter des jugements des dizaines de milliers, voire des millions de fois par jour.

Si chaque fois, on appelle le modèle le plus puissant, en prenant quelques secondes pour "réfléchir profondément", puis en crachant une longue série de tokens, les coûts et les délais vont rapidement augmenter.

Ce que Jev veut capturer, c'est ce niveau.

Confier à Jev un grand nombre de petites décisions fréquentes, et réserver les tâches nécessitant un raisonnement complexe pour les grands modèles.

C'est aussi pourquoi TypeSafe appelle Jev le Modèle Système Un.

Ce concept vient du "système 1" et "système 2" de Daniel Kahneman : l'un est responsable des jugements rapides et intuitifs, l'autre des réflexions lentes et complexes.

Le nom Jev vient même du "paradoxe de Jevons" :

Une ressource devient de moins en moins chère, les gens ne l'utiliseront pas moins, mais pourraient même l'utiliser davantage.

Si appeler l'IA coûte cher, vous ne l'utiliserez que pour les choses les plus importantes.

Mais si le coût d'un jugement par l'IA devient si faible qu'il peut presque être ignoré ?

Un e-mail, un journal, un appel d'outil, un bouton de page web, chaque étape exécutée par l'Agent pourrait inclure un jugement de l'IA.

Bien sûr, il est encore trop tôt pour dire que Jev représente la prochaine génération d'IA.

Son prétendu "zéro illusion" signifie davantage qu'il ne sort pas des types de réponses définis, et ne signifie pas qu'il ne peut pas se tromper ; des données extrêmes comme 193,6 fois et 444,6 fois proviennent principalement des tests de TypeSafe.

Mais ce qui mérite vraiment d'être noté dans la montée en puissance de Jev, ce n'est peut-être pas sa capacité à défier GPT ou Claude.

Mais plutôt qu'une personne ayant participé à la création de ChatGPT remet en question une question plus fondamentale :

Au cours des dernières années, l'ensemble de l'industrie a réfléchi à la manière de faire réfléchir l'IA plus longtemps et de lui faire dire plus.

Mais si l'avenir nécessite réellement des milliards de jugements entre machines, pourquoi l'IA doit-elle toujours "dire un discours" à chaque fois ?

ChatGPT a appris aux machines comment parler aux humains.

Et Jev parie sur la prochaine étape : lorsque les humains ne sont plus devant l'écran, l'IA peut-elle décider par elle-même ?

Prix de --

--
--
--

Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.

Vous pourriez aussi aimer

iconiconiconiconiconicon
Assistance client:@weikecs
Collaborations commerciales:@weikecs
Trading quantitatif/Market makers:bd@weex.com
Programme VIP:support@weex.com