Jev explose soudainement : ne sait pas discuter, ne code pas, se contente de juger
Auteur : Zhu Xueying
Ces derniers jours, un modèle d'IA un peu atypique a soudainement fait le buzz.
Il s'appelle Jev.
Il ne sait pas discuter, ne code pas, et ne génère même pas de longues réponses comme ChatGPT. Il ne fait qu'une seule chose : porter des jugements.
Mais ce modèle, qui semble avoir "perdu une grande partie de ses capacités", a soudainement pris d'assaut le cercle des développeurs.
Certaines personnes l'ont utilisé pour analyser 724 publicités en temps réel en 40 secondes, portant le total à 8724 jugements ; d'autres l'ont intégré dans Claude Code pour nettoyer le contexte inutile ; et certains l'ont utilisé comme "arbitre" pour vérifier si les tâches étaient réellement accomplies. LangChain a également commencé à tester Jev en tant qu'évaluateur d'Agent.
Plus impressionnant encore, c'est la vitesse et le coût.
Dans les tests publiés par TypeSafe, Jev a atteint une vitesse maximale d'environ 193,6 fois, avec un coût réduit jusqu'à 444,6 fois. L'entrée de chaque million de tokens ne coûte que 0,042 USD, et la sortie de tokens est même gratuite.
Pourquoi un AI qui semble avoir moins de capacités est-il devenu si populaire ?
Parce qu'à l'ère des Agents, ce dont l'IA a vraiment besoin n'est peut-être pas seulement de "réfléchir profondément", mais aussi de jugements massifs, rapides et bon marché : que faire ensuite, quel outil utiliser, la tâche est-elle vraiment accomplie ? Plus important encore, ces jugements devront à l'avenir être réalisés par l'IA elle-même en arrière-plan, sans qu'une personne doive rester devant l'écran. Ce que Jev vise, ce sont ces petites décisions qui peuvent se produire des millions de fois par jour.
Plus intéressant encore, le fondateur du modèle Jev, Diogo Almeida, a justement participé à RLHF, et maintenant il commence à réfléchir à RLHF : cette méthode d'entraînement qui a rendu ChatGPT utile pourrait ne pas convenir à l'automatisation réelle de l'IA.
Il y a un peu plus d'un mois, Almeida a donné une conférence. En y repensant maintenant, cette conférence était presque le "manuel de pensée" de Jev.
Pourquoi l'IA sait-elle faire des mathématiques avancées, mais pas bien le service client ?
Le parcours de Diogo Almeida est assez particulier.
Il a travaillé chez OpenAI, participant aux travaux sur GPT-4, ChatGPT et InstructGPT/RLHF. En d'autres termes, il a contribué à construire l'une des méthodes d'entraînement les plus importantes des grands modèles d'aujourd'hui.
Mais lors de cette conférence, il a commencé par se moquer de lui-même, se qualifiant comme l'un des rares à "critiquer" ouvertement ChatGPT au sein d'OpenAI.
Le thème de sa conférence était plus direct : Que se passe-t-il après RLHF ?
Diogo a d'abord posé une question qui semble contradictoire.
Les grands modèles d'aujourd'hui peuvent déjà relever des défis mathématiques très difficiles, le code, le raisonnement et divers benchmarks continuent de progresser.
Mais dans de nombreuses entreprises, les humains ne peuvent toujours pas être remplacés.
Par exemple, le service client.
Faire en sorte que l'IA recherche des informations, résume des documents, rédige des réponses, pas de problème.
Mais si l'on demande à l'IA de décider elle-même : cet argent doit-il être remboursé ? Ce client doit-il être indemnisé ?
Les entreprises deviennent soudainement prudentes.
Ces tâches semblent beaucoup plus simples que les mathématiques avancées, pourquoi ne pas oser les confier à l'IA ?
La réponse de Diogo est très simple : L'IA d'aujourd'hui est incroyable pour l'assistance, mais pas pour l'automatisation.
L'IA d'aujourd'hui est très efficace pour vous aider, mais elle n'est pas encore capable de terminer le travail toute seule.
Ces deux choses semblent ne différer que légèrement, mais en réalité, elles sont complètement différentes.
Peu importe la puissance de Claude Code, vous êtes généralement toujours assis devant l'ordinateur. Il écrit du code, vous regardez ; il modifie des fichiers, vous vérifiez ; s'il se trompe, vous lui demandez de corriger.
Ainsi, pour Diogo, Claude Code appartient toujours à l'"ère de l'assistance" ouverte par ChatGPT.
Qu'est-ce que l'automatisation réelle ?
L'humain n'est pas présent.
L'IA juge et exécute par elle-même en arrière-plan, pouvant fonctionner des dizaines de milliers, voire des millions de fois par jour, et vous ne verrez même jamais ce qu'elle a fait.
La question se pose alors : pourquoi l'IA d'aujourd'hui est-elle si intelligente, mais dépend-elle toujours des humains ?
Diogo a pointé du doigt quelque chose qu'il connaît très bien : RLHF.
Lorsque nous entraînons l'IA, nous avons inséré les humains dans le circuit
C'est un peu ironique.
Parce que RLHF est précisément l'une des lignes techniques que Diogo a contribué à promouvoir.
La logique de base de RLHF n'est en fait pas compliquée : collecter les préférences humaines, puis faire en sorte que le modèle corresponde de plus en plus à ces préférences.
Ainsi, Diogo a donné une explication très directe lors de sa conférence : pourquoi les grands modèles d'aujourd'hui ont-ils toujours besoin d'humains dans le circuit ?
Parce que lors de leur entraînement, nous avons littéralement inséré des humains dans ce circuit.
Le modèle apprend dès le départ : quel type de réponse les gens préfèrent ?
Cela explique également une caractéristique que nous connaissons très bien des grands modèles : même s'ils ne savent pas, ils peuvent souvent dire des choses qui semblent très plausibles.
Diogo a donné un exemple très amusant sur place.
Quelqu'un a envoyé à ChatGPT un enregistrement de rots, en lui disant que c'était une musique qu'il avait créée, et lui a demandé de l'évaluer "sincèrement et franchement".
Résultat : ChatGPT a sérieusement complimenté, disant que c'était une musique d'ambiance très sombre et étrange.
Diogo a même résumé cela par une phrase : "L'exagération est une caractéristique."
L'exagération n'est pas un bug, c'est une fonctionnalité.
Pour les produits de chat, cela n'est pas nécessairement fatal. Les utilisateurs sont encore devant l'écran, et peuvent corriger les erreurs.
Mais un système d'automatisation réel est complètement différent.
La machine ne se soucie pas de savoir si votre réponse est agréable à entendre, elle a juste besoin de connaître deux choses : que doit-elle faire, et quel est votre degré de certitude ?
Cela explique également pourquoi Jev, publié un peu plus d'un mois après, semble si atypique.
Donc, Jev ne laisse tout simplement pas l'IA "parler"
Les grands modèles ordinaires, même s'ils n'ont finalement besoin de répondre qu'à "A ou B", doivent souvent passer par le processus de génération de tokens.
Jev a directement supprimé cette partie.
Il fait actuellement principalement trois choses :
Noul, répondre Oui ou Non ;
Choice, choisir parmi plusieurs options ;
Score, évaluer selon des critères.
Puis il retourne directement le jugement et la probabilité.
Il ne vous écrit pas de petits essais, ni ne discute avec vous.
Le délai de bout en bout annoncé officiellement est aussi bas que 70 à 500 millisecondes, ce qui est 20 à 200 fois plus rapide que les modèles de pointe, avec des coûts réduits de 40 à 400 fois.
Mais ce qui est vraiment crucial, ce n'est pas "la rapidité", mais la probabilité qui suit.
Pour cela, TypeSafe a proposé une nouvelle méthode d'entraînement : RLCD, Reinforcement Learning for Calibrated Decisions, apprentissage par renforcement pour des décisions calibrées.
Le problème qu'il veut résoudre est très concret : si l'IA vous dit qu'il y a 80 % de chances que quelque chose se produise, peut-on vraiment faire confiance à ce 80 % ?
Idéalement, un ensemble de choses jugées avec 80 % de probabilité devrait en réalité se produire environ 80 % du temps.
C'est très important dans les systèmes d'automatisation.
99 % de certitude, cela peut être exécuté directement.
51 % de certitude, cela peut être confié à un modèle plus puissant et plus coûteux, ou même à un humain.
Le véritable problème n'est pas que l'IA ne sait pas, mais que l'IA ne sait pas qu'elle ne sait pas.
Ainsi, ce que Jev veut vraiment changer, c'est l'objet de la sortie de l'IA.
Les réponses générées par ChatGPT étaient principalement destinées à être lues par des humains. Les jugements et probabilités fournis par Jev sont destinés à être directement utilisés par des logiciels.
À l'ère des Agents, il se pourrait que ce dont nous avons besoin ne soit pas un cerveau plus grand
Cela explique également pourquoi Jev est devenu populaire maintenant.
Parce qu'une fois que les Agents fonctionnent réellement, ils produiront une multitude de petits jugements :
Quel outil appeler ensuite ? Quel bouton cliquer sur cette page web ? Cette information est-elle encore utile ? La tâche est-elle vraiment accomplie ? Les résultats doivent-ils être vérifiés à nouveau ?
Ces questions, prises individuellement, ne sont pas difficiles, mais un Agent peut avoir besoin de porter des jugements des dizaines de milliers, voire des millions de fois par jour.
Si chaque fois, on appelle le modèle le plus puissant, en prenant quelques secondes pour "réfléchir profondément", puis en crachant une longue série de tokens, les coûts et les délais vont rapidement augmenter.
Ce que Jev veut capturer, c'est ce niveau.
Confier à Jev un grand nombre de petites décisions fréquentes, et réserver les tâches nécessitant un raisonnement complexe pour les grands modèles.
C'est aussi pourquoi TypeSafe appelle Jev le Modèle Système Un.
Ce concept vient du "système 1" et "système 2" de Daniel Kahneman : l'un est responsable des jugements rapides et intuitifs, l'autre des réflexions lentes et complexes.
Le nom Jev vient même du "paradoxe de Jevons" :
Une ressource devient de moins en moins chère, les gens ne l'utiliseront pas moins, mais pourraient même l'utiliser davantage.
Si appeler l'IA coûte cher, vous ne l'utiliserez que pour les choses les plus importantes.
Mais si le coût d'un jugement par l'IA devient si faible qu'il peut presque être ignoré ?
Un e-mail, un journal, un appel d'outil, un bouton de page web, chaque étape exécutée par l'Agent pourrait inclure un jugement de l'IA.
Bien sûr, il est encore trop tôt pour dire que Jev représente la prochaine génération d'IA.
Son prétendu "zéro illusion" signifie davantage qu'il ne sort pas des types de réponses définis, et ne signifie pas qu'il ne peut pas se tromper ; des données extrêmes comme 193,6 fois et 444,6 fois proviennent principalement des tests de TypeSafe.
Mais ce qui mérite vraiment d'être noté dans la montée en puissance de Jev, ce n'est peut-être pas sa capacité à défier GPT ou Claude.
Mais plutôt qu'une personne ayant participé à la création de ChatGPT remet en question une question plus fondamentale :
Au cours des dernières années, l'ensemble de l'industrie a réfléchi à la manière de faire réfléchir l'IA plus longtemps et de lui faire dire plus.
Mais si l'avenir nécessite réellement des milliards de jugements entre machines, pourquoi l'IA doit-elle toujours "dire un discours" à chaque fois ?
ChatGPT a appris aux machines comment parler aux humains.
Et Jev parie sur la prochaine étape : lorsque les humains ne sont plus devant l'écran, l'IA peut-elle décider par elle-même ?
Prix de --
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.
Vous pourriez aussi aimer

Ondo lance des jetons de portefeuille BlackRock pour les investisseurs non américains

Une illusion de volume de 1 milliard de dollars ? Test de la capacité de vente réelle des tokens d'actions Coinbase pendant la fermeture du marché américain

Les paiements à l'ère de l'IA : tendances commerciales et points de conformité

Plus l'IA est forte, moins les salaires sont élevés : votre diplôme devient un actif dévalué coûteux

NYSE assemble les infrastructures pour un marché d'actifs tokenisés de 5,5 trillions de dollars

Aujourd'hui sur le marché des cryptomonnaies : Wall Street se tourne vers la tokenisation, les stablecoins américains veulent se mondialiser

Le FMI demande moins de réformes, mais plus profondes, pour faire face à une économie mondiale plus vulnérable

L'enthousiasme autour de 'Muse' de Meta... "Un moment iPod pour l'IA" (Résumé)

Russie : Le marché crypto chiffré à 44 milliards de dollars

L’action Krafton touche un plus bas sur 52 semaines : que se passe-t-il chez le créateur de PUBG ?
L’action Krafton a atteint un nouveau plus bas sur 52 semaines, alors qu’une controverse liée à une interdiction dans l’esport PUBG au Vietnam accentue la pression, malgré l’annonce récente de records de chiffre d’affaires et de bénéfices au premier semestre.

Le président de la CFTC appelle à une « tokenisation massive » ! Wall Street doit surmonter trois obstacles pour passer à la blockchain

Le cours de l’action NSE débute aujourd’hui à une valorisation supérieure à celle du Nasdaq : voici pourquoi
La NSE a fait son entrée en Bourse aujourd’hui à environ 43 fois ses bénéfices, un multiple supérieur à ceux du Nasdaq, d’ICE et de Hong Kong Exchanges réunis. Selon les analystes, les investisseurs ne valorisent pas seulement la plateforme, mais aussi les perspectives de croissance de l’Inde.

La fin du prompt vierge : pourquoi l’IA de trading a besoin d’un playbook

La proposition de Cardano réduit les frais de 55 %, mais a un coût pour les petits pools

Le farming de liquidité sur Aerodrome représentait 90 % des transferts d’USDC, selon un analyste

À quelle fréquence les grandes plateformes publient-elles réellement leur preuve de réserves ?

Un volume trading de 1 Md $ masque des risques de liquidité cachés pour les détenteurs de tokens d’action Coinbase

Les stablecoins détiennent près de 200 Md $ de dette américaine, mais les fonds monétaires ont absorbé la hausse

Liquid suspend les rachats de L-BTC après une attaque ; l’attaquant détient plus de 51 M $ en Bitcoin

Pourquoi laisser ses cryptomonnaies sur une plateforme crypto n’équivaut-il pas à les détenir dans son propre portefeuille ?

Enlèvements et séquestrations : les cryptos volées peuvent-elles être récupérées ?

BlackRock redéfinit l'argent crypto pour les machines avec Bitcoin et stablecoins

PQLN rend les niveaux de communication du Lightning Network de Bitcoin résistants aux ordinateurs quantiques

Raoul Pal prévoit un doublement des utilisateurs de cryptomonnaies grâce à l'IA

a16z et DeFi Education Fund proposent à la SEC d'établir un cadre d'exemption pour les DEX et d'enregistrement pour les CEX

Prometheum détaille les droits de propriété pour les actions américaines tokenisées

Geo lance des débats de style TikTok avec un affrontement sur la loi CLARITY

Nephos et Brinc apportent un soutien à la conformité crypto aux startups du GCC

La SEC avance dans l'examen des propositions de règles sur la garde des actifs cryptographiques









