Claude Opus 5 surpasse Fable 5 sur la plupart des benchmarks—à moitié prix

By: rootdata|2026/07/24 18:28:43

Claude Opus 5 est disponible aujourd'hui. Il est moins coûteux pour les entreprises que le modèle phare d'Anthropic, Claude Fable 5, que la société avait positionné comme le produit de pointe quotidien pour les utilisateurs payants. De plus, Opus 5 le surpasse également sur des benchmarks significatifs.

Pour comprendre où s'inscrit Opus 5 : la gamme d'Anthropic se compose de quatre niveaux. Haiku est rapide et bon marché. Sonnet est de milieu de gamme. Opus est le cheval de bataille. Au-dessus se trouve la classe Mythos---un niveau qu'Anthropic a introduit ce printemps---qui comprend Claude Fable 5 pour le public, et Claude Mythos 5, une version avec moins de restrictions réservée aux chercheurs en cybersécurité vérifiés et aux opérateurs d'infrastructures critiques via le projet Glasswing.

Fable 5 a eu un parcours difficile en tant que produit phare pour les abonnés. Il a été lancé le 9 juin, retiré mondialement trois jours plus tard après que le gouvernement américain a émis un ordre de contrôle des exportations d'urgence en raison d'une vulnérabilité de jailbreak, et est revenu le 30 juin---pour passer immédiatement à un modèle uniquement basé sur des crédits, n'étant plus inclus dans les plans standard. Opus 5 remplit désormais le créneau que Fable 5 n'a pas pu maintenir.

Lovable, une plateforme de développement avec des millions d'utilisateurs, a testé Opus 5 lors de ses évaluations internes et a noté que les gains vont au-delà des scores bruts : "Ce n'est pas seulement meilleur sur nos tâches de codage agentiques les plus difficiles, avec une augmentation de 22 % par rapport à Opus 4.7, c'est aussi plus stable, avec beaucoup moins de variance d'une exécution à l'autre," a déclaré Fabian Hedin dans une déclaration partagée par Anthropic.

Les benchmarks

Cela peut sembler étrange, mais Opus bat Fable sur presque tout ce qui comptera pour l'utilisateur quotidien tout en n'étant pas étiqueté comme de classe Mythos comme Fable.

Sur Frontier-Bench v0.1---un benchmark qui teste si les agents de codage IA peuvent accomplir des tâches d'ingénierie logicielle réelles de bout en bout, noté en pourcentage de tâches réussies---Opus 5 a atteint 43,3 %. Fable 5 a obtenu 33,7 %. Le GPT-5.6 Sol d'OpenAI, principal concurrent commercial d'Anthropic, a obtenu 34,4 %.

La plus grande marge se trouve sur l'ARC-AGI-3, un test de résolution de problèmes authentique basé sur des énigmes nouvelles qu'un modèle n'aurait pas pu mémoriser à partir des données d'entraînement, noté en pourcentage d'énigmes résolues. Opus 5 a atteint 30,2 % ; le GPT-5.6 Sol a obtenu 7,8 % ; et Fable 5 n'a pas été testé du tout. Sur GDPval-AA v2---un benchmark de travail de connaissance noté via des évaluations Elo, le système de classement de style échecs utilisé pour mesurer la performance relative sur des tâches professionnelles réelles---Opus 5 a atteint 1 861 contre 1 747 pour Fable 5 et 1 736 pour GPT-5.6 Sol.

Zapier a testé Opus 5 sur AutomationBench, une évaluation qui note si un modèle peut gérer un flux de travail commercial complet du début à la fin sans aide humaine. Leur verdict : le modèle "a pris un workbook de santé de compte brut et a exécuté une séquence complète de prévention de désabonnement de bout en bout : signalant les comptes à risque, alertant le bon propriétaire et résumant pour les opérations de rétention. Les modèles précédents n'ont pas réussi ; Opus 5 a atteint 100 %.

Anthropic présente également Opus 5 comme une mise à niveau pour la recherche. Ultima Genomics, une entreprise de séquençage ADN, a déclaré que le modèle "se comporte plus comme un scientifique prudent que tout modèle que nous avons testé. Il choisit les bons tests statistiques pour éliminer les facteurs de confusion, vérifie ses propres résultats par des méthodes indépendantes et reste sur la bonne voie à travers de longues analyses en plusieurs étapes."

Cela dit, ces deux domaines---juridique et santé---sont les seuls dans lesquels Fable 5 excelle par une petite marge.

La sortie arrive une semaine après que Moonshot AI, une startup basée à Pékin soutenue par Alibaba, a dévoilé Kimi K3---un modèle à poids ouvert de 2,8 trillions de paramètres (ce qui signifie que tout le monde peut télécharger le code sous-jacent pour l'exécuter de manière indépendante) que Moonshot décrit comme le plus grand système d'IA ouvert au monde. Les benchmarks indépendants placent systématiquement Kimi K3 au troisième rang, derrière Fable 5 et GPT-5.6 Sol, battant ces deux derniers dans des domaines spécifiques.

Opus 5 est désormais disponible via API à 5 $ par million de tokens d'entrée et 25 $ par million de tokens de sortie. (Les tokens sont l'unité de base d'information qu'un modèle d'IA peut traiter tant en entrée qu'en sortie). Un mode rapide fonctionnant à environ 2,5 fois la vitesse par défaut est également disponible, au double du prix de base---10 $ par million de tokens d'entrée et 50 $ par million de tokens de sortie.

Cette sortie pourrait mettre fin à l'anxiété concernant le manque de disponibilité publique de Fable 5. Opus est également disponible par abonnement pour tout le monde.

Avertissement : Ce contenu est fourni à des fins de communication et d'information générale uniquement et ne constitue en aucun cas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, événements en ligne ou toute information mentionnée dans ce document ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, échanger ou traiter de quelque manière que ce soit des actifs crypto, ni à utiliser un quelconque service. Les actifs crypto sont très volatils et peuvent entraîner des pertes. Les services et événements en ligne de WEEX peuvent ne pas être disponibles dans toutes les régions et sont soumis aux lois, réglementations et conditions d'éligibilité applicables. Il vous appartient de veiller à ce que votre utilisation des services WEEX respecte la législation locale et d'évaluer soigneusement les risques avant de participer à toute activité liée aux cryptomonnaies.

Vous pourriez aussi aimer

iconiconiconiconiconicon
Assistance client:@weikecs
Collaborations commerciales:@weikecs
Trading quantitatif/Market makers:bd@weex.com
Programme VIP:support@weex.com