Ant Group surprend le monde de l'IA avec Ling-3.0-Flash, un modèle à poids ouverts de 124 milliards de paramètres qui n'active que 5,1 milliards par token et surpasse en benchmarks son prédécesseur d'un billion. Un exploit qui redéfinit l'efficacité computationnelle et les coûts de mise en œuvre des agents d'IA.
Ant Group, le géant fintech derrière Alipay, a lancé Ling-3.0-Flash le 23 juillet 2026. Le modèle a été développé par son laboratoire inclusionAI et remet en question la notion selon laquelle en IA, plus grand est toujours mieux.
Ling-3.0-Flash a 124 milliards de paramètres au total, mais n'active qu'environ 5,1 milliards par token pendant l'inférence. Cette architecture de Mélange d'Experts (MoE) permet à un sous-ensemble du réseau neuronal de s'engager pour chaque entrée, détaille Cryptobriefing.
Dans l'Indice d'Analyse de l'Intelligence Artificielle, le modèle a obtenu un score de 38, égalant ou surpassant son prédécesseur Ling-2.6-1T, qui avait un billion de paramètres complets. Cela le rend environ huit fois plus petit en nombre total de paramètres, mais compétitif sur les métriques qui importent pour les déploiements en production.
L'accomplissement principal réside dans les tâches centrales de raisonnement et de suivi des instructions. L'architecture combine raisonnement hybride avec MoE, atteignant l'efficacité sans sacrifier la qualité.
La longueur de contexte progresse également : la fenêtre native est de 262 000 tokens, avec des plans d'expansion à un million. Le mécanisme d'attention combine des couches d'Attention Delta de Kimi et d'Attention Latente à Multiples Têtes, connu sous le nom d'approche hybride-linéaire.
Ce design maintient les exigences de mémoire et de calcul gérables à mesure que le contexte grandit. Ant Group décrit cette technique comme fondamentale pour supporter des tâches complexes d'agents.
Ling-3.0-Flash a été spécifiquement pensé pour des agents d'IA de niveau production fonctionnant à haute fréquence. Ces flux de travail exigent une génération rapide de tokens, une adhérence fiable aux instructions et une gestion de contexte long sans dégradation.
Une bibliothèque massive où le bibliothécaire n'a besoin de sortir que cinq livres à la fois, peu importe la complexité de la question. C'est la métaphore utilisée par les développeurs pour expliquer l'approche.
L'efficacité en inférence est clé pour réduire les coûts. En n'activant que 5,1B de paramètres, le calcul nécessaire par requête est directement réduit, ce qui rend l'opération à grande échelle moins coûteuse.
Ant Group a déjà testé le modèle dans ses propres services Alipay. Bien que des chiffres spécifiques n'aient pas été révélés, la société souligne que le modèle est optimisé pour gérer des tâches complexes d'agents en production.
Le modèle a été publié sur Hugging Face sous licence MIT, la plus permissive dans le domaine du code ouvert. Cela permet l'utilisation, la modification et la redistribution commerciale sans redevances.
Un accès gratuit à l'API a également été proposé via OpenRouter et Kilo jusqu'au 3 août 2026. De plus, il est accessible par les canaux d'Ant Group et la passerelle d'IA de Vercel.
La licence MIT élimine les barrières pour les développeurs et les entreprises souhaitant l'intégrer dans leurs produits. Cela contraste avec d'autres modèles open source qui imposent des restrictions d'utilisation commerciale.
La décision d'Ant Group d'ouvrir le modèle vise à positionner l'entreprise comme un leader en efficacité. Selon le rapport original, cela pourrait accélérer l'adoption de l'IA dans des secteurs où les coûts d'inférence sont prohibitifs.
Si un modèle MoE de 124B avec 5,1B actifs peut égaler ou surpasser la ligne de base d'un billion de paramètres, la structure de coûts de mise en œuvre de l'IA capable diminue considérablement. L'inférence est là où les entreprises d'IA dépensent de l'argent après l'entraînement.
Cette avancée pourrait pousser d'autres laboratoires à repenser leurs stratégies d'échelle. L'efficacité devient un facteur compétitif clé, pas seulement le nombre de paramètres.
Le marché des agents d'IA en bénéficie directement, car les temps de réponse sont critiques. Des modèles comme Ling-3.0-Flash permettent des interactions plus rapides et des coûts prévisibles.
CryptoBriefing souligne que c'est un pas notable dans la course à l'efficacité de l'IA, avec des implications pour toute l'industrie. La combinaison de vitesse, de faible coût et de licence ouverte pourrait changer le paysage de l'intelligence artificielle.
Ant Group démontre que l'innovation ne signifie pas toujours construire le modèle le plus grand, mais le plus intelligent pour un usage réel. La communauté de développement peut déjà expérimenter avec cette nouvelle génération d'IA efficace.
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.



















![[Éditorial] Dans un marché devenu incertain, c'est finalement la 'résilience' qui fera la différence](/public-static/33_70806c0ee0.png?format=avif)









