Ant Group a annoncé le lancement de Ling 3.0 Flash par son organisation d'IA, InclusionAI, qui active seulement 5,1 milliards de tokens parmi un total de 124 milliards de paramètres. La version quantifiée FP8 a une capacité d'environ 128 Go, soit la moitié de celle de la version BF16. Les versions BF16 et FP8 de Ling 3.0 Flash sont disponibles sur Hugging Face et ModelScope sous licence MIT, et peuvent être distribuées via SGLang ou vLLM. Ce modèle adopte une structure de mélange d'experts (Mixture-of-Experts, MoE) qui n'active qu'un sous-ensemble de réseaux d'experts en fonction de l'entrée, réduisant ainsi la charge de calcul. Il prend en charge une fenêtre de contexte de 256K et peut être étendu jusqu'à 1M de tokens. Il vise une vitesse d'inférence de pointe de 1000 tokens par seconde pour les tâches à haute fréquence et un temps de réponse pour le premier token de moins de 100 ms. Selon la documentation officielle, Ling 3.0 Flash applique une structure d'attention linéaire hybride avec des couches KDA et MLA disposées en croix dans un rapport de 5:1. Ling 3.0 Flash sera disponible gratuitement du 23 juillet à 1h00 au 7 août à 0h59:59, heure coréenne, et en août, un rabais de 75 % sera appliqué, le prix normal étant de 0,40 yuan pour 1 million de tokens d'entrée et de 1,20 yuan pour 1 million de tokens de sortie.
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.

















