NVIDIA Qwen3.8-Flash-Next alcanza más de 16,000 Tokens/segundo en GB300 NVL72

By: www.theblockbeats.info|2026/08/26 17:14:34

NVIDIA ha publicado un artículo afirmando que el último modelo de Alibaba, Qwen3.8-Flash-Next, ha recibido soporte en la plataforma GB300 NVL72 de NVIDIA. Este modelo tiene un tamaño total de parámetros de 176 mil millones, activando aproximadamente 60 mil millones de parámetros por Token, con soporte nativo para un contexto de 262,000 Tokens, y puede ampliarse a 1 millón de Tokens a través de YaRN, orientado principalmente a aplicaciones de agentes de contexto largo como programación inteligente, procesamiento de documentos y llamadas a herramientas. NVIDIA ha indicado que Qwen3.8-Flash-Next utiliza una arquitectura mixta de Gated DeltaNet (GDN) y Qwen Sparse Attention (QSA) para reducir el costo computacional y de caché KV en escenarios de contexto largo. Las pruebas muestran que en el GB300 NVL72, el rendimiento de este modelo en una sola GPU supera los 16,000 Tokens/segundo, con un rendimiento por usuario que supera los 200 Tokens/segundo; además, es compatible con marcos de inferencia como SGLang, vLLM y TensorRT-LLM.

Precio de --

--
--
--

Este contenido se ofrece únicamente con fines informativos generales y no constituye un asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, operar o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.

Te puede gustar

Qualcomm lanza IMSDK 2.0 para impulsar el desarrollo de aplicaciones de IA en el borde

Apple lanza el Mac mini con chip M6, a partir de 899 dólares

El nuevo Mac mini con chip M6 tiene un precio inicial de 899 dólares, 100 dólares más que el modelo que reemplaza • Apple ha actualizado el Mac Studio y ha posicionado ambas líneas de productos para tareas de IA que se ejecutan localmente en los dispositivos • Las reservas comenzaron el martes, y se...

La CFTC está considerando la viabilidad de los futuros perpetuos en computación【Guía de tendencias recientes】

La CFTC está llevando a cabo una consulta sobre los "futuros perpetuos de computación". La fecha límite para presentar comentarios es el 20 de octubre de 2026. Por favor, participe a través de la página oficial.

Thomson Reuters desarrolla el modelo de IA legal 'Thomson' con 40 millones de dólares

Thomson Reuters ha invertido 40 millones de dólares en el desarrollo de su propio modelo de lenguaje grande (LLM) 'Thomson'. En lugar de utilizar un modelo de IA general, se ha desarrollado específicamente para el ámbito legal.

La IA china supera los modelos de ciberseguridad restringidos de OpenAI y Anthropic, advierte la industria del Bitcoin

Los líderes de empresas de Bitcoin y desarrolladores de código abierto informan que los modelos de IA chinos están ofreciendo resultados superiores en el trabajo de ciberseguridad defensiva que los sistemas fronterizos estadounidenses restringidos, obligando a depender de ellos para asegurar la infr...

Morgan Stanley interpreta: ¿Los precios de Token y H100 bajan simultáneamente, comenzando a enfriarse los costos de IA?

...

Contenido

Artículos recientes

Más

Últimos listados de monedas en WEEX

iconiconiconiconiconiconicon
Atención al cliente:@weikecs
Cooperación empresarial:@weikecs
Trading cuantitativo y CM:bd@weex.com
Programa VIP:support@weex.com