英偉達 Qwen3.8-Flash-Next 在 GB300 NVL72 上實現超 1.6 萬 Token/秒吞吐

By: www.theblockbeats.info|2026/08/26 17:14:34

英偉達發布文章稱,阿里巴巴最新預覽模型 Qwen3.8-Flash-Next 已獲得英偉達 GB300 NVL72 平台支持。該模型總參數規模達 1760 億,每 Token 激活約 60 億參數,原生支持 26.2 萬 Token 上下文,並可通過 YaRN 擴展至 100 萬 Token,主要面向智能編程、文檔處理及工具調用等長上下文 Agent 應用。英偉達表示,Qwen3.8-Flash-Next 採用 Gated DeltaNet(GDN)與 Qwen Sparse Attention(QSA)混合架構,以降低長上下文場景下的計算和 KV 緩存開銷。測試顯示,在 GB300 NVL72 上,該模型單 GPU 吞吐量超過 1.6 萬 Token/秒,單用戶吞吐超過 200 Token/秒;同時支持 SGLang、vLLM 及 TensorRT-LLM 等推理框架。

-- 價格

--
--
--

本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。

猜你喜歡

iconiconiconiconiconiconiconiconicon
客戶服務:@weikecs
商務合作:@weikecs
量化做市商合作:bd@weex.com