英偉達實現快取跨模型重用,DeepSeek和Kimi優化KV快取
By: t.me|2026/08/10 04:14:22
0
分享
過去兩年,大模型推理優化聚焦於KV快取,模型在讀取上下文後留下的中間計算結果,內容越長,顯存和帶寬消耗越大。DeepSeek-V2通過MLA技術將KV快取減少93.3%,Kimi Linear則最多減少75%。各方努力降低長上下文的成本。但現有方案存在限制:快取通常只能在同一模型內部重用,切換模型時需重新計算前面幾萬甚至幾十萬Token,頻繁模型路由導致重複計算難以避免。英偉達最新論文提出解決方案,發現同一家族、KV結構匹配的不同大小模型之間,快取存在明顯線性關係。通過500段、每段1024 Token的文本校準,可以將一個模型的KV快取轉移至另一個模型使用。Qwen3-14B切換到32B時,32K上下文重新計算約需7秒,而轉換快取僅需約0.28秒,速度快約25倍。這意味著小模型可以先處理長上下文生成KV快取,待需要更強能力時再將快取轉給大模型進行生成。這種跨模型KV快取的成熟應用將使模型路由節省更多算力,簡單任務可由小模型完成,複雜問題再調用大模型,避免每次都從頭讀取上下文。
-- 價格
--
--
--
本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。
猜你喜歡

Anthropic 超過四成收入來自雲廠商間接渠道

瑞銀調研中國AI產業鏈:大模型加速迭代,資金開始湧向半導體

GoPlus DeepScan全面升級:推出AI智能合約安全全生命周期防護體系

美國銀行啟用AI模型性能與成本比較追蹤器
美國銀行(Bank of America·$BAC)正在運行一個內部AI模型追蹤器,用於比較大型語言模型的性能和成本。企業人工智慧(AI)...

DeepSeek漲價首日全球分叉:國內大廠跟價分三派,海外廠商還在打折

數位資產投資指標 xRev 的計算方法論及分析工具

超過53,000名加密貨幣擁有者本週失去了非金錢的東西

ZCode 免費送 1 億 GLM-5.3 Token 活動上線一小時暫停

模型可替換、工具可插拔:DeepSeek把Agent競爭從「大腦」推向「操作系統」

法國AI初創Kog押注軟體提速GPU推理

Temple透過Token Terminal上架公開了Canton應用指標
機構用非託管交易平台Temple在Token Terminal上架後,Canton網絡內的應用活動指標開始公開。

AI時代未來最重要的5個習慣

廣東首個詞元經濟金融產品 Token 貸 發布

K25.ai 啟動 KXXV 代幣社區輪,認購額度為 20 萬美元

閃迪投資者日的口號,高盛如何解讀

OpenAI 上線 Computer History 替代 Chronicle

Writer發布新模型Palmyra X6主打降本













