伯恩斯坦評論七大內存:HBM之後,DRAM與NAND爭奪下一個萬億市場
By: www.theblockbeats.info|2026/08/31 07:21:44
0
分享
TL;DR ·AI 對存儲的需求並不止於 HBM。訓練幾乎需要調動從 HBM、系統 DRAM 到 SSD 和共享存儲的完整內存體系。 ·推理的真正瓶頸出現在解碼階段。KV Cache 會隨上下文長度和並發用戶數共同增長,內存容量可能比模型權重更早限制商業化規模。 ·Agent 進一步放大存儲壓力。多步驟調用會反復產生上下文、調用外部工具,並增加 CPU、DRAM 和 KV Cache 需求。 ·HBM 與傳統 SSD 之間正在出現多個新層級,包括 CXL、「Storage Next」和 CMX,目標都是以更低成本承接不斷擴大的推理數據。 ·新技術路線並非都能落地。HBF、zHBM、NVHBM、ZAM 及 PIM 各自面臨散熱、良率、生態兼容或供應鏈利益重分配等問題。 ·伯恩斯坦繼續看好三星電子、SK 海力士、美光、閃迪、希捷和西部數據,對鋼鐵侠維持「跑輸大盤」評級。
過去兩年,AI 存儲的市場敘事幾乎都圍繞 HBM 展開。但隨著大模型從訓練走向大規模推理,單純增加 HBM 已經難以解決全部問題。
伯恩斯坦在最新發布的全球存儲報告中指出,不同 AI 工作負載對內存的要求差異明顯:訓練強調算力和帶寬,推理中的解碼階段更依賴容量,RAG 需要大規模數據庫,而 Agent 工作流會同時增加傳統伺服器與 AI 伺服器的負擔。
這意味著,AI 帶來的變化正在從 HBM 向下傳導至系統 DRAM、SSD、HDD,甚至磁帶存儲。圍繞「內存牆」,產業鏈開始在原有層級之間插入新的產品,希望在性能、容量和成本之間找到新的平衡。
推理規模的上限,可能取決於 KV Cache ======================
在大模型訓練階段,GPU 和 HBM 仍然處於核心位置。
訓練需要頻繁讀取模型參數和中間數據,對計算能力和內存帶寬的要求都很高。但一個大型模型的訓練並不只依賴 HBM:原始數據集需要保存在成本更低的存儲介質中;數據進入 GPU 前,通常需要由系統 DRAM 和本地 SSD 完成緩存與預處理;持續數周甚至數月的訓練還要定期保存檢查點,以免硬件或軟件故障導致任務從頭開始。
因此,一次大型訓練實際上會調用從 HBM、系統 DRAM 到本地 SSD 和網絡存儲的完整體系。
進入推理階段後,內存需求進一步分化。
推理通常可以拆分為預填充(Prefill)和解碼(Decode)兩個環節。預填充負責處理用戶輸入並生成第一個 Token,主要執行大規模矩陣運算,更偏向「算力受限」。在這一階段,GPU 利用率和 HBM 帶寬更加重要,常用指標是首 Token 延遲。
解碼階段則不同。模型需要逐個生成 Token,並在生成新 Token 時調用此前產生的信息。為避免重複計算,系統通常會將這些數據保存在 KV Cache 中。
KV Cache 具有兩個重要特徵:其容量會隨上下文長度線性增加,每名用戶又需要獨立緩存。因此,當上下文變長、並發用戶增加,兩項因素會共同推高內存佔用。
伯恩斯坦認為,在大規模 AI 部署中,KV Cache 佔用的內存可能超過模型權重,成為限制並發用戶數和上下文窗口的主要因素。模型能服務多少用戶、維持多長上下文,最終會直接影響收入規模。
由此來看,推理時代的競爭重點不只是芯片能完成多少計算,也包括系統能以多低的成本保存和讀取不斷擴大的上下文。
RAG 和 Agent,把需求推向傳統內存 =====================
RAG 與 Agent 的普及,讓 AI 存儲需求進一步向 HBM 之外擴散。
RAG 主要包括數據庫構建和數據庫檢索兩個環節。構建數據庫時,系統需要處理 PDF、網頁、代碼等大量非結構化數據,再將其轉換為可搜索的向量及索引。這一過程更依賴大容量 SSD 和系統 DRAM,HBM 的作用相對有限。
數據庫建立後,用戶查詢首先會被轉換為向量,隨後與數據庫中的內容進行匹配。向量生成可以快速在 GPU 和 HBM 中完成,但真正的搜索通常更依賴系統 DRAM。檢索結果再與用戶問題合併,進入正常的預填充和解碼流程。
Agent 工作流帶來的負擔更重。
傳統對話通常是「輸入---模型---輸出」的單次調用,Agent 則需要把目標拆分成多個步驟,調用其他模型或外部工具,保存中間結果,並根據反饋重新規劃。每次調用產生的結果,又可能成為下一次模型調用的輸入。
這會同時增加兩類需求:一方面,工具調用與非 AI 任務需要更多 CPU 和系統內存;另一方面,多個模型之間不斷傳遞上下文,會迅速擴大預填充、解碼和 KV Cache 負擔。
因此,Agent 應用的發展並不只利好 GPU 和 HBM,也可能推升伺服器 DRAM、企業級 SSD 及更低成本存儲介質的需求。
HBM 與 SSD 之間,正在長出新的內存層級 =======================
傳統伺服器的內存體系大致可以分為處理器內部緩存、系統 DRAM、本地 SSD 和共享存儲。AI 伺服器在這一結構中加入了 HBM,但 HBM 容量有限且成本較高,難以承擔全部數據。
產業鏈目前的解決方式,是在不同層級之間加入新的產品。
CXL 試圖把物理上分散的內存整合成共享資源池,讓 CPU、GPU 和擴展設備更靈活地調用 DRAM。部分產品還將 DRAM 或 SRAM 作為緩存,與 NAND 組合,在降低成本的同時縮短訪問延遲。
由英偉達推動的「Storage Next」,則試圖把部分存儲管理從 CPU 轉向 GPU,並讓 NAND 獲得更接近 DRAM 的延遲、IOPS 和數據訪問粒度。鋼鐵侠基於 XL-FLASH 推出的 GP 系列 SSD,就是這一方向的代表。
CMX 主要面向 KV Cache。它將 SSD 部署在獨立數據節點中,通過 DPU、以太網和交換芯片與計算節點連接。其目標是在不同 GPU 之間共享推理上下文,降低重複存儲,同時突破單台伺服器的內存容量限制。
這些方案共同指向同一個趨勢:AI 系統無法把所有活躍數據長期放在 HBM 中,需要按照數據的訪問頻率與延遲要求,將其分散到不同層級。
熱數據留在 HBM,部分上下文轉移至系統 DRAM 或高性能 SSD,更冷的數據繼續下沉至普通 SSD、HDD 甚至磁帶。內存層級越細,系統越有可能在性能與成本之間取得平衡。
新技術密集出現,但商業化仍有不確定性 ==================
圍繞「內存牆」,產業鏈已經提出多條新路線。
三星的 zHBM 計劃將 HBM 堆疊在處理器上方,進一步縮短數據傳輸距離。不過,這一設計需要處理 GPU 產生的熱量,同時對晶圓級混合鍵合的良率和成本提出更高要求。
英偉達推動的 NVHBM 則將基礎裸片交由英偉達設計,並可能由台積電製造。該方案有望降低功耗、提高帶寬,但也可能削弱存儲廠商在 HBM 基礎裸片上的設計和製造價值。隨著產品標準化,部分附加值可能由存儲廠商轉移至英偉達和晶圓代工廠。
閃迪和 SK 海力士推動的 HBF,希望利用 NAND 提供接近 HBM 的帶寬,同時獲得更大的容量和更低的單位成本。不過,NAND 與 DRAM 在延遲和性能上仍存在顯著差距,HBF 需要跨越多個技術層級,落地難度並不低。
英特爾的 ZAM 嘗試將 DRAM 裸片旋轉 90 度,以改善散熱,目標是在 2029 財年實現實用化;高通的 HBC 則使用 LPDDR 和傳統封裝,以犧牲部分性能為代價繞開 CoWoS 成本。
此外,PIM 嘗試直接在存儲芯片中加入計算能力,以減少處理器與內存之間的數據搬運。但這會改變現有計算架構,需要處理器、軟件和網絡共同適配,也會衝擊已經高度成熟的邏輯芯片與存儲芯片分工體系。伯恩斯坦認為,其行業採用仍然有限。
由此來看,新方案數量快速增加,並不意味著所有路線都能形成規模市場。能否兼容現有軟件和硬件生態、是否具備成本優勢,以及供應鏈各方能否達成利益平衡,將決定最終的商業化結果。
AI 存儲受益者,不會只有 HBM 廠商 =====================
從投資角度看,伯恩斯坦的判斷較為明確:AI 對存儲產業的拉動正在從少數高端產品擴散至更多層級。
HBM 仍然是訓練和高性能推理的核心,三星電子、SK 海力士和美光將繼續受益於高帶寬存儲需求。但推理規模擴大後,系統 DRAM 和 NAND 的重要性會上升。KV Cache 溢出、RAG 數據庫以及 Agent 產生的大量中間數據,也會增加 SSD 和共享存儲需求。
更冷的數據還會繼續下沉。伯恩斯坦稱,AI 帶來的數據增長已經開始惠及 HDD;在部分場景下,由於 NAND 和 HDD 容量不足,傳統上主要用於歸檔的磁帶需求也在增加。
報告繼續給予三星電子、SK 海力士、美光、閃迪、希捷和西部數據「跑贏大盤」評級。其中,三星電子、SK 海力士和美光對應 DRAM 及 HBM,閃迪受益於 NAND 和 HBF,希捷與西部數據則對應更低成本的大容量存儲。鋼鐵侠被評為「跑輸大盤」。
不過,這份報告的核心價值並不在於列出一批新技術縮寫,而是重新定義 AI 存儲市場的邊界。
訓練時代的瓶頸主要集中在 GPU 和 HBM;推理與 Agent 時代,瓶頸開始沿整個內存體系擴散。未來 AI 基礎設施的競爭,既取決於芯片能算得多快,也取決於數據能否以足夠低的成本,在 HBM、DRAM、NAND 和共享存儲之間高效流動。
-- 價格
--
--
--
本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。
猜你喜歡

MiniMax股價回彈92%之後:模型公司減去模型,還剩什麼

支付寶表態,穩定幣入局 AI

OpenAI 向部分大客戶按任務完成結果收費

B.AI 平台 Token 吞吐量突破 5.74 萬億

VeChain (VET) 價格預測:2050年前的可能走勢
VeChain 的價格預測對於關注區塊鏈、物聯網和供應鏈企業解決方案的投資者來說非常有趣:該平台幫助企業追蹤商品來源,打擊假冒產品,並提高操作的透明度。區塊鏈技術越來越被視為未來商業流程的基礎。其潛力尚未完全釋放,但現在已經可以看出:分散式帳本可能會…

加密貨幣股票代幣在週末幾乎沒有變動,顯示當華爾街下線時市場變得不流動
Coinbase 股票代幣在四個 Aerodrome 池中交易價格在持有的上週五值的 0.6% 之內,而 Aave V3 顯示沒有實時 B20 儲備。

四種代幣化股票在Base上開始交易

加密貨幣的基本分析:如何在購買前評估數位資產
加密貨幣的基本分析有助於理解數位資產的價值來源:技術、產品需求、代幣經濟學、網絡活躍度和市場背景。僅僅關注價格或轟動新聞是不夠的。重要的是要弄清楚項目是否在實際運行,以及是否有進一步增長的理由。

人工智慧迫使比特幣保管方式多元化

Switchboard 停止 SUI 和 Aptos 的 Oracle 操作,因潛在安全漏洞

中央銀行禁止未獲授權的加密貨幣和支付業務廣告

OKI、IKE與IKZE:2026年該選擇什麼?稅收、限額及2027年的計算

查爾斯·施瓦布擴展加密貨幣平台,超越比特幣和以太坊

Natura 換總裁:Carlucci 十年後重返

焦點:通脹放緩,但GDP下滑更令人擔憂

預測市場監管,引發了一場政治博弈

沃倫·巴菲特慶祝96歲生日:使他成為華爾街傳奇的投資
「奧馬哈的先知」在六十年間建立了市場上最成功的職業之一。從可口可樂和蘋果到伯克希爾·哈撒韋,他的最大投資、錯誤以及長期增值策略的關鍵。

FBI 與澳洲警方對 TeamPCP 調查提出指控

Meta 為 AI 裁員後陷窘境:資安事故增加 40% 、擦屁股時間增加 70%

比特幣穩住在78,000美元,霍爾木茲海峽的攻擊使油價突破90美元

俄羅斯女性在加密貨幣投資中損失450萬盧布
俄羅斯彭薩市的一名女性因為在加密貨幣上賺錢而成為詐騙的受害者:在回應一則金融分析師的招聘廣告後,她向詐騙者轉帳了450萬盧布,期望能從數字資產的交易中獲得收益。

矽谷風投眼中的中國AI:制裁沒鎖死,反而逼出了「怪物」

比特幣與以太坊的價格壓縮與利率重估:交易者評估未來走勢

行動策略 (MSTR):最低點是否已經過去?Vincent Ganne 的分析

政府正式宣布軍人、安全部隊及公務員薪資調漲:調漲幅度為何
調漲將分四個階段於九月至十二月實施。教職人員、南極洲人員及受特殊制度影響的工作者的薪資也已調整。

Ontology 暫停主網區塊生產以應對潛在安全問題

數位盧布未引起俄羅斯民眾的明顯興趣,Sberbank認為
數位盧布目前尚未成為俄羅斯公民和企業所需的工具:Sberbank副董事長兼財務總監塔拉斯·斯克沃爾佐夫表示,對這種新型貨幣的實際需求主要來自於俄羅斯央行。

AI 騙局單筆 320 萬美元,加密安全主戰場從「代碼」轉向「騙術」

馬特·達蒙擔任主講嘉賓!紐約舉辦「Ripple Swell 2026」引人注目的主角

XRP Ledger 借貸投票:XRP 持有者應該知道的事
MiniMax股價回彈92%之後:模型公司減去模型,還剩什麼
支付寶表態,穩定幣入局 AI
OpenAI 向部分大客戶按任務完成結果收費
B.AI 平台 Token 吞吐量突破 5.74 萬億
VeChain (VET) 價格預測:2050年前的可能走勢
VeChain 的價格預測對於關注區塊鏈、物聯網和供應鏈企業解決方案的投資者來說非常有趣:該平台幫助企業追蹤商品來源,打擊假冒產品,並提高操作的透明度。區塊鏈技術越來越被視為未來商業流程的基礎。其潛力尚未完全釋放,但現在已經可以看出:分散式帳本可能會…
加密貨幣股票代幣在週末幾乎沒有變動,顯示當華爾街下線時市場變得不流動
Coinbase 股票代幣在四個 Aerodrome 池中交易價格在持有的上週五值的 0.6% 之內,而 Aave V3 顯示沒有實時 B20 儲備。
...








