Comentario de Bernstein sobre las siete grandes memorias: Después de HBM, DRAM y NAND compiten por el próximo mercado de un billón
TL;DR · La demanda de almacenamiento por parte de la IA no se limita a HBM. El entrenamiento requiere movilizar un sistema de memoria completo que va desde HBM, DRAM del sistema hasta SSD y almacenamiento compartido. · El verdadero cuello de botella en la inferencia se presenta en la fase de decodificación. El KV Cache crecerá junto con la longitud del contexto y el número de usuarios concurrentes, y la capacidad de memoria podría limitar la escala comercial antes que los pesos del modelo. · Los agentes amplifican aún más la presión sobre el almacenamiento. Las llamadas de múltiples pasos generan repetidamente contexto, invocan herramientas externas y aumentan la demanda de CPU, DRAM y KV Cache. · Están surgiendo múltiples nuevos niveles entre HBM y SSD tradicionales, incluyendo CXL, "Storage Next" y CMX, todos con el objetivo de manejar los datos de inferencia en expansión a un costo más bajo. · No todas las nuevas rutas tecnológicas pueden implementarse. HBF, zHBM, NVHBM, ZAM y PIM enfrentan problemas de disipación de calor, rendimiento, compatibilidad ecológica o redistribución de beneficios en la cadena de suministro. · Bernstein sigue siendo optimista sobre Samsung Electronics, SK Hynix, Micron, SanDisk, Seagate y Western Digital, manteniendo una calificación de "bajo rendimiento" para Kioxia.
En los últimos dos años, la narrativa del mercado de almacenamiento de IA se ha centrado casi exclusivamente en HBM. Sin embargo, a medida que los grandes modelos pasan del entrenamiento a la inferencia a gran escala, simplemente aumentar HBM ya no resuelve todos los problemas.
Bernstein señala en su último informe global de almacenamiento que las diferentes cargas de trabajo de IA tienen requisitos de memoria significativamente diferentes: el entrenamiento enfatiza la potencia de cálculo y el ancho de banda, mientras que la fase de decodificación en la inferencia depende más de la capacidad, RAG requiere bases de datos a gran escala, y el flujo de trabajo de los agentes aumentará simultáneamente la carga tanto en servidores tradicionales como en servidores de IA.
Esto significa que los cambios traídos por la IA se están transmitiendo desde HBM hacia DRAM del sistema, SSD, HDD e incluso almacenamiento en cinta. Alrededor de la "pared de memoria", la cadena de suministro ha comenzado a insertar nuevos productos entre los niveles existentes, con la esperanza de encontrar un nuevo equilibrio entre rendimiento, capacidad y costo.
El límite de escala de la inferencia puede depender del KV Cache
Durante la fase de entrenamiento de grandes modelos, GPU y HBM siguen siendo fundamentales.
El entrenamiento requiere leer frecuentemente parámetros del modelo y datos intermedios, lo que exige una alta capacidad de cálculo y ancho de banda de memoria. Pero el entrenamiento de un modelo grande no depende únicamente de HBM: el conjunto de datos original debe almacenarse en medios de almacenamiento de menor costo; antes de que los datos ingresen a la GPU, generalmente deben ser almacenados en caché y preprocesados por DRAM del sistema y SSD locales; el entrenamiento que dura semanas o incluso meses también debe guardar puntos de control periódicamente para evitar que fallos de hardware o software reinicien la tarea desde cero.
Por lo tanto, un gran entrenamiento realmente invoca un sistema completo que va desde HBM, DRAM del sistema hasta SSD locales y almacenamiento en red.
Una vez que se entra en la fase de inferencia, la demanda de memoria se diversifica aún más.
La inferencia generalmente se puede dividir en dos etapas: prellenado (Prefill) y decodificación (Decode). El prellenado se encarga de procesar la entrada del usuario y generar el primer Token, ejecutando principalmente cálculos matriciales a gran escala, más enfocados en la "potencia de cálculo limitada". En esta etapa, la utilización de la GPU y el ancho de banda de HBM son más importantes, y un indicador común es la latencia del primer Token.
La fase de decodificación es diferente. El modelo necesita generar Tokens uno por uno y, al generar un nuevo Token, invocar la información previamente generada. Para evitar cálculos repetidos, el sistema generalmente almacena estos datos en KV Cache.
KV Cache tiene dos características importantes: su capacidad aumenta linealmente con la longitud del contexto, y cada usuario necesita un caché independiente. Por lo tanto, cuando la longitud del contexto aumenta y el número de usuarios concurrentes crece, ambos factores aumentarán el uso de memoria.
Bernstein cree que, en el despliegue de IA a gran escala, la memoria ocupada por KV Cache podría superar los pesos del modelo, convirtiéndose en el principal factor limitante del número de usuarios concurrentes y la ventana de contexto. Cuántos usuarios puede atender el modelo y cuánto contexto puede mantener, afectará directamente la escala de ingresos.
Desde esta perspectiva, el enfoque de competencia en la era de la inferencia no solo se centra en cuántos cálculos puede realizar el chip, sino también en cuán bajo puede ser el costo del sistema para almacenar y leer un contexto en expansión.
RAG y Agente, empujan la demanda hacia la memoria tradicional
La popularidad de RAG y Agente ha llevado la demanda de almacenamiento de IA a expandirse más allá de HBM.
RAG incluye principalmente dos etapas: construcción de bases de datos y recuperación de bases de datos. Al construir la base de datos, el sistema necesita procesar una gran cantidad de datos no estructurados, como PDF, páginas web y código, y luego convertirlos en vectores e índices buscables. Este proceso depende más de SSD de gran capacidad y DRAM del sistema, mientras que el papel de HBM es relativamente limitado.
Una vez establecida la base de datos, las consultas de los usuarios se convierten primero en vectores, que luego se emparejan con el contenido de la base de datos. La generación de vectores puede completarse rápidamente en GPU y HBM, pero la búsqueda real depende más de DRAM del sistema. Los resultados de la recuperación se combinan con las preguntas de los usuarios y entran en el flujo normal de prellenado y decodificación.
El flujo de trabajo de Agente trae una carga aún mayor.
El diálogo tradicional suele ser una llamada única de "entrada---modelo---salida", mientras que el Agente necesita descomponer el objetivo en múltiples pasos, invocar otros modelos o herramientas externas, guardar resultados intermedios y replanificar según los comentarios. Los resultados generados en cada llamada pueden convertirse en la entrada para la próxima llamada del modelo.
Esto aumentará simultáneamente dos tipos de demanda: por un lado, las llamadas a herramientas y tareas no relacionadas con IA requieren más CPU y memoria del sistema; por otro lado, la transmisión continua de contexto entre múltiples modelos ampliará rápidamente la carga de prellenado, decodificación y KV Cache.
Por lo tanto, el desarrollo de aplicaciones de Agente no solo beneficia a GPU y HBM, sino que también podría impulsar la demanda de DRAM en servidores, SSD de nivel empresarial y medios de almacenamiento de menor costo.
Entre HBM y SSD, están surgiendo nuevos niveles de memoria
El sistema de memoria de los servidores tradicionales se puede dividir en caché interna del procesador, DRAM del sistema, SSD locales y almacenamiento compartido. Los servidores de IA han añadido HBM a esta estructura, pero la capacidad de HBM es limitada y su costo es alto, lo que dificulta que asuma todos los datos.
La solución actual de la cadena de suministro es introducir nuevos productos entre diferentes niveles.
CXL intenta integrar la memoria físicamente dispersa en un grupo de recursos compartidos, permitiendo que CPU, GPU y dispositivos de expansión invoquen DRAM de manera más flexible. Algunos productos también utilizan DRAM o SRAM como caché, combinándolos con NAND, reduciendo costos y acortando la latencia de acceso.
"Storage Next", impulsado por NVIDIA, intenta trasladar parte de la gestión del almacenamiento de la CPU a la GPU, y permitir que NAND obtenga latencias, IOPS y granularidad de acceso a datos más cercanas a DRAM. La serie GP de SSD de Kioxia, basada en XL-FLASH, es un ejemplo representativo de esta dirección.
CMX se centra principalmente en KV Cache. Despliega SSD en nodos de datos independientes, conectándose a nodos de cálculo a través de DPU, Ethernet y chips de conmutación. Su objetivo es compartir el contexto de inferencia entre diferentes GPU, reduciendo el almacenamiento duplicado y superando las limitaciones de capacidad de memoria de un solo servidor.
Estas soluciones apuntan a una misma tendencia: los sistemas de IA no pueden mantener todos los datos activos a largo plazo en HBM, y necesitan distribuirlos entre diferentes niveles según la frecuencia de acceso y los requisitos de latencia de los datos.
Los datos calientes permanecen en HBM, parte del contexto se transfiere a DRAM del sistema o SSD de alto rendimiento, y los datos más fríos continúan descendiendo a SSD comunes, HDD e incluso cintas. Cuanto más finos sean los niveles de memoria, más probable será que el sistema logre un equilibrio entre rendimiento y costo.
Nuevas tecnologías surgen rápidamente, pero la comercialización sigue siendo incierta
Alrededor de la "pared de memoria", la cadena de suministro ya ha propuesto múltiples nuevas rutas.
El plan zHBM de Samsung apila HBM sobre el procesador, acortando aún más la distancia de transmisión de datos. Sin embargo, este diseño necesita manejar el calor generado por la GPU, al mismo tiempo que plantea mayores exigencias sobre el rendimiento y costo de la unión híbrida a nivel de oblea.
El NVHBM promovido por NVIDIA entrega los chips básicos a NVIDIA para su diseño, y podría ser fabricado por TSMC. Esta solución tiene el potencial de reducir el consumo de energía y aumentar el ancho de banda, pero también podría debilitar el valor de diseño y fabricación de los fabricantes de almacenamiento en los chips básicos de HBM. A medida que los productos se estandarizan, parte del valor agregado podría trasladarse de los fabricantes de almacenamiento a NVIDIA y a las fábricas de semiconductores.
El HBF promovido por SanDisk y SK Hynix busca utilizar NAND para proporcionar un ancho de banda cercano al de HBM, al mismo tiempo que obtiene mayor capacidad y menor costo por unidad. Sin embargo, NAND y DRAM aún presentan diferencias significativas en latencia y rendimiento, y HBF necesita superar múltiples niveles tecnológicos, lo que no es fácil de implementar.
Intel intenta rotar los chips de DRAM 90 grados para mejorar la disipación de calor, con el objetivo de lograr la comercialización en el año fiscal 2029; mientras que el HBC de Qualcomm utiliza LPDDR y empaquetado tradicional, sacrificando parte del rendimiento para evitar los costos de CoWoS.
Además, PIM intenta agregar capacidades de cálculo directamente en los chips de almacenamiento para reducir el transporte de datos entre el procesador y la memoria. Pero esto cambiará la arquitectura de cálculo existente, requiriendo que procesadores, software y redes se adapten conjuntamente, y también impactará el sistema de división de trabajo entre chips lógicos y de almacenamiento que ya está altamente maduro. Bernstein cree que su adopción en la industria sigue siendo limitada.
Desde esta perspectiva, el rápido aumento en el número de nuevas soluciones no significa que todas las rutas puedan formar un mercado a gran escala. La capacidad de ser compatible con el ecosistema de software y hardware existente, si tiene ventajas de costo, y si las partes de la cadena de suministro pueden alcanzar un equilibrio de intereses, determinará el resultado final de la comercialización.
Los beneficiarios del almacenamiento de IA no serán solo los fabricantes de HBM
Desde una perspectiva de inversión, el juicio de Bernstein es bastante claro: el impulso de la IA en la industria del almacenamiento se está expandiendo desde unos pocos productos de alta gama a más niveles.
HBM sigue siendo el núcleo del entrenamiento y la inferencia de alto rendimiento, y Samsung Electronics, SK Hynix y Micron seguirán beneficiándose de la demanda de almacenamiento de alto ancho de banda. Pero a medida que la escala de inferencia se expande, la importancia de DRAM del sistema y NAND aumentará. El desbordamiento de KV Cache, las bases de datos RAG y la gran cantidad de datos intermedios generados por los Agentes también aumentarán la demanda de SSD y almacenamiento compartido.
Los datos más fríos seguirán descendiendo. Bernstein señala que el crecimiento de datos traído por la IA ya ha comenzado a beneficiar a HDD; en ciertos escenarios, debido a la insuficiencia de capacidad de NAND y HDD, la demanda de cintas, que tradicionalmente se utilizan principalmente para archivo, también está aumentando.
El informe continúa otorgando calificaciones de "superior al mercado" a Samsung Electronics, SK Hynix, Micron, SanDisk, Seagate y Western Digital. Entre ellos, Samsung Electronics, SK Hynix y Micron están relacionados con DRAM y HBM, SanDisk se beneficia de NAND y HBF, mientras que Seagate y Western Digital están relacionados con almacenamiento de gran capacidad a menor costo. Kioxia ha sido calificada como "inferior al mercado".
Sin embargo, el valor central de este informe no radica en enumerar una serie de nuevas abreviaturas tecnológicas, sino en redefinir los límites del mercado de almacenamiento de IA.
Los cuellos de botella de la era del entrenamiento se concentran principalmente en GPU y HBM; en la era de la inferencia y los Agentes, los cuellos de botella comienzan a extenderse a través de todo el sistema de memoria. La competencia futura en la infraestructura de IA dependerá no solo de cuán rápido puede calcular el chip, sino también de si los datos pueden fluir de manera eficiente entre HBM, DRAM, NAND y almacenamiento compartido a un costo suficientemente bajo.
Este contenido se ofrece únicamente con fines informativos generales y no constituye un asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, operar o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.
Te puede gustar

Escasez de DRAM hasta 2030: ¿cómo posicionarse ante los gigantes de la memoria?

¿Por qué las stablecoins no pueden hacer crédito, a pesar de poder transferir y mantener valor?

Revolut inicia el lanzamiento de EURR mientras el BCE detalla las salvaguardias de privacidad del euro digital

RAKIB lanza un consejo para el desarrollo de instituciones financieras: la asociación prepara el mercado de criptomonedas para la autorregulación

Cómo distinguir pipedog de un clon de bytecode idéntico vecino

Después de Impactar a Dos Generaciones, Meta Ordenada a Pagar 18 Mil Millones

¿Qué es Thinking Cat (HMM)? Razones por las que un token sin propietario puede fallar

La policía británica confisca 1,4 millones de dólares en Bitcoin de un mercado oscuro cerrado

Análisis Técnico vs Análisis Fundamental: Definición, Diferencias y Cómo Usarlos - Mundo Fintech

Los derivados comienzan a impulsar el mercado al contado: el poder de fijación de precios de los activos de Corea del Sur está fluyendo hacia el exterior

HYPE enfrenta un retiro de equipo de 36 millones de dólares el 6 de septiembre

USD1 fluye a Binance mientras la billetera de Fireblocks mueve $30M

Bitcoin: 12 años después recupera su cartera y se convierte en millonario

Un abogado de Ripple vincula la Ley CLARITY con el crecimiento del empleo en EE. UU.

Una responsable del BCE llama a los bancos centrales a adoptar la blockchain

La 25ª palabra: Un cofre secreto en tu Ledger

Entrevista reciente de Tom Lee: Estos cuatro catalizadores impulsarán el aumento de ETH este año

La Agencia Financiera solicita un aumento de 13.4 mil millones de yenes en el presupuesto de 2027 y establecerá una nueva oficina para la supervisión de criptomonedas

¿Después de 10 semanas de pausa, Strategy finalmente regresará al modo de "comprar, comprar, comprar"?

Bitcoin ya no es solo un activo arriesgado, según este responsable de BlackRock

La alianza opositora de Japón queda al borde del colapso tras fracasar una fusión

Informe matutino de Wall Street: El halcón Waller interrumpe la fiesta de la potencia de cálculo, los gigantes de la nube se benefician del "alquiler de IA" y llega una ola de aumentos de precios en la parte superior

Apertura del mercado asiático y volatilidad de los activos criptográficos: ¿Cómo afectan el Nikkei 225, KOSPI y el carry trade en yenes a Bitcoin?

Perspectivas sobre las 'stablecoins' en dólares surgidas en Jackson Hole: "La hegemonía del dólar se fortalecerá"

Saylor suena la alarma, pero esta vez realmente tiene munición

Comienza la batalla de HIP-4, ¿quién se convertirá en el nuevo trade.xyz?

El Bitcoin se alza como alternativa al dólar débil

¿Es posible ganarse la vida con el trading de criptomonedas? La realidad del riesgo-recompensa, gestión de capital y herramientas necesarias

El vicegobernador del banco central, Lu Lei, habla sobre la necesidad de definir claramente las responsabilidades en los pagos de agentes inteligentes y anuncia un código de autorregulación

