Datos sintéticos: el próximo motor de crecimiento del almacenamiento
Los modelos de IA no solo consumen datos. Ellos lo fabrican.

El contexto cambia constantemente. Cada cambio de contexto obliga a una nueva generación de tokens. Cada ficha puede representar una nueva interpretación, una nueva línea de razonamiento, una nueva decisión.
Estamos entrando en una nueva era industrial. Las grandes empresas producirán inteligencia a escala, las 24 horas del día, todos los días del año.
La mayor parte de lo que generan estos procesos se almacena. Estos son datos sintéticos. No es un subproducto. Es el resultado principal del razonamiento automatizado a escala.
Algunos profesionales utilizan una definición más estricta de datos sintéticos, limitándola al contenido creado específicamente para entrenar otros modelos, como imágenes médicas generadas, transacciones financieras simuladas, conversaciones artificiales con clientes, registros de sistemas sintéticos y escenarios de conducción virtual.
Una visión más amplia incluye cualquier cosa que un modelo cree para que un humano la lea: un informe, un resumen, una transcripción. Al almacenamiento no le importa la distinción. Ambos consumen capacidad.
Por qué debería importarle a los equipos de almacenamiento
Gartner proyecta que para 2030, los datos sintéticos eclipsarán a los datos reales en el entrenamiento de modelos de IA. Los datos reales crecen linealmente. Los datos sintéticos crecen exponencialmente, generados por modelos que nunca dejan de ejecutarse.
Cada ciclo de inferencia escribe en el almacenamiento. Cada reintento escribe en el almacenamiento. Cada rastro de razonamiento se escribe en el almacenamiento. Nada de esto es almacenamiento opcional. Es el agotamiento de la producción de inteligencia y tiene que aterrizar en alguna parte.
Qué significa esto para la planificación de capacidad
Los modelos de crecimiento tradicionales asumen datos generados por humanos: documentos, registros, transacciones. Los datos sintéticos rompen esa suposición. El volumen ya no rastrea el número de empleados ni la actividad de los usuarios. Realiza un seguimiento de la computación.
Planifíquelo ahora. Las organizaciones que hoy tratan los datos sintéticos como un problema de nivel de almacenamiento no lucharán por conseguir capacidad en 2030.
Sobre el autor
Miembro del NetApp A-Team especializado en almacenamiento empresarial e infraestructura de IA
Pedro Couto · Arquitecto de Infraestructura Empresarial
Pedro trabaja en la intersección de NetApp ONTAP, cloud híbrida, protección de datos y plataformas de IA de alto rendimiento. Diseña e implementa infraestructura empresarial para organizaciones en las que el tiempo de inactividad no es una opción. Miembro reconocido del NetApp A-Team y titular de la distinción NetApp Subject Matter Expert Elite, es uno de los autores de diversas certificaciones de NetApp, como NCDA, NCIE-DP, NCIE-MetroCluster, Storage Engineer, entre otras.