Inicio
Storage

Datos sintéticos: el próximo motor de crecimiento del almacenamiento

Los modelos de IA no solo consumen datos. Ellos lo fabrican.

El gráfico de Gartner que proyecta que los datos sintéticos eclipsarán los datos reales en los modelos de IA para 2030
Pedro Couto14 jul 20262 min de lectura
Share
16 reads

El contexto cambia constantemente. Cada cambio de contexto obliga a una nueva generación de tokens. Cada ficha puede representar una nueva interpretación, una nueva línea de razonamiento, una nueva decisión.

Estamos entrando en una nueva era industrial. Las grandes empresas producirán inteligencia a escala, las 24 horas del día, todos los días del año.

La mayor parte de lo que generan estos procesos se almacena. Estos son datos sintéticos. No es un subproducto. Es el resultado principal del razonamiento automatizado a escala.

Algunos profesionales utilizan una definición más estricta de datos sintéticos, limitándola al contenido creado específicamente para entrenar otros modelos, como imágenes médicas generadas, transacciones financieras simuladas, conversaciones artificiales con clientes, registros de sistemas sintéticos y escenarios de conducción virtual.

Una visión más amplia incluye cualquier cosa que un modelo cree para que un humano la lea: un informe, un resumen, una transcripción. Al almacenamiento no le importa la distinción. Ambos consumen capacidad.

Por qué debería importarle a los equipos de almacenamiento

Gartner proyecta que para 2030, los datos sintéticos eclipsarán a los datos reales en el entrenamiento de modelos de IA. Los datos reales crecen linealmente. Los datos sintéticos crecen exponencialmente, generados por modelos que nunca dejan de ejecutarse.

Cada ciclo de inferencia escribe en el almacenamiento. Cada reintento escribe en el almacenamiento. Cada rastro de razonamiento se escribe en el almacenamiento. Nada de esto es almacenamiento opcional. Es el agotamiento de la producción de inteligencia y tiene que aterrizar en alguna parte.

Qué significa esto para la planificación de capacidad

Los modelos de crecimiento tradicionales asumen datos generados por humanos: documentos, registros, transacciones. Los datos sintéticos rompen esa suposición. El volumen ya no rastrea el número de empleados ni la actividad de los usuarios. Realiza un seguimiento de la computación.

Planifíquelo ahora. Las organizaciones que hoy tratan los datos sintéticos como un problema de nivel de almacenamiento no lucharán por conseguir capacidad en 2030.

Sobre el autor

Miembro del NetApp A-Team especializado en almacenamiento empresarial e infraestructura de IA

Pedro Couto · Arquitecto de Infraestructura Empresarial

Pedro trabaja en la intersección de NetApp ONTAP, cloud híbrida, protección de datos y plataformas de IA de alto rendimiento. Diseña e implementa infraestructura empresarial para organizaciones en las que el tiempo de inactividad no es una opción. Miembro reconocido del NetApp A-Team y titular de la distinción NetApp Subject Matter Expert Elite, es uno de los autores de diversas certificaciones de NetApp, como NCDA, NCIE-DP, NCIE-MetroCluster, Storage Engineer, entre otras.

Comments

0

No comments yet. Start the conversation.

Up to 2,000 characters. Plain text only.