Inicio
Storage

La planificación del almacenamiento no es sólo capacidad

Ilustración de planificación de capacidad de infraestructura de almacenamiento
Pedro Couto5 jul 20263 min de lectura
Share
20 reads

La primera pregunta suele ser: "¿Cuántos terabytes necesitas?" Es una pregunta válida, pero incompleta. En entornos críticos, el almacenamiento también implica rendimiento, disponibilidad, recuperación, seguridad y previsibilidad operativa. La capacidad es una parte del diseño, no el diseño completo.

La capacidad es una variable

Antes de definir terabytes, hay mejores preguntas que hacer:

  • ¿Cuál es la carga de trabajo y cuál es su perfil de E/S?
  • ¿Qué latencia se espera y qué crecimiento se proyecta?
  • ¿Cuál es el objetivo del punto de recuperación (RPO)? ¿Cuántos datos puede permitirse perder?
  • ¿Cuál es el objetivo de tiempo de recuperación (RTO)? ¿Cuánto tiempo puedes permitirte estar inactivo?
  • ¿Cuál es la ventana de copia de seguridad y cuál es el tiempo de restauración real?
  • ¿Cuál es el impacto de la caída de un controlador? ¿De un sitio que está cayendo?
  • ¿El entorno mantiene la disponibilidad durante una adquisición y el rendimiento se mantiene dentro de lo necesario después?
  • ¿Quién puede eliminar snapshots y quién puede cambiar las políticas?
  • ¿La replicación protege el medio ambiente o simplemente replica el problema?

Estas respuestas definen la arquitectura. Todo lo demás es el tamaño.

Es necesario diseñar la disponibilidad

La alta disponibilidad no significa solo tener dos controladores. La cuestión es comprender cómo se comporta el entorno durante una falla. En un escenario de adquisición, un controlador asume los servicios del otro: se preserva la disponibilidad, pero la carga se concentra en menos recursos.

La restricción de capacidad es directa. Un par de dos nodos en los que ambos nodos se ejecutan al 70 % de la CPU en su punto máximo no puede ofrecer un rendimiento completo después de una adquisición: al nodo superviviente se le pide que haga el 140 % del trabajo de un nodo. Si el rendimiento durante la adquisición es importante (y para cualquier cosa que justifique un par HA, lo es), el tamaño del nodo superviviente que soporta ambas cargas de trabajo: un punto de partida conservador es mantener la utilización sostenida por nodo alrededor del 50% en su punto máximo, o tener una respuesta explícita y escrita de exactamente qué se degrada y en qué medida cuando un nodo está fuera de servicio. El comportamiento de la CPU y la carga de trabajo no siempre se combinan linealmente durante la adquisición, por lo que se debe validar el objetivo con el modelo de controlador, la combinación de protocolos, el perfil de carga de trabajo y el rendimiento de adquisición observado en lugar de tratar el 50 % como un límite universal. Dos comandos te dicen cuál es tu situación hoy:

storage failover show
statistics show-periodic -object system -counter cpu_busy

El primero confirma que la adquisición es realmente posible (no se supone que sea posible) en ambos nodos. El segundo, ejecutado durante su período pico real en lugar de a las 10 a.m. de un martes tranquilo, es el número que se debe mantener frente a esa línea del 50%. Un entorno puede cumplir sus objetivos con todos los controladores activos y quedar por debajo de ellos cuando un controlador no está disponible.

La pregunta correcta no es simplemente "¿Tiene el entorno HA (alta disponibilidad)?" La pregunta correcta es: "¿El entorno sigue brindando el nivel de servicio requerido durante la adquisición?" Ese análisis cambia la forma de evaluar la CPU, el caché, los puertos, el rendimiento, IOPS, la latencia, los agregados, las rutas SAN/NAS y el crecimiento.

La tecnología no soluciona una mala premisa

ONTAP, SAN, NAS, almacenamiento de objetos, SnapMirror, MetroCluster, copia de seguridad, recuperación cibernética, Kubernetes, VMware y la nube son herramientas. Las buenas herramientas ayudan, pero no reemplazan la arquitectura. Si el diseño no tiene en cuenta los fallos, el funcionamiento, la seguridad, la recuperación y el crecimiento, el entorno es limitado desde el principio, incluso con un buen hardware.

Acerca de este blog

Este blog trata sobre almacenamiento, protección de datos y ciberresiliencia. El objetivo es compartir decisiones de arquitectura, resolución de problemas, dimensionamiento, mejores prácticas y lecciones de campo, con objetividad, contexto técnico y un enfoque en entornos reales.

El almacenamiento no es solo un estante, un disco, un controlador o un terabyte. El almacenamiento es una capa crítica de la continuidad del negocio. Cuanto más críticos sean los datos, más importante será diseñar adecuadamente su disponibilidad, recuperación y operación.

Versión y nota fuente

La disponibilidad de los comandos y el comportamiento del rendimiento varían según la versión y la plataforma de ONTAP. Valide el diseño con la documentación actual de ONTAP y pruebe el comportamiento de adquisición con la carga de trabajo real antes de utilizar cualquier umbral de utilización como límite de producción.

Sobre el autor

Miembro del NetApp A-Team especializado en almacenamiento empresarial e infraestructura de IA

Pedro Couto · Arquitecto de Infraestructura Empresarial

Pedro trabaja en la intersección de NetApp ONTAP, cloud híbrida, protección de datos y plataformas de IA de alto rendimiento. Diseña e implementa infraestructura empresarial para organizaciones en las que el tiempo de inactividad no es una opción. Miembro reconocido del NetApp A-Team y titular de la distinción NetApp Subject Matter Expert Elite, es uno de los autores de diversas certificaciones de NetApp, como NCDA, NCIE-DP, NCIE-MetroCluster, Storage Engineer, entre otras.

Comments

0

No comments yet. Start the conversation.

Up to 2,000 characters. Plain text only.