Inicio
Storage

ONTAP Health Check Cookbook

Una rutina guiada y de solo lectura en ONTAP para detectar riesgos, recopilar evidencias y decidir qué escalar.

Ilustración de health check de almacenamiento en ONTAP
Pedro Couto12 jul 20267 min de lectura
Share
29 reads

La mayoría de los incidentes de almacenamiento dejan señales antes de que los usuarios perciban una interrupción. La presión de capacidad, un RAID degradado, la replicación atrasada, las LIF fuera de origen y los certificados próximos a vencer pueden detectarse con una rutina consistente de health check.

Este tutorial convierte esa rutina en un runbook guiado. Siga los pasos en orden, utilice el botón Copiar de cada bloque de comandos, compare la salida con el estado esperado y registre cada excepción en el log operativo. Los comandos siguientes son de solo lectura.

Formatee y guarde la salida

Antes de ejecutar el health check, aumente el límite de líneas o el búfer de desplazamiento del cliente SSH y habilite el registro de la sesión. Guarde el log con el nombre del clúster y la fecha de recopilación para conservar la salida completa para comparación, escalación y auditoría.

Antes de comenzar

Conéctese a la LIF de administración del clúster y registre el clúster, la versión de ONTAP, la fecha y el número de ticket. Confirme si hay mantenimiento, takeover/giveback, una actualización o una prueba de replicación en curso. Mantenga abierto el informe anterior para identificar cambios, en lugar de revisar valores aislados.

rows 0
set -showseparator ","
cluster identity show
version
system node show -fields health,uptime,model
  • rows 0 desactiva la paginación para que toda la salida se registre sin prompts ni páginas interrumpidas.
  • set -showseparator "," separa con comas los campos mostrados. Esto facilita guardar la salida tabular como CSV e importarla en Excel después de eliminar los prompts de la CLI y las líneas no relacionadas.
  • cluster identity show registra el nombre y el UUID del clúster, evitando que el informe se asocie con el entorno equivocado.
  • version captura la versión de ONTAP en ejecución para interpretar los campos de los comandos y los hallazgos con la versión correcta.
  • system node show muestra el estado, el uptime y el modelo de cada nodo. Un uptime inesperado puede revelar un reinicio, takeover o mantenimiento reciente.

Estas preferencias de visualización de la CLI solo se aplican a la sesión actual. Guarde la salida relevante con la extensión .csv cuando necesite filtrarla, compararla o crear informes en Excel.

Punto de control: confirme que el clúster, la cantidad de nodos, los modelos y el uptime coincidan con el inventario.

1. Estado del clúster

cluster show
cluster ha show
system health status show
system health subsystem show
system health alert show

Esperado: todos los nodos están en buen estado y son elegibles, el HA coincide con el diseño, el estado general es OK y no existen alertas sin explicación.

Para cualquier alerta, recopile la causa, el impacto y la acción recomendada:

system health alert show -instance

Trate las nuevas alertas críticas o major como escalaciones para el mismo día. No suprima ni elimine una alerta únicamente para limpiar el panel.

2. Capacidad y disponibilidad

storage aggregate show -fields size,usedsize,availsize,percent-used,state,raidstatus
storage aggregate show -state !online
volume show -fields size,available,percent-used,state,percent-snapshot-space
volume show -state !online

Esperado: los aggregates y volúmenes de producción están online, el RAID presenta un estado normal y el espacio libre cubre el crecimiento previsto y el tiempo necesario para añadir o mover capacidad.

  • 70–80%: proyecte la fecha de agotamiento y planifique capacidad.
  • 85–90%: asigne un responsable y una corrección a corto plazo.
  • 95% o más: trátelo como un incidente.

Combine siempre la utilización con la tasa de crecimiento. Un aggregate al 75% que crece un 5% semanal puede ser más urgente que otro estable al 88%.

3. Discos, RAID y shelves

storage disk show -broken
storage disk error show
storage aggregate show -fields state,raidstatus
storage shelf show -connectivity

Esperado: ningún disco roto ni error sin explicación, aggregates online con RAID normal y conectividad redundante con las shelves.

Si el RAID está degradado, registre el aggregate afectado, el estado de reconstrucción, la disponibilidad de spares y la redundancia restante. Siga el procedimiento aprobado para la plataforma; no marque como fallidos ni retire discos desde este checklist.

4. Snapshots y replicación

volume snapshot show -fields size,create-time
volume snapshot policy show
volume show -fields percent-used,percent-snapshot-space
volume show -snapshot-policy none
volume snapshot autodelete show -enabled true
snapmirror show -fields source-path,destination-path,state,status,healthy,lag-time,unhealthy-reason
snapmirror show -healthy false

Esperado: los snapshots siguen la política sin consumir espacio inesperado y todas las relaciones protegidas están en buen estado y dentro del RPO de la aplicación.

No suponga que healthy=true demuestra el cumplimiento del RPO. Compare lag-time con el requisito del negocio. Para una excepción, registre origen, destino, retraso, resultado de la última transferencia, motivo del estado unhealthy y responsable de la aplicación. Confirme la propiedad y la retención antes de eliminar snapshots. Compruebe también que la eliminación automática de snapshots esté desactivada porque, durante un ataque de ransomware, los snapshots podrían eliminarse cuando el volumen alcance el umbral configurado para autodelete. Revise si existen volúmenes sin una política de snapshots asignada.

5. Puertos y LIF

network port show -fields link,health-status
network interface show -fields status-admin,status-oper,is-home,home-node,home-port,curr-node,curr-port
network interface show -is-home false
network interface show -failover

Esperado: los puertos necesarios están en buen estado, las LIF de clientes están operativas y cada LIF fuera de origen se explica por el diseño o por un mantenimiento activo.

Una LIF fuera de origen no es automáticamente una falla. Valide el puerto actual, los destinos de failover, el mantenimiento y el impacto en los clientes. No revierta una LIF a partir de un checklist genérico.

6. Línea base de rendimiento

qos statistics workload latency show
statistics show-periodic -object volume -counter total_ops,avg_latency
system node run -node <node> -command "sysstat -c 10 1"

Esperado: la latencia, las operaciones y la CPU permanecen dentro del rango normal para el mismo periodo de carga.

Un valor de latencia sin contexto de workload es una evidencia débil. Compare IOPS, latencia y CPU con la línea base establecida. Utilice este paso para detectar desviaciones; realice una investigación dedicada antes de cambiar ajustes de rendimiento.

7. Recopilación de versiones de firmware

version
system service-processor show -fields type,status,fw-version
storage disk show -fields model,serial-number,firmware-revision
storage shelf show -module
network fcp adapter show -instance

Esperado: el firmware de ONTAP, SP/BMC, discos, módulos de shelf y adaptadores FC coincide con las versiones aprobadas para la plataforma. Registre el modelo (part number), el número de serie y la revisión de firmware de cada disco, además de las excepciones por nodo, adaptador, shelf o modelo de disco; no inicie actualizaciones de firmware desde este health check.

8. Health Check de SAN

network interface show -data-protocol iscsi
iscsi initiator show -fields igroup,initiator-name,tpgroup
vserver iscsi session show
vserver iscsi connection show
network interface show -data-protocol fcp
fcp initiator show -fields igroup,wwpn,lif
lun mapping show -fields node,reporting-nodes,igroup,protocol

Esperado: compare la cantidad de iniciadores iSCSI y FC conectados con el inventario aprobado de hosts. Los iniciadores iSCSI deben usar los target portal groups previstos, los iniciadores FC deben iniciar sesión mediante las LIF y fabrics esperadas, y los reporting nodes de las LUN deben coincidir con el diseño del nodo propietario y su pareja de HA. Confirme en cada host que MPIO esté habilitado, que ALUA sea reconocido, que todas las rutas esperadas estén activas y que las rutas atraviesen iniciadores, switches o VLAN, LIF de destino y controladoras independientes. ONTAP muestra la conectividad del lado del destino; solo el host puede confirmar la política de multipath y el estado de la ruta de extremo a extremo.

9. Soporte operativo

system node autosupport show -node *
system node autosupport check show
system license show
cluster time-service ntp server show
security certificate show -fields expiration -expiration <60d

Esperado: AutoSupport operativo, licencias necesarias válidas, NTP configurado y certificados con tiempo suficiente para completar su renovación.

Registre el certificado con vencimiento más próximo. La falta de telemetría, la desviación del reloj o un certificado próximo a vencer quizá no causen una falla hoy, pero pueden complicar el próximo incidente o ventana de mantenimiento.

Cierre del health check

Para cada excepción, registre el objeto afectado, el hallazgo, el impacto en el negocio, el responsable, el ticket y la fecha objetivo. Clasifique como críticos la indisponibilidad activa, aggregates casi llenos, pérdida de redundancia y protección fuera del RPO comprometido. Siga las tendencias y los riesgos de soporte según el tiempo hasta el impacto.

Rutina lista para copiar

Diariamente

system health alert show
storage disk show -broken
storage aggregate show -state !online
volume show -state !online
snapmirror show -healthy false
network interface show -is-home false
volume show -snapshot-policy none
volume snapshot autodelete show -enabled true

Semanalmente

storage aggregate show -fields availsize,percent-used-capacity,state,raidstatus
volume show -fields available,percent-used,state,percent-snapshot-space
storage disk error show
storage shelf show -connectivity
snapmirror show -fields state,status,healthy,lag-time,unhealthy-reason
network port show -fields link,health-status
system node autosupport check show

Mensualmente

system node show -fields health,uptime,model
system service-processor show -fields type,status,fw-version
storage disk show -fields model,serial-number,firmware-revision
storage shelf show -module
network fcp adapter show
fcp initiator show -fields igroup,wwpn,lif
iscsi initiator show -fields igroup,initiator-name,tpgroup
vserver iscsi connection show
lun mapping show -fields node,reporting-nodes,igroup,protocol
system license show
cluster time-service ntp server show
security certificate show -fields expiration -expiration <60d
qos statistics workload latency show

Nota sobre versión y seguridad

Los campos y privilegios pueden variar según la versión de ONTAP, la plataforma y el contexto del clúster. Valide esta rutina con la referencia actual de comandos de ONTAP y los procedimientos locales. Este tutorial termina en la detección y recopilación de evidencias; utilice un runbook aprobado para la corrección.

¿Qué comandos añadiría a esta rutina? ¡Comparta sus scripts en los comentarios!

Sobre el autor

Miembro del NetApp A-Team especializado en almacenamiento empresarial e infraestructura de IA

Pedro Couto · Arquitecto de Infraestructura Empresarial

Pedro trabaja en la intersección de NetApp ONTAP, cloud híbrida, protección de datos y plataformas de IA de alto rendimiento. Diseña e implementa infraestructura empresarial para organizaciones en las que el tiempo de inactividad no es una opción. Miembro reconocido del NetApp A-Team y titular de la distinción NetApp Subject Matter Expert Elite, es uno de los autores de diversas certificaciones de NetApp, como NCDA, NCIE-DP, NCIE-MetroCluster, Storage Engineer, entre otras.

Comments

0

No comments yet. Start the conversation.

Up to 2,000 characters. Plain text only.