Lo que aprenderás en esta guía
Este es un artículo técnico y profundo redactado por los ingenieros de ForgeNEX. Está diseñado para profesionales que buscan implementar soluciones sólidas y evitar los errores comunes que cuestan horas de producción.
Una guardia necesita límites y contexto
Una persona de guardia no debería tener que descubrir durante una interrupción qué servicio está afectado, quién puede autorizar una acción o cuándo pedir ayuda. El runbook convierte alertas conocidas en pasos seguros y define cómo transferir la responsabilidad entre turnos. La guía de Google SRE sobre trabajo on-call destaca responsabilidades, lectura del relevo, mitigación inicial y playbooks asociados a alertas; adapta sus prácticas al tamaño y al riesgo de cada organización.
Ficha del servicio
Antes de activar la rotación, completa:
| Campo | Valor a documentar |
|---|---|
| Servicio y propietario | Nombre, responsable de negocio y responsable técnico |
| Cobertura | Horario, calendario, respaldo y método de contacto |
| Alcance | Sistemas cubiertos y límites del equipo de guardia |
| Severidad | Impacto, urgencia, usuarios y criterio para cada nivel |
| Escalado | Segundo nivel, proveedor, dirección y autoridad de decisión |
| Acciones seguras | Diagnóstico, mitigaciones autorizadas y acciones prohibidas |
| Relevo | Canal, formato, asuntos abiertos y confirmación de recepción |
Secuencia de respuesta
- Validar la señal: consulta alerta, servicio afectado, hora, tendencia y cambios recientes. Evita reiniciar componentes solo para silenciar el monitor.
- Determinar impacto: registra usuarios, procesos, sedes y degradación. Comunica incertidumbre con claridad.
- Mitigar dentro de autorización: sigue el playbook; si no aplica o aumenta el riesgo, detente y escala.
- Coordinar: asigna una persona responsable del incidente, una de comunicaciones y especialistas según necesidad.
- Actualizar: informa qué cambió, qué sigue afectado y cuándo será el siguiente aviso.
- Cerrar o transferir: verifica recuperación con señales del servicio, registra acciones y entrega asuntos pendientes al siguiente turno.
Plantilla de relevo
Servicio / incidente:
Estado y severidad actual:
Impacto confirmado y pendiente de confirmar:
Últimas acciones y resultado:
Riesgos o cambios activos:
Próxima acción / responsable / plazo:
Personas notificadas y siguiente actualización:
Enlaces a ticket, panel y runbook:Define un límite de tiempo o condición para escalar, una cobertura secundaria y un mecanismo para detener la rotación si falta capacidad. Revisa carga y falsos positivos de manera periódica; una guardia sostenible no depende de disponibilidad indefinida. Tras un incidente mayor, usa la plantilla de postmortem SRE y actualiza la preparación operativa del servicio.
¿Demasiado complejo para tu equipo?
En ForgeNEX gestionamos este tipo de soluciones tecnológicas todos los días. Evita riesgos y delega la implementación en nuestros expertos.
- Respuesta en menos de 2 horas
- Auditamos tu caso sin compromiso
- Expertos certificados