Cloud Reliability Scorecard 2026
30 comprobaciones para descubrir cuánto riesgo operativo esconde tu infraestructura cloud.
Tu infraestructura está funcionando. Los clientes pueden entrar. Los desarrolladores despliegan. Las facturas cloud se pagan. Eso no significa necesariamente que la plataforma esté bajo control. Muchos problemas de infraestructura permanecen invisibles hasta que ocurre algo grave. El objetivo de este Scorecard es ayudarte a detectar esos puntos ciegos antes de que se conviertan en incidentes.
Funcionamiento
Responde a cada una de las 30 preguntas con la máxima honestidad:
- ✅ Sí (3 puntos)
- 🟡 Parcialmente (2 puntos)
- 🔴 No / ⚪ No lo sabemos (0 puntos)
Al finalizar, suma tus puntos (máximo 90) y utiliza la fórmula: (Puntos Obtenidos / 90) × 100
Área 1: Arquitectura y Resiliencia
01 — Si falla una zona, nodo o instancia crítica, ¿sabemos exactamente qué servicios dejarán de funcionar? Por qué importa: Desconocer el blast radius convierte una caída parcial en una interrupción masiva. Qué esperar en una plataforma madura: Mapeo claro de dependencias y aislamiento arquitectónico.
02 — ¿Existen componentes individuales cuya caída puede dejar indisponible la totalidad de la plataforma? Por qué importa: Los Puntos Únicos de Fallo (SPOF) son el riesgo arquitectónico más crítico. Qué esperar en una plataforma madura: Redundancia en todos los niveles críticos.
03 — ¿La aplicación puede aumentar y reducir capacidad automáticamente ante fluctuaciones de demanda? Por qué importa: La intervención manual genera caídas de servicio durante picos inesperados. Qué esperar en una plataforma madura: Políticas de autoscaling configuradas y probadas.
04 — ¿Los entornos de producción están aislados a nivel de red y credenciales de los entornos de staging o desarrollo? Por qué importa: Si un script puede acceder a producción desde desarrollo, un error puede borrar datos reales. Qué esperar en una plataforma madura: Cuentas cloud separadas y controles de acceso estrictos.
05 — ¿Existe un procedimiento realista, probado y documentado para reconstruir los componentes críticos desde cero? Por qué importa: Los backups salvan datos, pero si no sabes reconstruir la infraestructura, el RTO será de días. Qué esperar en una plataforma madura: Procedimientos de DR probados anualmente.
Área 2: Deployment y Cambios
06 — Si una incidencia comienza ahora mismo, ¿podemos saber en menos de 5 minutos qué cambios se han desplegado? Por qué importa: Los cambios recientes son una hipótesis frecuente durante una investigación; poder relacionarlos con el incidente reduce el tiempo de diagnóstico. Qué esperar en una plataforma madura: Trazabilidad completa y registros inmutables.
07 — ¿Podemos volver rápidamente a una versión anterior sin tener que improvisar comandos o procesos? Por qué importa: La incapacidad de hacer rollback transforma un bug en una caída sostenida. Qué esperar en una plataforma madura: Mecanismos de rollback integrados a un solo clic.
08 — ¿Puede un ingeniero modificar producción manualmente sin dejar ningún rastro o revisión? Por qué importa: Los cambios manuales introducen drift y son imposibles de auditar. Qué esperar en una plataforma madura: Accesos de escritura bloqueados por defecto; todo pasa por código.
09 — ¿El código pasa por pruebas automatizadas antes de llegar a producción? Por qué importa: Confiar únicamente en el testing manual genera cuellos de botella. Qué esperar en una plataforma madura: CI robusto que bloquea commits que no superan umbrales.
10 — ¿Existe un flujo estructurado de aprobación (Code Review) para cualquier cambio de infraestructura? Por qué importa: Las decisiones aisladas reducen la calidad del código y aumentan el riesgo. Qué esperar en una plataforma madura: Aprobación de terceros obligatoria (PR reviews).
Área 3: Infrastructure as Code y Automatización
11 — Si perdiéramos un entorno, ¿cuánto podríamos reconstruir desde código frente a memoria manual? Por qué importa: Depender de la memoria humana es una receta para el desastre durante una crisis. Qué esperar en una plataforma madura: Infraestructura definida íntegramente en código (Terraform, etc.).
12 — ¿Podemos identificar si alguien ha alterado recursos manualmente modificando el estado esperado? Por qué importa: El drift crea una falsa sensación de seguridad. Qué esperar en una plataforma madura: Ejecuciones automatizadas que detectan desviaciones.
13 — ¿Existe un repositorio único y versionado donde resida toda la infraestructura base? Por qué importa: La fragmentación genera silos de conocimiento y configuraciones dispares. Qué esperar en una plataforma madura: Infraestructura centralizada y documentada.
14 — ¿Se aprovisionan las bases de datos o servicios a través de módulos estandarizados y aprobados? Por qué importa: Reinventar la rueda genera inconsistencias de seguridad. Qué esperar en una plataforma madura: Catálogo de infraestructura reutilizable.
15 — ¿Está el proceso de inyección de secretos (claves, tokens) completamente disociado del código? Por qué importa: Hardcodear credenciales es la vulnerabilidad más frecuente. Qué esperar en una plataforma madura: Uso de gestores de secretos dinámicos (Key Vault, Vault).
Área 4: Observabilidad y Respuesta a Incidentes
16 — ¿Normalmente descubrimos las incidencias gracias a nuestras alertas, o porque un cliente avisa? Por qué importa: Si los clientes son tu monitorización, el impacto reputacional ya se ha producido. Qué esperar en una plataforma madura: Detección y respuesta proactiva.
17 — Cuando se activa una alerta en producción, ¿está claro quién debe actuar y qué debe comprobar? Por qué importa: El ruido causa “fatiga de alertas” provocando que se ignoren alarmas críticas. Qué esperar en una plataforma madura: Alertas accionables enrutadas al equipo correcto (ownership).
18 — ¿Podemos relacionar rápidamente una degradación de rendimiento con un despliegue reciente? Por qué importa: La falta de correlación retrasa enormemente el diagnóstico. Qué esperar en una plataforma madura: Dashboards que superponen métricas con marcadores de despliegues.
19 — ¿Tenemos visibilidad del recorrido completo de una petición a través de los microservicios? Por qué importa: En arquitecturas distribuidas, saber que falla un componente es insuficiente. Qué esperar en una plataforma madura: Trazabilidad distribuida y agregación de logs.
20 — ¿Realizamos análisis post-mortem blameless para mejorar sistemas de detección y resiliencia? Por qué importa: Las organizaciones que penalizan el error se condenan a repetirlo. Qué esperar en una plataforma madura: Cultura donde el resultado es siempre una mejora técnica.
Área 5: Seguridad y Recuperación
21 — ¿Cuándo restauramos por última vez un backup crítico y comprobamos que los datos eran utilizables? Por qué importa: Tener configurado un backup no equivale a tener capacidad de recuperación. Qué esperar en una plataforma madura: Pruebas de restauración automatizadas y recurrentes.
22 — Bus Factor: Si la persona que más conoce la infraestructura estuviera indisponible 30 días, ¿operaría producción con normalidad? Por qué importa: La dependencia extrema de héroes técnicos es un riesgo sistémico severo. Qué esperar en una plataforma madura: Conocimiento distribuido y documentación accionable.
23 — ¿Se aplica estrictamente el principio de privilegio mínimo para servicios y usuarios? Por qué importa: Los permisos excesivos amplifican el impacto de cualquier brecha. Qué esperar en una plataforma madura: Políticas IAM restrictivas por defecto (RBAC) y Just-In-Time access.
24 — ¿Las credenciales de acceso a bases de datos se rotan de manera automática y frecuente? Por qué importa: Una credencial estática comprometida proporciona acceso silencioso continuo. Qué esperar en una plataforma madura: Credenciales de corta duración (Managed Identities).
25 — ¿Evitamos el uso de cuentas compartidas para administrar los entornos de producción? Por qué importa: Las cuentas compartidas destruyen la trazabilidad en auditorías. Qué esperar en una plataforma madura: Acceso federado (SSO) y MFA obligatorio.
Área 6: Costes y Gobernanza
26 — Si la factura cloud aumentara un 30%, ¿podríamos explicar qué servicio lo generó en minutos? Por qué importa: Sin visibilidad granular, la nube se convierte en una hemorragia incontrolable. Qué esperar en una plataforma madura: Alertas de anomalías de coste en tiempo real.
27 — ¿Sabemos qué equipos o productos específicos generan cada parte relevante del gasto? Por qué importa: No puedes optimizar lo que no puedes atribuir (Unit Economics). Qué esperar en una plataforma madura: Estrategia estricta de tagging/labels obligatoria.
28 — ¿Existe algún mecanismo automatizado para detectar infraestructura abandonada o infrautilizada? Por qué importa: Los entornos olvidados y los recursos sin propietario pueden generar gasto sin aportar valor; revisarlos periódicamente facilita su detección. Qué esperar en una plataforma madura: Políticas de limpieza y reportes de inactividad.
29 — ¿Existen presupuestos o límites que impidan a un error de código escalar el gasto infinitamente? Por qué importa: Un bucle infinito puede generar miles de euros de coste en un fin de semana. Qué esperar en una plataforma madura: Alertas de presupuesto (Soft limits) integradas.
30 — ¿La creación de nueva infraestructura está gobernada sin bloquear a los desarrolladores? Por qué importa: Si solicitar un recurso requiere semanas, los equipos crearán Shadow IT. Qué esperar en una plataforma madura: Plataformas de autoservicio para desarrolladores.
Resultados
- 80-100 (Infraestructura bajo control): Base operativa sólida. El desafío es conservar la disciplina.
- 60-79 (Deuda operativa emergente): La plataforma funciona pero existen procesos manuales repetitivos o falta de visibilidad. Corrige las desviaciones.
- 40-59 (Riesgo operativo significativo): Infraestructura frágil que depende de personas concretas. Una incidencia puede ser grave.
- 0-39 (Alta dependencia operativa): Riesgos críticos de recuperación y gobernanza. Prioriza riesgos de negocio inmediatos.
Nubyron forma parte del ecosistema de partners de Microsoft.
