Ingeniero de Confiabilidad de Sitio

Hace 3 días

Mexico City AvantGarde Human Capital Consultants Jornada completa

Empresa del sector financiero busca un(a) Site Reliability Engineer (SRE) & Observability Engineer con experiencia en ambientes de misión crítica, enfocado en garantizar la disponibilidad, estabilidad y desempeño de plataformas tecnológicas de alta disponibilidad.

¿Cuál será tu misión?

Serás responsable de asegurar la estabilidad y observabilidad de servicios críticos mediante prácticas de Site Reliability Engineering (SRE), liderando iniciativas de monitoreo proactivo, automatización, gestión de incidentes, análisis de causa raíz y mejora continua.

Responsabilidades principales

  • Diseñar, administrar y evolucionar la plataforma de observabilidad (métricas, logs y trazas).
  • Definir e implementar indicadores de confiabilidad (SLIs/SLOs) y administrar error budgets.
  • Liderar la respuesta técnica ante incidentes críticos (Sev1 y Sev2).
  • Realizar análisis de causa raíz (RCA) y conducir post-mortems.
  • Automatizar procesos operativos para reducir trabajo manual (toil) y minimizar errores.
  • Implementar mejoras continuas para incrementar la disponibilidad y resiliencia de los servicios.
  • Colaborar con equipos de desarrollo, infraestructura y operaciones para fortalecer la confiabilidad de las plataformas.