Ingeniero de Confiabilidad de Sitio (SRE) y Observabilidad

Tecnología · Ciudad de México

Inscribirme

Descripción

Empresa del sector financiero busca un(a) Site Reliability Engineer (SRE) & Observability Engineer con experiencia en ambientes de misión crítica, enfocado en garantizar la disponibilidad, estabilidad y desempeño de plataformas tecnológicas de alta disponibilidad.


¿Cuál será tu misión?

Serás responsable de asegurar la estabilidad y observabilidad de servicios críticos mediante prácticas de Site Reliability Engineering (SRE), liderando iniciativas de monitoreo proactivo, automatización, gestión de incidentes, análisis de causa raíz y mejora continua.


Responsabilidades principales


  • Diseñar, administrar y evolucionar la plataforma de observabilidad (métricas, logs y trazas).
  • Definir e implementar indicadores de confiabilidad (SLIs/SLOs) y administrar error budgets.
  • Liderar la respuesta técnica ante incidentes críticos (Sev1 y Sev2).
  • Realizar análisis de causa raíz (RCA) y conducir post-mortems.
  • Automatizar procesos operativos para reducir trabajo manual (toil) y minimizar errores.
  • Implementar mejoras continuas para incrementar la disponibilidad y resiliencia de los servicios.
  • Colaborar con equipos de desarrollo, infraestructura y operaciones para fortalecer la confiabilidad de las plataformas.

Requisitos

Buscamos profesionales con:



  • Ingeniería en Sistemas, Computación, Telecomunicaciones o carrera afín. (Título indispensable)
  • 7 años de experiencia en: Site Reliability Engineering (SRE), Observabilidad y monitoreo, Plataformas de misión crítica, Gestión de incidentes mayores, Automatización de operaciones y sistemas distribuidos.


Conocimientos técnicos


  • Herramientas de observabilidad: Prometheus, Grafana, ELK / OpenSearch, Datadog, New Relic, PRTG, OpenTelemetry y AxonOps (deseable).


  • Tecnologías: Kubernetes, Apache Cassandra, Kafka, Linux, Bases de datos SQL y NoSQL


  • Automatización: Python, Bash, Go, Ansible, Terraform y CI/CD


  • Gestión de confiabilidad: SLIs / SLOs, Error Budgets, PagerDuty u Opsgenie, ITIL v4, ISO 20000


  • Inglés intermedio-avanzado.

Localización