Pular para o conteúdo principal

Líder de Observabilidad y SER

Descrição da vaga

¡Sé parte de Stefanini!​


En Stefanini somos más de 30.000 genios, conectados desde 41 países, haciendo lo que les apasiona y co-creando un futuro mejor.​

Responsabilidades e atribuições

Estrategia de observabilidad

  • Definir la estrategia corporativa de Observabilidad.
  • Diseñar y mantener el modelo de observabilidad tecnológica.
  • Establecer estándares para la gestión de:
  • Métricas.
  • Registros.
  • Trazas.
  • Eventos.
  • Alertas.
  • Definir lineamientos para la instrumentación de aplicaciones y plataformas.
  • Asegurar la visibilidad de servicios críticos, aplicaciones, APIs, infraestructura y componentes Cloud.
  • Establecer criterios de monitoreo para ambientes productivos y no productivos.
  • Promover una visión integral de observabilidad desde la experiencia del usuario hasta la infraestructura.

SRE y confiabilidad

  • Definir y gobernar prácticas de Ingeniería de Confiabilidad del Sitio.
  • Establecer SLI, SLO y Presupuestos de Error.
  • Definir objetivos de disponibilidad, rendimiento y confiabilidad.
  • Liderar la identificación y reducción de riesgos operativos.
  • Promover la automatización de tareas repetitivas y manuales.
  • Diseñar prácticas para mejorar la resiliencia de las aplicaciones.
  • Gestionar la capacidad, disponibilidad y rendimiento de los servicios.
  • Definir estándares para la operación de aplicaciones críticas.
  • Trabaje con los equipos de desarrollo para incorporar confiabilidad desde el diseño.
  • Impulsar la adopción de principios de ingeniería de confiabilidad en la organización.

Gestión de incidentes y problemas

  • Liderar la gestión técnica de incidentes críticos.
  • Coordinar la atención de incidentes de alto impacto.
  • Participar en el Manejo de Incidentes.
  • Liderar análisis de causa raíz —Root Cause Analysis—.
  • Gestionar postmortems sin enfoque punitivo.
  • Liderar el Manejo de Problemas Técnico.
  • Identificar problemas recurrentes y definir planes de eliminación.
  • Dar seguimiento a las acciones correctivas y preventivas.
  • Evaluar tendencias de incidentes, degradaciones y fallas.
  • Coordinador con Mesa de Ayuda, Operaciones, Desarrollo, Infraestructura, Cloud y proveedores.
  • Participar en el Emergency Change Gate.
  • Asegurar la documentación y trazabilidad de los incidentes relevantes.

Monitoreo y gestion de alertas

  • Diseñar y gobernar tableros operativos y ejecutivos.
  • Definir alertas inteligentes y accionables.
  • Reduzca el ruido y la duplicidad de alertas.
  • Establecer niveles de criticidad y prioridades.
  • Definir procedimientos de respuesta ante eventos.
  • Monitorear disponibilidad, latencia, errores, capacidad y rendimiento.
  • Implementar prácticas de monitoreo proactivo.
  • Promover el uso de automatización para detección y resolución.
  • Asegurar que las alertas estén vinculadas con procedimientos operativos claros.

Plataformas y herramientas

  • Liderar la evolución de las plataformas de observabilidad.
  • Definir estándares de uso para Dynatrace, Datadog, Grafana y Prometheus.
  • Promover la adopción de OpenTelemetry.
  • Establecer criterios de gestión de logs mediante ELK, Splunk, Azure Monitor y Azure Log Analytics.
  • Integrar herramientas de observabilidad con plataformas Cloud, Kubernetes y DevOps.
  • Coordinador de instrumentación de aplicaciones y servicios.
  • Definir la estrategia de almacenamiento, retención y consulta de registros.
  • Evaluar nuevas herramientas y tecnologías de monitoreo.
  • Asegurar la interoperabilidad entre las diferentes herramientas de observabilidad.

Liderazgo y mejora continua

  • Liderar el equipo de Observabilidad y SRE.
  • Definir objetivos, prioridades y planes de trabajo del equipo.
  • Desarrollar capacidades técnicas y metodológicas.
  • Impulsar una cultura DevOps y SRE.
  • Promover la colaboración entre desarrollo, operaciones y soporte.
  • Establecer prácticas de mejora continua.
  • Presentar resultados, riesgos y oportunidades a la dirección.
  • Definir planos para mejorar la madurez de observabilidad y confiabilidad.
  • Identificar oportunidades de automatización y reducción de esfuerzo operativo.

Requisitos e qualificações

Experiencia general

  • Más de 7 años de experiencia profesional en tecnología, operaciones, infraestructura, Cloud, DevOps, observabilidad o confiabilidad.
  • Experiencia en ambientes de alta criticidad y alta disponibilidad.

Experiencia específica

  • Más de 3 años liderando equipos o iniciativas SRE.
  • Experiencia comprobada en:
  • Alta disponibilidad.
  • Gestión de incidentes.
  • Gestión de problemas.
  • Análisis de la causa raíz.
  • Observabilidad.
  • Monitoreo de aplicaciones y plataformas.
  • DevOps.
  • Nube.
  • Gestión de capacidad.
  • Gestión de rendimiento.
  • Automatización operativa.
  • Definición de SLI, SLO y Presupuesto de errores.
  • Gestión de postmortems.
  • Diseño de tableros y métricas operativas.
  • Gestión de incidentes críticos.
  • Experiencia liderando equipos multidisciplinarios.
  • Experiencia coordinando con desarrollo, infraestructura, soporte, seguridad, Cloud y proveedores.
  • Experiencia en organizaciones de banca, fintech, telecomunicaciones o sectores con servicios digitales críticos, preferentemente.

Competencias y habilidades blandas

  • Liderazgo técnico.
  • Capacidad de resolución de problemas.
  • Pensamiento analítico.
  • Automatización.
  • Mejora continúa.
  • Influencia transversal.
  • Comunicación efectiva.
  • Capacidad para trabajar bajo presión.
  • Toma de decisiones en situaciones críticas.
  • Orientación a resultados.
  • Capacidad de priorización.
  • Liderazgo de equipos técnicos.
  • Capacidad de negociación.
  • Comunicación con áreas técnicas y ejecutivas.
  • Orientación a la prevención.
  • Cultura de aprendizaje a partir de incidentes.

Indicadores de éxito del puesto

  • Disponibilidad de las aplicaciones y servicios críticos.
  • Cumplimiento de los SLO definidos.
  • Reducción del número de incidentes críticos.
  • Reducción del tiempo medio de detección —MTTD—.
  • Reducción del tiempo medio de recuperación —MTTR—.
  • Reducción del número de incidentes recurrentes.
  • Porcentaje de servicios con SLI y SLO definidos.
  • Porcentaje de servicios con monitoreo completo de métricas, logs y trazas.
  • Cumplimiento de Presupuestos Error.
  • Reducción del ruido y falsas alertas.
  • Porcentaje de autopsias ejecutadas en el tiempo.
  • Cumplimiento de acciones correctivas derivadas de RCA.
  • Nivel de automatización de tareas operativas.
  • Reducción de intervenciones manuales.
  • Porcentaje de aplicaciones críticas instrumentadas.
  • Cobertura de observabilidad en ambientes productivos.
  • Cumplimiento de los objetivos de capacidad y rendimiento.
  • Nivel de madurez de las prácticas SRE y DevOps.

Entregables principales

  • Estrategia corporativa de Observabilidad.
  • Modelo operativo de SRE.
  • Catálogo de servicios críticos.
  • Estándares de métricas, logs y trazas.
  • Catálogo de SLI y SLO.
  • Definición de Error Budgets.
  • Cuadros de mando operativos y ejecutivos.
  • Matriz de criticidad de servicios.
  • Modelo de alertamiento.
  • Procedimientos de respuesta ante incidentes.
  • Informes de disponibilidad y confiabilidad.
  • Análisis de capacidad y rendimiento.
  • Informes de incidentes críticos.
  • Análisis de causa raíz.
  • Post mortems y planos de acción.
  • Informes de Gestión de Problemas.
  • Hoja de ruta de automatización.
  • Plan de evolución de la plataforma de observabilidad.
  • Indicadores de madurez SRE y DevOps.

Competencias y habilidades blandas

  • Liderazgo técnico.
  • Capacidad de resolución de problemas.
  • Pensamiento analítico.
  • Automatización.
  • Mejora continúa.
  • Influencia transversal.
  • Comunicación efectiva.
  • Capacidad para trabajar bajo presión.
  • Toma de decisiones en situaciones críticas.
  • Orientación a resultados.
  • Capacidad de priorización.
  • Liderazgo de equipos técnicos.
  • Capacidad de negociación.
  • Comunicación con áreas técnicas y ejecutivas.
  • Orientación a la prevención.
  • Cultura de aprendizaje a partir de incidentes.

Etapas do processo

  1. Etapa 1: Cadastro
  2. Etapa 2: Entrevistas
  3. Etapa 3: Confirmación de candidato
  4. Etapa 4: Onboarding
  5. Etapa 5: Contratação

Creer para co-crear

¿Buscas un lugar donde tus ideas brillen?

Con más de 38 años y una presencia global, en Stefanini transformamos el mañana juntos. Aquí, cada acción cuenta y cada idea puede marcar la diferencia. Únete a un equipo que valora la innovación, el respeto y el compromiso. 


Si eres una persona disruptiva, te mantienes en aprendizaje continuo y la innovación está en tu ADN, entonces somos lo que buscas. ¡Ven y construyamos juntos un futuro mejor!