Role Description
Buscamos un/a Site Reliability Engineer (SRE) con experiencia sólida en operación de servicios críticos y entornos productivos, que combine conocimientos de cloud, automatización, observabilidad y gestión de incidentes para contribuir a la construcción y evolución de plataformas tecnológicas confiables, resilientes y escalables.
La posición trabajará de manera cercana con equipos de desarrollo y plataforma, promoviendo prácticas de confiabilidad desde el diseño hasta la operación y equilibrando la estabilidad de los servicios con la velocidad de entrega de cambios.
Tipo de posición: Tiempo completo, long-term.
Responsibilities
-
Diseñar e implementar soluciones de automatización para reducir tareas operativas manuales y repetitivas en ambientes productivos.
-
Implementar y evolucionar prácticas de observabilidad, utilizando métricas, logs y trazas para entender el comportamiento de los servicios.
-
Definir y mantener SLIs y SLOs en conjunto con equipos de desarrollo y stakeholders del negocio.
-
Participar en la atención de incidentes y esquemas de on-call, realizando diagnóstico, contención y recuperación de servicios.
-
Liderar y documentar análisis post-incidente y Root Cause Analysis (RCA), identificando oportunidades de mejora y acciones preventivas.
-
Promover el modelo “you build it, you run it”, incorporando prácticas de confiabilidad desde el desarrollo.
-
Diseñar y mantener mecanismos de control de cambios y despliegues integrados a pipelines de CI/CD.
-
Analizar capacidad, performance y comportamiento bajo carga de los servicios, proponiendo mejoras de arquitectura o configuración.
-
Evaluar y fortalecer la resiliencia, disponibilidad y recuperación ante fallas de plataformas y servicios.
-
Documentar estándares, procedimientos, runbooks y buenas prácticas de Site Reliability Engineering.
Qualifications
-
Experiencia profesional en Site Reliability Engineering, DevOps, Cloud, Infrastructure, Systems Engineering u Operations.
-
Experiencia hands-on trabajando con servicios críticos y ambientes productivos.
-
Sólidos conocimientos de Linux y troubleshooting de infraestructura y aplicaciones.
-
Experiencia con plataformas de cloud computing.
-
Experiencia en monitoreo y observabilidad mediante métricas, logs, trazas y alertamiento.
-
Experiencia atendiendo incidentes de producción, troubleshooting y Root Cause Analysis.
-
Conocimiento de conceptos de SLI, SLO y SLA y su aplicación en la gestión de confiabilidad.
-
Experiencia con automatización y scripting.
-
Conocimiento de CI/CD y procesos modernos de deployment.
-
Experiencia con Infrastructure as Code, idealmente Terraform.
-
Conocimiento de principios de alta disponibilidad, resiliencia, disaster recovery y escalabilidad.
-
Capacidad para trabajar de manera colaborativa con equipos de desarrollo, infraestructura y operaciones.
Requirements
-
Deseable experiencia con AWS y arquitecturas cloud-native.
-
Deseable experiencia con Terraform y automatización de infraestructura.
-
Deseable experiencia con Docker y Kubernetes.
-
Deseable conocimiento de herramientas de observabilidad como Prometheus, Grafana, Datadog, Splunk, CloudWatch o equivalentes.
-
Deseable experiencia trabajando con estrategias de High Availability y Disaster Recovery.
-
Deseable experiencia en análisis de capacidad, performance y escalabilidad.
-
Deseable experiencia participando en esquemas de on-call y gestión de incidentes críticos.
-
Deseable certificaciones relacionadas con AWS, Cloud Operations o Site Reliability Engineering.
Benefits
-
Seguro médico privado.
-
Asociación solidarista.
-
Vacaciones y feriados de acuerdo con la legislación de Costa Rica.
-
Oportunidades de aprendizaje y crecimiento profesional.
-
Participación en proyectos tecnológicos de alto impacto.
Note
Esta oportunidad está disponible únicamente para candidatos que residan actualmente en Costa Rica. Aplicaciones fuera de esta región no serán consideradas.