Role Description
Manter de pé, observável e previsível a plataforma que sustenta as operações de Soluções Open em produção. É um ambiente multi-tenant, em cloud (AWS, Kubernetes, Terraform), onde indisponibilidade não é inconveniente operacional — é descumprimento de obrigação regulatória, com janela de reporte e prazo definidos por regulador. O desafio central é deslocar a operação de reativa para preventiva: construir observabilidade que antecipe problema em vez de constatá-lo depois, e eliminar por automação o trabalho manual repetitivo. A pessoa nesta posição irá responder pelas soluções Open atuando junto de arquitetos cloud e de software, além de desenvolvedores, com responsabilidade compartilhada pelo que está no ar.
Quais serão suas atividades do dia-a-dia?
-
Observabilidade e monitoração
:
-
Construir e evoluir a monitoração dos ambientes de produção, com foco em antecipar falha;
-
Definir e instrumentar indicadores que representem experiência real de uso, não apenas saúde de recurso;
-
Reduzir ruído de alerta e falso positivo;
-
Manter dashboards que sustentem decisão técnica.
-
Automação e redução de toil:
-
Identificar e eliminar trabalho manual repetitivo: provisionamento, configuração, rotinas operacionais;
-
Evoluir infraestrutura como código (Terraform, Helm) como fonte única de verdade;
-
Desenvolver scripts e automações em Python e Shell para operações recorrentes;
-
Converter procedimento não documentado em runbook executável.
-
Sustentação e resposta a incidente
:
-
Atuar na triagem, mitigação e resolução de incidentes de produção;
-
Documentar e apoiar post-mortem com foco em causa raiz e ação preventiva;
-
Sustentar os ambientes junto do time de engenharia;
-
Acompanhar consumo e custo de infraestrutura, gerando visibilidade para decisão técnica.
Qualifications
-
Experiência demonstrável, não familiaridade conceitual:
-
Ter operado Kubernetes em produção: debug de pod, análise de consumo de recurso, entendimento de modos de falha Cloud em ambiente de missão crítica — AWS preferencialmente;
-
Ter escrito e mantido infraestrutura como código com Terraform e Helm, incluindo revisão de mudança de outra pessoa;
-
Ter construído monitoração com Prometheus e Grafana: criação de métrica e regra de alerta, não apenas consumo de dashboard pronto;
-
Troubleshooting em Linux com autonomia: serviços, processos, rede, disco, análise de log;
-
Automações em Python ou Shell que outras pessoas passaram a usar;
-
Participação em resposta a incidente de produção, com clareza sobre quando resolver e quando escalar;
-
Conhecimento de rede suficiente para investigar: segmentação, DNS, TLS, VPN, ferramentas de debug.
Requirements
-
Experiência em ambiente regulado: financeiro, seguros ou similar;
-
Vivência com APIs, REST e gateway de API;
-
Gerenciamento de logs em escala (Elasticsearch, OpenSearch, Loki ou equivalente);
-
Construção e manutenção de pipelines de CI/CD;
-
Prática de definição de SLI e SLO, e uso de error budget para orientar decisão;
-
Configuração como código (Ansible ou equivalente);
-
Inglês para leitura de documentação técnica.
Benefits
-
Vale Refeição/Vale Alimentação (Cartão Flash benefícios);
-
Plano de Saúde;
-
Plano Odontológico;
-
Seguro de Vida;
-
PPR;
-
TotalPass;
-
Auxílio Creche;
-
Programa Well-Being (destinado para saúde física e mental);
-
Universidade Corporativa (nossa #SensediaAcademy), com diversas trilhas de desenvolvimento;
-
Parceiros culturais e educacionais, com descontos especiais;
-
Licença maternidade e licença paternidade estendida.