Skills
Sobre a Vaga
A CERC é uma infraestrutura de mercado que conecta financiadores (bancos, fintechs, gestoras e securitizadoras) a milhares de empresas que buscam crédito. Como Especialista de SRE, você será referência técnica para elevar a confiabilidade da plataforma, com foco em cloud, observabilidade, automação e engenharia de resiliência.
Responsabilidades
- Definir a estratégia técnica de confiabilidade, transformando objetivos de negócio e requisitos regulatórios em um roadmap de SRE
- Atuar como referência em decisões complexas de arquitetura, cloud, Kubernetes, bancos de dados, mensageria, segurança, performance e custos
- Desenhar padrões e plataformas resilientes e escaláveis para sustentar crescimento com disponibilidade e eficiência
- Estruturar e evoluir práticas de SLO, error budget, gestão de incidentes, post-mortems, capacity planning e engenharia de resiliência
- Coordenar tecnicamente iniciativas transversais envolvendo SRE, desenvolvimento, arquitetura, segurança, GRC, produtos e operações
- Impulsionar a plataforma como produto com golden paths, autosserviço e componentes reutilizáveis
- Estabelecer padrões corporativos de observabilidade (métricas, logs, traces, alertas e visualização de saúde)
- Orientar decisões considerando confiabilidade, segurança, capacidade e custo desde a concepção dos serviços
- Liderar decisões de FinOps e dimensionamento com base em dados
- Conduzir investigações de alta complexidade para eliminar causas estruturais de incidentes e indisponibilidades
- Mentorar profissionais e multiplicar conhecimento dentro da organização
- Traduzir riscos técnicos em impactos financeiros, regulatórios e de negócio para apoiar decisões executivas
- Avaliar novas tecnologias e oportunidades com IA para aumentar produtividade e confiabilidade
Requisitos
- Trajetória sólida em SRE, engenharia de plataforma, infraestrutura, cloud ou sistemas distribuídos
- Experiência liderando tecnicamente iniciativas com impacto em múltiplos times, sistemas ou unidades
- Profundidade em Google Cloud Platform (ou equivalente em cloud de grande escala)
- Domínio de Kubernetes, infraestrutura como código, CI/CD, observabilidade e automação
- Capacidade de desenvolvimento de software e/ou ferramentas internas (preferencialmente com Python)
- Conhecimento avançado de arquiteturas distribuídas, alta disponibilidade, escalabilidade, disaster recovery e continuidade
- Experiência estruturando SLOs, error budgets, processos de incidentes, capacity planning e práticas de resiliência
- Forte base em redes, IAM, segurança em cloud, bancos de dados, mensageria, integração e performance
- Boa comunicação com áreas técnicas, executivos, auditorias e negócios
- Autonomia para estruturar problemas ambíguos e construir soluções do zero
Beneficios
- Remuneração variável com bônus anual e programa de opções de compra de ações
- Plano de saúde e odontológico sem co-participação
- Flexfood
- Seguro de vida e previdência privada
- Vale transporte ou estacionamento
- Subsídio educação e auxílio creche
- Gympass e Totalpass