O que esta vaga pede
Sobre a Vaga
Site Reliability Engineering (SRE) Sênior na SRM em SP, para operar e evoluir uma infraestrutura híbrida com AWS multi-conta e datacenter on-premises, sustentando plataformas críticas de um grupo regulado (BACEN/CVM/LGPD).
Responsabilidades
- Operar e evoluir o ambiente AWS multi-conta (Control Tower) e clusters Kubernetes/EKS com centenas de microserviços
- Sustentar deploys via GitOps (ArgoCD + Helm) e evoluir esteiras CI/CD padronizadas (GitHub Actions / GitLab CI) com gates de segurança (secret scanning, SCA, containers, IaC)
- Atuar com infraestrutura como código usando Terraform/Terragrunt e automação self-service de provisionamento
- Garantir observabilidade de ponta a ponta com Datadog (APM), Prometheus/Grafana, OpenSearch e OpenTelemetry, incluindo SLIs/SLOs, dashboards e alertas
- Responder a incidentes e conduzir post-mortems blameless, além de participar de GMUD
- Aplicar FinOps com análise de custos, reservas/Savings Plans, rightsizing e desligamento de não-produção
- Usar IA aplicada (Claude Code, Copilot) para automação, scripts, IaC e documentação
- Documentar runbooks/arquitetura e reduzir toil com automação
Requisitos
- Experiência comprovada como SRE/DevOps em ambientes críticos
- Kubernetes sólido (EKS): Helm, troubleshooting de workloads, probes/autoscaling, ingress
- GitOps com ArgoCD e CI/CD (GitHub Actions e/ou GitLab CI)
- Terraform/Terragrunt: módulos, state remoto, múltiplas contas
- AWS: EC2, RDS/Aurora, S3, IAM, VPC/Transit Gateway, Lambda, CloudWatch
- Observabilidade: Datadog e/ou Prometheus/Grafana; logs centralizados (OpenSearch/ELK)
- Bancos de dados em operação: SQL Server, MongoDB/DocumentDB, PostgreSQL
- Ambientes on-premises: Linux e Windows Server, virtualização (Nutanix/VMware), balanceamento (F5 ou similar)