# Site Reliability Engineering (SRE) Sênior | Híbrido

**Empresa:** SRM
**Local:** SP
**Modalidade:** Híbrido
**Contrato:** CLT
**Publicada em:** 2026-08-20

## Descrição

Sobre a Vaga
Site Reliability Engineering (SRE) Sênior na SRM em SP, para atuar na operação e evolução de infraestrutura híbrida (AWS multi-conta e datacenter on-premises) de plataformas críticas do grupo regulado (BACEN/CVM/LGPD), com foco em confiabilidade, segurança, automação e eficiência de custos.
Responsabilidades

Operar e evoluir o ambiente AWS multi-conta (Control Tower) e clusters Kubernetes/EKS com centenas de microserviços
Sustentar deploys via GitOps (ArgoCD + Helm) e evoluir esteiras CI/CD padronizadas (GitHub Actions / GitLab CI) com gates de segurança (secret scanning, SCA, containers, IaC)
Atuar com infraestrutura como código usando Terraform/Terragrunt e automação self-service de provisionamento
Garantir observabilidade de ponta a ponta com Datadog (APM), Prometheus/Grafana, OpenSearch e OpenTelemetry (SLIs/SLOs, dashboards e alertas)
Responder a incidentes e conduzir post-mortems blameless; participar de GMUD (gestão de mudanças)
Aplicar FinOps com metas ativas: análise de custos, reservas/Savings Plans, rightsizing e desligamento de não-produção
Usar IA aplicada (Claude Code, Copilot) para automação, scripts, IaC e documentação
Documentar runbooks/arquitetura e reduzir toil com automação
Requisitos

Experiência comprovada como SRE/DevOps em ambientes críticos
Kubernetes sólido (EKS): Helm, troubleshooting de workloads, probes/autoscaling, ingress
GitOps com ArgoCD e CI/CD (GitHub Actions e/ou GitLab CI)
Terraform/Terragrunt: módulos, state remoto, múltiplas contas
AWS: EC2, RDS/Aurora, S3, IAM, VPC/Transit Gateway, Lambda, CloudWatch
Observabilidade: Datadog e/ou Prometheus/Grafana; logs centralizados (OpenSearch/ELK)
Bancos de dados: SQL Server, MongoDB/DocumentDB, PostgreSQL
Ambientes on-premises: Linux e Windows Server, virtualização (Nutanix/VMware), balanceamento (F5 ou similar)

## Habilidades

- Kubernetes (EKS)
- GitOps (ArgoCD + Helm)
- Terraform/Terragrunt

**Página original:** https://www.123vagas.com.br/vaga/site-reliability-engineering-sre-senior-srm-sp-hibrido-60186
