123Vagas
Entrar / Criar conta Vagas
Modalidade
Contratos
Senioridade
Para Empresas Skills Blog
Ferramentas
123Vagas Plus
Entrar como empresa Cadastrar empresa grátis
SR

SRE Pleno

SRM Hoje

Prepare esta candidatura

Veja o match com o seu perfil antes de ir pro site da empresa. Match e alerta grátis; currículo ATS no Plus.

Compartilhar

Presencial CLT Tecnologia 1 visualização
AWS Kubernetes Veeam Backup Datadog Linux TCP/IP Docker Git
Ver se você combina

Site Reliability Engineer (SRE) Pleno

Objetivo da posição

Atuar na sustentação, administração, observabilidade e evolução dos ambientes de infraestrutura e aplicações, garantindo disponibilidade, estabilidade, segurança e desempenho dos serviços.

O profissional será responsável principalmente pela administração dos ambientes AWS, Kubernetes, soluções de backup Veeam/AWS e observabilidade através do Datadog, atuando também na análise e resolução de incidentes.

Principais responsabilidades

Administração de Recursos AWS

  • Administrar e acompanhar recursos e serviços hospedados na AWS.
  • Realizar troubleshooting de infraestrutura, conectividade, disponibilidade e performance.
  • Acompanhar utilização e capacidade dos recursos.
  • Apoiar provisionamento, configuração e manutenção dos ambientes.
  • Administrar recursos como EC2, EBS, S3, IAM, VPC, Load Balancers, Route 53 e demais serviços utilizados pela organização.
  • Analisar eventos, logs e métricas através de Cloud

Watch e Cloud
Trail.

  • Apoiar aplicação de boas práticas de segurança, disponibilidade e controle de acesso.
  • Participar da análise e otimização de custos e recursos AWS.
  • Apoiar processos de atualização, manutenção e mudanças de infraestrutura.
  • Administração de Backup Veeam e AWS
  • Administrar e monitorar rotinas de backup através do Veeam e serviços AWS.
  • Acompanhar execução, sucesso e falhas dos jobs de backup.
  • Investigar e corrigir falhas relacionadas às rotinas de backup.
  • Executar e acompanhar procedimentos de restore quando necessário.
  • Realizar testes periódicos de recuperação para garantir a integridade dos backups.
  • Apoiar políticas de retenção, armazenamento e ciclo de vida dos backups.
  • Acompanhar capacidade e utilização dos repositórios de backup.
  • Apoiar procedimentos relacionados a Disaster Recovery e continuidade de negócio.
  • Manter documentação e evidências das rotinas e testes de recuperação.
  • Administração de Clusters Kubernetes
  • Administrar e monitorar clusters Kubernetes.
  • Acompanhar Pods, Deployments, Stateful
  • Sets, Daemon
  • Sets, Services, Ingress, Config
  • Maps e Secrets.
  • Realizar troubleshooting de aplicações e workloads executados nos clusters.
  • Analisar eventos, logs, probes, consumo de CPU/memória e comportamento dos Pods.
  • Investigar problemas como Crash
  • LoopBackOff, Image
  • PullBackOff, OOM
  • Killed, falhas de probes e indisponibilidade de aplicações.
  • Apoiar atualização e manutenção dos clusters e seus componentes.
  • Administrar namespaces, permissões e recursos dos ambientes.
  • Apoiar configurações de escalabilidade, requests, limits e autoscaling.
  • Trabalhar em conjunto com os times de desenvolvimento na análise de problemas das aplicações.
  • Apoiar processos de deploy e operação de aplicações utilizando práticas de CI/CD e GitOps.
  • Administração de Observabilidade e Datadog
  • Administrar e manter dashboards no Datadog.
  • Criar e evoluir dashboards técnicos e operacionais.
  • Criar e ajustar monitors e alertas.
  • Acompanhar métricas de infraestrutura e aplicações.
  • Realizar análise de logs, métricas e traces para troubleshooting.
  • Utilizar recursos de APM para identificação de gargalos e falhas de aplicações.
  • Acompanhar indicadores de disponibilidade, latência, erros e saturação.
  • Apoiar definição e acompanhamento de SLIs e SLOs.
  • Revisar alertas buscando redução de falsos positivos e melhoria da qualidade da monitoração.
  • Apoiar times técnicos durante incidentes utilizando dados de observabilidade para identificação da causa raiz.

Atuação operacional

  • O profissional também deverá:
  • Atuar no atendimento e resolução de incidentes de infraestrutura e aplicações.
  • Realizar troubleshooting de problemas de média complexidade.
  • Participar de análises de causa raiz (RCA).
  • Registrar procedimentos, incidentes e soluções em documentação técnica.
  • Executar mudanças seguindo os processos internos de Change Management.
  • Trabalhar em conjunto com os times de SRE, Infraestrutura, Redes, Segurança, Banco de Dados e Desenvolvimento.
  • Apoiar automações para redução de atividades operacionais manuais.
  • Participar da evolução contínua dos ambientes e processos de confiabilidade.
  • Conhecimentos técnicos desejados
  • AWS.
  • Kubernetes.
  • Veeam Backup & Replication.
  • Datadog.
  • Linux.
  • Redes TCP/IP, DNS, HTTP/HTTPS e troubleshooting de conectividade.
  • Conceitos de containers e Docker.
  • Git.
  • CI/CD.
  • Shell Script e/ou Python.
  • Terraform ou outra ferramenta de Infrastructure as Code.
  • Conceitos de observabilidade: métricas, logs e traces.
  • Conceitos de alta disponibilidade, backup e Disaster Recovery.
  • Conhecimentos básicos de segurança em ambientes Cloud.

Perfil esperado

Buscamos um profissional de nível pleno, com autonomia para executar atividades operacionais e troubleshooting de média complexidade, capacidade de análise de incidentes e interesse em automação e melhoria contínua.

É importante possuir boa comunicação, organização, senso de responsabilidade sobre ambientes produtivos e capacidade de trabalhar de forma integrada com diferentes times técnicos.

Título e texto são os da empresa. A candidatura é no site da empresa (gruposrm.inhire.app) — daqui você sai preparado. Saiba como funciona.
Publicada em 11 de setembro de 2026

Candidatura no site da empresa · gruposrm.inhire.app

Match · CV