123Vagas
Vagas Vagas Remotas Vagas Híbridas Cidades Empresas Skills Blog 123Vagas Plus Para Empresas

Institucional

Sobre Como Funciona FAQ Contato Privacidade Termos de Uso

Sou candidato

Entrar / Criar conta

Sou empresa

Entrar como empresa Cadastrar empresa grátis
BR

Líder de Platform Reliability & Operations (SRE) | Sumaré/SP | Presencial

Presencial CLT Tecnologia 0 visualizações
SRE Observabilidade e monitoramento Gestão de incidentes e análise de causa raiz

Sobre a Vaga

A 3M busca um(a) Platform Ops & Reliability Lead para liderar a confiabilidade e a excelência operacional da plataforma corporativa de dados e IA do time de Corporate Research Digital Platforms (CRDP). O foco é garantir estabilidade, disponibilidade e maturidade operacional do ambiente, incluindo Databricks e infraestrutura em nuvem na AWS.

Responsabilidades

  • Garantir a saúde do runtime da plataforma e atuar como líder principal na resposta a incidentes
  • Definir e acompanhar métricas de disponibilidade, desempenho e confiabilidade (ex.: sucesso de jobs, conclusão de workflows e tempo de resolução)
  • Conduzir a gestão de incidentes críticos, organizando war rooms e liderando análises de causa raiz com foco em melhoria contínua
  • Implementar e evoluir práticas de SRE, observabilidade, monitoramento, alertas e automação para aumentar a confiabilidade
  • Desenhar e operar o modelo de suporte da plataforma (entrada, triagem, escalonamento, SLAs e KPIs operacionais)
  • Acompanhar pipelines e workflows em produção, atuando para prevenir e resolver falhas, atrasos e interrupções
  • Assegurar conformidade com padrões operacionais e de governança em produção, incluindo controles de acesso e políticas aprovadas
  • Manter documentação operacional atualizada, como runbooks, incident playbooks e guias de troubleshooting

Requisitos

  • Experiência sólida em operações de infraestrutura, operações em nuvem, SRE ou operações de plataforma
  • Experiência apoiando Databricks ou plataformas modernas de dados (arquiteturas lakehouse)
  • Atuação comprovada com sistemas em produção, com alta disponibilidade e rigor operacional
  • Experiência liderando gestão de incidentes, incluindo resposta a major incidents e análise de causa raiz
  • Conhecimento prático de ferramentas de monitoramento e observabilidade (ex.: Datadog, Grafana, CloudWatch, Dynatrace)
  • Experiência com plataformas baseadas em nuvem, com AWS como diferencial (troubleshooting de infraestrutura e serviços)
  • Compreensão de modelos de suporte (L1/L2/L3) e práticas de service management (ITIL)
  • Capacidade de atuar em ambientes cross-funcionais, coordenando times de engenharia, plataforma, dados e suporte
  • Formação superior completa em áreas como Ciência da Computação, Engenharia ou correlatas
  • Inglês em nível de proficiência

Beneficios

  • Programas de bem-estar para apoiar a vida pessoal e financeira
  • Pacote de remuneração e benefícios com benchmarking de mercado
  • Cultura de segurança (EHS) e oportunidades de melhoria contínua
Esta vaga foi curada e enriquecida pelo 123Vagas para facilitar sua busca. A candidatura é feita no site original: 3m.wd1.myworkdayjobs.com. Saiba como funciona.
Publicada em 29 de julho de 2026
Compartilhar:
Candidatar-se