123Vagas
Entrar / Criar conta Vagas
Modalidade
Contratos
Senioridade
Para Empresas Skills Blog
Ferramentas
123Vagas Plus
Entrar como empresa Cadastrar empresa grátis
SR

SRE de Plataforma de IA

SRM 09/09/2026

Prepare esta candidatura

Veja o match com o seu perfil antes de ir pro site da empresa. Match e alerta grátis; currículo ATS no Plus.

Compartilhar

Presencial CLT Tecnologia 0 visualizações
AWS Kubernetes GitOps Infrastructure as Code CI/CD Observabilidade AI Engineering
Ver se você combina

SRE de Plataforma de IA

Missão da posição

Projetar, construir, automatizar e operar a Plataforma de Engenharia de IA , garantindo que aplicações, modelos, LLMs, agentes e serviços de IA possam ser desenvolvidos e executados com segurança, observabilidade, escalabilidade, confiabilidade e governança.

O profissional atuará na interseção entre SRE, Platform Engineering, DevOps, Cloud, Observabilidade e AI Engineering , construindo a camada de infraestrutura e automação necessária para transformar iniciativas de IA em serviços produtivos e sustentáveis.

A posição terá forte atuação em AWS, Kubernetes, GitOps, Infrastructure as Code, CI/CD, Observabilidade e AI Observability .

Principais responsabilidades

  • Plataforma AWS

Projetar, administrar e evoluir a infraestrutura AWS utilizada pela plataforma de IA.

Responsabilidades

  • Administração e evolução de ambientes AWS.
  • Arquitetura de workloads distribuídos e altamente disponíveis.
  • Administração de EKS.
  • ECR para gerenciamento de imagens.
  • S3 para datasets, artefatos, modelos e logs.
  • IAM e políticas de acesso.
  • Secrets Manager e Parameter Store.
  • Load Balancers e networking.
  • Route 53.
  • Cloud

Watch.

  • SQS/SNS/Event
  • Bridge para arquiteturas orientadas a eventos.
  • RDS/Aurora e serviços de persistência quando necessários.
  • Elasti
  • Cache/Redis.
  • Integração com serviços de IA da AWS.
  • Gestão de custos, capacidade e eficiência dos workloads.

O profissional deverá aplicar conceitos de:

High Availability, Disaster Recovery, Security by Design, FinOps e Well-Architected Framework.

  • Kubernetes e Plataforma de Containers
  • Construir e operar clusters Kubernetes utilizados pelos serviços e workloads de IA.

Principais atividades

  • Administração de clusters Amazon EKS.
  • Helm.
  • Kubernetes Operators.
  • Ingress Controllers.
  • Service Accounts e RBAC.
  • Network Policies.
  • Secrets.
  • Persistent Volumes.
  • Autoscaling.
  • HPA.
  • KEDA.
  • Cluster Autoscaler/Karpenter.
  • Troubleshooting de workloads Kubernetes.
  • Capacity Planning.
  • Também será responsável por definir padrões de deployment para:
  • APIs de IA;
  • serviços Python;
  • aplicações Java;
  • agentes de IA;
  • gateways;
  • workers;
  • pipelines assíncronos;
  • aplicações de inferência;
  • ferramentas internas da plataforma.
  • Infrastructure as Code
  • Toda infraestrutura deverá ser tratada como código.

Stack principal:

Terraform / OpenTofu + Terragrunt + Atlantis

Responsabilidades

  • desenvolvimento de módulos reutilizáveis;
  • versionamento da infraestrutura;
  • revisão de mudanças via Pull Request;
  • execução automatizada de Plan;
  • aprovação controlada de Apply;
  • gestão de múltiplos ambientes;
  • padronização de módulos;
  • controle de drift;
  • políticas de segurança;
  • automação do ciclo de vida da infraestrutura.

O Atlantis deverá funcionar como camada de governança do processo de IaC.

Fluxo esperado:

Developer

Pull Request

GitHub

Atlantis

Terraform / OpenTofu

AWS

  • GitOps e Continuous Delivery
  • Responsável pela implementação e evolução do modelo GitOps da plataforma.

Stack principal:

GitHub + GitHub Actions + ArgoCD + Helm

Fluxo esperado:

Developer

GitHub

GitHub Actions

Build / Test / Security

Container Image

Amazon ECR

GitOps Repository

ArgoCD

Amazon EKS

Responsabilidades

  • construção de pipelines CI/CD;
  • criação de workflows reutilizáveis;
  • gerenciamento de secrets;
  • integração com ECR;
  • deployment GitOps;
  • estratégias de rollback;
  • promoção entre ambientes;
  • controle de versões;
  • políticas de aprovação.
  • Desejável conhecimento de:
  • Argo Rollouts;
  • Blue/Green Deployment;
  • Canary Deployment;
  • Progressive Delivery.
  • Observabilidade da Plataforma
  • Responsável por implementar observabilidade completa dos workloads.

Stack principal:

OpenTelemetry + Datadog

  • A plataforma deverá coletar:
  • Metrics
  • Logs
  • Traces
  • Events

O OpenTelemetry deverá ser utilizado como camada de instrumentação e coleta independente de fornecedor.

Arquitetura esperada:

Applications
AI Services
AI Agents
Kubernetes

OpenTelemetry SDK

OpenTelemetry Collector

Datadog

Responsabilidades

  • instrumentação OpenTelemetry;
  • administração de OpenTelemetry Collectors;
  • distributed tracing;
  • dashboards;
  • alertas;
  • correlação entre logs, métricas e traces;
  • definição de SLIs e SLOs;
  • monitoração de disponibilidade;
  • monitoração de performance;
  • análise de incidentes;
  • troubleshooting distribuído.
  • AI Observability / LLM Observability

Um dos diferenciais da posição será operar a camada de observabilidade específica para Inteligência Artificial.

  • Além da observabilidade tradicional, deverão ser acompanhados indicadores como:
  • Latência de inferência.
  • Time to First Token.
  • Tokens de entrada.
  • Tokens de saída.
  • Custo por requisição.
  • Custo por modelo.
  • Custo por aplicação/agente.
  • Taxa de erro.
  • Falhas de ferramentas.
  • Retries.
  • Context size.
  • Model/provider utilizado.
  • Consumo por usuário ou aplicação.
  • Qualidade das respostas.
  • Avaliações de LLM.
  • Traces de agentes.

Para arquiteturas Agentic AI:

User Request

Agent

LLM

Tool

Agent

Another Agent

LLM

Response
O profissional deverá ser capaz de reconstruir e diagnosticar todo esse fluxo através de traces.

  • Conhecimentos desejáveis:
  • OpenTelemetry GenAI Semantic Conventions;
  • OpenLIT;
  • Langfuse;
  • Arize Phoenix;
  • avaliação e tracing de aplicações LLM.
  • Plataforma de Engenharia de IA

O profissional participará da construção de uma Internal Developer Platform — IDP direcionada para workloads de IA.

Objetivo:

Permitir que desenvolvedores e times de IA publiquem serviços sem precisar conhecer toda a complexidade da infraestrutura.

Exemplo:

Developer

Developer Portal

Service Template

GitHub Repository

GitHub Actions

ECR

ArgoCD

EKS

OpenTelemetry

Datadog
A plataforma deverá fornecer Golden Paths para criação de:

  • APIs;
  • microserviços;
  • workers;
  • aplicações Python;
  • serviços Java;
  • agentes de IA;
  • aplicações RAG;
  • serviços de inferência.
  • Cada Golden Path deverá entregar automaticamente:
  • repositório;
  • pipeline;
  • Dockerfile;
  • Helm Chart;
  • deployment Kubernetes;
  • observabilidade;
  • health checks;
  • secrets;
  • dashboards;
  • alertas;
  • políticas básicas de segurança.
  • AI Gateway e acesso aos modelos
  • Participará da construção da camada de abstração entre aplicações e provedores/modelos de IA.

Arquitetura conceitual:

Applications
Agents
Services

AI Gateway

Model Router

┌──────────────┬──────────────┬──────────────┐
│ AWS Bedrock │ External LLM │ Local Models │
└─────────...

Título e texto são os da empresa. A candidatura é no site da empresa (gruposrm.inhire.app) — daqui você sai preparado. Saiba como funciona.
Publicada em 9 de setembro de 2026

Candidatura no site da empresa · gruposrm.inhire.app

Match · CV