# SRE de Plataforma de IA

**Empresa:** SRM
**Local:** SP
**Modalidade:** Presencial
**Contrato:** CLT
**Publicada em:** 2026-09-09

## Descrição

SRE de Plataforma de IA
Missão da posição
Projetar, construir, automatizar e operar a Plataforma de Engenharia de IA , garantindo que aplicações, modelos, LLMs, agentes e serviços de IA possam ser desenvolvidos e executados com segurança, observabilidade, escalabilidade, confiabilidade e governança.
O profissional atuará na interseção entre SRE, Platform Engineering, DevOps, Cloud, Observabilidade e AI Engineering , construindo a camada de infraestrutura e automação necessária para transformar iniciativas de IA em serviços produtivos e sustentáveis.
A posição terá forte atuação em AWS, Kubernetes, GitOps, Infrastructure as Code, CI/CD, Observabilidade e AI Observability .
Principais responsabilidades

Plataforma AWS
Projetar, administrar e evoluir a infraestrutura AWS utilizada pela plataforma de IA.
Responsabilidades

Administração e evolução de ambientes AWS.
Arquitetura de workloads distribuídos e altamente disponíveis.
Administração de EKS.
ECR para gerenciamento de imagens.
S3 para datasets, artefatos, modelos e logs.
IAM e políticas de acesso.
Secrets Manager e Parameter Store.
Load Balancers e networking.
Route 53.
Cloud
Watch.

SQS/SNS/Event
Bridge para arquiteturas orientadas a eventos.
RDS/Aurora e serviços de persistência quando necessários.
Elasti
Cache/Redis.
Integração com serviços de IA da AWS.
Gestão de custos, capacidade e eficiência dos workloads.
O profissional deverá aplicar conceitos de:
High Availability, Disaster Recovery, Security by Design, FinOps e Well-Architected Framework.

Kubernetes e Plataforma de Containers
Construir e operar clusters Kubernetes utilizados pelos serviços e workloads de IA.
Principais atividades

Administração de clusters Amazon EKS.
Helm.
Kubernetes Operators.
Ingress Controllers.
Service Accounts e RBAC.
Network Policies.
Secrets.
Persistent Volumes.
Autoscaling.
HPA.
KEDA.
Cluster Autoscaler/Karpenter.
Troubleshooting de workloads Kubernetes.
Capacity Planning.

Também será responsável por definir padrões de deployment para:
APIs de IA;
serviços Python;
aplicações Java;
agentes de IA;
gateways;
workers;
pipelines assíncronos;
aplicações de inferência;
ferramentas internas da plataforma.

Infrastructure as Code
Toda infraestrutura deverá ser tratada como código.
Stack principal:
Terraform / OpenTofu + Terragrunt + Atlantis
Responsabilidades

desenvolvimento de módulos reutilizáveis;
versionamento da infraestrutura;
revisão de mudanças via Pull Request;
execução automatizada de Plan;
aprovação controlada de Apply;
gestão de múltiplos ambientes;
padronização de módulos;
controle de drift;
políticas de segurança;
automação do ciclo de vida da infraestrutura.
O Atlantis deverá funcionar como camada de governança do processo de IaC.
Fluxo esperado:
Developer↓Pull Request↓GitHub↓Atlantis↓Terraform / OpenTofu↓AWS

GitOps e Continuous Delivery
Responsável pela implementação e evolução do modelo GitOps da plataforma.
Stack principal:
GitHub + GitHub Actions + ArgoCD + Helm
Fluxo esperado:
Developer↓GitHub↓GitHub Actions↓Build / Test / Security↓Container Image↓Amazon ECR↓GitOps Repository↓ArgoCD↓Amazon EKS
Responsabilidades

construção de pipelines CI/CD;
criação de workflows reutilizáveis;
gerenciamento de secrets;
integração com ECR;
deployment GitOps;
estratégias de rollback;
promoção entre ambientes;
controle de versões;
políticas de aprovação.

Desejável conhecimento de:
Argo Rollouts;
Blue/Green Deployment;
Canary Deployment;
Progressive Delivery.

Observabilidade da Plataforma
Responsável por implementar observabilidade completa dos workloads.
Stack principal:
OpenTelemetry + Datadog

A plataforma deverá coletar:
Metrics
Logs
Traces
Events
O OpenTelemetry deverá ser utilizado como camada de instrumentação e coleta independente de fornecedor.
Arquitetura esperada:
ApplicationsAI ServicesAI AgentsKubernetes↓OpenTelemetry SDK↓OpenTelemetry Collector↓Datadog
Responsabilidades

instrumentação OpenTelemetry;
administração de OpenTelemetry Collectors;
distributed tracing;
dashboards;
alertas;
correlação entre logs, métricas e traces;
definição de SLIs e SLOs;
monitoração de disponibilidade;
monitoração de performance;
análise de incidentes;
troubleshooting distribuído.

AI Observability / LLM Observability
Um dos diferenciais da posição será operar a camada de observabilidade específica para Inteligência Artificial.

Além da observabilidade tradicional, deverão ser acompanhados indicadores como:
Latência de inferência.
Time to First Token.
Tokens de entrada.
Tokens de saída.
Custo por requisição.
Custo por modelo.
Custo por aplicação/agente.
Taxa de erro.
Falhas de ferramentas.
Retries.
Context size.
Model/provider utilizado.
Consumo por usuário ou aplicação.
Qualidade das respostas.
Avaliações de LLM.
Traces de agentes.
Para arquiteturas Agentic AI:
User Request↓Agent↓LLM↓Tool↓Agent↓Another Agent↓LLM↓ResponseO profissional deverá ser capaz de reconstruir e diagnosticar todo esse fluxo através de traces.

Conhecimentos desejáveis:
OpenTelemetry GenAI Semantic Conventions;
OpenLIT;
Langfuse;
Arize Phoenix;
avaliação e tracing de aplicações LLM.

Plataforma de Engenharia de IA
O profissional participará da construção de uma Internal Developer Platform — IDP direcionada para workloads de IA.
Objetivo:
Permitir que desenvolvedores e times de IA publiquem serviços sem precisar conhecer toda a complexidade da infraestrutura.
Exemplo:
Developer↓Developer Portal↓Service Template↓GitHub Repository↓GitHub Actions↓ECR↓ArgoCD↓EKS↓OpenTelemetry↓DatadogA plataforma deverá fornecer Golden Paths para criação de:

APIs;
microserviços;
workers;
aplicações Python;
serviços Java;
agentes de IA;
aplicações RAG;
serviços de inferência.

Cada Golden Path deverá entregar automaticamente:
repositório;
pipeline;
Dockerfile;
Helm Chart;
deployment Kubernetes;
observabilidade;
health checks;
secrets;
dashboards;
alertas;
políticas básicas de segurança.

AI Gateway e acesso aos modelos
Participará da construção da camada de abstração entre aplicações e provedores/modelos de IA.
Arquitetura conceitual:
ApplicationsAgentsServices↓AI Gateway↓Model Router↓┌──────────────┬──────────────┬──────────────┐│ AWS Bedrock │ External LLM │ Local Models │└─────────...

## Habilidades

- AWS
- Kubernetes
- GitOps
- Infrastructure as Code
- CI/CD
- Observabilidade
- AI Engineering

**Página original:** https://www.123vagas.com.br/vaga/sre-de-plataforma-de-ia-sao-paulo-sp-81632
