Skills
Sobre a Vaga
Buscamos um(a) Data & ML Engineer Sênior para atuar na camada de inteligência de um produto de IA aplicado à saúde. Você vai transformar grandes volumes de dados clínicos e documentos em informação confiável para agentes inteligentes, integrando engenharia de dados e engenharia de ML na mesma frente.
Responsabilidades
- Projetar e manter pipelines de ingestão de dados estruturados e não estruturados para retrieval e reasoning
- Construir e evoluir pipelines de feature engineering e embeddings para RAG, incluindo estratégias de chunking, seleção e avaliação de modelos
- Gerir índices vetoriais e acompanhar métricas de qualidade de retrieval (ex.: MRR, NDCG, precision@k)
- Implementar monitoramento de comportamento de modelos em produção, com detecção de distribution shift e suporte a rollback automático por regressão
- Atuar em conjunto com o time de MLOps para versionamento de modelos, experiment tracking e roteamento A/B
- Garantir tratamento seguro de dados sensíveis (PHI), com pseudonimização, enforcement de residência de dados e auditoria de acessos
- Manter padrões de qualidade em Knowledge Graphs com ingestão auditável de conhecimento clínico
- Avaliar e integrar novas fontes de dados do ecossistema de saúde conforme a expansão do produto
Requisitos
- 8+ anos de experiência em Data Science ou ML Engineering, com 3+ anos liderando projetos de ML em produção de forma independente
- Inglês fluente
- Fundamentos sólidos de engenharia de dados (pipelines, schemas, qualidade de dados, ETL/ELT em escala)
- Experiência prática em ML Engineering com modelos efetivamente em produção, entendendo a diferença entre métricas de pesquisa e confiabilidade operacional
- Arquitetura RAG com avaliação de embeddings, estratégia de chunking e bancos vetoriais (Vertex AI Vector Search, Weaviate, Pinecone ou equivalentes)
- Fluência em GCP/Vertex AI (BigQuery, Cloud Storage, Vertex AI Pipelines, Model Registry e endpoints gerenciados de embedding)
- Experiência com PHI ou conhecimento sólido de privacidade e legislação canadense (PIPEDA/PHIPA), com privacidade como restrição de design
- Proficiente em Python
- RAG e MLOps são obrigatórios
- Formação em Mestrado em Ciência da Computação/Data Science ou experiência/certificações equivalentes
- Certificação GCP Machine Learning Engineer (ou equivalente em ML na nuvem)
Beneficios
- Trabalho remoto com flexibilidade e autonomia
- Plano de saúde e odontológico, seguro de vida e Wellhub (Gympass)
- Descontos em cursos da FIAP e MBA USP Esalq
- Diferenciais como bonificação por indicação, horário adaptável e bônus anual