Skills
Sobre a Vaga
Na Luby, você atuará ponta a ponta no loop de feedback que evolui agentes de IA de uma plataforma de saúde a partir de preferências de clínicos, profissionais de apoio e pacientes. O trabalho é remoto e exige atenção rigorosa à segurança clínica e ao tratamento de dados sensíveis (PHI).
Responsabilidades
- Projetar e manter a infraestrutura de coleta de dados de preferência, incluindo UIs de revisão e fluxos para revisores clínicos
- Construir e evoluir a infraestrutura de reward modeling, com datasets, pipelines de treino e metodologias de avaliação
- Assumir o ciclo RLHF/RLAIF dos agentes principais, apoiando automações como inbox, prontuário, documentação clínica e encaminhamentos
- Definir e manter a hierarquia de sinais de qualidade, determinando quando cada tipo de feedback exige revisão especialista, apoio ou automação via RLAIF
- Desenvolver pipelines de RLAIF para escalar a anotação com abordagens como Constitutional AI e geração automatizada de pares de preferência
- Atuar em conjunto com a engenharia de inteligência na estratégia de fine-tuning, prompt engineering e RAG, entendendo como o aprendizado por preferência se integra
- Garantir conformidade com PHI em todas as etapas do pipeline, com interfaces seguras, auditoria e requisitos de residência de dados
Requisitos
- Mestrado em Ciência da Computação, Ciência de Dados ou experiência equivalente
- Experiência de pelo menos 8 anos em Ciência de Dados ou Engenharia de ML, com no mínimo 3 anos em aprendizado por preferência, RLHF ou reward modeling em produção
- Experiência hands-on com RLHF/RLAIF, incluindo vivência com reward hacking e desenho de soluções para mitigação
- Expertise em reward modeling: construção de datasets de preferência, treino de reward models e avaliação com estabilidade sob distribution shift
- Fundamentos sólidos de engenharia de ML, com experiment tracking (MLflow ou equivalente), versionamento e avaliação em CI
- Domínio de Python e frameworks de ML, com PyTorch preferencialmente, além de familiaridade com fine-tuning eficiente (PEFT/LoRA)
- Entendimento de ambientes regulados e do perfil de risco de IA clínica para desenhar fluxos de anotação com segurança
- Certificação GCP Machine Learning Engineer (ou equivalente)
- Inglês fluente/avançado
Beneficios
- Plano de Saúde e Odontológico
- Seguro de Vida e Wellhub (Gympass)
- Descontos em cursos da FIAP e MBA USP Esalq
- Horário adaptável e bônus anual
- Bonificação por indicação e descontos em lojas Multilaser