O que esta vaga pede
Buscamos um profissional na interseção entre Machine Learning e Cibersegurança. Alguém que entende como modelos preditivos (os que decidem crédito, fraude, malware e recomendação em produção) podem ser atacados em cada etapa do pipeline, e que é capaz tanto de executar esses ataques em laboratório quanto de projetar as defesas correspondentes e operar a segurança desses modelos no dia a dia. Não buscamos apenas um cientista de dados com curiosidade por segurança, mas alguém com visão crítica sobre como um atacante explora um modelo de ML clássico, do dataset de treino à API que serve as predições em produção.
O perfil ideal já trabalhou com segurança de machine learning em alguma capacidade, seja realizando red teaming de modelos preditivos (poisoning, evasão, extração de modelo), implementando hardening e defesa adversarial de modelos em produção, ou atuando em MLSecOps (monitoramento de drift, resposta a incidente de modelo comprometido, programa de segurança de ML). Tem linguagem técnica precisa e consegue traduzir conceitos matemáticos de adversarial ML para profissionais de segurança e vice-versa.
- Experiência esperada
- 2+ anos de experiência em segurança da informação combinada com atuação prática em machine learning ou adversarial ML
- Vivência real com ao menos um dos seguintes contextos: red teaming/pentest de modelos de ML (poisoning, evasão, extração e inferência), hardening e defesa adversarial de modelos já em produção, ou MLSecOps (monitoramento contínuo, resposta a incidente de modelo comprometido)
- Experiência prática com Python científico aplicado a ML (scikit-learn, PyTorch, pandas/numpy) e capacidade de treinar, avaliar e servir modelos preditivos
- Familiaridade prática com ART (Adversarial Robustness Toolbox, IBM/Linux Foundation AI & Data) e/ou Foolbox para gerar, avaliar e mitigar ataques adversariais
Conhecimentos técnicos essenciais (não precisa ter todos)
- Threat modeling e frameworks de referência:
- O pipeline de ML (coleta, treinamento, validação, deploy, serving) como superfície de ataque, diferenciando ML preditivo/discriminativo de LLMs e modelos generativos
- MITRE ATLAS aplicado a sistemas de ML: táticas ao longo do ciclo de vida (reconnaissance, ML attack staging, poisoning, evasão, exfiltração)
- OWASP Machine Learning Security Top 10 e como ele se relaciona com o ATLAS (um cataloga táticas, o outro prioriza riscos)
- Ataques a modelos de ML clássico:
- Data e model poisoning: label flipping (indiscriminado e direcionado), backdoor/trojan attacks e clean-label poisoning (feature collision, gradient matching)
- Evasion attacks: exemplos adversariais com FGSM e PGD (white-box), ataques black-box baseados em consulta, transferability entre modelos, aplicados a classificadores tabulares de fraude/scoring e a detectores de malware
- Model extraction (clonagem de modelo proprietário via consultas a API de MLaaS), model inversion (reconstrução de dado de treino) e membership inference
- Defesa e hardening:
- Adversarial training, defensive distillation e outras técnicas de hardening de modelo
- Defesas em tempo de inferência (detecção de anomalias na entrada) e defesas contra poisoning no dado de treino (outlier detection, activation clustering)
- Avaliação e benchmarking de robustez adversarial, incluindo a armadilha de gradient masking/obfuscated gradients e o trade-off robustez vs. acurácia
- Privacidade e operação contínua (MLSecOps):
- Differential privacy aplicada a ML: treinamento privado com DP-SGD (Opacus, Tensor
- Flow Privacy) e o trade-off privacidade vs. utilidade
- Watermarking de modelos e defesas operacionais de API contra extração
- MLSecOps: monitoramento de drift malicioso (Evidently AI, whylogs), logging/auditoria de consultas e resposta a incidente de modelo comprometido
- Diferenciais
- Pesquisa publicada ou apresentação em eventos sobre adversarial ML ou segurança de machine learning (NeurIPS workshops, USENIX Security, Black Hat, DEF CON AI Village, Mind the Sec ou equivalentes)
- Experiência real protegendo sistemas de scoring de crédito, detecção de fraude ou classificação de malware baseados em ML em produção
- Conhecimento de plataformas de MLaaS comerciais (AWS SageMaker, Google Vertex AI, Azure ML, BigML) e dos riscos específicos de exposição via API
- Criação de conteúdo técnico público: artigos, repositórios, cursos ou palestras sobre segurança de machine learning
- Capacidade de transformar projetos reais e experiências profissionais em aulas práticas e acessíveis;
- Boa comunicação verbal e escrita para apresentar conceitos técnicos de forma clara, estruturada e com linguagem próxima da comunidade de tecnologia.