O que esta vaga pede
Sobre a Vaga
Engenheiro de Dados Sênior na Leega Consultoria 100% remoto, com foco em Redshift, Airflow e dbt e responsabilidade arquitetural na plataforma de dados.
Responsabilidades
- Projetar, construir e manter pipelines de ingestão e transformação orquestrados em Apache Airflow, com padrões consistentes de retry, idempotência, alerta e SLA
- Desenvolver e evoluir modelos de transformação em dbt sobre o data warehouse, organizando camadas (staging, intermediate e marts) com testes e documentação
- Implementar ingestões de fontes heterogêneas, como bancos transacionais, APIs de terceiros, arquivos regulatórios e planilhas operacionais
- Definir e defender o modelo de dados do warehouse (dimensional, Data Vault ou híbrido), incluindo chaves, granularidade, historização (SCD) e tratamento de correções retroativas
- Estabelecer padrões de distribuição, ordenação e particionamento no MPP (DISTKEY, SORTKEY e compressão em Redshift, ou equivalentes)
- Conduzir tuning de performance e custo, com análise de planos, filas/WLM, concorrência, manutenção (VACUUM/ANALYZE) e materializações
- Instrumentar observabilidade e controles automatizados de qualidade dos dados (freshness, volumetria, quebras de contrato e reconciliação)
- Garantir linhagem e rastreabilidade ponta a ponta, com controles de acesso, segregação por sensibilidade e conformidade com LGPD
- Documentar decisões arquiteturais (ADRs), manter dicionário de dados vivo e atuar em code review
Requisitos
- 6+ anos de experiência em engenharia de dados, com pelo menos 2 anos de responsabilidade arquitetural
- Histórico comprovado de ter colocado em produção e operado plataforma de dados analítica, com incidentes e plantão
- SQL avançado: window functions, CTEs recursivas, leitura de plano de execução e diagnóstico de skew/spill
- Python aplicado a engenharia de dados (código modular, testável e versionado; pandas ou polars; tipagem e testes automatizados)
- Apache Airflow em produção: autoria de DAGs, sensores, backfill e gestão de falhas
- Data warehouse MPP em nuvem, preferencialmente Redshift
- dbt (ou equivalente) com transformação versionada e testes
- Modelagem dimensional (Kimball) com SCD (tipos 1 e 2), tabelas ponte e snapshots
- Git e cultura de code review com CI/CD aplicado a dados
- Diagnóstico de performance com explicação e comprovação com números antes e depois
Beneficios
- Atuação 100% remota