- Conhecimento comprovado em DBT no mínimo de 3 anos;
- Domínio de:
- models (staging, intermediate, marts)
- ref() e source()
- macros (Jinja)
- seeds e snapshots
- tests (not null, unique, custom)
- Organização em camadas:
- Staging → Transform → Mart (Data Warehouse
- Google Cloud Platform (GCP):
- BigQuery: Profundo conhecimento em modelagem de dados, otimização de consultas, particionamento, clustering, carga de dados (streaming e batch), segurança e governança de dados.
- Cloud Storage: Experiência em gerenciamento de buckets, classes de armazenamento, políticas de ciclo de vida, controle de acesso (IAM) e segurança de dados.
- Dataproc: Habilidade em provisionamento, configuração e gerenciamento de clusters Spark/Hadoop, otimização de jobs, e integração com outros serviços GCP.
- Dataflow/Composer/DBT: Conhecimento em ferramentas de orquestração e processamento de dados para pipelines ELT/ETL.
- Cloud IAM (Identity and Access Management): Implementação de políticas de segurança e controle de acesso granular.
- VPC, Networking e Security: Entendimento de redes, sub-redes, regras de firewall e melhores práticas de segurança na nuvem.
- Linguagens de Programação:
- Python e PySpark: Essencial para scripts de automação, desenvolvimento de pipelines de dados e integração com APIs GCP.
- SQL (avançado): Para BigQuery, DBT e transformações de dados.
- Shell Scripting: Para automação de tarefas.
- Controle de Versão:
- Git/GitHub/Bitbucket.
- Trabalho 100% remoto
- Tempo de Projeto: Até Dez/2026, podendo ser prorrogado;
Análise e Planejamento de Cargas/Pipelines:
- Avaliar a arquitetura e os requisitos do DW.
Mapear os dados, transformações e processos os serviços GCP (Cloud Storage, BigQuery, Dataproc).
- Definir a estratégia de migração de dados (full load, incremental, CDC).
- Elaborar um plano de arquitetura de dados no GCP.
Design e Modelagem de Dados no GCP:
- Projetar esquemas de tabelas no BigQuery, considerando performance, custo e escalabilidade.
- Definir estratégias de particionamento e clustering para BigQuery.
- Modelar as zonas de dados no Cloud Storage (Bronze, Silver e Gold).
Desenvolvimento de Pipelines de ELT/ETL:
- Criar rotinas de transformação de dados usando Dataproc (Spark) ou Dataflow para carregar dados para o BigQuery.
- Traduzir a lógica de negócios e as transformações existentes no GCP.
- Implementar mecanismos de validação e qualidade de dados.
Otimização de Performance e Custo:
- Otimizar consultas no BigQuery para reduzir custos e melhorar o desempenho.
- Ajustar e otimizar jobs Spark no Dataproc.
- Monitorar e otimizar o uso de recursos GCP para controlar custos.
Segurança e Governança de Dados:
- Implementar e garantir a segurança dos dados em trânsito e em repouso.
- Definir e aplicar políticas de IAM para controlar o acesso aos dados e recursos.
- Garantir a conformidade com as políticas de governança de dados.
Monitoramento e Suporte:
- Solucionar problemas de desempenho e funcionalidade dos pipelines de dados e recursos GCP.
Documentação:
- Documentar a arquitetura, os pipelines de dados, os modelos de dados e os procedimentos operacionais.
Comunicação:
- Comunicar-se de forma eficaz com membros da equipe, stakeholders e outras áreas da empresa.
- Garantir a comunicação clara entre as definições de arquitetura e componentes de software, evolução e a qualidade dos desenvolvimentos da equipe;
Jira / Metodologias Ágeis:
- Conhecer as metodologias ágeis, seus ritos e proficiência com a ferramenta Jira.