# Engenheiro de dados pleno gcp/dbt

**Empresa:** Leega Consultoria
**Modalidade:** Remoto
**Contrato:** CLT
**Publicada em:** 2026-09-11

## Descrição

Conhecimento comprovado em DBT no mínimo de 3 anos;
Domínio de:
models (staging, intermediate, marts)
ref() e source()
macros (Jinja)
seeds e snapshots
tests (not null, unique, custom)
Organização em camadas:
Staging → Transform → Mart (Data Warehouse
Google Cloud Platform (GCP):
BigQuery: Profundo conhecimento em modelagem de dados, otimização de consultas, particionamento, clustering, carga de dados (streaming e batch), segurança e governança de dados.
Cloud Storage: Experiência em gerenciamento de buckets, classes de armazenamento, políticas de ciclo de vida, controle de acesso (IAM) e segurança de dados.
Dataproc: Habilidade em provisionamento, configuração e gerenciamento de clusters Spark/Hadoop, otimização de jobs, e integração com outros serviços GCP.
Dataflow/Composer/DBT: Conhecimento em ferramentas de orquestração e processamento de dados para pipelines ELT/ETL.
Cloud IAM (Identity and Access Management): Implementação de políticas de segurança e controle de acesso granular.
VPC, Networking e Security: Entendimento de redes, sub-redes, regras de firewall e melhores práticas de segurança na nuvem.

Linguagens de Programação:
Python e PySpark: Essencial para scripts de automação, desenvolvimento de pipelines de dados e integração com APIs GCP.
SQL (avançado): Para BigQuery, DBT e transformações de dados.
Shell Scripting: Para automação de tarefas.
Controle de Versão:
Git/GitHub/Bitbucket.

Trabalho 100% remoto
Tempo de Projeto: Até Dez/2026, podendo ser prorrogado;

Análise e Planejamento de Cargas/Pipelines:

Avaliar a arquitetura e os requisitos do DW.
Mapear os dados, transformações e processos os serviços GCP (Cloud Storage, BigQuery, Dataproc).

Definir a estratégia de migração de dados (full load, incremental, CDC).
Elaborar um plano de arquitetura de dados no GCP.
Design e Modelagem de Dados no GCP:

Projetar esquemas de tabelas no BigQuery, considerando performance, custo e escalabilidade.
Definir estratégias de particionamento e clustering para BigQuery.
Modelar as zonas de dados no Cloud Storage (Bronze, Silver e Gold).
Desenvolvimento de Pipelines de ELT/ETL:

Criar rotinas de transformação de dados usando Dataproc (Spark) ou Dataflow para carregar dados para o BigQuery.
Traduzir a lógica de negócios e as transformações existentes no GCP.
Implementar mecanismos de validação e qualidade de dados.
Otimização de Performance e Custo:

Otimizar consultas no BigQuery para reduzir custos e melhorar o desempenho.
Ajustar e otimizar jobs Spark no Dataproc.
Monitorar e otimizar o uso de recursos GCP para controlar custos.
Segurança e Governança de Dados:

Implementar e garantir a segurança dos dados em trânsito e em repouso.
Definir e aplicar políticas de IAM para controlar o acesso aos dados e recursos.
Garantir a conformidade com as políticas de governança de dados.
Monitoramento e Suporte: 

Solucionar problemas de desempenho e funcionalidade dos pipelines de dados e recursos GCP.
Documentação: 

Documentar a arquitetura, os pipelines de dados, os modelos de dados e os procedimentos operacionais.
Comunicação:

Comunicar-se de forma eficaz com membros da equipe, stakeholders e outras áreas da empresa.
Garantir a comunicação clara entre as definições de arquitetura e componentes de software, evolução e a qualidade dos desenvolvimentos da equipe;
Jira / Metodologias Ágeis:

Conhecer as metodologias ágeis, seus ritos e proficiência com a ferramenta Jira.

## Habilidades

- DBT
- GCP
- BigQuery
- Python
- SQL
- PySpark
- Shell Scripting
- Git

**Página original:** https://www.123vagas.com.br/vaga/engenheiro-de-dados-pleno-remoto-1789089463522-82181
