Skip to content

Latest commit

 

History

4 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 

Repository files navigation

🧩 Sales Data Pipeline

📘 Visão Geral

O projeto Sales Data Pipeline tem como objetivo demonstrar a implementação completa de um pipeline de dados moderno utilizando o Pentaho Data Integration (PDI), aplicando os princípios de arquitetura em camadas (Bronze, Silver e Gold) e boas práticas de ETL/ELT.

A pipeline realiza a ingestão, padronização, tratamento, enriquecimento e disponibilização de dados de vendas em formato analítico (modelo dimensional), permitindo análises de performance e indicadores de negócio.


🏗️ Arquitetura de Camadas

O pipeline foi construído seguindo o conceito Medallion Architecture, com três níveis de processamento:

🥉 Camada Bronze

  • Objetivo: Ingestão dos dados brutos (raw data) a partir de arquivos CSV.
  • Transformações aplicadas:
    • Leitura do arquivo vendas_raw.csv
    • Padronização de separadores e codificação
    • Criação do dataset vendas_bronze.csv

📸 Visão da transformação Bronze: Bronze Overview


🥈 Camada Silver

  • Objetivo: Limpeza, padronização e enriquecimento dos dados de vendas.
  • Principais tratativas:
    • Conversão e padronização de datas
    • Tratamento de valores nulos e formatos numéricos
    • Cálculo de novos campos de negócio:
      • valor_bruto = preco_unitario * quantidade
      • valor_desconto = valor_bruto * desconto_pct
      • valor_liquido = valor_bruto - valor_desconto
    • Geração do dataset limpo e validado vendas_silver.csv

📸 Visão da transformação Silver: Silver Overview


🥇 Camada Gold

  • Objetivo: Modelagem dimensional e disponibilização dos dados prontos para análise.
  • Transformações realizadas:
    • Criação das tabelas dimensionais:
      • dim_cliente (nome e CPF)
      • dim_produto (código, nome e categoria)
    • Criação da tabela fato:
      • fato_vendas (contendo medidas de valor e chaves de dimensão)
    • Escrita final dos datasets em CSV na pasta data/gold/.

📸 Visão da transformação Gold: Gold Overview


📂 Estrutura de Diretórios

Sales Data Pipeline/ │ ├── data/ │ ├── bronze/ │ │ ├── vendas_raw.csv │ │ └── vendas_bronze.csv │ │ │ ├── silver/ │ │ └── vendas_silver.csv │ │ │ └── gold/ │ ├── dim_cliente.csv │ ├── dim_produto.csv │ └── fato_vendas.csv │ ├── transformations/ │ ├── Sales Data Pipeline - Bronze.ktr │ ├── Sales Data Pipeline - Silver.ktr │ └── Sales Data Pipeline - Gold.ktr │ ├── docs/ │ ├── README.md │ └── images/ │ ├── bronze_overview.png │ ├── silver_overview.png │ └── gold_overview.png │ ├── .gitignore └── LICENSE


📊 Modelo Dimensional (Camada Gold)

A camada Gold segue o conceito de modelo estrela (Star Schema), composta por dimensões e uma tabela fato central.

About

End-to-end sales data pipeline built with Pentaho Data Integration, Medallion Architecture, and dimensional modeling.

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors