O projeto Sales Data Pipeline tem como objetivo demonstrar a implementação completa de um pipeline de dados moderno utilizando o Pentaho Data Integration (PDI), aplicando os princípios de arquitetura em camadas (Bronze, Silver e Gold) e boas práticas de ETL/ELT.
A pipeline realiza a ingestão, padronização, tratamento, enriquecimento e disponibilização de dados de vendas em formato analítico (modelo dimensional), permitindo análises de performance e indicadores de negócio.
O pipeline foi construído seguindo o conceito Medallion Architecture, com três níveis de processamento:
- Objetivo: Ingestão dos dados brutos (raw data) a partir de arquivos CSV.
- Transformações aplicadas:
- Leitura do arquivo
vendas_raw.csv - Padronização de separadores e codificação
- Criação do dataset
vendas_bronze.csv
- Leitura do arquivo
📸 Visão da transformação Bronze:

- Objetivo: Limpeza, padronização e enriquecimento dos dados de vendas.
- Principais tratativas:
- Conversão e padronização de datas
- Tratamento de valores nulos e formatos numéricos
- Cálculo de novos campos de negócio:
valor_bruto=preco_unitario * quantidadevalor_desconto=valor_bruto * desconto_pctvalor_liquido=valor_bruto - valor_desconto
- Geração do dataset limpo e validado
vendas_silver.csv
📸 Visão da transformação Silver:

- Objetivo: Modelagem dimensional e disponibilização dos dados prontos para análise.
- Transformações realizadas:
- Criação das tabelas dimensionais:
dim_cliente(nome e CPF)dim_produto(código, nome e categoria)
- Criação da tabela fato:
fato_vendas(contendo medidas de valor e chaves de dimensão)
- Escrita final dos datasets em CSV na pasta
data/gold/.
- Criação das tabelas dimensionais:
📸 Visão da transformação Gold:

Sales Data Pipeline/ │ ├── data/ │ ├── bronze/ │ │ ├── vendas_raw.csv │ │ └── vendas_bronze.csv │ │ │ ├── silver/ │ │ └── vendas_silver.csv │ │ │ └── gold/ │ ├── dim_cliente.csv │ ├── dim_produto.csv │ └── fato_vendas.csv │ ├── transformations/ │ ├── Sales Data Pipeline - Bronze.ktr │ ├── Sales Data Pipeline - Silver.ktr │ └── Sales Data Pipeline - Gold.ktr │ ├── docs/ │ ├── README.md │ └── images/ │ ├── bronze_overview.png │ ├── silver_overview.png │ └── gold_overview.png │ ├── .gitignore └── LICENSE
A camada Gold segue o conceito de modelo estrela (Star Schema), composta por dimensões e uma tabela fato central.