
Engenharia Reversa e Modernização de Dados Legados¶
Arqueologia de dados, recuperação de regras de negócio e infraestrutura analítica de alta performance estruturada localmente.
O InfoEscola é um projeto de engenharia de dados end-to-end focado em consolidar o ativo de dados legado de uma rede de franquias de informática (que operou por 30 anos no Brasil) em uma plataforma moderna, escalável e de baixo custo computacional.
TL;DR¶
1. Estudo de Caso - Churn (São Paulo - 2018)¶
2. Simulação de Churn utilizando Mesa¶
3. Software Jack-In para auxílio em Arqueologia de Dados¶
4. Plano de Migração de Dados¶
O Desafio (Contexto de Negócio)¶
O projeto nasce da necessidade de processar e extrair inteligência de um ambiente altamente fragmentado, originado de uma rede com 1.000 unidades ativas.
Dores do cenário legado:
- Volume e Origem: ~100 GB de dados brutos extraídos de instâncias obsoletas de MySQL 5.1.
- Lógica Oculta: Regras de negócio essenciais encapsuladas em mais de 700 UDFs (User-Defined Functions) e stored procedures.
- Qualidade de Dados: Esquemas com severos problemas de integridade referencial.
Objetivos da Engenharia Reversa:
- [x] Diagnosticar retrospectivamente falhas no modelo de franquias via análise de séries temporais.
- [x] Mensurar o impacto atuarial e financeiro da inadimplência crônica no fluxo de caixa.
- [x] Identificar padrões de churn precoce (micro-segmentação D+7) e sua correlação com a sustentabilidade da rede.
Arquitetura de Dados (Data Lakehouse)¶
A solução foi desenhada sob rígidos princípios de FinOps, priorizando ferramentas de processamento local de alta performance para eliminar a dependência de infraestruturas cloud de alto custo.
O fluxo de dados segue a arquitetura Medalhão:
- 🥉 Camada Bronze (Raw): Ingestão de dados brutos em formato imutável (
.parquet), otimizando armazenamento e compressão. - 🥈 Camada Silver (Cleansed): Saneamento, padronização de tipagem, resolução de encoding e modelagem dimensional (Star Schema / Fatos e Dimensões).
- 🥇 Camada Gold (Curated): Data Marts altamente indexados, tabelas agregadas e métricas prontas para consumo em ferramentas de visualização.
Stack Tecnológica¶
| Categoria | Tecnologias |
|---|---|
| Engine de Processamento | DuckDB, Polars (transformações vetorizadas in-memory de ultra-baixa latência) |
| Orquestração e Escala | Kaggle Pipelines (ETL pesado e treinamento de modelos estatísticos) |
| Visualização / BI | Streamlit, Dash (consumo da camada Gold) |
| Governança e Linhagem | Zensical (ERDs, dicionário de metadados, documentação técnica) |
| Simulação | Mesa (Python) (Simulação comportamental de alunos, expansão de negócios) |
Domínios de Dados e Analytics¶
Os pipelines foram segmentados em quatro pilares para garantir a integridade das transições de estado da operação:
- 🤝 Comercial e Contratos: Customer Lifecycle, funil de conversão e sazonalidade de matrículas.
- 💰 Controladoria e Finanças: Agregação de recebíveis, ticket médio dinâmico e Aging List.
- 📚 Pedagógico: Correlação entre assiduidade, performance acadêmica e retenção.
- 📢 Marketing: Atribuição multi-touch, CAC histórico e eficiência de canais de aquisição.
Modelagem Avançada: ML & Simulação¶
Além do BI tradicional, a camada Gold alimenta modelos analíticos avançados para análise preditiva e contrafactual:
- Machine Learning: Modelos probabilísticos para predição de evasão de alunos.
- Agent-Based Modeling (ABM): Simulações macroeconômicas desenvolvidas com o framework
MESA. Utilizado para projetar cenários contrafactuais, testando como políticas de crédito e prazos de recebimento impactariam a taxa de sobrevivência das franquias.
Referências¶
1. Engenharia e Modelagem de Dados¶
- Databricks. (2022). What is the Medallion Architecture? https://www.databricks.com/blog/what-is-medallion-architecture.
- Kimball, R., & Ross, M. (2013). The Data Warehouse Toolkit: The Definitive Guide to Dimensional Modeling (3ª ed.). Wiley.
2. Banco de Dados e Processamento Analítico¶
- Schwartz, B., Zaitsev, P., & Tkachenko, V. (2012). High Performance MySQL: Optimization, Backups, and Replication (3ª ed.). O'Reilly Media.
- DuckDB Labs. (s.d.). DuckDB Documentation. Recuperado de https://duckdb.org/docs/.
3. Visualização e Análise Baseada em Agentes¶
-
Plotly. (s.d.). Dash Python User Guide. Recuperado de https://dash.plotly.com/.
-
Wilensky, U., & Rand, W. (2015). An Introduction to Agent-Based Modeling: Modeling Natural, Social, and Engineered Complex Systems with NetLogo. MIT Press.
-
Project Mesa Team. (s.d.). Mesa: Agent-Based Modeling in Python. Recuperado de https://mesa.readthedocs.io/.
4. Otimização de Hiperparâmetros¶
- Akiba, T., Sano, S., Yanase, T., Ohta, T., & Koyama, M. (2019). Optuna: A Next-generation Hyperparameter Optimization Framework. Proceedings of the 25th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining. Recuperado de https://arxiv.org/abs/1907.10902.