Pular para conteúdo

infoescola_robo.png

Engenharia Reversa e Modernização de Dados Legados

Arqueologia de dados, recuperação de regras de negócio e infraestrutura analítica de alta performance estruturada localmente.

O InfoEscola é um projeto de engenharia de dados end-to-end focado em consolidar o ativo de dados legado de uma rede de franquias de informática (que operou por 30 anos no Brasil) em uma plataforma moderna, escalável e de baixo custo computacional.


TL;DR

1. Estudo de Caso - Churn (São Paulo - 2018)

2. Simulação de Churn utilizando Mesa

3. Software Jack-In para auxílio em Arqueologia de Dados

4. Plano de Migração de Dados

O Desafio (Contexto de Negócio)

O projeto nasce da necessidade de processar e extrair inteligência de um ambiente altamente fragmentado, originado de uma rede com 1.000 unidades ativas.

Dores do cenário legado:

  • Volume e Origem: ~100 GB de dados brutos extraídos de instâncias obsoletas de MySQL 5.1.
  • Lógica Oculta: Regras de negócio essenciais encapsuladas em mais de 700 UDFs (User-Defined Functions) e stored procedures.
  • Qualidade de Dados: Esquemas com severos problemas de integridade referencial.

Objetivos da Engenharia Reversa:

  • [x] Diagnosticar retrospectivamente falhas no modelo de franquias via análise de séries temporais.
  • [x] Mensurar o impacto atuarial e financeiro da inadimplência crônica no fluxo de caixa.
  • [x] Identificar padrões de churn precoce (micro-segmentação D+7) e sua correlação com a sustentabilidade da rede.

Arquitetura de Dados (Data Lakehouse)

A solução foi desenhada sob rígidos princípios de FinOps, priorizando ferramentas de processamento local de alta performance para eliminar a dependência de infraestruturas cloud de alto custo.

O fluxo de dados segue a arquitetura Medalhão:

  • 🥉 Camada Bronze (Raw): Ingestão de dados brutos em formato imutável (.parquet), otimizando armazenamento e compressão.
  • 🥈 Camada Silver (Cleansed): Saneamento, padronização de tipagem, resolução de encoding e modelagem dimensional (Star Schema / Fatos e Dimensões).
  • 🥇 Camada Gold (Curated): Data Marts altamente indexados, tabelas agregadas e métricas prontas para consumo em ferramentas de visualização.

Stack Tecnológica

Categoria Tecnologias
Engine de Processamento DuckDB, Polars (transformações vetorizadas in-memory de ultra-baixa latência)
Orquestração e Escala Kaggle Pipelines (ETL pesado e treinamento de modelos estatísticos)
Visualização / BI Streamlit, Dash (consumo da camada Gold)
Governança e Linhagem Zensical (ERDs, dicionário de metadados, documentação técnica)
Simulação Mesa (Python) (Simulação comportamental de alunos, expansão de negócios)

Domínios de Dados e Analytics

Os pipelines foram segmentados em quatro pilares para garantir a integridade das transições de estado da operação:

  1. 🤝 Comercial e Contratos: Customer Lifecycle, funil de conversão e sazonalidade de matrículas.
  2. 💰 Controladoria e Finanças: Agregação de recebíveis, ticket médio dinâmico e Aging List.
  3. 📚 Pedagógico: Correlação entre assiduidade, performance acadêmica e retenção.
  4. 📢 Marketing: Atribuição multi-touch, CAC histórico e eficiência de canais de aquisição.

Modelagem Avançada: ML & Simulação

Além do BI tradicional, a camada Gold alimenta modelos analíticos avançados para análise preditiva e contrafactual:

  • Machine Learning: Modelos probabilísticos para predição de evasão de alunos.
  • Agent-Based Modeling (ABM): Simulações macroeconômicas desenvolvidas com o framework MESA. Utilizado para projetar cenários contrafactuais, testando como políticas de crédito e prazos de recebimento impactariam a taxa de sobrevivência das franquias.

Referências

1. Engenharia e Modelagem de Dados

2. Banco de Dados e Processamento Analítico

  • Schwartz, B., Zaitsev, P., & Tkachenko, V. (2012). High Performance MySQL: Optimization, Backups, and Replication (3ª ed.). O'Reilly Media.
  • DuckDB Labs. (s.d.). DuckDB Documentation. Recuperado de https://duckdb.org/docs/.

3. Visualização e Análise Baseada em Agentes

  • Plotly. (s.d.). Dash Python User Guide. Recuperado de https://dash.plotly.com/.

  • Wilensky, U., & Rand, W. (2015). An Introduction to Agent-Based Modeling: Modeling Natural, Social, and Engineered Complex Systems with NetLogo. MIT Press.

  • Project Mesa Team. (s.d.). Mesa: Agent-Based Modeling in Python. Recuperado de https://mesa.readthedocs.io/.

4. Otimização de Hiperparâmetros

  • Akiba, T., Sano, S., Yanase, T., Ohta, T., & Koyama, M. (2019). Optuna: A Next-generation Hyperparameter Optimization Framework. Proceedings of the 25th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining. Recuperado de https://arxiv.org/abs/1907.10902.