08 de outubro de 2026
Transformação de Dados Transacionais em Inteligência de Negócio: Framework de “Data Wrangling” e “Dashboards”
Transformação de Dados Transacionais em Inteligência de Negócio: Framework de “Data Wrangling” e “Dashboards”
Kurt Roland Windisch; Jacques Henrique Dias
DOI: 10.22167/2675-6528-202603115
Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.
Resumo
A evolução das capacidades de captura e processamento de dados tornou imperativa a transformação de informações para tomada de decisão ágil e bem-informada. O estudo focou na aplicação de conhecimentos da ciência de dados para capturar, processar e manipular dados transacionais de um comércio britânico, visando facilitar a compreensão e a tomada de decisões sobre consumidores, produtos e vendas. Utilizou-se uma abordagem qualitativa do tipo pesquisa-ação, empregando dados transacionais de um varejo digital do Reino Unido. Os dados foram tratados em Python, aplicando técnicas de data wrangling, modelagem dimensional em esquema estrela e métodos estatísticos como Tuckey Fences (IQR) para normalização de preços. A segmentação de consumidores foi realizada por meio do algoritmo K-Means, considerando frequência e valor monetário. Os dados processados foram então carregados e visualizados em dashboards interativos no Power BI. Os resultados revelaram a identificação de diferentes perfis de consumidores, destacando a importância de clientes de alto valor e a oportunidade de crescimento em mercados específicos. Observaram-se tendências de vendas sazonais e anomalias em dados de produtos, evidenciando a necessidade de governança de dados. Concluiu-se que o framework desenvolvido permite transformar dados brutos em diagnósticos estratégicos, promovendo a maturidade digital e a tomada de decisão baseada em dados.
Palavras-chave: Clustering; Dashboards; Data Wrangling; Power BI.
1. Introdução
A revolução dos dados tem transformado o cenário empresarial, tornando os empreendimentos cada vez mais dependentes de informações para suas operações e estratégias. Este fenômeno é parte integrante da quarta revolução industrial, caracterizada por avanços computacionais que possibilitam a automação, a criação de fábricas inteligentes interconectadas e uma crescente dependência de dados internos e externos. Nesse contexto, a capacidade de análise e inteligência de dados, bem como a interação avançada entre humanos e máquinas, tornam-se cruciais (Marr, 2017).
Nesse ambiente dinâmico, empresas conectadas à internet geram volumes astronômicos de dados, e os modelos de negócios se renovam rapidamente. Surge, assim, a necessidade premente de não apenas capturar, limpar e analisar esses dados, mas também de interpretá-los e apresentá-los de forma compreensível. O objetivo é capacitar funcionários e a gestão a obter uma visão clara para agir, interagir e reagir ao comportamento dos clientes, utilizando as informações capturadas em suas interações.
A importância da tomada de decisão baseada em dados é corroborada por estudos que demonstram seus benefícios. Em 2012, uma pesquisa com 330 empresas públicas americanas revelou que companhias líderes em suas indústrias, ao adotarem decisões orientadas por dados, alcançaram uma produtividade 5% maior e uma rentabilidade 6% superior em comparação com seus concorrentes (McAfee et al., 2012). A relevância dos aspectos visuais na comunicação de informações complexas também é amplamente reconhecida, desde o ditado popular atribuído a Confúcio (Azevedo, 2021) até estudos focados em visualização de dados (Wexler et al., 2017). Ferramentas como os “dashboards” são essenciais nesse processo, pois permitem a apresentação interativa e intuitiva de informações, democratizando o acesso aos dados para os tomadores de decisão.
Contudo, apesar da abundância de dados e do reconhecimento de sua importância, ainda existe uma lacuna significativa na adoção de práticas eficazes de análise e governança de dados. Um estudo europeu de 2025 indicou que, mesmo em empresas consideradas digitalmente maduras, o uso de análise de dados é baixo, com médias de 14,5% para pequenas empresas, 33,8% para médias e 59,4% para grandes empresas (Bálint et al., 2025). Essa deficiência se estende à disponibilização de “dashboards” para uma tomada de decisão aprimorada. Além disso, a área de pesquisa que se concentra especificamente na visualização de dados para decisões estratégicas de gestão ainda é pouco explorada (Eberhard, 2021). Frequentemente, os dados transacionais brutos apresentam ruídos, inconsistências e falta de informações complementares, o que dificulta a extração de valor sem um tratamento adequado, conhecido como “data wrangling” (Kahn et al., 2024).
Diante desse cenário, torna-se fundamental desenvolver uma abordagem metódica para transformar dados brutos em inteligência de negócio acionável. Este estudo justifica-se pela necessidade de preencher a lacuna na adoção de práticas de análise de dados e visualização, oferecendo um framework que integra técnicas de ciência de dados, como o “data wrangling” para limpeza e tratamento, e o “clustering” (Ikotun et al., 2023) para segmentação de consumidores, culminando na criação de “dashboards” informativos. O objetivo final é conseguir demonstrar uma fundação metódica que inicia com dados transacionais brutos e aplicação de técnicas de ciência de dados se torna possível transformar dados poluídos transacionais em informações relevantes para tomada de decisão por meio de um dashboard com dados de consumidor, produto e vendas.
2. Material e Métodos
O presente estudo adotou uma natureza qualitativa, com abordagem de pesquisa-ação, focando na aplicação de conhecimentos da ciência de dados para transformar dados transacionais brutos em inteligência de negócio. A unidade de análise consistiu em um banco de dados público de varejo digital, proveniente de um comércio britânico. Os dados foram coletados de um repositório para “machine learning” da UC Irvine, conforme disponibilizado por Chen (2015), abrangendo o período de dezembro de 2010 a dezembro de 2011.
A metodologia geral seguiu os princípios de Extração, Transformação e Carregamento (ETL), conforme discutido por Kahn et al. (2024), com ênfase na etapa de transformação. Esta etapa envolveu a limpeza, padronização e conversão dos dados para garantir sua integridade e conformidade. O objetivo foi preparar os dados para serem carregados em ferramentas de Business Intelligence (BI), permitindo a construção de dashboards interativos e informativos.
Os dados transacionais originais apresentavam oito colunas, incluindo número da fatura, referência do produto, descrição do produto, quantidade, data da fatura, preço unitário, número do cliente e país do cliente. A manipulação e o tratamento desses dados foram realizados no ambiente de desenvolvimento integrado Spyder, utilizando a linguagem de programação Python. Este ambiente foi escolhido por sua capacidade de programação científica e manipulação de dados.
A etapa de limpeza e preparação dos dados iniciou com uma inspeção detalhada da base original. Identificou-se a ausência de identificação de consumidor em 135.081 linhas, as quais foram classificadas como “Visitante” para preservar o máximo de informações. Além disso, 10.625 linhas com quantidades negativas foram marcadas como “Retorno”, representando devoluções, e 2.516 linhas sem descrição, preço ou consumidor foram observadas, sendo consideradas para atualização de inventário sem uso analítico prático.
Procedeu-se à remoção de linhas anômalas que não possuíam preço, eram linhas de desconto não relacionadas a transações específicas, ou continham códigos de produtos não comerciais. Uma nova coluna, “Receita_por_Item”, foi adicionada, calculada pela multiplicação da quantidade unitária pelo preço unitário, resultando em uma tabela com 539.161 registros após a primeira fase de limpeza. As transações com quantidades negativas foram mantidas para análise posterior da receita bruta e taxa de retorno.
Para otimizar a análise e visualização, os dados foram remodelados em um esquema estrela, seguindo os princípios de modelagem dimensional descritos por Kirmani (2017). Esta estrutura separa os dados em uma tabela de fatos, contendo métricas quantitativas e mensuráveis, e tabelas de dimensão, que fornecem contexto descritivo. A tabela de transações originais foi mantida como a tabela de fatos, preservando a granularidade dos registros de linha de fatura.
Duas tabelas dimensionais principais foram criadas: “dim_produto” e “dim_consumidor”. A “dim_produto” consolidou informações sobre os produtos vendidos, incluindo código, descrição, quantidade total vendida, receita total por produto, contagem de faturas, número de consumidores e preço médio. A “dim_consumidor” agrupou dados relevantes do cliente, como quantidade comprada, receita total, número de transações, média de preço pago, valor médio por transação, valor monetário, frequência de compras e datas da primeira e última compra.
Devido a discrepâncias observadas entre o preço médio calculado e os preços unitários originais, aplicou-se o método estatístico Tuckey Fences, ou Intervalo Interquartil (IQR), para normalização de preços. Esta técnica, proposta por Tuckey (1977), foi utilizada para identificar e mitigar a influência de valores anômalos (“outliers”). O IQR foi calculado como a diferença entre o terceiro e o primeiro quartil, e os limites superior e inferior foram definidos por Q1 – (1.5 * IQR) e Q3 + (1.5 * IQR), respectivamente. Este procedimento foi implementado em Python, utilizando a biblioteca “numpy”, para criar uma coluna “Preço_Tabela” com preços ajustados para cada produto.
A segmentação de consumidores foi realizada utilizando o algoritmo K-Means, uma técnica de agrupamento não supervisionada, conforme descrito por Ikotun et al. (2023). Devido à limitação temporal dos dados (um ano), a segmentação focou nas dimensões de frequência de compra e valor monetário, adaptando a metodologia RFM (Recência, Frequência, Valor Monetário) mencionada por Handojo (2023). O número ideal de clusters (k) para cada variável foi determinado pelo método do cotovelo, que analisou a soma dos quadrados intragrupos, indicando três clusters para a frequência de compras e três para o total de vendas.
Após o processamento e a modelagem, as tabelas de fatos e dimensões foram carregadas no Power BI para a construção dos dashboards. Durante o carregamento, foram realizados ajustes como a formatação das datas para exibição curta. Para otimizar o modelo em esquema estrela e resolver a redundância da dimensão País, uma nova tabela dimensional, “Dim_País”, foi criada. Adicionalmente, uma “Tabela_Calendario” foi desenvolvida para centralizar filtros e cálculos temporais, facilitando a segmentação e a análise temporal dos dados no ambiente de visualização.
3. Resultados e Discussão
A análise dos dados transacionais de um comércio britânico revelou um panorama detalhado sobre o comportamento de consumidores, desempenho de produtos e tendências de vendas, permitindo a transformação de dados brutos em inteligência de negócio acionável. O estudo demonstrou que, por meio da aplicação de técnicas de ciência de dados, é possível gerar diagnósticos estratégicos que apoiam a tomada de decisão. A abordagem metodológica incluiu etapas de limpeza, transformação e modelagem de dados, culminando na criação de dashboards interativos, conforme o objetivo de fornecer uma fundação metódica para a análise de dados de varejo.
Inicialmente, identificou-se uma receita bruta total de £8,86 milhões, distribuída em 21,9 mil faturas, com um ticket médio por fatura de £404,00. O desconto médio aplicado sobre as transações foi de 26,43%. Esses indicadores gerais fornecem uma base quantitativa para compreender a escala das operações do varejo e o impacto das políticas de precificação e promoções. A visualização desses dados em um dashboard, como o desenvolvido, facilita a rápida compreensão desses valores agregados por parte dos gestores.
Dados de Clientes – Segmentação de Consumidores: Visão Geral
A segmentação dos consumidores foi realizada com base em sua frequência de compra e valor monetário, utilizando o algoritmo K-Means, uma técnica de agrupamento não supervisionada (Ikotun et al., 2023). Observou-se que a grande maioria dos clientes se enquadra no grupo de “consumidores comuns”, tanto em termos de valor total gasto quanto de frequência de compras. No entanto, a análise revelou que o grupo de “consumidores médios” apresenta um valor médio de compra por transação mais elevado, indicando um potencial de valorização desses clientes.
A distribuição da receita bruta demonstrou uma dependência significativa de um pequeno grupo de clientes de alto valor. Seis “consumidores grandes” foram responsáveis por 12,6% da receita bruta total, com um ticket médio 6,5 vezes superior ao dos consumidores comuns. Essa concentração de receita em poucos clientes de maior frequência e gasto aponta para uma oportunidade estratégica de crescimento, onde a atração de poucos novos clientes com esse perfil poderia gerar um aumento substancial na receita geral do negócio. A análise ressalta a importância de focar em estratégias de retenção e aquisição direcionadas a esses segmentos de alto valor.
Apesar da relevância da segmentação, a análise inicial dos dados de clientes evidenciou uma limitação na compreensão do cruzamento entre dados de consumidor e produto. Isso impede uma visão clara sobre quais produtos são preferidos pelos grandes consumidores ou se há padrões de compra que indicam revenda, o que poderia impactar a lucratividade da empresa. Adicionalmente, foi observado que os consumidores de alta frequência apresentaram um desconto médio de 30,52% menor do que o preço otimizado, calculado pela técnica IQR, sugerindo uma oportunidade para refinar as estratégias de precificação.
Detalhes de Clientes – Segmentação de Consumidores: Visão Geral
A análise da distribuição geográfica dos clientes revelou uma predominância do mercado britânico, o que é esperado para um varejo digital localizado na Inglaterra. Contudo, a granularidade dos dados por país trouxe observações surpreendentes. Países como Holanda e Irlanda, com apenas nove e três clientes, respectivamente, superaram em receita bruta mercados maiores como Alemanha e França. Este achado indica um potencial de crescimento significativo para o varejo, caso sejam desenvolvidas campanhas de marketing direcionadas a esses mercados.
Um fator que contribui para o desempenho da Holanda é o desconto médio aplicado, que foi de 33,53%, significativamente maior em comparação com os 26,65% da Inglaterra e 24,09% da Irlanda. Essa diferença nos descontos pode influenciar a atratividade e o volume de vendas em mercados específicos, sugerindo que a política de descontos é um elemento crucial a ser considerado nas estratégias de expansão geográfica. A capacidade de filtrar e analisar esses dados por país no dashboard permite uma compreensão aprofundada dessas dinâmicas.
Detalhes de Vendas – Detalhes de Vendas Temporais
A evolução mensal das vendas totais ao longo de 2011 apresentou uma tendência geral de crescimento, com períodos de baixa atividade em fevereiro e abril. O segundo semestre do ano demonstrou uma melhora significativa, culminando em um pico de vendas no mês de novembro. Essa sazonalidade é um achado importante para o planejamento de estoque e campanhas promocionais, permitindo que o varejo se prepare para os períodos de maior demanda e otimize suas operações.
Uma limitação importante na análise temporal foi o encerramento dos dados em 12 de dezembro, o que impediu a captura completa da atividade de vendas do mês. Essa truncagem dos dados pode distorcer a percepção da atividade de vendas de dezembro, um mês tipicamente de alta demanda devido às festividades de fim de ano. Séries temporais mais prolongadas seriam ideais para uma compreensão mais robusta dos comportamentos sazonais e para a aplicação de técnicas de previsão de vendas.
A taxa de devoluções e cancelamentos manteve-se relativamente estável ao longo do ano, com exceção de um aumento em dezembro e janeiro. Embora o alto volume de vendas no final do ano, impulsionado por produtos de presente, possa explicar parte dessas desistências, o fenômeno exige atenção dos gestores. É fundamental investigar se há fatores operacionais que contribuem para essas devoluções, como problemas de logística ou qualidade do produto, para mitigar impactos negativos na receita e satisfação do cliente.
Detalhes de Produto
A análise detalhada do desempenho dos produtos revelou os itens mais rentáveis do catálogo. O produto “REGENCY CAKESTAND 3 TIER” destacou-se, gerando uma receita de £174,4 mil libras esterlinas a partir da venda de aproximadamente 13,87 mil unidades. Em seguida, o “PAPER CRAFT LITTLE BIRDIE” contribuiu com mais de £168 mil em receita, demonstrando a importância desses produtos para o faturamento geral do varejo.
Contudo, a análise de produtos também expôs anomalias significativas nos dados, sublinhando a necessidade de um processo contínuo de limpeza e governança de dados. O item “PAPER CRAFT LITTLE BIRDIE”, apesar de ser o segundo mais rentável, apresentou uma taxa de retorno de 100% para uma quantidade encomendada consideravelmente alta. Embora possa ser uma devolução legítima, essa ocorrência distorce os dados e o modelo analítico, evidenciando que a limpeza de dados não é uma tarefa pontual, mas um processo recorrente.
Outra anomalia foi identificada no produto “PICNIC BASKET WICKER 60 PIECES”, que possuía um preço de tabela de aproximadamente £11, mas o preço médio praticado, segundo os dados, era de cerca de £650. Essa discrepância resultou em um desconto calculado de -5.919%, indicando um possível erro de registro de preço ou um problema no sistema. A identificação dessas inconsistências foi facilitada pela elaboração de um preço de referência via Intervalo Interquartil (IQR), uma técnica robusta para identificar outliers (Tuckey, 1977). A correção dessas anomalias requer colaboração com gestores para implementar processos de governança de dados, garantindo a fidelidade das análises.
Mesmo com as limitações de um banco de dados transacionais com ruídos, inconsistências e informações incompletas, o estudo demonstrou que a aplicação de técnicas de ciência de dados, como o data wrangling e a modelagem dimensional, permite transformar dados brutos em diagnósticos estratégicos. As visualizações dinâmicas em Power BI materializam o objetivo principal deste estudo, que é o processo completo de transformação de dados em um sistema de suporte à decisão. Este framework não apenas fornece informações valiosas, mas também estimula a maturidade digital da organização, promovendo maior disciplina na manutenção e estruturação dos dados e enriquecendo a cultura de tomada de decisão baseada em evidências.
Em síntese, os resultados obtidos demonstram que o framework desenvolvido, ao integrar data wrangling, modelagem dimensional e clustering, permite transformar dados transacionais brutos em inteligência de negócio acionável. A segmentação de clientes revelou perfis distintos e a importância de consumidores de alto valor, enquanto a análise geográfica e temporal identificou oportunidades de mercado e padrões sazonais de vendas. A detecção de anomalias nos dados de produtos ressaltou a necessidade crítica de governança de dados. Assim, o estudo atinge seu objetivo de fornecer uma fundação metódica para a tomada de decisão estratégica, mesmo com dados desafiadores.
4. Conclusão
O presente estudo buscou demonstrar uma fundação metódica para transformar dados transacionais brutos em inteligência de negócio acionável, facilitando a tomada de decisão sobre consumidores, produtos e vendas por meio da aplicação de técnicas de ciência de dados e visualização. Verificou-se a possibilidade de identificar distintos perfis de consumidores, com destaque para a relevância de clientes de alto valor e o potencial de crescimento em mercados internacionais específicos, como Holanda e Irlanda, que, com 9 e 3 clientes, respectivamente, superaram em receita mercados maiores com menor número de clientes. Observou-se, ainda, a sazonalidade das vendas, com picos em novembro e períodos de menor atividade em fevereiro e abril, e a ocorrência de anomalias nos dados de produtos, como taxas de retorno elevadas e discrepâncias de preços, que sublinharam a necessidade de governança de dados. A principal contribuição reside no desenvolvimento de um framework que integra data wrangling, modelagem dimensional e clustering, culminando na criação de dashboards interativos no Power BI, que convertem dados brutos em diagnósticos estratégicos, promovendo a maturidade digital e a tomada de decisão baseada em evidências.
Apesar dos achados significativos, o estudo enfrentou limitações inerentes à natureza dos dados transacionais brutos, que apresentavam ruídos, inconsistências e informações incompletas, como a dificuldade em cruzar dados de consumidor e produto para uma análise mais aprofundada de preferências ou padrões de revenda. A truncagem dos dados de vendas em dezembro também impediu uma compreensão completa da sazonalidade de fim de ano. Diante dessas observações, sugere-se para estudos futuros a ampliação da base temporal dos dados para uma análise sazonal mais robusta e a incorporação de informações adicionais sobre consumidores e localização para refinar as estratégias de marketing e vendas. Recomenda-se, ainda, a implementação de processos contínuos de governança de dados para mitigar anomalias e garantir a fidelidade das análises, fortalecendo a cultura de decisão orientada por dados na organização.
Referências Bibliográficas
Bálint, L.P.; Péntek, A.; Nabradi, Z.; Botos, S. 2025. How can data analytics and employee upskilling foster digital maturity and sutainable practices in SMEs?. Problems and Perspectives in Management, 23, 606-620. Disponível em <https://www.researchgate.net/publication/392425136_How_can_data_analytics_and_employ ee_upskilling_foster_digital_maturity_and_sustainable_practices_in_SMES> Acesso em 15 Mar. 2026
Chen, D., 2015. Online Retail [Dataset]. UCI Machine Learning Repository. Disponivel em <https://doi.org/10.24432/C5BW33>. Acesso em 15 Abr. 2025
Eberhard, K, 2023. The effects of visualization on judgment and decision-making: a systematic literature review. Magag Rev Q, 73, 167-241.
Handojo, A.; Pujawan, N.; Santosa, B.; & Singgih, M. L. 2023. A multi layer recency frequency monetary method for customer priority segmentation in online transaction. Cognet Engineering, 10(1). Disponível em <https://doi.org/10.1080/23311916.2022.2162679>. Acesso em 15 Mar. 2026
Ikotun, A.M.; Ezugwu, A. E.; Laith, A.; Abuhaija, B.; Heming, J. 2023. K-means Clustering Algorithms: A Comprehensive Review, Variants Analysis, and Advances in the Era of Big Data. Information Sciences, 622, 178-210. Disponível em <https://www.sciencedirect.com/science/article/abs/pii/S0020025522014633>. Acesso 25 Mar. 2026
Kahn, B, Jan, S, Khan, W, Chugthtai, M., 2024. An Overview of ETL Techniques, Tools, Processes and Evaluations in Data Warehousing. Journal on Big Data, 6, 1-20.
Kirmani, M. M., 2017. Dimensional modeling using star schema for data warehouse creation. Oriental Journal of Computer Science and Technology, 10(4), 745–754. Disponível em <http://www.computerscijournal.org/?p=7002>. Acesso em 15 Mar. 2026
Marr, B., 2017. Data strategy: How to profit from a world of big data, analytics and the internet of things. Kogan Page Publishers.
McAfee, A., Brynjolfsson, E., Davenport, T.H., Patil, D.J. and Barton, D., 2012. Big data: the management revolution. Harvard business review, 90(10), 60-68.
Tuckey, J.W., 1977. Exploratory Data Analysis. Addison-Wesley, Reading, MA.
Universidade Estadual do Rio Grande do Sul [UERGS], Gilmar de Azevedo. 2021. “Uma imagem vale por mil palavras”, mas diga isso sem as palavras. Disponivel em <https://www.uergs.edu.br/uma-imagem-vale-por-mil-palavras-mas-diga-isso-sem-as-palavras>. Acesso em 03 de Mar. 2025.
Wexler, S., Shaffer, J. and Cotgreave, A., 2017. The big book of “dashboards”: visualizing your data using real-world business scenarios. John Wiley & Sons.
Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq
Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

