Artigo

10 de setembro de 2026

Desempenho de Modelos de Machine Learning na Seleção de Ações da Bolsa de Valores Brasileira

Gabriel Fernandes Masalskas; Ricardo Janes

DOI: 10.22167/2675-6528-202602221

Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.

Resumo

O mercado acionário brasileiro, caracterizado por elevada volatilidade e restrições de liquidez, impõe desafios à aplicação de modelos de aprendizado de máquina na previsão de retornos e na construção de estratégias de investimento. O estudo comparou o desempenho preditivo e econômico de modelos de aprendizado de máquina e métodos estatísticos tradicionais na estimação de retornos futuros e na formação de carteiras baseadas em ranking de ativos. Utilizaram-se dados históricos de ações da B3, com variáveis técnicas e financeiras derivadas de preços e volume. Avaliaram-se modelos lineares (Regressão Linear, Ridge, LASSO, Elastic Net), de ensemble (Random Forest, XGBoost, LightGBM) e uma rede neural (Multilayer Perceptron). A avaliação preditiva ocorreu por métricas de erro em conjunto de teste, e a econômica por backtest de estratégias long-only, com custos operacionais baseados no turnover para análise de retornos brutos e líquidos. Os resultados revelaram baixa capacidade preditiva em todos os modelos, com R² negativos e erros elevados. Embora diferenças marginais nas previsões tenham gerado variações no desempenho econômico, estas foram de baixa magnitude e instáveis. O modelo LightGBM obteve o melhor desempenho econômico, mas com ganhos limitados em relação ao benchmark após a inclusão de custos operacionais. Não se observou evidência consistente de geração de retorno ajustado ao risco superior.

Palavras-chave: aprendizado de máquina; backtest; mercado acionário; previsão de retornos; seleção de ativos.

1. Introdução

O mercado acionário brasileiro, negociado pela B3 S.A. – Brasil, Bolsa, Balcão (B3), apresenta particularidades que o diferenciam de mercados desenvolvidos, impondo desafios específicos para a aplicação de modelos de aprendizado de máquina na previsão de retornos e na construção de estratégias de investimento. A compreensão de suas dinâmicas é fundamental para investidores e pesquisadores que buscam otimizar o desempenho e a gestão de riscos em um ambiente de alta complexidade.

Entre as características distintivas do mercado brasileiro, destacam-se a maior volatilidade, a menor profundidade de liquidez e os custos operacionais mais elevados. Estudos comparativos confirmam que mercados emergentes, como o Brasil, tendem a exibir maior sensibilidade a choques de volatilidade e menor liquidez estrutural em comparação a mercados maduros. Vartanian (2023), por exemplo, identificou o Brasil entre os mercados mais voláteis em períodos de instabilidade. De Carvalho (2021) evidenciou um prêmio de liquidez significativo nas ações da B3, enquanto Brito (2024) demonstrou que a relação entre liquidez e volatilidade no mercado nacional é acentuada durante crises. Adicionalmente, Benetti et al. (2007) destacaram que os custos operacionais e tributários no mercado acionário brasileiro permanecem superiores aos observados em países desenvolvidos. Essas particularidades estruturais tornam o Brasil um ambiente desafiador para a implementação de estratégias quantitativas.

Nesse contexto, o aprendizado de máquina (ML) surge como uma ferramenta promissora para analisar e prever retornos de ativos de renda variável. A literatura recente já demonstra avanços significativos na aplicação de ML em finanças. Arismendi-Zambrano et al. (2023) mostraram que métodos de ML baseados em regressões penalizadas são capazes de prever retornos intradiários no mercado brasileiro, gerando estratégias com desempenho ajustado ao custo de transação superior ao de benchmarks lineares. No campo de gestão de fundos, a CFA Society Brasil (2024) aplicou o XGBoost para distinguir gestores, constatando que carteiras formadas com base nas previsões do modelo apresentaram melhor relação risco-retorno. Felizardo e Pinto (2019) também avaliaram arquiteturas de redes neurais artificiais na previsão de retornos de ações brasileiras, demonstrando ganhos de assertividade em comparação a abordagens lineares, embora ressaltassem a sensibilidade do desempenho à calibragem de hiperparâmetros. Evidências adicionais (Henrique et al., 2019) indicam o potencial de modelos não lineares, como Support Vector Regression, na previsão de preços e retornos de ativos financeiros no Brasil, apesar de limitações associadas à estabilidade e generalização dos modelos.

Apesar desses avanços, lacunas relevantes persistem na literatura nacional. A maioria dos trabalhos concentra-se em previsões de alta frequência ou em análises de fundos, sendo raras as pesquisas que comparam de forma sistemática diferentes famílias de modelos de ML, como Random Forest, boosting (XGBoost, LightGBM) e redes neurais, em contextos de recomendação de ativos no mercado acionário. Além disso, poucos estudos incorporam elementos operacionais da realidade brasileira, como custos de transação, slippage e liquidez efetiva, em seus backtests e validações temporais. Essa carência impede uma avaliação completa da viabilidade prática e econômica das estratégias baseadas em ML no mercado local.

A aplicação de ML no mercado financeiro brasileiro, portanto, encontra-se em estágio promissor, mas ainda carente de abordagens que conciliem robustez preditiva e viabilidade operacional. Conforme ressaltam De Prado (2018) e Gu, Kelly e Xiu (2020), o sucesso de modelos de ML em finanças depende não apenas de desempenho estatístico, mas da capacidade de gerar previsões economicamente úteis e exequíveis. No contexto nacional, essa discussão torna-se particularmente relevante devido às restrições de liquidez e aos custos de negociação, que podem inviabilizar estratégias rentáveis em simulações. Assim, torna-se necessário desenvolver estudos que avaliem, de forma comparativa e reprodutível, o desempenho de diferentes algoritmos de ML em estratégias de recomendação de ativos no mercado acionário brasileiro, utilizando métricas ajustadas ao risco, como o índice de Sharpe, bem como medidas de drawdown e volatilidade. Em especial, compreender quais modelos oferecem o melhor trade-off entre desempenho e viabilidade operacional é uma contribuição relevante tanto para a pesquisa acadêmica quanto para a prática profissional. Diante disso, este trabalho tem como objetivo comparar os desempenhos preditivo e econômico de modelos de aprendizado de máquina e métodos estatísticos tradicionais na estimação de retornos futuros e na construção de estratégias de investimento baseadas em ranking no mercado acionário brasileiro.

2. Material e Métodos

Este trabalho avaliou a capacidade preditiva e a utilidade econômica de diferentes modelos de aprendizado de máquina e métodos estatísticos tradicionais aplicados ao mercado acionário brasileiro. A análise foi conduzida a partir de dados históricos de preços ajustados de ações negociadas na B3, contemplando um painel não balanceado de ativos.

Definição do universo investível e tratamento dos dados

O estudo utilizou dados históricos de preços ajustados de ações negociadas na B3, obtidos da plataforma “Dados de Mercado – Ações listadas na B3” e coletados via biblioteca Python yfinance (Yahoo Finance). As séries de preços corresponderam aos preços de fechamento ajustados (“adjusted close”), que incorporam eventos corporativos como dividendos e desdobramentos, garantindo consistência temporal dos retornos.

A partir do conjunto inicial de ativos, foram aplicados critérios de elegibilidade e filtragem sequencial para definir o universo investível. Esses critérios incluíram disponibilidade de dados históricos, consistência de preços, liquidez mínima (volume financeiro negociado) e exclusão de séries incompletas ou inconsistentes, conforme detalhado na Tabela 1.

Tabela 1. Etapas de definição do universo investível

EtapaDescrição
Base inicialAções listadas na B3
Coleta de dadosAtivos com histórico disponível no provedor
Filtro de qualidadeExclusão por inconsistências de preço e volume
Histórico mínimoExclusão de séries insuficientes
LiquidezSeleção mensal dos 50 ativos mais líquidos
Universo finalPainel dinâmico de ativos elegíveis

Fonte: Dados originais da pesquisa

Os dados diários foram agregados para periodicidade mensal, utilizando o último preço de fechamento disponível em cada mês. Adicionalmente, em cada período, os 50 ativos mais líquidos (com base no volume financeiro diário negociado) foram selecionados para compor um universo investível dinâmico, refletindo a realidade operacional do mercado.

Definição da variável target

A variável de interesse foi o retorno logarítmico mensal futuro de cada ativo, calculado a partir dos preços de fechamento mensais, conforme a Equação 1:

rt+1 = ln(Pt+1 / Pt) (1)

em que: rt+1 é o retorno logarítmico no período t+1; Pt+1 é o preço de fechamento no período t+1; e Pt é o preço de fechamento no período t. Este retorno foi associado ao período t (shift), de modo que as previsões realizadas ao final do mês t referiam-se ao retorno observado no mês t+1. O problema foi formulado como uma tarefa de regressão supervisionada para estimar retornos futuros contínuos. A avaliação econômica das estratégias foi realizada com base em retornos simples.

Construção das variáveis explicativas e dos modelos

As variáveis explicativas incluíram retornos defasados, medidas de volatilidade, indicadores de tendência e métricas técnicas baseadas em preço e volume, conforme detalhado na Tabela 2.

Tabela 2. Variáveis explicativas utilizadas na modelagem

GrupoVariávelDescrição
Retornosret_log_1dRetorno logarítmico diário
Retornosret_5dRetorno acumulado em 5 dias
Retornosret_21dRetorno mensal
Retornosret_63dRetorno trimestral
Retornosret_252dRetorno anual
Volatilidadevol_21dDesvio padrão dos retornos (21 dias)
Volatilidadevol_63dDesvio padrão dos retornos (63 dias)
Tendênciaprice_sma21_ratioRazão preço / média móvel 21 dias
Tendênciaprice_sma63_ratioRazão preço / média móvel 63 dias
Tendênciasma_diff_21_63Diferença entre médias móveis (21d – 63d)
Indicadoresrsi_14Índice de Força Relativa (14 dias)
Indicadoresrsi_21Índice de Força Relativa (21 dias)
IndicadoresmacdIndicador MACD
Indicadoresmacd_signalLinha de sinal do MACD
Indicadoresmacd_histHistograma do MACD
RiscoATR_14Average True Range (14 dias)
Liquidezvol_med_21dVolume médio negociado
Liquidezvol_med_63dVolume médio (63 dias)
Liquidezvol_fin_med_21dVolume financeiro médio
Liquidezvol_fin_med_63dVolume financeiro médio (63 dias)
Liquidezturnover_proxyProxy de liquidez
Outrosadx_14Índice Direcional Médio
OutrosobvOn Balance Volume

Fonte: Dados originais da pesquisa

As variáveis foram calculadas diariamente e agregadas mensalmente, utilizando a última observação disponível. Todas as variáveis explicativas foram defasadas em um período (t-1) mensal para garantir que as previsões utilizassem apenas informações disponíveis até o final do mês anterior.

Foram selecionados modelos representativos de diferentes abordagens: regressões lineares (Regressão Linear, Ridge, LASSO e Elastic Net), modelos de ensemble baseados em árvores de decisão (Random Forest, XGBoost e LightGBM) e uma rede neural artificial (Multilayer Perceptron – MLP). A Tabela 3 lista os modelos e suas bibliotecas de implementação em Python.

Tabela 3. Modelos utilizados e respectivas bibliotecas de implementação

ModeloBibliotecaImplementação
Regressão Linearscikit-learnLinearRegression
Ridgescikit-learnRidge
LASSOscikit-learnLasso
Elastic Netscikit-learnElasticNet
Random Forestscikit-learnRandomForestRegressor
XGBoostxgboostXGBRegressor
LightGBMlightgbmLGBMRegressor
Rede Neural (MLP)tensorflow / kerasSequential (Dense)

Fonte: Dados originais da pesquisa

As variáveis explicativas foram padronizadas por transformação z-score para modelos sensíveis à escala, enquanto modelos de ensemble foram estimados nas variáveis originais. Todos os modelos foram formulados como problemas de regressão supervisionada para prever retornos futuros contínuos. A amostra foi dividida temporalmente de forma sequencial, com 80% das observações iniciais para treinamento e 20% finais para teste, preservando a ordem cronológica dos dados.

A avaliação preditiva foi realizada por meio de métricas de erro (RMSE, MAE e R²), e a avaliação econômica foi conduzida por um “backtest” no conjunto de teste, utilizando métricas como retorno médio, volatilidade, índice de Sharpe e máximo “drawdown”. Um benchmark, definido como uma carteira igualmente ponderada de todos os ativos elegíveis com rebalanceamento mensal, foi usado como referência. Para garantir a reprodutibilidade, foram fixados “seeds” aleatórios nas bibliotecas Python (random), NumPy e TensorFlow.

Construção das estratégias baseadas em ranking

As previsões dos modelos foram usadas para construir estratégias de investimento “long-only” baseadas em ranking “cross-sectional”. Mensalmente, os 10 ativos com maior retorno previsto, dentre os 50 ativos mais líquidos do universo investível, foram selecionados para formar uma carteira igualmente ponderada. As carteiras foram integralmente rebalanceadas ao final de cada mês.

A rotatividade das carteiras foi mensurada pelo turnover médio mensal, que é a proporção de ativos substituídos entre períodos consecutivos. O retorno da estratégia foi calculado como a média simples dos retornos realizados dos ativos selecionados no mês subsequente. Custos operacionais foram incorporados como uma estimativa simplificada, aplicando um custo proporcional fixo de 0,2% por unidade de turnover. O retorno líquido (rliq) foi calculado deduzindo esse custo do retorno bruto (rbruto), conforme a Equação 2:

rliq = rbruto – c * turnovert (2)

onde c é o custo operacional (0,2%) e turnovert é a proporção de ativos substituídos no período t. O desempenho das carteiras foi avaliado no período de teste em termos de retorno bruto e líquido, sendo o retorno líquido a principal métrica de comparação econômica. O benchmark, por sua vez, não teve custos operacionais.

3. Resultados e Discussão

A interpretação dos resultados considerou o contexto metodológico adotado, incluindo o horizonte temporal do período do conjunto de teste e as simplificações inerentes ao backtest, como a modelagem de custos operacionais baseada no turnover das carteiras (fixada em 0,2%), sem a incorporação de componentes adicionais como slippage, impacto de mercado e restrições de liquidez.

Impacto dos filtros no universo de ativos

A aplicação dos critérios de elegibilidade e filtragem resultou em uma redução progressiva do universo inicial de ativos disponíveis para análise. A Tabela 4 apresenta o funil de seleção, detalhando o número de ativos remanescentes após cada etapa do processo.

Tabela 4. Funil de seleção do universo de ativos

EtapaNúmero de ativos
Base inicial (ações listadas – CSV)398
Ativos com dados históricos no provedor393
Após filtro de qualidade (preço e volume)150
Após filtro de histórico mínimo150
Top 50 por liquidez (amostra final)50

Fonte: Dados originais da pesquisa

Observou-se uma redução significativa do universo de ativos, de 398 para 50, o que representa uma contração de aproximadamente 87% do conjunto inicial. Essa redução evidencia a elevada concentração de liquidez no mercado acionário brasileiro e é consistente com a estrutura do mercado, onde poucos ativos possuem volume de negociação suficiente para estratégias sistemáticas. O universo final utilizado na modelagem e no backtest reflete predominantemente o comportamento de ativos de maior liquidez. Metodologicamente, essa filtragem implica que os resultados não são diretamente generalizáveis para ativos de menor negociação, e a definição dinâmica do universo investível influencia a composição das carteiras e do benchmark, impactando a avaliação comparativa das estratégias.

Estatísticas descritivas da variável alvo

Antes da modelagem, analisou-se a distribuição da variável alvo, o retorno logarítmico mensal futuro, para avaliar suas propriedades estatísticas e plausibilidade econômica. A Tabela 5 apresenta as estatísticas descritivas da variável.

Tabela 5. Estatísticas descritivas do retorno logarítmico mensal futuro

MétricaValor
Observações3.207
Média0,0121
Desvio padrão0,1237
Mínimo-0,9252
1%-0,3462
5%-0,1661
25%-0,0538
Mediana0,0118
75%0,0807
Máximo0,6987

Fonte: Resultados originais da pesquisa

Os resultados indicaram uma distribuição caracterizada por elevada volatilidade e caudas longas, padrão amplamente documentado na literatura financeira (Fama e French, 2015; Harvey et al., 2016). A média próxima de zero (0,012) e o desvio padrão elevado (0,124) evidenciaram um ambiente de baixa relação sinal-ruído, dificultando a identificação de padrões preditivos consistentes. A presença de valores extremos, com retornos mínimos próximos a -92% e máximos em torno de 70%, indicou a ocorrência de eventos idiossincráticos e uma assimetria negativa na distribuição, característica de mercados acionários emergentes. Essas propriedades implicam desafios na modelagem, como sensibilidade a outliers e instabilidade nas estimativas, reforçando a importância de avaliar o desempenho das estratégias de forma ajustada ao risco.

Avaliação preditiva dos modelos

A capacidade preditiva dos modelos foi avaliada por métricas de erro como RMSE, MAE e coeficiente de determinação (R²), calculadas no conjunto de teste. As previsões foram baseadas nas variáveis explicativas descritas na metodologia. A Tabela 6 apresenta o desempenho preditivo dos modelos, comparando abordagens lineares e não lineares.

Tabela 6. Desempenho preditivo dos modelos (RMSE, MAE e R²)

ModeloRMSEMAE
Linear0.10310.0754-0.0571
Ridge0.10310.0754-0.0567
LASSO0.10290.0753-0.0533
ElasticNet0.10300.0754-0.0547
RandomForest0.10170.0742-0.0297
XGBoost0.10740.0792-0.1476
LightGBM0.11210.0831-0.2503
MLP0.12440.0943-0.5391

Fonte: Resultados originais da pesquisa

Todos os modelos apresentaram baixo poder preditivo no conjunto de teste, com coeficientes de determinação negativos em todas as especificações, indicando que suas previsões são, em média, inferiores a uma estratégia ingênua baseada na média histórica dos retornos. As diferenças entre os modelos em termos de RMSE e MAE foram relativamente pequenas, sem evidência de superioridade consistente de modelos mais complexos em relação às abordagens lineares. Modelos regularizados, como LASSO e Elastic Net, apresentaram desempenho marginalmente superior, enquanto modelos mais flexíveis, como Gradient Boosting e redes neurais, exibiram pior desempenho, sugerindo possível sobreajuste. A proximidade entre os valores de RMSE e o desvio padrão da variável alvo (Tabela 5) sugere que os modelos são incapazes de explicar parcela significativa da variância dos retornos em um ambiente de baixa relação sinal-ruído. As diferenças observadas devem ser interpretadas com cautela, dada a ausência de evidência estatística de capacidade preditiva superior (Giacomini e White, 2006).

Avaliação econômica das estratégias

A Tabela 7 apresenta os principais indicadores de desempenho econômico das estratégias baseadas em ranking, calculados no período de teste, já deduzidos dos custos operacionais estimados com base no turnover das carteiras. São reportados o retorno médio mensal, o retorno geométrico mensal, o retorno anualizado, a volatilidade dos retornos, o índice de Sharpe, o máximo drawdown e o turnover médio mensal, além do valor final de um investimento hipotético inicial de R$ 100.

Tabela 7. Desempenho econômico das estratégias por modelo

ModeloRet. mensal (%)Ret. geom (%)Ret. anual (%)Vol. (%)SharpeMax DD (%)Turnover médio mensalR$ 100 final
LightGBM0,450,151,768,150,1920-28,790,5619103,10
Ridge0,280,010,107,750,1249-31,310,4619100,18
ElasticNet0,28-0,01-0,078,010,1225-33,300,442999,87
Benchmark0,13-0,06-0,726,410,0703-25,3498,74
LASSO0,21-0,10-1,218,290,0873-34,540,414397,90
Linear0,13-0,11-1,317,220,0621-30,960,471497,72
XGBoost0,24-0,12-1,388,830,0949-30,930,452497,60
RandomForest0,16-0,18-2,108,420,0644-31,160,347696,35
MLP-0,43-0,62-7,146,30-0,2365-35,440,600087,84

Fonte: Resultados originais da pesquisa

O benchmark, uma estratégia passiva igualmente ponderada com rebalanceamento mensal, serviu como referência. Os resultados indicam que o desempenho econômico das estratégias baseadas em ranking foi, de forma geral, limitado. O modelo LightGBM apresentou o melhor desempenho, com retorno geométrico mensal positivo e valor final superior ao investimento inicial. Modelos lineares regularizados, como Ridge e Elastic Net, também exibiram retornos geométricos ligeiramente positivos. Contudo, modelos como Linear, LASSO, XGBoost, Random Forest e MLP mostraram retornos geométricos negativos, indicando perda de valor ao longo do tempo. A diferença entre retorno médio e geométrico reflete o impacto da volatilidade, resultando em crescimento composto negativo para a maioria dos modelos, onde a variabilidade dos retornos superou o ganho médio esperado. As diferenças de desempenho entre os modelos foram pequenas, e os índices de Sharpe permaneceram baixos, indicando que a relação risco-retorno das estratégias foi pouco atrativa. A janela de avaliação econômica, de 21 meses, é relativamente curta, o que implica sensibilidade dos resultados a condições específicas de mercado e limita a robustez das conclusões.

Evolução temporal do desempenho das estratégias

A Figura 1 apresenta a evolução temporal do retorno acumulado das estratégias baseadas em ranking no período do conjunto de teste, construído a partir da capitalização composta dos retornos mensais de cada modelo, incluindo o benchmark.

Figura 1. Evolução do retorno acumulado das estratégias baseadas em modelos de machine learning

Fonte: Resultados originais da pesquisa

A análise da Figura 1 evidencia diferenças relevantes na trajetória de desempenho entre as estratégias. O modelo com melhor desempenho apresentou uma trajetória de crescimento relativamente mais consistente, ainda que com episódios de queda, enquanto o modelo de pior desempenho exibiu deterioração progressiva do capital. O benchmark apresentou comportamento intermediário, com menor amplitude de variação, refletindo o efeito da diversificação. As estratégias não seguiram trajetórias monotônicas de crescimento, sendo caracterizadas por ciclos alternados de ganhos e perdas. Pequenas diferenças nas previsões dos modelos podem se traduzir em impactos relevantes no desempenho acumulado, reforçando a sensibilidade das estratégias à ordenação relativa dos ativos. A dispersão entre as curvas ao final do período foi limitada, sugerindo que a diferença de desempenho decorre mais de acertos pontuais do que de vantagens persistentes, alinhado à baixa capacidade preditiva. A presença de períodos prolongados de drawdown em quase todas as estratégias evidencia o risco significativo associado, mesmo em casos de desempenho final positivo, reforçando a importância de avaliar a dinâmica temporal das perdas em contextos de elevada volatilidade.

Relação entre turnover e desempenho econômico

A incorporação de custos operacionais, mesmo simplificada, alterou a ordenação relativa dos modelos, evidenciando a importância de uma modelagem acurada desses custos. A Tabela 8 apresenta o impacto dos custos operacionais estimados no desempenho das estratégias, incluindo retornos anualizados e valores finais antes e após a dedução de custos, bem como métricas associadas à rotatividade das carteiras.

Tabela 8. Impacto de custos de transação no desempenho das estratégias

ModeloRet. anual bruto (%)Valor final bruto (R$)Turnover médio mensalTotal de ativos trocadosCusto total est. (R$)Ret. anual líq. (%)Valor final líq. (R$)
LightGBM3,15105,580,56191182,361,76103,10
Ridge1,22102,140,4619971,940,10100,18
ElasticNet1,00101,750,4429931,86-0,0799,87
Benchmark-0,7298,74-0,7298,74
LASSO-0,2199,620,4143871,74-1,2197,90
Linear-0,1999,670,4714991,98-1,3197,72
XGBoost-0,2999,490,4524951,90-1,3897,60
RandomForest-1,2897,770,3476731,46-2,1096,35
MLP-5,7890,100,60001262,52-7,1487,84

Fonte: Resultados originais da pesquisa

A comparação entre retornos brutos e líquidos mostra que a incorporação de custos não apenas reduz o retorno, mas pode alterar a ordenação relativa das estratégias. Modelos com desempenho bruto superior podem se tornar inferiores após a dedução de custos, especialmente com alta rotatividade, indicando que a avaliação baseada apenas em retornos brutos pode ser enviesada. O turnover médio mensal variou entre 0,35 e 0,60. Estratégias com maior rotatividade, como LightGBM e MLP, apresentaram maior custo acumulado. Em contraste, modelos com menor turnover, como Random Forest, tiveram menor erosão de retorno, sugerindo que a eficiência da estratégia depende da interação entre capacidade preditiva e intensidade de negociação. A Figura 2 ilustra a relação entre o turnover médio mensal e o retorno anualizado líquido.

Figura 2. Relação entre turnover médio mensal e retorno anualizado líquido das estratégias

Fonte: Resultados originais da pesquisa

A Figura 2 não mostra uma relação monotônica clara entre rotatividade e desempenho, indicando que níveis mais elevados de turnover não implicam necessariamente em pior desempenho econômico. No entanto, há maior dispersão dos resultados entre estratégias com maior rotatividade, sugerindo que o turnover amplifica a variabilidade do desempenho ao aumentar a exposição a custos operacionais. Esse resultado indica que o impacto econômico da rotatividade é determinado pela interação entre custos operacionais e qualidade do sinal preditivo. Estratégias com maior capacidade de ordenação relativa podem compensar custos de negociação, enquanto modelos com baixa capacidade preditiva tendem a ter seu desempenho deteriorado. A modelagem de custos operacionais é central na avaliação de estratégias de aprendizado de máquina, e o uso de proxies simplificadas, embora útil para comparação, pode não capturar integralmente as fricções reais de mercado, superestimando o desempenho econômico das estratégias.

Interpretação integrada dos resultados

Os resultados evidenciaram baixa capacidade preditiva dos modelos, com R² negativos no conjunto fora da amostra (Tabela 6), indicando que não superaram previsões baseadas na média histórica dos retornos. Isso é consistente com a elevada volatilidade e baixa relação sinal-ruído da variável alvo (Tabela 5). Apesar dessa limitação, pequenas diferenças nas estimativas foram suficientes para gerar variações no desempenho econômico das estratégias (Tabela 7), devido ao mecanismo de seleção por ranking, onde a ordenação relativa dos ativos foi mais relevante que a precisão absoluta. Contudo, essas variações foram reduzidas e não configuraram evidência robusta de geração consistente de valor, com as estratégias apresentando desempenho líquido próximo ao benchmark, com ganhos pontuais e dependentes do período. A incorporação de custos operacionais reduziu os retornos e, em alguns casos, alterou a ordenação relativa das estratégias, evidenciando a influência da intensidade de negociação. A relação entre turnover e desempenho (Figura 2) não indicou um padrão monotônico claro. A comparação com o benchmark revelou um trade-off entre estratégias ativas e passivas; embora algumas estratégias tenham superado o benchmark em certos momentos, este apresentou menor volatilidade e drawdowns mais controlados (Tabela 7 e Figura 1), refletindo o efeito da diversificação. A análise temporal indicou ausência de superioridade persistente entre os modelos, com alternância frequente de desempenho, sugerindo forte dependência do recorte temporal. Em conjunto, os modelos avaliados não apresentaram capacidade consistente de geração de retorno ajustado ao risco superior ao benchmark.

4. Conclusão

Este trabalho teve como objetivo comparar os desempenhos preditivo e econômico de modelos de aprendizado de máquina e métodos estatísticos tradicionais na estimação de retornos futuros e na construção de estratégias de investimento baseadas em ranking no mercado acionário brasileiro. Verificou-se que todos os modelos avaliados apresentaram baixa capacidade preditiva no conjunto de teste, com coeficientes de determinação negativos, indicando que suas previsões foram, em média, inferiores a uma estratégia ingênua. Apesar das diferenças marginais nas previsões, estas geraram variações no desempenho econômico das estratégias, embora de baixa magnitude e instáveis ao longo do tempo. O modelo LightGBM obteve o melhor desempenho econômico, mas com ganhos limitados em relação ao benchmark após a incorporação de custos operacionais. Não se observou evidência consistente de geração de retorno ajustado ao risco superior ao benchmark. A principal contribuição do estudo reside na avaliação sistemática de diferentes famílias de modelos de aprendizado de máquina em um mercado emergente desafiador, destacando a importância da modelagem de custos operacionais e a limitada viabilidade prática de estratégias de geração de alpha nas configurações testadas.

As limitações do estudo incluíram a simplificação na modelagem de custos operacionais, que não contemplou componentes como slippage e impacto de mercado, e a restrição do universo de ativos aos 50 mais líquidos, o que limita a generalização dos resultados para ativos de menor negociação. Adicionalmente, a janela de avaliação econômica, de 21 meses, implica sensibilidade dos resultados a condições específicas de mercado. Para estudos futuros, sugere-se a implementação de validação temporal mais robusta, como abordagens walk-forward, o tuning sistemático de hiperparâmetros, a modelagem mais realista de fricções de mercado e a exploração de diferentes regras de construção de portfólio e rebalanceamento, bem como a revisão dos critérios de definição do universo investível.

Referências Bibliográficas

ARISMENDI-ZAMBRANO, J.; LEONE ALEXANDRE, A.; GENARO, A. Intraday returns forecasting using machine learning: evidence from the Brazilian stock market. SSRN Electronic Journal, 2023. DOI: 10.2139/ssrn.5122977. Acesso em: 9 set. 2025.

BENETTI, C.; DECOURT, R.; RENATO, P. The practice of corporate finance in Brazil and in the USA: comparative survey evidence. São Paulo: ICN Business School; Universidade do Vale do Rio dos Sinos; Catholic University of Santiago de Guayaquil, 2007. Disponível em: https://www.researchgate.net/publication/265454641. Acesso em: 4 nov. 2025.

BRITO, A. D. Instability of returns and liquidity during the Covid-19 pandemic: evidence from the Brazilian stock market. Revista de Administração UFSM, v. 17, n. 2, p. 1–19, 2024. Disponível em: https://periodicos.ufsm.br/reaufsm/article/view/84713. Acesso em: 9 set. 2025.

CARVALHO, G. A. de. Pricing of liquidity risk in the Brazilian stock market. Revista Brasileira de Finanças, v. 19, n. 3, p. 67–94, 2021. Disponível em: https://periodicos.fgv.br/rbfin/article/view/81844. Acesso em: 8 set. 2025.

CFA SOCIETY BRASIL. Using machine learning to separate good and bad equity mutual fund managers: evidence from Brazil. São Paulo: CFA Society Brasil, 2024. Disponível em: https://cfasociety.org.br/wp-content/uploads/2024/09/final_paper.pdf. Acesso em: 14 out. 2025.

DE PRADO, M. L. Advances in financial machine learning. Hoboken: John Wiley & Sons, 2018. Acesso em: 7 fev. 2026.

FAMA, E. F.; FRENCH, K. R. A five-factor asset pricing model. Journal of Financial Economics, v. 116, n. 1, p. 1–22, 2015. DOI: 10.1016/j.jfineco.2014.10.010. Acesso em: 10 jan. 2026.

FELIZARDO, C.; PINTO, A. A study on neural network architecture applied to the prediction of Brazilian stock returns. arXiv preprint, arXiv:1901.09143, 2019. Disponível em: https://arxiv.org/abs/1901.09143. Acesso em: 1 nov. 2025.

GIACOMINI, R.; WHITE, H. Tests of conditional predictive ability. Econometrica, v. 74, n. 6, p. 1545-1578, 2006. DOI: 10.1111/j.1468-0262.2006.00718.x. Acesso em: 19 jan. 2026.

GU, S.; KELLY, B.; XIU, D. Empirical asset pricing via machine learning. The Review of Financial Studies, v. 33, n. 5, p. 2223–2273, 2020. DOI: 10.1093/rfs/hhaa009. Acesso em: 19 jan. 2026.

HARVEY, C. R.; LIU, Y.; ZHU, H. …and the cross-section of expected returns. The Review of Financial Studies, v. 29, n. 1, p. 5–68, 2016. DOI: 10.1093/rfs/hhv059. Acesso em: 19 jan. 2026.

HENRIQUE, B. M.; SOBREIRO, V. A.; KIMURA, H. Stock price prediction using support vector regression on daily and up to the minute prices. Journal of Finance and Data Science, v. 5, n. 1, p. 1–12, 2019. DOI: 10.1016/j.jfds.2018.04.003. Acesso em: 1 nov. 2025.

VARTANIAN, P. R. The VIX index and the volatility of the Latin American and G7 markets. International Journal of Economics and Finance, v. 15, n. 4, p. 1–15, 2023. DOI: 10.5539/ijef.v15n12p25. Acesso em: 1 nov. 2025.

Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq

Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

Você também pode gostar

17 de setembro de 2026

Heterogeneidade Territorial do Bolsa Família: uma Análise por Clusters e Efeitos Fixos

O Programa Bolsa Família (PBF) representa uma das políticas de proteção social mais relevantes globalmente, o que justifica a investigação de seus efeitos diante das acentuadas e heterogêneas desigualdades regionais brasileiras. O estudo avaliou os reflexos socioeconômicos dos repasses do programa sobre a saúde, a educação e o mercado de trabalho nos municípios brasileiros, no período de 2004 a 2019. Para isso, aplicou-se a técnica de agrupamento K-means para segmentação territorial e estimaram-se modelos econométricos de dados em painel com efeitos fixos, tanto a nível nacional quanto segregados por clusters. Os resultados revelaram a natureza anticíclica do PBF no mercado de trabalho, com uma relação negativa entre repasses e vínculos empregatícios formais em quatro dos cinco clusters, sugerindo que os recursos foram mais intensos onde o mercado formal falhou. Na saúde, o programa associou-se à redução significante da mortalidade infantil evitável em municípios com maior equilíbrio socioeconômico, mas não apresentou efeito detectável em agrupamentos de maior precariedade estrutural, indicando que a transferência de renda é necessária, porém insuficiente sem infraestrutura de saúde funcional. Na educação, a análise por subperíodos mostrou atenuação progressiva do coeficiente nacional, refletindo a convergência das taxas de matrícula para um patamar de alta inércia temporal. Concluiu-se que o PBF cumpriu seu objetivo de proteção social de forma anticíclica e territorialmente focalizada, mas sua capacidade de transformar indicadores estruturais dependeu da sinergia com investimentos em infraestrutura pública.

Palavras-chave: Bolsa Família; Mortalidade Infantil; Municípios Brasileiros; Painel de Dados; Política Pública.

Gestão Tributária

17 de setembro de 2026

Limites Jurídicos e Práticos da Dedutibilidade Retroativa dos Juros sobre Capital Próprio

A gestão tributária adequada é crucial para a saúde financeira das empresas, especialmente no complexo sistema tributário brasileiro. Os Juros sobre Capital Próprio (JCP) constituem um mecanismo jurídico relevante para a remuneração do capital próprio, utilizado para otimizar a carga tributária. O estudo investigou a controvérsia sobre a dedutibilidade de JCP referentes a exercícios anteriores à deliberação societária que autoriza seu pagamento. Aplicou-se a metodologia de pesquisa e análise documental empírica, baseada em “Normative Systems”, para identificar cinco propriedades representativas dos argumentos jurídicos na jurisprudência administrativa e judicial. Analisaram-se acórdãos do Conselho Administrativo de Recursos Fiscais (CARF), revelando padrões decisórios predominantes, divergências interpretativas, incoerências argumentativas e significativa insegurança jurídica. Os resultados indicaram forte tendência de invalidação dos planejamentos envolvendo JCP extemporâneos na esfera administrativa. Contudo, o julgamento do Tema 1319 pelo Superior Tribunal de Justiça (STJ) seguiu direção oposta, consagrando tese favorável à dedutibilidade e estabelecendo um precedente paradigmático que pode influenciar a jurisprudência administrativa e redefinir os critérios decisórios.

Palavras-chave: CARF; gestão tributária; limitação temporal; lucro real; planejamento tributário.

17 de setembro de 2026

Símbolos da Moda Esportiva: Consumo, Identidade e Status entre Consumidores Brasileiros

A moda esportiva consolidou-se como linguagem simbólica de distinção social nas últimas décadas, impulsionada pela expansão do mercado de wellness e pela reconfiguração dos padrões de prestígio nas sociedades de consumo contemporâneas. O estudo objetivou compreender como os símbolos da moda esportiva influenciaram a construção de identidade e pertencimento e sua associação ao prestígio social entre consumidores brasileiros que adquiriram produtos do setor nos últimos 12 meses. Desenvolveu-se a pesquisa por meio de levantamento bibliográfico e pesquisa descritiva, com levantamento do tipo survey aplicado a uma amostra não probabilística por conveniência de 445 consumidores brasileiros de moda esportiva. Os principais resultados indicaram que a maioria dos respondentes associou marcas esportivas a percepções de status social; mais da metade reconheceu o wellness como novo símbolo de prestígio; e parcela expressiva percebeu o sportstyle como mais aceito em ambientes formais de trabalho. Em contrapartida, formas ostensivas de sinalização, como preferência por logotipos visíveis, influência de redes sociais e disposição a pagar sobrepreço, foram amplamente rejeitadas, revelando uma dissociação entre a atribuição simbólica de status e o comportamento de sinalização ostensiva. O consumidor brasileiro de moda esportiva com elevado capital cultural operou por meio de sinais simbólicos sutis e não ostensivos, compatíveis com o fenômeno do consumo inconspícuo, no qual a distinção social se manifestou de forma internalizada.

Palavras-chave: Consumo inconspícuo; Distinção; Prestígio social; Sportstyle; Wellness.

17 de setembro de 2026

Modelo Validado de Formação de Competência Técnica e Habilidades Não Técnicas em Indústrias Químicas Complexas

Analisou-se a implementação de um processo sistemático para o desenvolvimento e a atualização de competências técnicas e habilidades não técnicas em Operações Industriais e Segurança de Processo em uma indústria química de alta complexidade, pertencente a uma multinacional localizada no Polo Petroquímico de Camaçari, Bahia. O estudo objetivou implementar um processo mensurável e sustentável que assegurou a competência técnica e não técnica de 100% dos operadores, em conformidade com a legislação estadual da Bahia, diretrizes de institutos internacionais e políticas corporativas. A pesquisa caracterizou-se como um estudo de caso de abordagem mista, que envolveu diagnóstico documental, entrevistas semiestruturadas com 85 operadores experientes, análise de tarefas críticas e o desenvolvimento e aplicação piloto de um programa modular de treinamento. Este processo evidenciou a necessidade de alinhamento e atualização sistemática das competências requeridas. Os resultados obtidos indicaram a eficácia do modelo proposto, com 100% dos operadores concluindo os módulos teóricos e práticos e alcançando uma taxa de aprovação superior a 80%, além de conformidade operacional em campo. O trabalho contribuiu com um modelo estruturado de formação, incluindo matriz de competências, programas modulares de treinamento e diretrizes para certificação e recertificação, demonstrando potencial de replicação em outras unidades industriais de elevada complexidade e risco, e fortalecendo a segurança de processo e a sustentabilidade operacional.

Palavras-chave: Capacitação; Competência; Habilidades não técnicas; Segurança de processo; Treinamento.

Compliance E Esg

17 de setembro de 2026

Governança Pública Climática e Enchentes de 2024 no Rio Grande do Sul

As enchentes de 2024 no Rio Grande do Sul evidenciaram fragilidades estruturais na governança pública em um contexto federativo submetido a risco climático extremo. Este trabalho analisou, no recorte temporal de maio de 2024 a maio de 2025, como a atuação federal, estadual e municipal se estruturou diante da crise e em que medida a comparação com os Países Baixos ofereceu parâmetros úteis para o fortalecimento da resiliência institucional. A pesquisa adotou abordagem qualitativa, aplicada, exploratória e comparativa, com análise documental e análise de conteúdo de fontes oficiais, relatórios técnicos internacionais, atos normativos e pronunciamentos institucionais, organizados por categorias temáticas e interpretados com apoio do Modelo das Três Linhas do IIA. Os resultados mostraram que, embora os três níveis de governo tenham criado ou reestruturado instrumentos relevantes de coordenação e reconstrução após o desastre, prevaleceu uma institucionalidade reativa, posterior ao evento, com lacunas de continuidade administrativa, integração preventiva, monitoramento e accountability. Na comparação internacional, o modelo neerlandês destacou-se por combinar autoridade operacional permanente, base territorial clara, financiamento próprio e mecanismos mais robustos de monitoramento e responsabilização. Concluiu-se que os impactos das enchentes foram agravados menos pela ausência formal de normas e mais pela insuficiente articulação entre operação, gestão de riscos e controle. O fortalecimento da governança climática, no caso gaúcho, depende de institucionalizar coordenação, dados, financiamento e accountability em bases permanentes.

Palavras-chave: accountability; adaptação climática; gestão de riscos; governança multinível.

Digital Business

17 de setembro de 2026

Dados e Automação Utilizados em uma Campanha de Marketing na Engenharia Civil

A crescente utilização de dados no marketing digital impulsionou a adoção de estratégias mais orientadas por métricas e desempenho, com o Inbound Marketing em destaque. O uso de ferramentas de Business Intelligence (BI) mostrou-se fundamental para transformar dados em informações estratégicas, apoiando a tomada de decisão e a construção de bases de contatos qualificadas. Analisou-se como a ausência de integração entre sistemas de BI e plataformas de automação de marketing impactou a eficiência operacional e a efetividade das estratégias de Inbound Marketing em uma empresa de engenharia. Para isso, adotou-se uma abordagem descritiva de natureza qualitativa, baseada na análise dos processos operacionais envolvidos, desde a leitura de relatórios extraídos do BI e sua posterior transformação em mailings, até a preparação para importação no RD Station. Os resultados indicaram que o processo atual dependia de etapas manuais e empíricas, demandando tempo significativo. Identificaram-se limitações relacionadas à ausência de integração entre os sistemas, o que impactou diretamente a eficiência operacional e aumentou a dependência de atividades repetitivas. Concluiu-se que a estruturação adequada do processo de gestão de mailings e a integração entre BI e ferramentas de automação de marketing representam uma oportunidade para otimizar fluxos, melhorar a qualidade dos dados e fortalecer as estratégias de Inbound Marketing.

Palavras-chave: Automação de Marketing; Business Intelligence; Inbound Marketing; Integração de Sistemas; RD Station.

17 de setembro de 2026

Detecção de Anomalias no Monitoramento de Saúde de Pontes Usando Redes Neurais

O monitoramento da saúde estrutural de pontes tornou-se cada vez mais relevante diante do envelhecimento das infraestruturas e da intensificação de eventos extremos associados às mudanças climáticas. Nesse contexto, abordagens baseadas em dados destacaram-se como alternativas promissoras para o reconhecimento de anomalias. O estudo objetivou desenvolver e avaliar uma abordagem baseada em aprendizado de máquina para o reconhecimento de anomalias em séries temporais de aceleração estrutural. A metodologia adotada consistiu no uso de autoencoders treinados exclusivamente com dados representativos da condição íntegra, permitindo ao modelo aprender padrões associados ao estado saudável da estrutura; em seguida, o erro de reconstrução, quantificado por meio do erro quadrático médio (MSE), foi utilizado como critério para identificação de desvios em relação a essa condição. O conjunto de dados analisado foi composto por 1767 séries temporais de 1000 pontos cada, pertencentes a duas classes: íntegra (normal) e anômala (danificada). Os resultados obtidos demonstraram que o modelo proposto apresentou elevada capacidade de reconhecimento da classe anômala, com taxa de detecção superior a 90%, e desempenho global satisfatório, com área sob a curva ROC (AUC) próxima de 0,78, indicando boa capacidade discriminativa e reforçando o potencial da abordagem para aplicações em monitoramento estrutural.

Palavras-chave: Autoencoders; Detecção de Anomalias; Monitoramento de Pontes; Redes Neurais.

17 de setembro de 2026

Gestão Escolar Integrada: o Papel da Direção Administrativa na Capacitação da Equipe de Gestão Pedagógica para a Compreensão do Orçamento Escolar

A administração escolar foi abordada sob a perspectiva da integração entre gestores administrativos e pedagógicos, com foco na participação democrática, capacitação e qualificação dos atores. O objetivo geral consistiu na elaboração de um Guia de Orientações para Orçamento, direcionado à equipe de gestão pedagógica e mediado pela direção administrativa, visando instrumentalizar esses profissionais para a compreensão e participação nos processos financeiros e decisórios da instituição. Para tanto, o estudo desenvolveu-se em uma instituição particular privada, adotando uma abordagem qualitativa, descritiva e aplicada, com procedimento metodológico de estudo de caso. A pesquisa mapeou desafios práticos e dificuldades de comunicação entre os setores, analisou referenciais teóricos da gestão escolar e estruturou o instrumento formativo proposto. Os resultados demonstraram que a ausência de integração entre as áreas administrativa e pedagógica pode comprometer a efetividade da gestão escolar, evidenciando a necessidade de processos formativos contínuos que promovam entendimento mútuo, cooperação e construção coletiva de soluções. O Guia proposto fortaleceu a gestão democrática, elevou a qualificação da equipe pedagógica e melhorou os processos decisórios institucionais, destacando o papel formativo e estratégico do diretor administrativo.

Palavras-chave: Comunicação escolar; Gestão escolar participativa; Orçamento escolar.

Inscreva-se em nossa newsletter!

Receba conteúdos e fique sempre atualizado sobre as novidades em gestão, liderança e carreira com a Revista E&S.

Ao preencher o formulário você está ciente de que podemos enviar comunicações e conteúdos da Revista E&S. Confira nossa Política de Privacidade