Generalização de Sistemas de Detecção de Intrusão baseados em Aprendizado de Máquina

Tese de Doutorado
por Caroline Félix de Oliveira
Publicado: 28/08/2026 - 13:49
Última modificação: 28/08/2026 - 13:49

Linha de pesquisa: Sistemas de Computação

Resumo: O crescimento contínuo das ameaças cibernéticas e a evolução dos ataques de rede evidenciam a necessidade de Sistemas de Detecção de Intrusão em Redes (NIDS) mais robustos e capazes de operar em ambientes heterogêneos. Embora técnicas baseadas em aprendizado de máquina tenham ampliado o desempenho desses sistemas, sua capacidade de generalização permanece limitada, sobretudo quando modelos treinados em um único conjunto de dados são expostos a domínios de tráfego distintos. A literatura mostra que variações no ambiente de rede e na natureza dos ataques podem provocar quedas signifi cativas de desempenho, revelando lacunas relacionadas à qualidade e à representatividade dos dados utilizados no treinamento. Diante desse cenário, esta tese investiga estratégias de intervenção aplicadas a con juntos de dados públicos (UNSW-NB15, CIC-IDS2017 e CIC-IDS2018), com o objetivo de aprimorar a generalização de modelos de detecção de intrusão. Duas classes de in tervenções são exploradas: (i) intervenções no domínio dos atributos de dados, incluindo técnicas de redução de dimensão e seleção de atributos; e (ii) intervenções no domínio das instâncias de dados, envolvendo a integração de fluxos normais e maliciosos proveni entes de diferentes cenários de tráfego. Essas intervenções foram avaliadas em modelos supervisionados (XGBoost e um modelo ensemble composto por Logistic Regression– LR, k-Nearest Neighbours– kNN, Support Vector Machine– SVM, Naive Bayes– NB, Random Forest– RF e Multilayer Perceptron Classifier– MLP) e não supervisionados (Isolation Forest– iForest), empregados para avaliar a detecção entre múltiplos domínios. Os resultados demonstram que as intervenções propostas são promissoras em alguns cenários e impactam positivamente a capacidade de generalização dos modelos, favore cendo a identificação de ataques não vistos durante a fase de treinamento. Além disso, a abordagem desenvolvida assegura a reprodutibilidade e possibilita comparações consis tentes entre diferentes cenários experimentais. Como contribuições, o trabalho apresenta evidências empíricas sobre o impacto das intervenções na melhoria da generalização, de monstra o potencial da integração de fluxos provenientes de múltiplos domínios, realiza uma análise sistemática de validação cruzada entre conjuntos de dados heterogêneos e disponibiliza versões modificadas desses conjuntos para uso em pesquisas futuras.

Link para a defesa: https://teams.microsoft.com/dl/launcher/launcher.html?url=%2F_%23%2Fmeet...

Banca Examinadora: 
Silvio Ereno Quincozes - Universidade Federal do Pampa, Campus alegrete.
Elaine Ribeiro de Faria Paiva - Universidade Federal de Uberlândia, Centro de Ciências Exatas e Tecnologia, Faculdade de Computação.
Lourenço Alves Pereira Júnior - Instituto Tecnológico de Aeronáutica, Divisão de Ciência da Computação, Departamento de Sistemas de Computação.
Carla Merkle Westphall - Universidade Federal de Santa Catarina, CTC-INE (Centro Tecnológico - Departamento de Informática e Estatística.
Data e Horário: 
09/09/2026 - 09:00
Virtual, 2121 1B
Uberlândia, Minas Gerais, Brasil
38400-902
Campus Santa Mônica - Bloco 1B - Sala 230
Complemento: 
1B