Generalização de Sistemas de Detecção de Intrusão baseados em Aprendizado de Máquina
Publicado: 28/08/2026 - 13:49
Última modificação: 28/08/2026 - 13:49
Linha de pesquisa: Sistemas de Computação
Resumo: O crescimento contínuo das ameaças cibernéticas e a evolução dos ataques de rede evidenciam a necessidade de Sistemas de Detecção de Intrusão em Redes (NIDS) mais robustos e capazes de operar em ambientes heterogêneos. Embora técnicas baseadas em aprendizado de máquina tenham ampliado o desempenho desses sistemas, sua capacidade de generalização permanece limitada, sobretudo quando modelos treinados em um único conjunto de dados são expostos a domínios de tráfego distintos. A literatura mostra que variações no ambiente de rede e na natureza dos ataques podem provocar quedas signifi cativas de desempenho, revelando lacunas relacionadas à qualidade e à representatividade dos dados utilizados no treinamento. Diante desse cenário, esta tese investiga estratégias de intervenção aplicadas a con juntos de dados públicos (UNSW-NB15, CIC-IDS2017 e CIC-IDS2018), com o objetivo de aprimorar a generalização de modelos de detecção de intrusão. Duas classes de in tervenções são exploradas: (i) intervenções no domínio dos atributos de dados, incluindo técnicas de redução de dimensão e seleção de atributos; e (ii) intervenções no domínio das instâncias de dados, envolvendo a integração de fluxos normais e maliciosos proveni entes de diferentes cenários de tráfego. Essas intervenções foram avaliadas em modelos supervisionados (XGBoost e um modelo ensemble composto por Logistic Regression– LR, k-Nearest Neighbours– kNN, Support Vector Machine– SVM, Naive Bayes– NB, Random Forest– RF e Multilayer Perceptron Classifier– MLP) e não supervisionados (Isolation Forest– iForest), empregados para avaliar a detecção entre múltiplos domínios. Os resultados demonstram que as intervenções propostas são promissoras em alguns cenários e impactam positivamente a capacidade de generalização dos modelos, favore cendo a identificação de ataques não vistos durante a fase de treinamento. Além disso, a abordagem desenvolvida assegura a reprodutibilidade e possibilita comparações consis tentes entre diferentes cenários experimentais. Como contribuições, o trabalho apresenta evidências empíricas sobre o impacto das intervenções na melhoria da generalização, de monstra o potencial da integração de fluxos provenientes de múltiplos domínios, realiza uma análise sistemática de validação cruzada entre conjuntos de dados heterogêneos e disponibiliza versões modificadas desses conjuntos para uso em pesquisas futuras.
Link para a defesa: https://teams.microsoft.com/dl/launcher/launcher.html?url=%2F_%23%2Fmeet...