Um framework para análise da relação entre tamanho e complexidade de conjuntos de dados
DOI:
https://doi.org/10.5335/rbca.v13i2.10898Palavras-chave:
Bagging, Boosting, Medidas de Complexidade, Tamanho do Conjunto de DadosResumo
Na área de Reconhecimento de Padrões, um problema de classificação é dito complexo quando as observações de classes diferentes apresentam elevada semelhança. Ao reconhecer a estimativa de complexidade como um fator importante na obtenção de acurácia, a literatura propôs uma variedade de descritores de complexidade. Porém, não se sabe a sensibilidade desses descritores quanto a variação do tamanho dos conjuntos de treinamento. Neste trabalho, este comportamento foi analisado. Os descritores foram medidos em 20.800 subconjuntos criados a partir de: i) 26 problemas de classificação, ii) 2 geradores e iii) 4 tamanhos. Os resultados comprovaram que a sensibilidade dos descritores ao tamanho é uma realidade, sendo menos perceptíveis em F1, F2, L2, N4, L3, T1, D2 e D3. Já as métricas F3, F4, N1, N2 e N3 são mais influenciadas por variações no número de instâncias presentes no conjunto.
Downloads
Downloads
Publicado
Edição
Seção
Licença

Todos os artigos estão licenciados com a licença Creative Commons Atribuição-NãoComercial-SemDerivações 4.0 Internacional. Autores que publicam nesta revista concordam com os seguintes termos:
a) Autores mantém os direitos autorais e concedem à revista o direito de primeira publicação, com o trabalho simultaneamente licenciado sob a Licença Creative Commons Attribution que permite o compartilhamento do trabalho com reconhecimento da autoria e publicação inicial nesta revista.
b) Autores têm autorização para assumir contratos adicionais separadamente, para distribuição não-exclusiva da versão do trabalho publicada nesta revista (ex.: publicar em repositório institucional ou como capítulo de livro), com reconhecimento de autoria e publicação inicial nesta revista.
c) Autores têm permissão e são estimulados a publicar e distribuir seu trabalho online (ex.: em repositórios institucionais ou na sua página pessoal) a qualquer ponto antes ou durante o processo editorial, já que isso pode gerar alterações produtivas, bem como aumentar o impacto e a citação do trabalho publicado (Veja O Efeito do Acesso Livre).