vic35get/nhtsa_complaints_dataset
NHTSA Complaints Dataset Este dataset contém reclamações de veículos coletadas pela National Highway Traffic Safety Administration (NHTSA) entre 2014 e 2024. O objetivo do dataset é classificar o tipo de componente veicular relatado nas reclamações. O dataset foi criado para ser utilizado em tarefas de classificação de texto, com foco em Processamento de Linguagem Natural (NLP) e Machine Learning. Tarefa Classificação de texto: O conjunto de dados consiste em uma… See the full description on the dataset page: https://huggingface.co/datasets/vic35get/nhtsa_complaints_dataset.
NHTSA Complaints Dataset
Este dataset contém reclamações de veículos coletadas pela National Highway Traffic Safety Administration (NHTSA) entre 2014 e 2024. O objetivo do dataset é classificar o tipo de componente veicular relatado nas reclamações. O dataset foi criado para ser utilizado em tarefas de classificação de texto, com foco em Processamento de Linguagem Natural (NLP) e Machine Learning.
Tarefa
Classificação de texto: O conjunto de dados consiste em uma abordagem multiclasse de reclamações de diferentes categorias de componentes veiculares. As categorias são:
- ELECTRICAL SYSTEM
- AIR BAGS
- STRUCTURE
- SERVICE BRAKES
- OTHER (categoria usada para outras classes menos frequentes ou classes combinadas)
Descrição dos Dados
O dataset contém informações sobre as reclamações de veículos, incluindo o tipo de problema relatado, a marca e modelo do veículo, e outras informações relacionadas. Os dados foram adquiridos diretamente da API oficial da NHTSA, que são fornecidos em formato JSON.
Arquivos
train.csv: Conjunto de treinamento (8.357 amostras)eval.csv: Conjunto de validação (2.090 amostras)test.csv: Conjunto de teste (2.090 amostras)
Estrutura do Arquivo
Cada arquivo contém as seguintes colunas:
- odiNumber: Número da reclamação
- dateComplaintFiled: Data em que a reclamação foi registrada
- components: Categoria de componente relacionado à reclamação (anotação fraca).
- summary: Descrição resumida da reclamação
- label: Categoria de componente relacionado à reclamação (anotação utilizada).
Aquisição dos Dados
Os dados foram adquiridos diretamente da API da NHTSA. A coleta foi realizada em várias etapas:
- Obtenção dos anos de modelo.
- Obtenção das marcas de veículos por ano.
- Obtenção dos modelos de veículos por marca e ano.
- Obtenção das reclamações registradas para cada veículo.
Os dados foram armazenados em arquivos JSON e, posteriormente, processados e salvos em arquivos CSV.
Processamento e Limpeza de Dados
O dataset passou por um processo de limpeza, que incluiu:
- Filtragem de Dados: Apenas as colunas relevantes foram mantidas.
- Conversão de Datas: A coluna
dateComplaintFiledfoi convertida para o formato datetime. - Remoção de Dados Duplicados e Nulos: Reclamações sem descrição ou sem categoria foram descartadas.
- Balanceamento de Classes: Técnicas de balanceamento foram aplicadas para garantir uma distribuição uniforme das classes no conjunto de treinamento.
- Limpeza de Texto: Remoção de caracteres especiais, normalização de texto e conversão para caixa baixa.
Os dados foram divididos em três conjuntos: treinamento, validação e teste, com as seguintes distribuições de classe:
Como Usar
Exemplo de Código para Carregar o Dataset
from datasets import load_dataset
# Carregar o dataset
dataset = load_dataset("vic35get/nhtsa_complaints_dataset")
# Visualizar os dados de treinamento
print(dataset["train"][0])
