datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
fipex-veiculos-brasil
fipeX: Dataset Completo da Tabela FIPE
Este dataset contém preços históricos e atuais de veículos comercializados no Brasil, baseados na Tabela FIPE (Fundação Instituto de Pesquisas Econômicas).
Os dados são extraídos e organizados pelo projeto fipeX — uma iniciativa independente para facilitar o acesso a dados automotivos públicos, com API pública gratuita e este dataset em domínio público.
Licença: CC0-1.0 — domínio público. Use livremente, inclusive comercialmente, sem… See the full description on the dataset page: https://huggingface.co/datasets/alanwgt/fipex-veiculos-brasil.ibge-nomes-no-brasil-2022
IBGE Nomes no Brasil 2022
Este dataset reúne os nomes próprios e sobrenomes no Brasil disponibilizados pelo Censo Demográfico 2022 do IBGE, organizados em um modelo relacional e distribuídos em arquivos Parquet.
A base contém cerca de 128 mil nomes e 202 mil sobrenomes, com dados de frequência, ranking, distribuição por sexo, idade mediana, evolução por década, variantes de grafia e distribuição geográfica até o nível de município (5.570).
Também inclui os verbetes editoriais de… See the full description on the dataset page: https://huggingface.co/datasets/olob0/ibge-nomes-no-brasil-2022.cpc_2015_brasil
SALVAMENTO do Dataset
from datasets import load_dataset
from datasets import Dataset
import pandas as pd
# Carregar os dados do arquivo de texto
df = pd.read_parquet('../data/cpc_2015_cleaned.parquet')
data = {
"livro": df["Livro"],
"capitulo": df["Capitulo"],
"titulo": df["Titulo"],
"secao": df["Secao"],
"subsecao": df["Subsecao"],
"artigo": df["Artigo"]
}
# Dividir o texto em seções
dataset = Dataset.from_pandas(pd.DataFrame(data))… See the full description on the dataset page: https://huggingface.co/datasets/0rakul0/cpc_2015_brasil.importacoes-tarifas-brasilsmoke-openai-terra-batch-brasil-25-20260724-01
Smoke OpenAI Terra Batch — Brasil × 25 tasks
Run real de validação do fluxo matricial document_task_matrix, executada
sobre um único documento da Wikipédia em português com o título Brasil.
Cada uma das 25 tasks canônicas recebeu exatamente um slot inicial.
Resultado
status: completed
documentos: 1
pares planejados: 25
exemplos aceitos: 25
pares pulados: 0
pares esgotados: 0
resultados reais do backend: 27
retries com nova chamada: 2
backend: openai_api… See the full description on the dataset page: https://huggingface.co/datasets/costadev00/smoke-openai-terra-batch-brasil-25-20260724-01.OIG_small_chip2_portuguese_brasil
Dataset Card for "OIG_small_chip2_portuguese_brasil"
This dataset was translated to Portuguese-Brasil from here
The data was translated with MarianMT model and weights Helsinki-NLP/opus-mt-en-ROMANCE
The full details to replicate the translation are here: translation_notebook
license: apache-2.0
codigo_penal_brasileiro_lei_2848_1940concursos-publicos-brasil
Brazilian Public Service Exams (Concursos Públicos), 2015–2026
Structured records of Brazilian public service exam notices ("concursos
públicos"), organized from official sources and published as a single CSV.
Maintained by Radar de Concurso.
Full methodology, coverage limits, and the always-current download:
https://radardeconcurso.com.br/dados
What this is — and what it is not
This is not the universe of Brazilian public exams. Reading it as if it
were produces… See the full description on the dataset page: https://huggingface.co/datasets/LucasGiraldi/concursos-publicos-brasil.girias-brasileirafipex-veiculos-brasil
fipeX: Dataset Completo da Tabela FIPE
Este dataset contém preços históricos e atuais de veículos comercializados no Brasil, baseados na Tabela FIPE (Fundação Instituto de Pesquisas Econômicas).
Os dados foram extraídos e organizados pelo projeto fipeX, uma iniciativa independente para facilitar o acesso a dados automotivos públicos.
Sobre o Dataset
Este conjunto de dados é ideal para:
Análise de depreciação de veículos
Previsão de preços (Machine Learning)
Estudos… See the full description on the dataset page: https://huggingface.co/datasets/joaosilva424/fipex-veiculos-brasil.crime_brasil_rs_2022_2026
crime_brasil_rs_2022_2026 (TsFile)
Apache TsFile version of valdovaldo1500/crime-brasil-rs-2022-2026.
Converted rows: 522,336
Data files: ['crime_brasil_rs_2022_2026.tsfile']
Usage
Install the Apache TsFile Python SDK (pip install tsfile) and read a converted file:
from pathlib import Path
from tsfile import TsFileReader
path = Path("crime_brasil_rs_2022_2026.tsfile")
with TsFileReader(str(path)) as reader:
schemas = reader.get_all_table_schemas()… See the full description on the dataset page: https://huggingface.co/datasets/THULab/crime_brasil_rs_2022_2026.adaoduque_campeonato-brasileiro-de-futebol
Campeonato Brasileiro de futebol
Campeonato Brasileiro de Futebol
Dataset Info
Source: Kaggle
Original Size: 0.67 MB
Kaggle Downloads: 13,811
Files: 5
Files
Legenda.txt
campeonato-brasileiro-cartoes.csv
campeonato-brasileiro-estatisticas-full.csv
campeonato-brasileiro-full.csv
campeonato-brasileiro-gols.csv
Mirrored from Kaggle
texto-clinico-brasileiro
Texto Clinico Brasileiro
Dataset unificado de texto clinico em portugues brasileiro para NLP.
Agrega multiplos datasets publicos em um schema Parquet padronizado, facilitando
o treinamento e avaliacao de modelos de linguagem para o dominio clinico.
Conteudo
Dataset
Registros
Tipo
Acesso
Fonte
MedPT
384.085
Perguntas e respostas medicas
Livre
AKCIT/MedPT
Sepse HC-RP
200
Resumos de alta hospitalar
Livre
Dataverse
Total: 384.285 registros | Tamanho: ~95 MB… See the full description on the dataset page: https://huggingface.co/datasets/LABDAPS/texto-clinico-brasileiro.Brasil
🇧🇷 Brasil — Textos Literários Brasileiros
Dataset de textos em português brasileiro para pré-treinamento e fine-tuning de modelos de linguagem. O corpus é composto por obras literárias clássicas brasileiras em domínio público, com foco na riqueza linguística e cultural do Brasil.
📚 Conteúdo atual
Obra
Autor
Ano
Palavras (aprox.)
Obra A
Autor Brasileiro 1
1880
~80.000
Obra B
Autor Brasileiro 2
1902
~65.000
Obra C
Autor Brasileiro 3
1925
~90.000
📌… See the full description on the dataset page: https://huggingface.co/datasets/jinilson/Brasil.codigo_civil_brasileiro_lei_10406_2002mapa-da-discriminacao-racial-no-brasil
Mapa da Discriminação Racial no Brasil
Este dataset contém coeficientes de discriminação racial por município no Brasil, calculados a partir de dados do Censo Demográfico.
Variáveis
cod_mun: Código do município (IBGE)
coef: Coeficiente base (intercepto) para cada município
mulher_negra: Coeficiente para mulheres negras
homem_negro: Coeficiente para homens negros
mulher_branca: Coeficiente para mulheres brancas
superior: Coeficiente para pessoas com ensino… See the full description on the dataset page: https://huggingface.co/datasets/atlas-da-saude-mental/mapa-da-discriminacao-racial-no-brasil.agua_e_esgoto_nordeste_brasileiro
Brazilian Northeast Water and Sanitation Crisis Dataset (BNWSC)
Overview
This dataset provides multidisciplinary data on water access, sanitation, public health, and socioeconomic disparities in Brazil's Northeast region. It integrates official sources (2014–2022) and includes projections up to 2030, supporting research in public policy, collective health, and sustainability.
Key Features
Applications
Correlation analysis between sanitation, income… See the full description on the dataset page: https://huggingface.co/datasets/carpenterbb/agua_e_esgoto_nordeste_brasileiro.texto-clinico-brasileiro
Texto Clinico Brasileiro
Dataset unificado de texto clinico em portugues brasileiro para NLP.
Agrega multiplos datasets publicos em um schema Parquet padronizado, facilitando
o treinamento e avaliacao de modelos de linguagem para o dominio clinico.
Conteudo
Dataset
Registros
Tipo
Acesso
Fonte
MedPT
384.085
Perguntas e respostas medicas
Livre
AKCIT/MedPT
Sepse HC-RP
200
Resumos de alta hospitalar
Livre
Dataverse
Total: 384.285 registros | Tamanho: ~95 MB… See the full description on the dataset page: https://huggingface.co/datasets/fabianonbfilho/texto-clinico-brasileiro.adaption-pt-afro-brasileiro-qa
This dataset is a remastered version prepared using Adaption's Adaptive Data platform.
adaption-pt_afro_brasileiro_qa
This dataset contains question-answer pairs in Portuguese focusing on the linguistic features of Afro-Brazilian Portuguese, such as reduced nominal agreement and preposition variation. The content provides historical context, sociolinguistic analysis, and references to academic research to explain these phenomena as regular grammatical systems rather than… See the full description on the dataset page: https://huggingface.co/datasets/Fernandosr85/adaption-pt-afro-brasileiro-qa.brasil-homicidios-municipio-2018-2024
Homicídios por município no Brasil (2018–2024) / Homicides by municipality in Brazil
One-line: Annual intentional-homicide counts and rates per 100k inhabitants for 5,050 Brazilian municipalities, 2018–2024. A clean, analysis-ready summary compiled from official DataSUS mortality microdata (SIM).
Files
brasil-homicidios-por-municipio-2018-2024.csv — 27,296 rows
Columns
column
description
uf
state (2-letter UF)
city_slug
municipality… See the full description on the dataset page: https://huggingface.co/datasets/valdovaldo1500/brasil-homicidios-municipio-2018-2024.ctb_codigo_de_transito_brasileiro_lei_9_503_1997synapse-nomes-brasileiros🇧🇷 Synapse Nomes brasileiros
Dataset de nomes brasileiros em linguagem natural desenvolvido pela Comunidade Synapse BR.
O dataset contém exemplos de interações em português brasileiro envolvendo sugestões e geração de nomes, desenvolvido para aplicações de Processamento de Linguagem Natural (PLN) e treinamento de modelos de linguagem.
📊 Estrutura
Cada exemplo contém:
"prompt" — solicitação ou contexto fornecido ao modelo.
"completion" — resposta correspondente em português brasileiro.
📤… See the full description on the dataset page: https://huggingface.co/datasets/Comunidade-Synapse-BR/synapse-nomes-brasileiros.Word_Brasil_V0001brasil-newssmoke-gemma4-matrix-brasil-25-v3-20260724-09
Smoke Gemma 4 — matriz de 25 tasks sobre Brasil
Run real de validação do fluxo matricial document_task_matrix, executada sobre o
documento Brasil da Wikipédia em português.
Resultado
status: completed
documentos: 1
pares planejados: 25
exemplos aceitos: 25
pares pulados: 0
pares esgotados: 0
chamadas reais: 27
backend: vllm_local
modelo: google/gemma-4-31B-it-qat-w4a16-ct
As 25 tasks canônicas foram executadas uma vez cada. Todos os slots terminaram
aceitos;… See the full description on the dataset page: https://huggingface.co/datasets/costadev00/smoke-gemma4-matrix-brasil-25-v3-20260724-09.dataset-ncm-brasil-jsonl-training
🇧🇷 NCM Brasil 2026: Dataset de Classificação Fiscal (Amostra)
Pare de perder tempo limpando notas fiscais. Treine sua IA com dados validados.
📄 Sobre o Dataset
Este repositório contém uma AMOSTRA GRÁTIS (Sample) do dataset NCM Brasil 2026.
O dataset foi projetado para Fine-Tuning de LLMs (Llama 3, Mistral, GPT) para tarefas de Classificação Fiscal Automática de produtos brasileiros.
🎯 Diferenciais (Por que usar?)
Dados Reais: Extraídos de Notas… See the full description on the dataset page: https://huggingface.co/datasets/MonegattoAI/dataset-ncm-brasil-jsonl-training.merged_cemig-ceia__sites_educacionais_brasil_escola_by_promptcrime-brasil-rs-2022-2026
Crime Brasil — Rio Grande do Sul 2022-2025 (aggregated)
522,000+ aggregated crime records from Rio Grande do Sul State Police (SSP-RS), 2022-2025.
This dataset has been aggregated at the municipality × month × crime-type level to protect individual records. No PII — no victim age, sex, race, or coordinates.
Released under Brazil's Lei de Acesso à Informação (LAI).
Scope
497 municipalities across RS
Monthly totals per crime type and subtype
2022–2025 time series… See the full description on the dataset page: https://huggingface.co/datasets/valdovaldo1500/crime-brasil-rs-2022-2026.agent_eval_questions
Agent Questions Generated Pt-Br
Detalhes do Dataset
Descrição
Desenvolvidor por:
Álvaro Lopes. Linkedin
Artur de Vlieger Linkedin
Fabrício Salomon Linkedin
Leticia Bossatto Marchezi Linkedin
Luis Felipe Jorge Linkedin
Otávio Coletti Linkedin
Patrocinado por : Pico
Língua(s) (NLP) :Português
Correspondência: raia.projetos@gmail.com, leticiabossatto@gmail.com
Fontes
Repositório: Github
Uso
O dataset pode ser utilizado… See the full description on the dataset page: https://huggingface.co/datasets/RAIA-BRASIL/agent_eval_questions.contituicao-federal-do-brasil
