CoolFace
30 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01alanwgt /fipex-veiculos-brasil fipeX: Dataset Completo da Tabela FIPE Este dataset contém preços históricos e atuais de veículos comercializados no Brasil, baseados na Tabela FIPE (Fundação Instituto de Pesquisas Econômicas). Os dados são extraídos e organizados pelo projeto fipeX — uma iniciativa independente para facilitar o acesso a dados automotivos públicos, com API pública gratuita e este dataset em domínio público. Licença: CC0-1.0 — domínio público. Use livremente, inclusive comercialmente, sem… See the full description on the dataset page: https://huggingface.co/datasets/alanwgt/fipex-veiculos-brasil.tabulartabular-regression10M<n<100M12 likes1.1k downloads22d agoHugging Face02olob0 /ibge-nomes-no-brasil-2022 IBGE Nomes no Brasil 2022 Este dataset reúne os nomes próprios e sobrenomes no Brasil disponibilizados pelo Censo Demográfico 2022 do IBGE, organizados em um modelo relacional e distribuídos em arquivos Parquet. A base contém cerca de 128 mil nomes e 202 mil sobrenomes, com dados de frequência, ranking, distribuição por sexo, idade mediana, evolução por década, variantes de grafia e distribuição geográfica até o nível de município (5.570). Também inclui os verbetes editoriais de… See the full description on the dataset page: https://huggingface.co/datasets/olob0/ibge-nomes-no-brasil-2022.tabulartabular-classification1M<n<10M0 likes635 downloads2mo agoHugging Face030rakul0 /cpc_2015_brasil SALVAMENTO do Dataset from datasets import load_dataset from datasets import Dataset import pandas as pd # Carregar os dados do arquivo de texto df = pd.read_parquet('../data/cpc_2015_cleaned.parquet') data = { "livro": df["Livro"], "capitulo": df["Capitulo"], "titulo": df["Titulo"], "secao": df["Secao"], "subsecao": df["Subsecao"], "artigo": df["Artigo"] } # Dividir o texto em seções dataset = Dataset.from_pandas(pd.DataFrame(data))… See the full description on the dataset page: https://huggingface.co/datasets/0rakul0/cpc_2015_brasil.texttext-classification10K<n<100K3 likes67 downloads2y agoHugging Face04ViniForger /importacoes-tarifas-brasiltabular100K<n<1M0 likes62 downloads20d agoHugging Face05costadev00 /smoke-openai-terra-batch-brasil-25-20260724-01 Smoke OpenAI Terra Batch — Brasil × 25 tasks Run real de validação do fluxo matricial document_task_matrix, executada sobre um único documento da Wikipédia em português com o título Brasil. Cada uma das 25 tasks canônicas recebeu exatamente um slot inicial. Resultado status: completed documentos: 1 pares planejados: 25 exemplos aceitos: 25 pares pulados: 0 pares esgotados: 0 resultados reais do backend: 27 retries com nova chamada: 2 backend: openai_api… See the full description on the dataset page: https://huggingface.co/datasets/costadev00/smoke-openai-terra-batch-brasil-25-20260724-01.texttext-generationn<1K0 likes61 downloads2mo agoHugging Face06paulofinardi /OIG_small_chip2_portuguese_brasil Dataset Card for "OIG_small_chip2_portuguese_brasil" This dataset was translated to Portuguese-Brasil from here The data was translated with MarianMT model and weights Helsinki-NLP/opus-mt-en-ROMANCE The full details to replicate the translation are here: translation_notebook license: apache-2.0 text100K<n<1M16 likes56 downloads4y agoHugging Face07celsowm /codigo_penal_brasileiro_lei_2848_1940textn<1K1 likes56 downloads12d agoHugging Face08LucasGiraldi /concursos-publicos-brasil Brazilian Public Service Exams (Concursos Públicos), 2015–2026 Structured records of Brazilian public service exam notices ("concursos públicos"), organized from official sources and published as a single CSV. Maintained by Radar de Concurso. Full methodology, coverage limits, and the always-current download: https://radardeconcurso.com.br/dados What this is — and what it is not This is not the universe of Brazilian public exams. Reading it as if it were produces… See the full description on the dataset page: https://huggingface.co/datasets/LucasGiraldi/concursos-publicos-brasil.tabulartabular-classificationn<1K0 likes53 downloads22d agoHugging Face09Skskskd /girias-brasileiratext1K<n<10K0 likes52 downloads1mo agoHugging Face10joaosilva424 /fipex-veiculos-brasil fipeX: Dataset Completo da Tabela FIPE Este dataset contém preços históricos e atuais de veículos comercializados no Brasil, baseados na Tabela FIPE (Fundação Instituto de Pesquisas Econômicas). Os dados foram extraídos e organizados pelo projeto fipeX, uma iniciativa independente para facilitar o acesso a dados automotivos públicos. Sobre o Dataset Este conjunto de dados é ideal para: Análise de depreciação de veículos Previsão de preços (Machine Learning) Estudos… See the full description on the dataset page: https://huggingface.co/datasets/joaosilva424/fipex-veiculos-brasil.tabulartabular-regression10M<n<100M1 likes48 downloads5mo agoHugging Face11THULab /crime_brasil_rs_2022_2026 crime_brasil_rs_2022_2026 (TsFile) Apache TsFile version of valdovaldo1500/crime-brasil-rs-2022-2026. Converted rows: 522,336 Data files: ['crime_brasil_rs_2022_2026.tsfile'] Usage Install the Apache TsFile Python SDK (pip install tsfile) and read a converted file: from pathlib import Path from tsfile import TsFileReader path = Path("crime_brasil_rs_2022_2026.tsfile") with TsFileReader(str(path)) as reader: schemas = reader.get_all_table_schemas()… See the full description on the dataset page: https://huggingface.co/datasets/THULab/crime_brasil_rs_2022_2026.timeseriestime-series-forecasting0 likes42 downloads8d agoHugging Face12jason1966 /adaoduque_campeonato-brasileiro-de-futebol Campeonato Brasileiro de futebol Campeonato Brasileiro de Futebol Dataset Info Source: Kaggle Original Size: 0.67 MB Kaggle Downloads: 13,811 Files: 5 Files Legenda.txt campeonato-brasileiro-cartoes.csv campeonato-brasileiro-estatisticas-full.csv campeonato-brasileiro-full.csv campeonato-brasileiro-gols.csv Mirrored from Kaggle text0 likes33 downloads6mo agoHugging Face13LABDAPS /texto-clinico-brasileiro Texto Clinico Brasileiro Dataset unificado de texto clinico em portugues brasileiro para NLP. Agrega multiplos datasets publicos em um schema Parquet padronizado, facilitando o treinamento e avaliacao de modelos de linguagem para o dominio clinico. Conteudo Dataset Registros Tipo Acesso Fonte MedPT 384.085 Perguntas e respostas medicas Livre AKCIT/MedPT Sepse HC-RP 200 Resumos de alta hospitalar Livre Dataverse Total: 384.285 registros | Tamanho: ~95 MB… See the full description on the dataset page: https://huggingface.co/datasets/LABDAPS/texto-clinico-brasileiro.texttext-generation100K<n<1M2 likes33 downloads6mo agoHugging Face14jinilson /Brasil 🇧🇷 Brasil — Textos Literários Brasileiros Dataset de textos em português brasileiro para pré-treinamento e fine-tuning de modelos de linguagem. O corpus é composto por obras literárias clássicas brasileiras em domínio público, com foco na riqueza linguística e cultural do Brasil. 📚 Conteúdo atual Obra Autor Ano Palavras (aprox.) Obra A Autor Brasileiro 1 1880 ~80.000 Obra B Autor Brasileiro 2 1902 ~65.000 Obra C Autor Brasileiro 3 1925 ~90.000 📌… See the full description on the dataset page: https://huggingface.co/datasets/jinilson/Brasil.text-generation1M<n<10M0 likes30 downloads6mo agoHugging Face15celsowm /codigo_civil_brasileiro_lei_10406_2002text1K<n<10K3 likes29 downloads2y agoHugging Face16atlas-da-saude-mental /mapa-da-discriminacao-racial-no-brasil Mapa da Discriminação Racial no Brasil Este dataset contém coeficientes de discriminação racial por município no Brasil, calculados a partir de dados do Censo Demográfico. Variáveis cod_mun: Código do município (IBGE) coef: Coeficiente base (intercepto) para cada município mulher_negra: Coeficiente para mulheres negras homem_negro: Coeficiente para homens negros mulher_branca: Coeficiente para mulheres brancas superior: Coeficiente para pessoas com ensino… See the full description on the dataset page: https://huggingface.co/datasets/atlas-da-saude-mental/mapa-da-discriminacao-racial-no-brasil.tabularother1K<n<10K1 likes26 downloads1y agoHugging Face17carpenterbb /agua_e_esgoto_nordeste_brasileiro Brazilian Northeast Water and Sanitation Crisis Dataset (BNWSC) Overview This dataset provides multidisciplinary data on water access, sanitation, public health, and socioeconomic disparities in Brazil's Northeast region. It integrates official sources (2014–2022) and includes projections up to 2030, supporting research in public policy, collective health, and sustainability. Key Features Applications Correlation analysis between sanitation, income… See the full description on the dataset page: https://huggingface.co/datasets/carpenterbb/agua_e_esgoto_nordeste_brasileiro.tabular1K<n<10K0 likes25 downloads1y agoHugging Face18fabianonbfilho /texto-clinico-brasileiro Texto Clinico Brasileiro Dataset unificado de texto clinico em portugues brasileiro para NLP. Agrega multiplos datasets publicos em um schema Parquet padronizado, facilitando o treinamento e avaliacao de modelos de linguagem para o dominio clinico. Conteudo Dataset Registros Tipo Acesso Fonte MedPT 384.085 Perguntas e respostas medicas Livre AKCIT/MedPT Sepse HC-RP 200 Resumos de alta hospitalar Livre Dataverse Total: 384.285 registros | Tamanho: ~95 MB… See the full description on the dataset page: https://huggingface.co/datasets/fabianonbfilho/texto-clinico-brasileiro.texttext-generation100K<n<1M0 likes25 downloads6mo agoHugging Face19Fernandosr85 /adaption-pt-afro-brasileiro-qa This dataset is a remastered version prepared using Adaption's Adaptive Data platform. adaption-pt_afro_brasileiro_qa This dataset contains question-answer pairs in Portuguese focusing on the linguistic features of Afro-Brazilian Portuguese, such as reduced nominal agreement and preposition variation. The content provides historical context, sociolinguistic analysis, and references to academic research to explain these phenomena as regular grammatical systems rather than… See the full description on the dataset page: https://huggingface.co/datasets/Fernandosr85/adaption-pt-afro-brasileiro-qa.text1K<n<10K0 likes23 downloads3mo agoHugging Face20valdovaldo1500 /brasil-homicidios-municipio-2018-2024 Homicídios por município no Brasil (2018–2024) / Homicides by municipality in Brazil One-line: Annual intentional-homicide counts and rates per 100k inhabitants for 5,050 Brazilian municipalities, 2018–2024. A clean, analysis-ready summary compiled from official DataSUS mortality microdata (SIM). Files brasil-homicidios-por-municipio-2018-2024.csv — 27,296 rows Columns column description uf state (2-letter UF) city_slug municipality… See the full description on the dataset page: https://huggingface.co/datasets/valdovaldo1500/brasil-homicidios-municipio-2018-2024.tabulartabular-regression10K<n<100K0 likes22 downloads2mo agoHugging Face21celsowm /ctb_codigo_de_transito_brasileiro_lei_9_503_1997textn<1K0 likes20 downloads2y agoHugging Face22Comunidade-Synapse-BR /synapse-nomes-brasileiros🇧🇷 Synapse Nomes brasileiros Dataset de nomes brasileiros em linguagem natural desenvolvido pela Comunidade Synapse BR. O dataset contém exemplos de interações em português brasileiro envolvendo sugestões e geração de nomes, desenvolvido para aplicações de Processamento de Linguagem Natural (PLN) e treinamento de modelos de linguagem. 📊 Estrutura Cada exemplo contém: "prompt" — solicitação ou contexto fornecido ao modelo. "completion" — resposta correspondente em português brasileiro. 📤… See the full description on the dataset page: https://huggingface.co/datasets/Comunidade-Synapse-BR/synapse-nomes-brasileiros.text10K<n<100K0 likes19 downloads2mo agoHugging Face23zsdizital /Word_Brasil_V0001text100K<n<1M0 likes17 downloads2y agoHugging Face24Villaitech /brasil-news0 likes16 downloads1y agoHugging Face25costadev00 /smoke-gemma4-matrix-brasil-25-v3-20260724-09 Smoke Gemma 4 — matriz de 25 tasks sobre Brasil Run real de validação do fluxo matricial document_task_matrix, executada sobre o documento Brasil da Wikipédia em português. Resultado status: completed documentos: 1 pares planejados: 25 exemplos aceitos: 25 pares pulados: 0 pares esgotados: 0 chamadas reais: 27 backend: vllm_local modelo: google/gemma-4-31B-it-qat-w4a16-ct As 25 tasks canônicas foram executadas uma vez cada. Todos os slots terminaram aceitos;… See the full description on the dataset page: https://huggingface.co/datasets/costadev00/smoke-gemma4-matrix-brasil-25-v3-20260724-09.0 likes15 downloads2mo agoHugging Face26MonegattoAI /dataset-ncm-brasil-jsonl-training 🇧🇷 NCM Brasil 2026: Dataset de Classificação Fiscal (Amostra) Pare de perder tempo limpando notas fiscais. Treine sua IA com dados validados. 📄 Sobre o Dataset Este repositório contém uma AMOSTRA GRÁTIS (Sample) do dataset NCM Brasil 2026. O dataset foi projetado para Fine-Tuning de LLMs (Llama 3, Mistral, GPT) para tarefas de Classificação Fiscal Automática de produtos brasileiros. 🎯 Diferenciais (Por que usar?) Dados Reais: Extraídos de Notas… See the full description on the dataset page: https://huggingface.co/datasets/MonegattoAI/dataset-ncm-brasil-jsonl-training.texttext-classification1K<n<10K0 likes14 downloads7mo agoHugging Face27juliadollis /merged_cemig-ceia__sites_educacionais_brasil_escola_by_prompttext10K<n<100K0 likes14 downloads7mo agoHugging Face28valdovaldo1500 /crime-brasil-rs-2022-2026 Crime Brasil — Rio Grande do Sul 2022-2025 (aggregated) 522,000+ aggregated crime records from Rio Grande do Sul State Police (SSP-RS), 2022-2025. This dataset has been aggregated at the municipality × month × crime-type level to protect individual records. No PII — no victim age, sex, race, or coordinates. Released under Brazil's Lei de Acesso à Informação (LAI). Scope 497 municipalities across RS Monthly totals per crime type and subtype 2022–2025 time series… See the full description on the dataset page: https://huggingface.co/datasets/valdovaldo1500/crime-brasil-rs-2022-2026.texttabular-classification100K<n<1M0 likes14 downloads5mo agoHugging Face29RAIA-BRASIL /agent_eval_questions Agent Questions Generated Pt-Br Detalhes do Dataset Descrição Desenvolvidor por: Álvaro Lopes. Linkedin Artur de Vlieger Linkedin Fabrício Salomon Linkedin Leticia Bossatto Marchezi Linkedin Luis Felipe Jorge Linkedin Otávio Coletti Linkedin Patrocinado por : Pico Língua(s) (NLP) :Português Correspondência: raia.projetos@gmail.com, leticiabossatto@gmail.com Fontes Repositório: Github Uso O dataset pode ser utilizado… See the full description on the dataset page: https://huggingface.co/datasets/RAIA-BRASIL/agent_eval_questions.textn<1K0 likes13 downloads1y agoHugging Face30lucasfrct /contituicao-federal-do-brasilgatedtext1K<n<10K6 likes11 downloads2y agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.