CoolFace
30 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01alanwgt /fipex-veiculos-brasil fipeX: Dataset Completo da Tabela FIPE Este dataset contém preços históricos e atuais de veículos comercializados no Brasil, baseados na Tabela FIPE (Fundação Instituto de Pesquisas Econômicas). Os dados são extraídos e organizados pelo projeto fipeX — uma iniciativa independente para facilitar o acesso a dados automotivos públicos, com API pública gratuita e este dataset em domínio público. Licença: CC0-1.0 — domínio público. Use livremente, inclusive comercialmente, sem… See the full description on the dataset page: https://huggingface.co/datasets/alanwgt/fipex-veiculos-brasil.tabulartabular-regression10M<n<100M12 likes1.1k downloads22d agoHugging Face02olob0 /ibge-nomes-no-brasil-2022 IBGE Nomes no Brasil 2022 Este dataset reúne os nomes próprios e sobrenomes no Brasil disponibilizados pelo Censo Demográfico 2022 do IBGE, organizados em um modelo relacional e distribuídos em arquivos Parquet. A base contém cerca de 128 mil nomes e 202 mil sobrenomes, com dados de frequência, ranking, distribuição por sexo, idade mediana, evolução por década, variantes de grafia e distribuição geográfica até o nível de município (5.570). Também inclui os verbetes editoriais de… See the full description on the dataset page: https://huggingface.co/datasets/olob0/ibge-nomes-no-brasil-2022.tabulartabular-classification1M<n<10M0 likes635 downloads2mo agoHugging Face030rakul0 /cpc_2015_brasil SALVAMENTO do Dataset from datasets import load_dataset from datasets import Dataset import pandas as pd # Carregar os dados do arquivo de texto df = pd.read_parquet('../data/cpc_2015_cleaned.parquet') data = { "livro": df["Livro"], "capitulo": df["Capitulo"], "titulo": df["Titulo"], "secao": df["Secao"], "subsecao": df["Subsecao"], "artigo": df["Artigo"] } # Dividir o texto em seções dataset = Dataset.from_pandas(pd.DataFrame(data))… See the full description on the dataset page: https://huggingface.co/datasets/0rakul0/cpc_2015_brasil.texttext-classification10K<n<100K3 likes67 downloads2y agoHugging Face04ViniForger /importacoes-tarifas-brasiltabular100K<n<1M0 likes62 downloads20d agoHugging Face05costadev00 /smoke-openai-terra-batch-brasil-25-20260724-01 Smoke OpenAI Terra Batch — Brasil × 25 tasks Run real de validação do fluxo matricial document_task_matrix, executada sobre um único documento da Wikipédia em português com o título Brasil. Cada uma das 25 tasks canônicas recebeu exatamente um slot inicial. Resultado status: completed documentos: 1 pares planejados: 25 exemplos aceitos: 25 pares pulados: 0 pares esgotados: 0 resultados reais do backend: 27 retries com nova chamada: 2 backend: openai_api… See the full description on the dataset page: https://huggingface.co/datasets/costadev00/smoke-openai-terra-batch-brasil-25-20260724-01.texttext-generationn<1K0 likes61 downloads2mo agoHugging Face06paulofinardi /OIG_small_chip2_portuguese_brasil Dataset Card for "OIG_small_chip2_portuguese_brasil" This dataset was translated to Portuguese-Brasil from here The data was translated with MarianMT model and weights Helsinki-NLP/opus-mt-en-ROMANCE The full details to replicate the translation are here: translation_notebook license: apache-2.0 text100K<n<1M16 likes56 downloads4y agoHugging Face07celsowm /codigo_penal_brasileiro_lei_2848_1940textn<1K1 likes56 downloads12d agoHugging Face08LucasGiraldi /concursos-publicos-brasil Brazilian Public Service Exams (Concursos Públicos), 2015–2026 Structured records of Brazilian public service exam notices ("concursos públicos"), organized from official sources and published as a single CSV. Maintained by Radar de Concurso. Full methodology, coverage limits, and the always-current download: https://radardeconcurso.com.br/dados What this is — and what it is not This is not the universe of Brazilian public exams. Reading it as if it were produces… See the full description on the dataset page: https://huggingface.co/datasets/LucasGiraldi/concursos-publicos-brasil.tabulartabular-classificationn<1K0 likes53 downloads22d agoHugging Face09Skskskd /girias-brasileiratext1K<n<10K0 likes52 downloads1mo agoHugging Face10joaosilva424 /fipex-veiculos-brasil fipeX: Dataset Completo da Tabela FIPE Este dataset contém preços históricos e atuais de veículos comercializados no Brasil, baseados na Tabela FIPE (Fundação Instituto de Pesquisas Econômicas). Os dados foram extraídos e organizados pelo projeto fipeX, uma iniciativa independente para facilitar o acesso a dados automotivos públicos. Sobre o Dataset Este conjunto de dados é ideal para: Análise de depreciação de veículos Previsão de preços (Machine Learning) Estudos… See the full description on the dataset page: https://huggingface.co/datasets/joaosilva424/fipex-veiculos-brasil.tabulartabular-regression10M<n<100M1 likes48 downloads5mo agoHugging Face11jason1966 /adaoduque_campeonato-brasileiro-de-futebol Campeonato Brasileiro de futebol Campeonato Brasileiro de Futebol Dataset Info Source: Kaggle Original Size: 0.67 MB Kaggle Downloads: 13,811 Files: 5 Files Legenda.txt campeonato-brasileiro-cartoes.csv campeonato-brasileiro-estatisticas-full.csv campeonato-brasileiro-full.csv campeonato-brasileiro-gols.csv Mirrored from Kaggle text0 likes33 downloads6mo agoHugging Face12LABDAPS /texto-clinico-brasileiro Texto Clinico Brasileiro Dataset unificado de texto clinico em portugues brasileiro para NLP. Agrega multiplos datasets publicos em um schema Parquet padronizado, facilitando o treinamento e avaliacao de modelos de linguagem para o dominio clinico. Conteudo Dataset Registros Tipo Acesso Fonte MedPT 384.085 Perguntas e respostas medicas Livre AKCIT/MedPT Sepse HC-RP 200 Resumos de alta hospitalar Livre Dataverse Total: 384.285 registros | Tamanho: ~95 MB… See the full description on the dataset page: https://huggingface.co/datasets/LABDAPS/texto-clinico-brasileiro.texttext-generation100K<n<1M2 likes33 downloads6mo agoHugging Face13celsowm /codigo_civil_brasileiro_lei_10406_2002text1K<n<10K3 likes29 downloads2y agoHugging Face14carpenterbb /agua_e_esgoto_nordeste_brasileiro Brazilian Northeast Water and Sanitation Crisis Dataset (BNWSC) Overview This dataset provides multidisciplinary data on water access, sanitation, public health, and socioeconomic disparities in Brazil's Northeast region. It integrates official sources (2014–2022) and includes projections up to 2030, supporting research in public policy, collective health, and sustainability. Key Features Applications Correlation analysis between sanitation, income… See the full description on the dataset page: https://huggingface.co/datasets/carpenterbb/agua_e_esgoto_nordeste_brasileiro.tabular1K<n<10K0 likes25 downloads1y agoHugging Face15fabianonbfilho /texto-clinico-brasileiro Texto Clinico Brasileiro Dataset unificado de texto clinico em portugues brasileiro para NLP. Agrega multiplos datasets publicos em um schema Parquet padronizado, facilitando o treinamento e avaliacao de modelos de linguagem para o dominio clinico. Conteudo Dataset Registros Tipo Acesso Fonte MedPT 384.085 Perguntas e respostas medicas Livre AKCIT/MedPT Sepse HC-RP 200 Resumos de alta hospitalar Livre Dataverse Total: 384.285 registros | Tamanho: ~95 MB… See the full description on the dataset page: https://huggingface.co/datasets/fabianonbfilho/texto-clinico-brasileiro.texttext-generation100K<n<1M0 likes25 downloads6mo agoHugging Face16Fernandosr85 /adaption-pt-afro-brasileiro-qa This dataset is a remastered version prepared using Adaption's Adaptive Data platform. adaption-pt_afro_brasileiro_qa This dataset contains question-answer pairs in Portuguese focusing on the linguistic features of Afro-Brazilian Portuguese, such as reduced nominal agreement and preposition variation. The content provides historical context, sociolinguistic analysis, and references to academic research to explain these phenomena as regular grammatical systems rather than… See the full description on the dataset page: https://huggingface.co/datasets/Fernandosr85/adaption-pt-afro-brasileiro-qa.text1K<n<10K0 likes23 downloads3mo agoHugging Face17valdovaldo1500 /brasil-homicidios-municipio-2018-2024 Homicídios por município no Brasil (2018–2024) / Homicides by municipality in Brazil One-line: Annual intentional-homicide counts and rates per 100k inhabitants for 5,050 Brazilian municipalities, 2018–2024. A clean, analysis-ready summary compiled from official DataSUS mortality microdata (SIM). Files brasil-homicidios-por-municipio-2018-2024.csv — 27,296 rows Columns column description uf state (2-letter UF) city_slug municipality… See the full description on the dataset page: https://huggingface.co/datasets/valdovaldo1500/brasil-homicidios-municipio-2018-2024.tabulartabular-regression10K<n<100K0 likes22 downloads2mo agoHugging Face18celsowm /ctb_codigo_de_transito_brasileiro_lei_9_503_1997textn<1K0 likes20 downloads2y agoHugging Face19Comunidade-Synapse-BR /synapse-nomes-brasileiros🇧🇷 Synapse Nomes brasileiros Dataset de nomes brasileiros em linguagem natural desenvolvido pela Comunidade Synapse BR. O dataset contém exemplos de interações em português brasileiro envolvendo sugestões e geração de nomes, desenvolvido para aplicações de Processamento de Linguagem Natural (PLN) e treinamento de modelos de linguagem. 📊 Estrutura Cada exemplo contém: "prompt" — solicitação ou contexto fornecido ao modelo. "completion" — resposta correspondente em português brasileiro. 📤… See the full description on the dataset page: https://huggingface.co/datasets/Comunidade-Synapse-BR/synapse-nomes-brasileiros.text10K<n<100K0 likes19 downloads2mo agoHugging Face20zsdizital /Word_Brasil_V0001text100K<n<1M0 likes17 downloads2y agoHugging Face21MonegattoAI /dataset-ncm-brasil-jsonl-training 🇧🇷 NCM Brasil 2026: Dataset de Classificação Fiscal (Amostra) Pare de perder tempo limpando notas fiscais. Treine sua IA com dados validados. 📄 Sobre o Dataset Este repositório contém uma AMOSTRA GRÁTIS (Sample) do dataset NCM Brasil 2026. O dataset foi projetado para Fine-Tuning de LLMs (Llama 3, Mistral, GPT) para tarefas de Classificação Fiscal Automática de produtos brasileiros. 🎯 Diferenciais (Por que usar?) Dados Reais: Extraídos de Notas… See the full description on the dataset page: https://huggingface.co/datasets/MonegattoAI/dataset-ncm-brasil-jsonl-training.texttext-classification1K<n<10K0 likes14 downloads7mo agoHugging Face22juliadollis /merged_cemig-ceia__sites_educacionais_brasil_escola_by_prompttext10K<n<100K0 likes14 downloads7mo agoHugging Face23valdovaldo1500 /crime-brasil-rs-2022-2026 Crime Brasil — Rio Grande do Sul 2022-2025 (aggregated) 522,000+ aggregated crime records from Rio Grande do Sul State Police (SSP-RS), 2022-2025. This dataset has been aggregated at the municipality × month × crime-type level to protect individual records. No PII — no victim age, sex, race, or coordinates. Released under Brazil's Lei de Acesso à Informação (LAI). Scope 497 municipalities across RS Monthly totals per crime type and subtype 2022–2025 time series… See the full description on the dataset page: https://huggingface.co/datasets/valdovaldo1500/crime-brasil-rs-2022-2026.texttabular-classification100K<n<1M0 likes14 downloads5mo agoHugging Face24RAIA-BRASIL /agent_eval_questions Agent Questions Generated Pt-Br Detalhes do Dataset Descrição Desenvolvidor por: Álvaro Lopes. Linkedin Artur de Vlieger Linkedin Fabrício Salomon Linkedin Leticia Bossatto Marchezi Linkedin Luis Felipe Jorge Linkedin Otávio Coletti Linkedin Patrocinado por : Pico Língua(s) (NLP) :Português Correspondência: raia.projetos@gmail.com, leticiabossatto@gmail.com Fontes Repositório: Github Uso O dataset pode ser utilizado… See the full description on the dataset page: https://huggingface.co/datasets/RAIA-BRASIL/agent_eval_questions.textn<1K0 likes13 downloads1y agoHugging Face25lucasfrct /contituicao-federal-do-brasilgatedtext1K<n<10K6 likes11 downloads2y agoHugging Face26juliadollis /cemig-ceia__sites_educacionais_default_brasil_escola_scored_5000_prompt2text1K<n<10K1 likes11 downloads6mo agoHugging Face27Montival /fipex-veiculos-brasil fipeX: Dataset Completo da Tabela FIPE Este dataset contém preços históricos e atuais de veículos comercializados no Brasil, baseados na Tabela FIPE (Fundação Instituto de Pesquisas Econômicas). Os dados foram extraídos e organizados pelo projeto fipeX, uma iniciativa independente para facilitar o acesso a dados automotivos públicos. Sobre o Dataset Este conjunto de dados é ideal para: Análise de depreciação de veículos Previsão de preços (Machine Learning) Estudos… See the full description on the dataset page: https://huggingface.co/datasets/Montival/fipex-veiculos-brasil.tabulartabular-regression10M<n<100M0 likes11 downloads5mo agoHugging Face28joaosanches /literatura_brasileiratextn<1K1 likes10 downloads3y agoHugging Face29gabrielsouto /brasileirao2026-vasco-ptbrtext1K<n<10K1 likes9 downloads3mo agoHugging Face30iagoalves /dialect_Brasiliencetextn<1K0 likes8 downloads2y agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.