CoolFace
14 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01nvidia /Nemotron-Personas-Brazil Nemotron-Personas-Brazil Abordagem de IA composta para geração de personas baseada em distribuições do mundo real Visão Geral do Conjunto de Dados (Dataset Overview): Nemotron-Personas-Brazil é um conjunto de dados (dataset) de código aberto (CC BY 4.0) composto por personas geradas sinteticamente e fundamentadas em distribuições demográficas, geográficas e traços de personalidade reais do Brasil, visando capturar a diversidade e a riqueza da população. Trata-se de… See the full description on the dataset page: https://huggingface.co/datasets/nvidia/Nemotron-Personas-Brazil.texttext-generation1M<n<10M102 likes864 downloads8mo agoHugging Face02costadev00 /openai-terra-batch-wiki-brazil-1000-partial-20260724-01 OpenAI Terra Batch — Wikipédia PT-BR (run parcial) Checkpoint publicável de uma execução real e interrompida do fluxo document_task_matrix. A execução planejou gerar uma matriz de 1.000 documentos da Wikipédia em português por 25 tasks canônicas usando a Responses API Batch e o modelo gpt-5.6-terra. Este repositório não representa a conclusão dos 25.000 pares planejados. Ele contém somente os 1.282 candidatos aceitos após a reconciliação offline de todos os resultados Batch já… See the full description on the dataset page: https://huggingface.co/datasets/costadev00/openai-terra-batch-wiki-brazil-1000-partial-20260724-01.texttext-generation1K<n<10K0 likes171 downloads2mo agoHugging Face03RichardSakaguchiMS /brazilian-customer-service-conversations Brazilian Customer Service Conversations Dataset de conversas de atendimento ao cliente em portugues brasileiro (PT-BR). De um like me apoie em manter esse dataset! Descricao Conversas sinteticas de alta qualidade simulando interacoes reais entre clientes e atendentes em diversos setores da economia brasileira. Util para treinar e avaliar modelos de: Chatbots de atendimento Classificacao de intencao (intent classification) Analise de sentimento em conversas Geracao de… See the full description on the dataset page: https://huggingface.co/datasets/RichardSakaguchiMS/brazilian-customer-service-conversations.texttext-classificationn<1K5 likes135 downloads10mo agoHugging Face04gerson-vfs /dou-brazil-dataset Dataset Card for Dataset Diário Oficial da União (DOU) The Diário Oficial da União (DOU) is the official government gazette of Brazil, published by the National Press. It serves as the primary means of communication for federal government acts, including laws, decrees, ordinances, public notices, and other official decisions. The DOU ensures transparency and legal validity for government actions and is divided into three sections: Section 1: Publishes laws, decrees, and… See the full description on the dataset page: https://huggingface.co/datasets/gerson-vfs/dou-brazil-dataset.imagetext-generation100K<n<1M0 likes87 downloads2y agoHugging Face05emdemor /news-of-the-brazilian-newspaper News of the Brazilian Newspaper This repository contains a comprehensive dataset of news articles from a Brazilian newspaper, Folha de São Paulo (http://www.folha.uol.com.br/). The dataset includes 167,053 examples of news articles, comprising headlines, URLs of articles, complete articles, and their respective categories. Dataset Creation The headlines were initially gathered from Inshorts and were then used to scrape the complete news articles from Folha de São Paulo.… See the full description on the dataset page: https://huggingface.co/datasets/emdemor/news-of-the-brazilian-newspaper.texttext-classification100K<n<1M2 likes47 downloads2y agoHugging Face06Licitei /Brazilian-Public-Procurement-Notices Editais Brasileiros de Licitação - Pergunte ao Edital QA Gold v0.2 Dataset de perguntas e respostas sobre editais de licitação brasileiros. O uso principal é treinar e avaliar componentes do agente interno "Pergunte ao Edital": dado o texto de um edital, responder perguntas objetivas usando apenas o próprio documento. Este dataset usa dados sintéticos (synthetic data). Os editais e textos-base vêm de fontes públicas reais, mas a maior parte das perguntas foi criada por templates… See the full description on the dataset page: https://huggingface.co/datasets/Licitei/Brazilian-Public-Procurement-Notices.question-answering1K<n<10K1 likes39 downloads3mo agoHugging Face07sc0v0ne /BrazilianPortugueseOCRThis set was created and is expanding. The objective is for students to be able to use and learn about OCR. Examples: Llama Vision - Optical Character Recognition (OCR) ExtractThinker using Ollama ExtractThinker Llama Vision Dataset Description This dataset contains images of three types of documents commonly used in Brazil: Electronic Invoices (NF-e), Medical Leaflets, and Telephone Directories. These documents are essential for various economic, medical, and communication purposes. The… See the full description on the dataset page: https://huggingface.co/datasets/sc0v0ne/BrazilianPortugueseOCR.imagetext-classificationn<1K5 likes33 downloads2y agoHugging Face08maikerdr /brazilian-news-articlestexttext-generation1K<n<10K0 likes23 downloads2y agoHugging Face09artificialguybr /brazilian-math-physics-qa Brazilian Math & Physics QA English | Português do Brasil English Summary Brazilian Portuguese question-answer pairs covering mathematics, physics, chemistry, and related educational subjects. Each record contains a user question and an assistant answer in chat/SFT format. Examples: 19.082 Train: 18.148 Validation: 934 Language: Brazilian Portuguese (pt-BR) Schema {"id":"qa_...","subject":"fisica","category":"mecanica-geral"… See the full description on the dataset page: https://huggingface.co/datasets/artificialguybr/brazilian-math-physics-qa.textquestion-answering10K<n<100K0 likes22 downloads1mo agoHugging Face10AxionLab-official /Reasoning-MiniGPT-brazilian-portuguesetexttext-generationn<1K0 likes17 downloads10mo agoHugging Face11br-llm-data /wiki_rephrase_brazilgated wiki_brazil Dataset em portugues derivado de conteudos da Wikipedia em portugues, com um subset para os textos originais e subsets separados para reescritas sinteticas. Repositorio alvo: gregassagraf/wiki_brazil. Visibilidade pretendida no Hugging Face Hub: private. Subsets original: 1,617 rows in 1 shard(s). article_pt: 1,879 rows in 1 shard(s). commentary_pt: 1,879 rows in 1 shard(s). discussion_pt: 1,879 rows in 1 shard(s). explanation_pt: 1,879 rows in 1… See the full description on the dataset page: https://huggingface.co/datasets/br-llm-data/wiki_rephrase_brazil.texttext-generation10K<n<100K0 likes8 downloads3mo agoHugging Face12costadev00 /wiki-brazilgated Wiki Brazil Dataset criado a partir da API da Wikipédia em português. Conteúdo O dataset contém o artigo Brasil e os artigos em namespace principal listados nos links internos desse artigo. Arquivos wiki_brazil.jsonl: registros em JSONL. Schema title: título resolvido do artigo na Wikipédia. page_id_: identificador numérico da página na Wikipédia. text: texto completo extraído em plaintext pela API MediaWiki. Fonte… See the full description on the dataset page: https://huggingface.co/datasets/costadev00/wiki-brazil.texttext-generation1K<n<10K0 likes5 downloads3mo agoHugging Face13br-llm-data /wiki_rephrase_multillm_brazilgated wiki_rephrase_multillm_brazil Dataset em portugues derivado de conteudos da Wikipedia em portugues, com um subset para os textos originais e subsets separados para reescritas sinteticas. A reescrita foi feita utilizando quatro modelos diferentes de três famílias de llms: google/gemma-4-E4B-it google/gemma-4-E2B-it mistralai/Ministral-3-3B-Instruct-2512 Qwen/Qwen3.5-4B Repositorio alvo: wiki_rephrase_multillm_brazil. Visibilidade pretendida no Hugging Face Hub: private.… See the full description on the dataset page: https://huggingface.co/datasets/br-llm-data/wiki_rephrase_multillm_brazil.texttext-generation10K<n<100K0 likes5 downloads2mo agoHugging Face14br-llm-data /wiki-brazilgated Wiki Brazil Dataset criado a partir da API da Wikipédia em português. Conteúdo O dataset contém o artigo Brasil e os artigos em namespace principal listados nos links internos desse artigo. Arquivos wiki_brazil.jsonl: registros em JSONL. Schema title: título resolvido do artigo na Wikipédia. page_id_: identificador numérico da página na Wikipédia. text: texto completo extraído em plaintext pela API MediaWiki. Fonte… See the full description on the dataset page: https://huggingface.co/datasets/br-llm-data/wiki-brazil.texttext-generation1K<n<10K0 likes4 downloads3mo agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.