datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
Nemotron-Personas-Brazil
Nemotron-Personas-Brazil
Abordagem de IA composta para geração de personas baseada em distribuições do mundo real
Visão Geral do Conjunto de Dados (Dataset Overview):
Nemotron-Personas-Brazil é um conjunto de dados (dataset) de código aberto (CC BY 4.0) composto por personas geradas sinteticamente e fundamentadas em distribuições demográficas, geográficas e traços de personalidade reais do Brasil, visando capturar a diversidade e a riqueza da população. Trata-se de… See the full description on the dataset page: https://huggingface.co/datasets/nvidia/Nemotron-Personas-Brazil.openai-terra-batch-wiki-brazil-1000-partial-20260724-01
OpenAI Terra Batch — Wikipédia PT-BR (run parcial)
Checkpoint publicável de uma execução real e interrompida do fluxo
document_task_matrix. A execução planejou gerar uma matriz de 1.000
documentos da Wikipédia em português por 25 tasks canônicas usando a Responses
API Batch e o modelo gpt-5.6-terra.
Este repositório não representa a conclusão dos 25.000 pares planejados. Ele
contém somente os 1.282 candidatos aceitos após a reconciliação offline de
todos os resultados Batch já… See the full description on the dataset page: https://huggingface.co/datasets/costadev00/openai-terra-batch-wiki-brazil-1000-partial-20260724-01.brazilian-customer-service-conversations
Brazilian Customer Service Conversations
Dataset de conversas de atendimento ao cliente em portugues brasileiro (PT-BR).
De um like me apoie em manter esse dataset!
Descricao
Conversas sinteticas de alta qualidade simulando interacoes reais entre clientes e atendentes em diversos setores da economia brasileira. Util para treinar e avaliar modelos de:
Chatbots de atendimento
Classificacao de intencao (intent classification)
Analise de sentimento em conversas
Geracao de… See the full description on the dataset page: https://huggingface.co/datasets/RichardSakaguchiMS/brazilian-customer-service-conversations.dou-brazil-dataset
Dataset Card for Dataset Diário Oficial da União (DOU)
The Diário Oficial da União (DOU) is the official government gazette of Brazil, published by the National Press. It serves as the primary means of communication for federal government acts, including laws, decrees, ordinances, public notices, and other official decisions. The DOU ensures transparency and legal validity for government actions and is divided into three sections:
Section 1: Publishes laws, decrees, and… See the full description on the dataset page: https://huggingface.co/datasets/gerson-vfs/dou-brazil-dataset.news-of-the-brazilian-newspaper
News of the Brazilian Newspaper
This repository contains a comprehensive dataset of news articles from a Brazilian newspaper, Folha de São Paulo (http://www.folha.uol.com.br/). The dataset includes 167,053 examples of news articles, comprising headlines, URLs of articles, complete articles, and their respective categories.
Dataset Creation
The headlines were initially gathered from Inshorts and were then used to scrape the complete news articles from Folha de São Paulo.… See the full description on the dataset page: https://huggingface.co/datasets/emdemor/news-of-the-brazilian-newspaper.Brazilian-Public-Procurement-Notices
Editais Brasileiros de Licitação - Pergunte ao Edital QA Gold v0.2
Dataset de perguntas e respostas sobre editais de licitação brasileiros.
O uso principal é treinar e avaliar componentes do agente interno "Pergunte ao Edital": dado o texto de um edital, responder perguntas objetivas usando apenas o próprio documento.
Este dataset usa dados sintéticos (synthetic data). Os editais e textos-base vêm de fontes públicas reais, mas a maior parte das perguntas foi criada por templates… See the full description on the dataset page: https://huggingface.co/datasets/Licitei/Brazilian-Public-Procurement-Notices.BrazilianPortugueseOCRThis set was created and is expanding. The objective is for students to be able to use and learn about OCR.
Examples:
Llama Vision - Optical Character Recognition (OCR)
ExtractThinker using Ollama
ExtractThinker
Llama Vision
Dataset Description
This dataset contains images of three types of documents commonly used in Brazil: Electronic Invoices (NF-e), Medical Leaflets, and Telephone Directories. These documents are essential for various economic, medical, and communication purposes. The… See the full description on the dataset page: https://huggingface.co/datasets/sc0v0ne/BrazilianPortugueseOCR.brazilian-news-articlesbrazilian-math-physics-qa
Brazilian Math & Physics QA
English | Português do Brasil
English
Summary
Brazilian Portuguese question-answer pairs covering mathematics, physics, chemistry, and related educational subjects. Each record contains a user question and an assistant answer in chat/SFT format.
Examples: 19.082
Train: 18.148
Validation: 934
Language: Brazilian Portuguese (pt-BR)
Schema
{"id":"qa_...","subject":"fisica","category":"mecanica-geral"… See the full description on the dataset page: https://huggingface.co/datasets/artificialguybr/brazilian-math-physics-qa.Reasoning-MiniGPT-brazilian-portuguesewiki_rephrase_brazil
wiki_brazil
Dataset em portugues derivado de conteudos da Wikipedia em portugues, com um subset
para os textos originais e subsets separados para reescritas sinteticas.
Repositorio alvo: gregassagraf/wiki_brazil.
Visibilidade pretendida no Hugging Face Hub: private.
Subsets
original: 1,617 rows in 1 shard(s).
article_pt: 1,879 rows in 1 shard(s).
commentary_pt: 1,879 rows in 1 shard(s).
discussion_pt: 1,879 rows in 1 shard(s).
explanation_pt: 1,879 rows in 1… See the full description on the dataset page: https://huggingface.co/datasets/br-llm-data/wiki_rephrase_brazil.wiki-brazil
Wiki Brazil
Dataset criado a partir da API da Wikipédia em português.
Conteúdo
O dataset contém o artigo Brasil e os artigos em namespace principal
listados nos links internos desse artigo.
Arquivos
wiki_brazil.jsonl: registros em JSONL.
Schema
title: título resolvido do artigo na Wikipédia.
page_id_: identificador numérico da página na Wikipédia.
text: texto completo extraído em plaintext pela API MediaWiki.
Fonte… See the full description on the dataset page: https://huggingface.co/datasets/costadev00/wiki-brazil.wiki_rephrase_multillm_brazil
wiki_rephrase_multillm_brazil
Dataset em portugues derivado de conteudos da Wikipedia em portugues, com um subset
para os textos originais e subsets separados para reescritas sinteticas. A reescrita
foi feita utilizando quatro modelos diferentes de três famílias de llms:
google/gemma-4-E4B-it
google/gemma-4-E2B-it
mistralai/Ministral-3-3B-Instruct-2512
Qwen/Qwen3.5-4B
Repositorio alvo: wiki_rephrase_multillm_brazil.
Visibilidade pretendida no Hugging Face Hub: private.… See the full description on the dataset page: https://huggingface.co/datasets/br-llm-data/wiki_rephrase_multillm_brazil.wiki-brazil
Wiki Brazil
Dataset criado a partir da API da Wikipédia em português.
Conteúdo
O dataset contém o artigo Brasil e os artigos em namespace principal
listados nos links internos desse artigo.
Arquivos
wiki_brazil.jsonl: registros em JSONL.
Schema
title: título resolvido do artigo na Wikipédia.
page_id_: identificador numérico da página na Wikipédia.
text: texto completo extraído em plaintext pela API MediaWiki.
Fonte… See the full description on the dataset page: https://huggingface.co/datasets/br-llm-data/wiki-brazil.
