datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
smoke-openai-terra-batch-brasil-25-20260724-01
Smoke OpenAI Terra Batch — Brasil × 25 tasks
Run real de validação do fluxo matricial document_task_matrix, executada
sobre um único documento da Wikipédia em português com o título Brasil.
Cada uma das 25 tasks canônicas recebeu exatamente um slot inicial.
Resultado
status: completed
documentos: 1
pares planejados: 25
exemplos aceitos: 25
pares pulados: 0
pares esgotados: 0
resultados reais do backend: 27
retries com nova chamada: 2
backend: openai_api… See the full description on the dataset page: https://huggingface.co/datasets/costadev00/smoke-openai-terra-batch-brasil-25-20260724-01.codigo_civil_brasileiro_lei_10406_2002adaption-pt-afro-brasileiro-qa
This dataset is a remastered version prepared using Adaption's Adaptive Data platform.
adaption-pt_afro_brasileiro_qa
This dataset contains question-answer pairs in Portuguese focusing on the linguistic features of Afro-Brazilian Portuguese, such as reduced nominal agreement and preposition variation. The content provides historical context, sociolinguistic analysis, and references to academic research to explain these phenomena as regular grammatical systems rather than… See the full description on the dataset page: https://huggingface.co/datasets/Fernandosr85/adaption-pt-afro-brasileiro-qa.ctb_codigo_de_transito_brasileiro_lei_9_503_1997synapse-nomes-brasileiros🇧🇷 Synapse Nomes brasileiros
Dataset de nomes brasileiros em linguagem natural desenvolvido pela Comunidade Synapse BR.
O dataset contém exemplos de interações em português brasileiro envolvendo sugestões e geração de nomes, desenvolvido para aplicações de Processamento de Linguagem Natural (PLN) e treinamento de modelos de linguagem.
📊 Estrutura
Cada exemplo contém:
"prompt" — solicitação ou contexto fornecido ao modelo.
"completion" — resposta correspondente em português brasileiro.
📤… See the full description on the dataset page: https://huggingface.co/datasets/Comunidade-Synapse-BR/synapse-nomes-brasileiros.dataset-ncm-brasil-jsonl-training
🇧🇷 NCM Brasil 2026: Dataset de Classificação Fiscal (Amostra)
Pare de perder tempo limpando notas fiscais. Treine sua IA com dados validados.
📄 Sobre o Dataset
Este repositório contém uma AMOSTRA GRÁTIS (Sample) do dataset NCM Brasil 2026.
O dataset foi projetado para Fine-Tuning de LLMs (Llama 3, Mistral, GPT) para tarefas de Classificação Fiscal Automática de produtos brasileiros.
🎯 Diferenciais (Por que usar?)
Dados Reais: Extraídos de Notas… See the full description on the dataset page: https://huggingface.co/datasets/MonegattoAI/dataset-ncm-brasil-jsonl-training.copa_brasil_2002
