datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
openai-terra-batch-wiki-brazil-1000-partial-20260724-01
OpenAI Terra Batch — Wikipédia PT-BR (run parcial)
Checkpoint publicável de uma execução real e interrompida do fluxo
document_task_matrix. A execução planejou gerar uma matriz de 1.000
documentos da Wikipédia em português por 25 tasks canônicas usando a Responses
API Batch e o modelo gpt-5.6-terra.
Este repositório não representa a conclusão dos 25.000 pares planejados. Ele
contém somente os 1.282 candidatos aceitos após a reconciliação offline de
todos os resultados Batch já… See the full description on the dataset page: https://huggingface.co/datasets/costadev00/openai-terra-batch-wiki-brazil-1000-partial-20260724-01.wikipedia-pt-br-instruct-5k
Wikipedia PT-BR Instruct
wikipedia-pt-br-instruct is a synthetic supervised fine-tuning (SFT)
dataset in Brazilian Portuguese generated from Wikipedia-derived documents.
This release is an intermediate evaluation dataset produced with the
sft-dataset-creator pipeline from the run
wiki-ptbr-extract-calib-5kdocs-14tasks. It was generated from a fixed
revision of costadev00/wikipedia-pt-br-extract:
cdbd07dc4a3de6e64632c718710b3ae0ebaeb0ff
The dataset is intended for intermediate… See the full description on the dataset page: https://huggingface.co/datasets/costadev00/wikipedia-pt-br-instruct-5k.smoke-openai-terra-batch-brasil-25-20260724-01
Smoke OpenAI Terra Batch — Brasil × 25 tasks
Run real de validação do fluxo matricial document_task_matrix, executada
sobre um único documento da Wikipédia em português com o título Brasil.
Cada uma das 25 tasks canônicas recebeu exatamente um slot inicial.
Resultado
status: completed
documentos: 1
pares planejados: 25
exemplos aceitos: 25
pares pulados: 0
pares esgotados: 0
resultados reais do backend: 27
retries com nova chamada: 2
backend: openai_api… See the full description on the dataset page: https://huggingface.co/datasets/costadev00/smoke-openai-terra-batch-brasil-25-20260724-01.wikipedia-pt-br-instructions-sft
wikipedia-pt-br-instructions-gemma-alpaca
Dataset de Instruction Following em formato Alpaca puro, com exatamente os campos instruction, input e output.
Origem
Derivado do dataset local instruction_following produzido por wiki-if-builder, por sua vez derivado de costadev00/wikipedia-pt-br-extract.
Campos
instruction: comando em português brasileiro.
input: contexto mínimo opcional.
output: resposta esperada.
Licença e limitações
A licença herdada é… See the full description on the dataset page: https://huggingface.co/datasets/costadev00/wikipedia-pt-br-instructions-sft.ptdbench-reward-design-reward-min-cost-reducing-lnds-020-dataset
PTDBench dataset snapshot: reward_min_cost_reducing_lnds_020
This repository stores the immutable runtime dataset snapshot for one
materialized PTDBench task. It intentionally excludes model weights and
training checkpoints.
PTDBench family: reward_design
Source evaluation metric: eval/HELD-OUT_ENVIRONMENTS_128
Provenance: RLVE repository snapshot under its MIT license; bundled upstream benchmark notices remain applicable.
License: MIT
The artifact manifest records every… See the full description on the dataset page: https://huggingface.co/datasets/LIF1014/ptdbench-reward-design-reward-min-cost-reducing-lnds-020-dataset.wikibooks-instruct
Wikibooks Instruct pt-BR
Synthetic instruction-tuning dataset in Brazilian Portuguese generated from
cleaned Portuguese Wikibooks text.
The published run contains all accepted examples from
20260630T233835Z-wikibooks-instruct-7fec6755.
Summary
Accepted examples: 106,010
Attempted examples: 248,040
Original target: 127,330 examples
Run status in metadata: partial
Source documents selected: 9,095
Split: train only
Source dataset: costadev00/wikibooks-pt-br-extract… See the full description on the dataset page: https://huggingface.co/datasets/costadev00/wikibooks-instruct.wiki-brazil
Wiki Brazil
Dataset criado a partir da API da Wikipédia em português.
Conteúdo
O dataset contém o artigo Brasil e os artigos em namespace principal
listados nos links internos desse artigo.
Arquivos
wiki_brazil.jsonl: registros em JSONL.
Schema
title: título resolvido do artigo na Wikipédia.
page_id_: identificador numérico da página na Wikipédia.
text: texto completo extraído em plaintext pela API MediaWiki.
Fonte… See the full description on the dataset page: https://huggingface.co/datasets/costadev00/wiki-brazil.wikipedia-pt-br-instructions
wikipedia-pt-br-instructions-gemma
Dataset sintético de Instruction Following em português brasileiro, derivado de artigos da Wikipedia pt-BR.
Origem
Os exemplos derivam de costadev00/wikipedia-pt-br-extract e preservam source_page_id, source_title, source_dataset e a licença herdada cc-by-sa-3.0.
Processo
A geração é inspirada em Alpaca e Self-Instruct: cada artigo válido passa por uma chamada de analista documental que produz candidatos de instrução ancorados… See the full description on the dataset page: https://huggingface.co/datasets/costadev00/wikipedia-pt-br-instructions.
