CoolFace
8 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01costadev00 /openai-terra-batch-wiki-brazil-1000-partial-20260724-01 OpenAI Terra Batch — Wikipédia PT-BR (run parcial) Checkpoint publicável de uma execução real e interrompida do fluxo document_task_matrix. A execução planejou gerar uma matriz de 1.000 documentos da Wikipédia em português por 25 tasks canônicas usando a Responses API Batch e o modelo gpt-5.6-terra. Este repositório não representa a conclusão dos 25.000 pares planejados. Ele contém somente os 1.282 candidatos aceitos após a reconciliação offline de todos os resultados Batch já… See the full description on the dataset page: https://huggingface.co/datasets/costadev00/openai-terra-batch-wiki-brazil-1000-partial-20260724-01.texttext-generation1K<n<10K0 likes171 downloads2mo agoHugging Face02costadev00 /wikipedia-pt-br-instruct-5k Wikipedia PT-BR Instruct wikipedia-pt-br-instruct is a synthetic supervised fine-tuning (SFT) dataset in Brazilian Portuguese generated from Wikipedia-derived documents. This release is an intermediate evaluation dataset produced with the sft-dataset-creator pipeline from the run wiki-ptbr-extract-calib-5kdocs-14tasks. It was generated from a fixed revision of costadev00/wikipedia-pt-br-extract: cdbd07dc4a3de6e64632c718710b3ae0ebaeb0ff The dataset is intended for intermediate… See the full description on the dataset page: https://huggingface.co/datasets/costadev00/wikipedia-pt-br-instruct-5k.texttext-generation100K<n<1M1 likes81 downloads3mo agoHugging Face03costadev00 /smoke-openai-terra-batch-brasil-25-20260724-01 Smoke OpenAI Terra Batch — Brasil × 25 tasks Run real de validação do fluxo matricial document_task_matrix, executada sobre um único documento da Wikipédia em português com o título Brasil. Cada uma das 25 tasks canônicas recebeu exatamente um slot inicial. Resultado status: completed documentos: 1 pares planejados: 25 exemplos aceitos: 25 pares pulados: 0 pares esgotados: 0 resultados reais do backend: 27 retries com nova chamada: 2 backend: openai_api… See the full description on the dataset page: https://huggingface.co/datasets/costadev00/smoke-openai-terra-batch-brasil-25-20260724-01.texttext-generationn<1K0 likes61 downloads2mo agoHugging Face04costadev00 /wikipedia-pt-br-instructions-sft wikipedia-pt-br-instructions-gemma-alpaca Dataset de Instruction Following em formato Alpaca puro, com exatamente os campos instruction, input e output. Origem Derivado do dataset local instruction_following produzido por wiki-if-builder, por sua vez derivado de costadev00/wikipedia-pt-br-extract. Campos instruction: comando em português brasileiro. input: contexto mínimo opcional. output: resposta esperada. Licença e limitações A licença herdada é… See the full description on the dataset page: https://huggingface.co/datasets/costadev00/wikipedia-pt-br-instructions-sft.texttext-generationn<1K0 likes20 downloads5mo agoHugging Face05LIF1014 /ptdbench-reward-design-reward-min-cost-reducing-lnds-020-dataset PTDBench dataset snapshot: reward_min_cost_reducing_lnds_020 This repository stores the immutable runtime dataset snapshot for one materialized PTDBench task. It intentionally excludes model weights and training checkpoints. PTDBench family: reward_design Source evaluation metric: eval/HELD-OUT_ENVIRONMENTS_128 Provenance: RLVE repository snapshot under its MIT license; bundled upstream benchmark notices remain applicable. License: MIT The artifact manifest records every… See the full description on the dataset page: https://huggingface.co/datasets/LIF1014/ptdbench-reward-design-reward-min-cost-reducing-lnds-020-dataset.texttext-generationn<1K0 likes8 downloads1mo agoHugging Face06costadev00 /wikibooks-instructgated Wikibooks Instruct pt-BR Synthetic instruction-tuning dataset in Brazilian Portuguese generated from cleaned Portuguese Wikibooks text. The published run contains all accepted examples from 20260630T233835Z-wikibooks-instruct-7fec6755. Summary Accepted examples: 106,010 Attempted examples: 248,040 Original target: 127,330 examples Run status in metadata: partial Source documents selected: 9,095 Split: train only Source dataset: costadev00/wikibooks-pt-br-extract… See the full description on the dataset page: https://huggingface.co/datasets/costadev00/wikibooks-instruct.texttext-generation100K<n<1M0 likes6 downloads3mo agoHugging Face07costadev00 /wiki-brazilgated Wiki Brazil Dataset criado a partir da API da Wikipédia em português. Conteúdo O dataset contém o artigo Brasil e os artigos em namespace principal listados nos links internos desse artigo. Arquivos wiki_brazil.jsonl: registros em JSONL. Schema title: título resolvido do artigo na Wikipédia. page_id_: identificador numérico da página na Wikipédia. text: texto completo extraído em plaintext pela API MediaWiki. Fonte… See the full description on the dataset page: https://huggingface.co/datasets/costadev00/wiki-brazil.texttext-generation1K<n<10K0 likes5 downloads3mo agoHugging Face08costadev00 /wikipedia-pt-br-instructionsgated wikipedia-pt-br-instructions-gemma Dataset sintético de Instruction Following em português brasileiro, derivado de artigos da Wikipedia pt-BR. Origem Os exemplos derivam de costadev00/wikipedia-pt-br-extract e preservam source_page_id, source_title, source_dataset e a licença herdada cc-by-sa-3.0. Processo A geração é inspirada em Alpaca e Self-Instruct: cada artigo válido passa por uma chamada de analista documental que produz candidatos de instrução ancorados… See the full description on the dataset page: https://huggingface.co/datasets/costadev00/wikipedia-pt-br-instructions.tabulartext-generationn<1K0 likes3 downloads5mo agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.