CoolFace
Datasetpublic

davanstrien/test-chunked-sprint-D1

Generated Responses Dataset This dataset contains generated responses for prompts from davanstrien/haiku_dpo. Generation Details Source Dataset: davanstrien/haiku_dpo Source Split: train Input Column: question (plain text prompts) Model: Qwen/Qwen2.5-3B-Instruct Rows Processed: 5 Batches: 3 (chunk size: 2) Generation Date: 2026-04-14T13:42:30.674651 Script: generate-responses-chunked.py (experimental streaming version) Sampling Parameters… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/test-chunked-sprint-D1.

sourceHugging Faceupdated 6mo agoView on Hugging Face
0likes16downloads
Dataset Card

Generated Responses Dataset

This dataset contains generated responses for prompts from davanstrien/haiku_dpo.

Generation Details

  • —Source Dataset: davanstrien/haiku_dpo
  • —Source Split: train
  • —Input Column: question (plain text prompts)
  • —Model: Qwen/Qwen2.5-3B-Instruct
  • —Rows Processed: 5
  • —Batches: 3 (chunk size: 2)
  • —Generation Date: 2026-04-14T13:42:30.674651
  • —Script: generate-responses-chunked.py (experimental streaming version)

Sampling Parameters

  • —Temperature: 0.7
  • —Top P: 0.8
  • —Top K: 20
  • —Min P: 0.0
  • —Max Tokens: 64
  • —Repetition Penalty: 1.0

Hardware Configuration

  • —Tensor Parallel Size: 1
  • —GPU Configuration: 1 GPU(s)
  • —Max Model Length: 4,096 tokens

Dataset Structure

The dataset contains all columns from the source dataset plus:

  • —response: The generated response from the model

Generation Script

Generated using the streaming vLLM inference script from uv-scripts/vllm.

To reproduce:

bash
uv run https://huggingface.co/datasets/uv-scripts/vllm/raw/main/generate-responses-chunked.py \
    davanstrien/haiku_dpo \
    <output-dataset> \
    --model-id Qwen/Qwen2.5-3B-Instruct \
    --prompt-column question \
    --split train \
    --chunk-size 2 \
    --temperature 0.7 \
    --top-p 0.8 \
    --top-k 20 \
    --max-tokens 64 --max-model-len 4096

Notes

This dataset was generated using the experimental streaming/chunked pipeline. Unlike the standard generate-responses.py, this script processes the dataset in a streaming fashion using IterableDataset.map() + push_to_hub(), which reduces memory usage and enables progressive upload of Parquet shards.