CoolFace
Datasetpublic

hamishivi/qwen35-4b-drpo-vs0f49th-trainer-logprobs

Qwen3.5 4B DRPO trainer logprobs from W&B run vs0f49th This dataset contains the raw trainer-logprob JSONL shards saved by W&B run ai2-llm/open_instruct_internal/vs0f49th (qwen35_4b_drpo__42__1782345587). Contents Source run: https://wandb.ai/ai2-llm/open_instruct_internal/runs/vs0f49th Source path: /weka/oe-adapt-default/allennlp/deletable_rollouts/ Filename pattern: qwen35_4b_drpo__42__1782345587_trainer_logprobs_step*_rank*.jsonl Files: 4320 JSONL shards… See the full description on the dataset page: https://huggingface.co/datasets/hamishivi/qwen35-4b-drpo-vs0f49th-trainer-logprobs.

sourceHugging Faceotherupdated 3mo agoView on Hugging Face
0likes228downloads
Dataset Card

Qwen3.5 4B DRPO trainer logprobs from W&B run vs0f49th

This dataset contains the raw trainer-logprob JSONL shards saved by W&B run ai2-llm/open_instruct_internal/vs0f49th (qwen35_4b_drpo__42__1782345587).

Contents

  • —Source run: https://wandb.ai/ai2-llm/open_instruct_internal/runs/vs0f49th
  • —Source path: /weka/oe-adapt-default/allennlp/deletable_rollouts/
  • —Filename pattern: qwen35_4b_drpo__42__1782345587_trainer_logprobs_step*_rank*.jsonl
  • —Files: 4320 JSONL shards
  • —Steps: 231 through 500 (270 steps)
  • —Ranks: 0 through 15 (16 ranks)
  • —Total size: 73.11 GiB

Record Schema

Each JSONL row stores one sample from a rank/step shard. Tensor values are flattened and paired with *_shape fields. Observed fields include:

step, sample_idx, sp_size, trainer_logprobs_shape, trainer_logprobs, response_mask_shape, response_mask, logprob_token_offset, trainer_model_step, rank, world_size, dp_rank, sp_rank, input_token_ids_shape, input_token_ids, token_ids_shape, token_ids, rollout_sample_ids_shape, rollout_sample_ids, model_steps_shape, model_steps, model_step, vllm_logprobs_shape, vllm_logprobs, prompt_mask_shape, prompt_mask, attention_mask_shape, attention_mask, prompt_boundaries.

Manifests

  • —trainer_logprobs_file_list.tsv: filename and byte size for each shard.
  • —trainer_logprobs_manifest.json: source metadata plus per-file step/rank/size metadata.
  • —wandb_config.yaml and wandb_summary.json: downloaded from the source W&B run.