CoolFace
Datasetpublic

open-athena/exp_rpt_stack-pytest-large-qwen3.5-122b-131k-opencode-traces

Agent trace dataset Decoding the literal token IDs The prompt_token_ids / completion_token_ids / logprobs columns are the verbatim tokens the serving engine emitted, stored PER AGENT STEP as a list-of-lists (one inner list per turn). To turn them back into text you MUST use the exact tokenizer the model was served with — a generic same-family tokenizer will decode word tokens to garbage. Served model / tokenizer source: Qwen/Qwen3.5-122B-A10B-FP8 from transformers… See the full description on the dataset page: https://huggingface.co/datasets/open-athena/exp_rpt_stack-pytest-large-qwen3.5-122b-131k-opencode-traces.

sourceHugging Faceupdated 3mo agoView on Hugging Face
0likes92downloads
10 commits on main
6a55d433mo ago

Document literal-token decoding (tokenizer provenance)

penfever
d44f7cd3mo ago

Add tokenizer provenance for literal token columns

penfever
9fd90d13mo ago

Add data/train-00006.parquet

penfever
de823723mo ago

Add data/train-00005.parquet

penfever
eab39593mo ago

Add data/train-00004.parquet

penfever
03e71013mo ago

Add data/train-00003.parquet

penfever
47c9e863mo ago

Add data/train-00002.parquet

penfever
7decc273mo ago

Add data/train-00001.parquet

penfever
330417a3mo ago

Add data/train-00000.parquet

penfever
fd48dee3mo ago

initial commit

penfever