open-athena/exp_rpt_ghactions-v3-qwen3.5-122b-131k-opencode-traces
Agent trace dataset Decoding the literal token IDs The prompt_token_ids / completion_token_ids / logprobs columns are the verbatim tokens the serving engine emitted, stored PER AGENT STEP as a list-of-lists (one inner list per turn). To turn them back into text you MUST use the exact tokenizer the model was served with — a generic same-family tokenizer will decode word tokens to garbage. Served model / tokenizer source: Qwen/Qwen3.5-122B-A10B-FP8 from transformers… See the full description on the dataset page: https://huggingface.co/datasets/open-athena/exp_rpt_ghactions-v3-qwen3.5-122b-131k-opencode-traces.
Document literal-token decoding (tokenizer provenance)
Add tokenizer provenance for literal token columns
Add data/train-00027.parquet
Add data/train-00026.parquet
Add data/train-00025.parquet
Add data/train-00024.parquet
Add data/train-00023.parquet
Add data/train-00022.parquet
Add data/train-00021.parquet
Add data/train-00020.parquet
Add data/train-00019.parquet
Add data/train-00018.parquet
Add data/train-00017.parquet
Add data/train-00016.parquet
Add data/train-00015.parquet
Add data/train-00014.parquet
Add data/train-00013.parquet
Add data/train-00012.parquet
Add data/train-00011.parquet
Add data/train-00010.parquet
Add data/train-00009.parquet
Add data/train-00008.parquet
Add data/train-00007.parquet
Add data/train-00006.parquet
Add data/train-00005.parquet
Add data/train-00004.parquet
Add data/train-00003.parquet
Add data/train-00002.parquet
Add data/train-00001.parquet
Add data/train-00000.parquet
initial commit
