ermiaazarkhalili/orca-mini-short-100tok
Orca-Mini - Short Context (<100 tokens) This dataset is a filtered version of ermiaazarkhalili/orca-mini-v1-high-prob-qwen-0.5b-10k containing only samples with fewer than 100 tokens. Dataset Description This dataset is designed for efficient XAI (Explainable AI) attribution evaluation on decoder models. Short context samples allow for faster evaluation while maintaining meaningful attribution analysis. Statistics Total samples: 5,000 Token count… See the full description on the dataset page: https://huggingface.co/datasets/ermiaazarkhalili/orca-mini-short-100tok.
Orca-Mini - Short Context (<100 tokens)
This dataset is a filtered version of ermiaazarkhalili/orca-mini-v1-high-prob-qwen-0.5b-10k containing only samples with fewer than 100 tokens.
Dataset Description
This dataset is designed for efficient XAI (Explainable AI) attribution evaluation on decoder models. Short context samples allow for faster evaluation while maintaining meaningful attribution analysis.
Statistics
- Total samples: 5,000
- Token count range: 5 - 99
- Mean token count: 23.1 (std: 11.8)
- Median token count: 21.0
Columns
Source Dataset
This dataset was created by filtering ermiaazarkhalili/orca-mini-v1-high-prob-qwen-0.5b-10k with the following criteria:
- Token length: 5 <= tokens < 100
- Tokenizer:
Qwen/Qwen2.5-0.5B
Usage
from datasets import load_dataset
dataset = load_dataset("ermiaazarkhalili/orca-mini-short-100tok", split="train")
print(f"Loaded {len(dataset)} samples")Citation
If you use this dataset, please cite the ALTI-XAI framework.
License
MIT License
