CoolFace
Datasetpublic

ermiaazarkhalili/orca-mini-short-100tok

Orca-Mini - Short Context (<100 tokens) This dataset is a filtered version of ermiaazarkhalili/orca-mini-v1-high-prob-qwen-0.5b-10k containing only samples with fewer than 100 tokens. Dataset Description This dataset is designed for efficient XAI (Explainable AI) attribution evaluation on decoder models. Short context samples allow for faster evaluation while maintaining meaningful attribution analysis. Statistics Total samples: 5,000 Token count… See the full description on the dataset page: https://huggingface.co/datasets/ermiaazarkhalili/orca-mini-short-100tok.

sourceHugging Facemitupdated 9mo agoView on Hugging Face
0likes26downloads
Dataset Card

Orca-Mini - Short Context (<100 tokens)

This dataset is a filtered version of ermiaazarkhalili/orca-mini-v1-high-prob-qwen-0.5b-10k containing only samples with fewer than 100 tokens.

Dataset Description

This dataset is designed for efficient XAI (Explainable AI) attribution evaluation on decoder models. Short context samples allow for faster evaluation while maintaining meaningful attribution analysis.

Statistics

  • —Total samples: 5,000
  • —Token count range: 5 - 99
  • —Mean token count: 23.1 (std: 11.8)
  • —Median token count: 21.0

Columns

ColumnDescription
sentence_prefixText prefix before predicted token
predicted_tokenModel's top-1 prediction
actual_tokenGround truth token
probabilityPrediction confidence (0-1)

Source Dataset

This dataset was created by filtering ermiaazarkhalili/orca-mini-v1-high-prob-qwen-0.5b-10k with the following criteria:

  • —Token length: 5 <= tokens < 100
  • —Tokenizer: Qwen/Qwen2.5-0.5B

Usage

python
from datasets import load_dataset

dataset = load_dataset("ermiaazarkhalili/orca-mini-short-100tok", split="train")
print(f"Loaded {len(dataset)} samples")

Citation

If you use this dataset, please cite the ALTI-XAI framework.

License

MIT License