CoolFace
Datasetpublic

FlyaiLab/ecommerce_last_exam

E-Commerce Last Exam A benchmark for evaluating LLM agents on 120 real-world travel planning and e-commerce tool-use tasks. Each task runs in an isolated Docker container with domain-specific CLI tools and SQLite databases. Agents must search, analyze, and produce structured recommendations. Repository: alibaba-flyai/ecommerce_last_exam Evaluation CLI: flyai-bench (pip install flyai-bench) Leaderboard: FlyaiLab/ecommerce_last_exam_leaderboard Dataset Summary… See the full description on the dataset page: https://huggingface.co/datasets/FlyaiLab/ecommerce_last_exam.

sourceHugging Facemitupdated 20d agoView on Hugging Face
1likes208downloads
Dataset Card

E-Commerce Last Exam

<iframe src="https://FlyaiLab-ecommercelastexam_leaderboard.hf.space" frameborder="0" width="100%" height="600"

</iframe>

A benchmark for evaluating LLM agents on 120 real-world travel planning and e-commerce tool-use tasks. Each task runs in an isolated Docker container with domain-specific CLI tools and SQLite databases. Agents must search, analyze, and produce structured recommendations.

Dataset Summary

E-Commerce Last Exam consists of 120 tasks across two configs:

ConfigTasksDomains
travel77Hotel booking, transport routing, attraction planning
e_commerce43Travel gear, food, electronics, lifestyle shopping

Each task provides a natural-language user question and a pre-built Docker image containing the environment (CLI tools, databases, test harness). Agents interact with the environment via tool calls and produce a structured answer scored 0.00 - 1.00.

Data Fields

FieldTypeDescription
instance_idstringUnique task identifier (e.g., attraction_auckland_extreme_sports_415)
domainstringTask domain (e.g., attraction, hotel, transport, consume)
configstringBenchmark config: travel or e_commerce
user_questionstringNatural-language task description
docker_imagestringDocker image for the task environment

Usage

python
from datasets import load_dataset

# Load all 120 tasks
ds = load_dataset("FlyaiLab/ecommerce_last_exam", split="test")

# Load only travel tasks (77)
ds_travel = load_dataset("FlyaiLab/ecommerce_last_exam", "travel", split="test")

# Load only e-commerce tasks (43)
ds_ecom = load_dataset("FlyaiLab/ecommerce_last_exam", "e_commerce", split="test")

Evaluation

bash
pip install flyai-bench

# Run evaluation on travel config
flyai-bench run --dataset-config travel --limit 5 --dry-run
flyai-bench run --dataset-config travel

# Generate report and submit
flyai-bench report
flyai-bench submit --model your-model --provider your-provider

See the GitHub repository for full documentation.

Citation

If you use this benchmark, please cite:

bibtex
@misc{ecommerce_last_exam,
  title={E-Commerce Last Exam: A Benchmark for LLM Agent Evaluation on Real-World Tool-Use Tasks},
  author={FlyaiLab},
  year={2026},
  url={https://huggingface.co/datasets/FlyaiLab/ecommerce_last_exam}
}