CoolFace
Datasetpublic

Younggooo/kitrec-test-setb

KitREC Test Dataset - Set B Evaluation test dataset for the KitREC (Knowledge-Instruction Transfer for Recommendation) cross-domain recommendation system. Dataset Description This test dataset is designed for evaluating fine-tuned LLMs on cross-domain recommendation tasks across 10 different user types. Dataset Summary Attribute Value Candidate Set Set B (Random (Fair baseline)) Total Samples 30,000 Source Domain Books Target… See the full description on the dataset page: https://huggingface.co/datasets/Younggooo/kitrec-test-setb.

sourceHugging Faceapache-2.0updated 10mo agoView on Hugging Face
0likes9downloads
Dataset Card

KitREC Test Dataset - Set B

Evaluation test dataset for the KitREC (Knowledge-Instruction Transfer for Recommendation) cross-domain recommendation system.

Dataset Description

This test dataset is designed for evaluating fine-tuned LLMs on cross-domain recommendation tasks across 10 different user types.

Dataset Summary

AttributeValue
Candidate SetSet B (Random (Fair baseline))
Total Samples30,000
Source DomainBooks
Target DomainsMovies & TV, Music
User Types10 (5 per target domain)
Rating Range1.0 - 5.0
Mean Rating4.259

Set A vs Set B

  • Set A (Hybrid): Contains hard negative candidates + random candidates for challenging evaluation
  • Set B (Random): Contains only random candidates for fair baseline comparison

Both sets use the same ground truth items but differ in candidate composition.

User Type Distribution

User TypeCountPercentage
coldstart2core_movies3,00010.00%
coldstart2core_music3,00010.00%
coldstart3core_movies3,00010.00%
coldstart3core_music3,00010.00%
coldstart4core_movies3,00010.00%
coldstart4core_music3,00010.00%
overlappingbooksmovies3,00010.00%
overlappingbooksmusic3,00010.00%
sourceonlymovies3,00010.00%
sourceonlymusic3,00010.00%

User Type Definitions

User TypeDescription
overlapping_books_moviesUsers with history in both Books and Movies & TV
overlapping_books_musicUsers with history in both Books and Music
cold_start_2core_moviesMovies cold-start users with 2 target interactions
cold_start_2core_musicMusic cold-start users with 2 target interactions
cold_start_3core_moviesMovies cold-start users with 3 target interactions
cold_start_3core_musicMusic cold-start users with 3 target interactions
cold_start_4core_moviesMovies cold-start users with 4 target interactions
cold_start_4core_musicMusic cold-start users with 4 target interactions
source_only_moviesUsers with ONLY Books history (extreme cold-start for Movies)
source_only_musicUsers with ONLY Books history (extreme cold-start for Music)

Dataset Structure

Data Fields

  • instruction (string): The recommendation prompt including user history
  • input (string): Candidate items for recommendation (100 items per sample)
  • gt_item_id (string): Ground truth item ID
  • gt_title (string): Ground truth item title
  • gt_rating (float): User's actual rating for the ground truth item (1-5 scale)
  • user_id (string): Unique user identifier
  • user_type (string): User category (10 types)
  • candidate_set (string): A or B
  • source_domain (string): Books
  • target_domain (string): Movies & TV or Music
  • candidate_count (int): Number of candidate items (100)

Data Split

SplitSamplesDescription
test30,000Evaluation test set

Usage

python
from datasets import load_dataset

# Load test dataset
dataset = load_dataset("Younggooo/kitrec-test-setb")

# Access test data
test_data = dataset["test"]
print(f"Test samples: {len(test_data)}")

# Example: Filter by user type
overlapping_movies = test_data.filter(
    lambda x: x["user_type"] == "overlapping_books_movies"
)
print(f"Overlapping Movies users: {len(overlapping_movies)}")

# Example: Calculate metrics by user type
from collections import defaultdict
user_type_metrics = defaultdict(list)
for sample in test_data:
    user_type_metrics[sample["user_type"]].append(sample["gt_rating"])

Evaluation Protocol

Metrics

  • Hit@K (K=1, 5, 10): Whether GT item is in top-K predictions
  • MRR: Mean Reciprocal Rank
  • NDCG@10: Normalized Discounted Cumulative Gain

Stratified Analysis

Evaluate separately for each of the 10 user types to understand model performance across different scenarios.

RQ4: Confidence-Rating Alignment

Use gt_rating field to analyze correlation between model's confidence scores and actual user ratings.

Research Questions Addressed

RQQuestionRelevant Fields
RQ1KitREC structure effectivenessAll user types
RQ2Comparison with baselinesAll metrics
RQ3Cold-start performancecoldstart* user types
RQ4Confidence-rating alignmentgt_rating

Citation

bibtex
@misc{kitrec2024,
  title={KitREC: Knowledge-Instruction Transfer for Cross-Domain Recommendation},
  author={KitREC Research Team},
  year={2024},
  note={Test dataset for cross-domain recommendation evaluation}
}

License

This dataset is released under the Apache 2.0 License.