manzoliw/trucobench-sft
TrucoPaulista SFT v2 Dataset This dataset contains 8,204,630 reasoning-augmented instruction turns generated from 100,000 self-play games of a mathematically optimal heuristic agent (HeuristicAgent) playing Truco Paulista. It is designed to fine-tune Large Language Models (LLMs) to master strategic reasoning, bluffing, and decision-making under imperfect information. Dataset Details Game: Truco Paulista (Brazilian card game) Total Turns/Examples: 8,204,630… See the full description on the dataset page: https://huggingface.co/datasets/manzoliw/trucobench-sft.
023
Upload README.md with huggingface_hub
Upload truco_sft_100k_v2.jsonl.gz with huggingface_hub
initial commit
