mjbommar/binary-30k
Binary-30K: Cross-Platform Binary Dataset with Stratified Splits Paper | Code 🔗 Original Dataset (no splits): mjbommar/binary-30k-tokenized This is the stratified train/validation/test split version of the Binary-30K dataset, containing 29,793 unique cross-platform binaries with pre-computed tokenization. This version provides standardized splits for reproducible machine learning research. 🎯 Key Features ✅ Stratified 70/15/15 splits maintaining class balance… See the full description on the dataset page: https://huggingface.co/datasets/mjbommar/binary-30k.
5508
