CoolFace
Datasetpublic

mjbommar/magic-bert-dataset

Magic-BERT Binary File Classification Dataset This dataset contains tokenized binary file samples for training MIME type classification models. Each sample is a 64KB chunk from the beginning of a file, tokenized using a byte-level BPE tokenizer. Splits Split Samples Train 37,111 Validation 4,591 Test 4,748 Features Each sample contains: Feature Type Description blake2b string Content hash (unique sample ID) mime_type… See the full description on the dataset page: https://huggingface.co/datasets/mjbommar/magic-bert-dataset.

sourceHugging Faceapache-2.0updated 10mo agoView on Hugging Face
0likes135downloads
Dataset Card

Magic-BERT Binary File Classification Dataset

This dataset contains tokenized binary file samples for training MIME type classification models. Each sample is a 64KB chunk from the beginning of a file, tokenized using a byte-level BPE tokenizer.

Dataset Description

  • Total Samples: 46,450
  • Number of Classes: 125
  • Sequence Length: 999999
  • Vocabulary Size: 32,768

Splits

SplitSamples
Train37,111
Validation4,591
Test4,748

Features

Each sample contains:

FeatureTypeDescription
blake2bstringContent hash (unique sample ID)
mime_typestringMIME type label
source_pathstringOriginal file path
source_rootstringDataset source
extensionstringFile extension
source_size_bytesint64Original file size
sample_bytesint32Sample size (max 64KB)
tokensList[int32]Tokenized input (999999 tokens)

MIME Type Distribution (Top 20)

MIME TypeCountPercentage
application/octet-stream2,0004.3%
application/vnd.ms-powerpoint2,0004.3%
audio/flac2,0004.3%
text/x-c2,0004.3%
text/plain1,9994.3%
image/png1,9644.2%
application/gzip1,5743.4%
image/svg+xml1,4863.2%
text/html1,4543.1%
application/vnd.ms-excel1,3803.0%
application/javascript1,3402.9%
application/x-7z-compressed1,2002.6%
image/gif1,1562.5%
text/csv1,1282.4%
image/webp1,0142.2%
application/zlib9872.1%
text/x-lisp9802.1%
application/x-gettext-translation9652.1%
text/x-c++8001.7%
application/zstd7811.7%