CoolFace
Datasetpublic

MoL2/autotrain-data-dnabert_classfy_chr1

AutoTrain Dataset for project: dnabert_classfy_chr1 Dataset Description This dataset has been automatically processed by AutoTrain for project dnabert_classfy_chr1. Languages The BCP-47 code for the dataset's language is unk. Dataset Structure Data Instances A sample from this dataset looks as follows: [ { "target": 13, "text":… See the full description on the dataset page: https://huggingface.co/datasets/MoL2/autotrain-data-dnabert_classfy_chr1.

sourceHugging Faceupdated 3y agoView on Hugging Face
0likes21downloads
Dataset Card

AutoTrain Dataset for project: dnabertclassfychr1

Dataset Description

This dataset has been automatically processed by AutoTrain for project dnabertclassfychr1.

Languages

The BCP-47 code for the dataset's language is unk.

Dataset Structure

Data Instances

A sample from this dataset looks as follows:

json
[
  {
    "target": 13,
    "text": "tctgaaaataactgtattgcttctgtttgtaaggtcagtttgctggatgtattaacagaattctcagcactttgagtgttgtcttttgagttgcattattaagttagccgttaatttaattgttatttctttgtagttaatgccttttttctctggctgcttttaagatcttctgtgtgactttggtgtgctaagtaagttctgctatgatatgtccagtagaacttctttttttattattatccttaggatttgataggttttctgaatctgagaattggtatctttcatccattctggaacatttttatatattatttcttcaattgtgcttttctttcattcctctatcatctccatctagatctcttgtttagacaggctcaccctatcctctgtatttgctgcattctcgataatttcacagtctgtcttctaggtcactaattccttctttagttgtgtctaaactcttttccacctgcacattgagtttctgg"
  },
  {
    "target": 13,
    "text": "GCCAGTGTCTCTCGTGGTCTCTCAAATTCCTTTCCTTCCTGAAAAGAAAAAAAATGATACCTTACATTTTTTAACTTAAGATTTAAAAATATGTTATATAGAGTAAAATTGGGCTTCTCTCATCCTTTAGCCATGAGAAAAAAAATGTTCTTTTGTTAGGAGGACCATGGTCACCATGAAGGTCAGTCATAGGCATCCATGGAGTCAATTGTGGCAGCCATGTCCCCCCAGCAGCAGATCCCTACTACTTAGATCCAGCCACTCCTCAGAGGTGGAGAAGGGGAAGTGAGAAAAGGTCCATCCTGGCCCCTAGGAAACTCTCCCCAAAGAAAAACCAAGAAGAAACACTTTCCAAATGTTTCTTTCCTTTAAAATAAAGTTAGTTAGCAACCCTGATGCCTTCATCAAAACAAAGAAAGACCTTCTGATGACAGAGTCTGAGGATGATCATGCAAAGTGCTGAACAAAGTGAAAAATGAAATCAAGATTTTTTCCATTCT"
  }
]

Dataset Fields

The dataset has the following fields (also called "features"):

json
{
  "target": "ClassLabel(names=['0', '1', '10', '11', '12', '13', '14', '15', '2', '3', '4', '5', '6', '7', '8', '9'], id=None)",
  "text": "Value(dtype='string', id=None)"
}

Dataset Splits

This dataset is split into a train and validation split. The split sizes are as follow:

Split nameNum samples
train1595
valid405