datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
seq2seq-mixed-pretraining-SmolLM2seq2seq-glue
Dataset Card for "seq2seq-glue"
More Information needed
seq2seq-cnndm
Dataset Card for "seq2seq-cnndm"
More Information needed
esnli-seq2seqphoner_seq2seq
Dataset Card for "phoner_seq2seq"
More Information needed
seq2seq-qnli
Dataset Card for "seq2seq-qnli"
More Information needed
seq2seq-mnli
Dataset Card for "seq2seq-mnli"
More Information needed
seq2seq-stsb
Dataset Card for "seq2seq-stsb"
More Information needed
seq2seq-qqp
Dataset Card for "seq2seq-qqp"
More Information needed
seq2seq-sst2
Dataset Card for "seq2seq-sst2"
More Information needed
en-Pile-NER-seq2seq_formatseq2seq-rte
Dataset Card for "seq2seq-rte"
More Information needed
squad_seq2seqseq2seq-mrpc
Dataset Card for "seq2seq-mrpc"
More Information needed
budget-seq2seq
Dataset Card for "budget-seq2seq-xml"
More Information needed
seq2seq-cola
Dataset Card for "seq2seq-cola"
More Information needed
seq2seq-squad
Dataset Card for "seq2seq-squad"
More Information needed
dna2aa-eb502-seq2seq
DNA → Amino Acid Translation Dataset (EB502 Submission)
Description
이 데이터셋은 무작위로 생성된 DNA 시퀀스(A, C, G, T)와 표준 유전 코드를 사용한 해당 아미노산 번역 쌍을 포함합니다. 각 DNA 서열은 ATG로 시작하여 정지 코돈으로 끝납니다.
Dataset Structure
필드: src (DNA), tgt (아미노산)
분할: train (240개), validation (60개), test (60개)
budget-seq2seq-json
Dataset Card for "budget-seq2seq-json"
More Information needed
diffusiondb-seq2seq
Dataset Card for "diffusiondb-seq2seq"
More Information needed
lsoie_seq2seqcarb_seq2seqlistwise_seq2seq_9w
Dataset Card for "listwise_seq2seq_9w"
More Information needed
