FishCaduceus
FishCaduceus-Functional-Site-Benchmark
FishCaduceus Functional Site Benchmark
Dataset description
This dataset contains sequence-based benchmarks for four gene-annotation tasks used to evaluate FishCaduceus:
translation initiation site (TIS) prediction
translation termination site (TTS) prediction
splice donor site prediction
splice acceptor site prediction
The benchmark was designed to evaluate both within-species performance and cross-species transfer. Models are trained and selected only with… See the full description on the dataset page: https://huggingface.co/datasets/FishCaduceus/FishCaduceus-Functional-Site-Benchmark.FishCaduceus-Evolutionary-Constraint-Benchmark
FishCaduceus Evolutionary Constraint Benchmark
Dataset description
This dataset contains sequence-based benchmarks for evaluating whether FishCaduceus representations capture evolutionary constraint in fish genomes.
Constraint labels were derived from a 26-fish whole-genome alignment generated with Progressive Cactus. Grass carp (Ctenopharyngodon idella) was used as the primary reference genome for defining aligned and conserved positions. The resulting labeled… See the full description on the dataset page: https://huggingface.co/datasets/FishCaduceus/FishCaduceus-Evolutionary-Constraint-Benchmark.FishCaduceus-Pretraining-1024
FishCaduceus Pretraining Dataset 1024
Dataset description
This dataset contains fixed-length 1,024-bp genomic sequence windows prepared for pretraining FishCaduceus DNA language models. It uses single-nucleotide tokenization and is intended for masked language modeling.
Dataset summary
The dataset contains 2,709,306 JSON Lines records. Each record contains genomic coordinates and a seq field. The six files were audited by streaming line-by-line… See the full description on the dataset page: https://huggingface.co/datasets/FishCaduceus/FishCaduceus-Pretraining-1024.FishCaduceus-Pretraining-512
FishCaduceus Pretraining Dataset 512
Dataset description
This dataset contains fixed-length 512-bp genomic sequence windows prepared for pretraining FishCaduceus DNA language models. It uses single-nucleotide tokenization and is intended for masked language modeling.
Dataset summary
The dataset contains 6,087,221 JSON Lines records. Each record contains genomic coordinates and a seq field. The six files were audited by streaming line-by-line… See the full description on the dataset page: https://huggingface.co/datasets/FishCaduceus/FishCaduceus-Pretraining-512.
