CoolFace
Datasetpublic

omniomni/omni-science

GitHub   Website   Paper (Coming Soon) Dataset Details This dataset is a combination of corpora of text from scientific Wikipedia articles and scientific papers across major fields of science. This dataset contains continued-pretrain data. Sources This dataset was sourced from the following open-sourced datasets: Science zeroshot/arxiv-biology legacy-datasets/wikipedia bisectgroup/PubMed_TA… See the full description on the dataset page: https://huggingface.co/datasets/omniomni/omni-science.

sourceHugging Facecc-by-sa-4.0updated 1y agoView on Hugging Face
1likes50downloads
Dataset Card

<p align="center"> <img alt="Omni 0 preview header" src="https://github.com/omniomni-ai/omni-0-preview-models/raw/refs/heads/main/omni-0-preview-models-image.png"> </p>

<p align="center"> <a href="https://github.com/omniomni-ai"><strong>GitHub</strong></a> &nbsp <a href="https://omniomni.framer.website/"><strong>Website</strong></a> &nbsp <strong>Paper (Coming Soon)</strong> </p>

<br>

Dataset Details

This dataset is a combination of corpora of text from scientific Wikipedia articles and scientific papers across major fields of science. This dataset contains continued-pretrain data.

Sources

This dataset was sourced from the following open-sourced datasets:

Science