omniomni/omni-science
GitHub Website Paper (Coming Soon) Dataset Details This dataset is a combination of corpora of text from scientific Wikipedia articles and scientific papers across major fields of science. This dataset contains continued-pretrain data. Sources This dataset was sourced from the following open-sourced datasets: Science zeroshot/arxiv-biology legacy-datasets/wikipedia bisectgroup/PubMed_TA… See the full description on the dataset page: https://huggingface.co/datasets/omniomni/omni-science.
<p align="center"> <img alt="Omni 0 preview header" src="https://github.com/omniomni-ai/omni-0-preview-models/raw/refs/heads/main/omni-0-preview-models-image.png"> </p>
<p align="center"> <a href="https://github.com/omniomni-ai"><strong>GitHub</strong></a>   <a href="https://omniomni.framer.website/"><strong>Website</strong></a>   <strong>Paper (Coming Soon)</strong> </p>
<br>
Dataset Details
This dataset is a combination of corpora of text from scientific Wikipedia articles and scientific papers across major fields of science. This dataset contains continued-pretrain data.
Sources
This dataset was sourced from the following open-sourced datasets:
Science
