datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
Global-Ocean-Science-Corpus
🌊 Global-Ocean-Science-Corpus (v2.0 Curated & Cleaned)
A Highly Curated, Large-Scale Pre-Training & RAG Corpus for Deep Ocean Sciences, Marine Biology, and Oceanography
Language Note: This dataset is a 100% English-language scientific corpus (language: "en") aggregating peer-reviewed literature, deep-sea exploration dossiers, and technical oceanographic reports from leading global marine institutes.
Global-Ocean-Science-Corpus, derin okyanus bilimleri, deniz biyolojisi… See the full description on the dataset page: https://huggingface.co/datasets/tilikumotp/Global-Ocean-Science-Corpus.TILO.RA_CODER_Dataset
TILO.RA CODER Dataset
Объединённый русско-английский датасет для обучения и поиска по коду.
Формат — пары question / code: вопрос на естественном языке → готовый код-ответ.
Датасет собран для локального ассистента TILO.RA CODER — офлайн-помощника по программированию
Скачать по ссылке
https://github.com/thetemirbolatov/TILO.RA_CODER_Dataset/releases/download/v1.0.0/tilora_knowledge_merged.jsonl
Состав
Источник
Язык
Записей
English coding… See the full description on the dataset page: https://huggingface.co/datasets/thetemirbolatov/TILO.RA_CODER_Dataset.SFinD-S
Dataset Description
This sample is part of the larger SFinD-S (Strative Financial Dataset - Synthetic), a comprehensive dataset designed for Retrieval-Augmented Generation (RAG) GenAI applications, Natural Language Processing (NLP), Large Language Models (LLM), and AI tasks in the financial domain. The full SFinD-S dataset contains over 20,000 records of realistic financial questions and verified answers, sourced from a wide variety of web content.
If you find this dataset useful or… See the full description on the dataset page: https://huggingface.co/datasets/tilmann-strative/SFinD-S.KazToolCall-30k
KazToolCall-30k
Қазақша tool-calling деректер жинағы · Набор данных для tool-calling на казахском языке · Kazakh tool-calling dataset
Қазақша · Русский · English
Қазақша
KazToolCall-30k — қазақ тіліндегі tool-calling сценарийлеріне арналған 10.3 МБ деректер жинағы. Репозиторийде 10 санат бойынша 1 909 дайын үлгі бар; жоспарланған көлемі — 30 000 үлгі.
Құрамы
Әр жазбада пайдаланушы сұрауы, қолжетімді құралдардың JSON түріндегі тізімі, күтілетін… See the full description on the dataset page: https://huggingface.co/datasets/TilQazyna/KazToolCall-30k.Til-Web-Raw-KK-v1
Til-Web-Raw-KK-v1
Білім беру сайттарының бастапқы веб-айнасы · Исходное зеркало образовательных сайтов · Raw mirror of educational websites
Қазақша · Русский · English
Қазақша
Til-Web-Raw-KK-v1 — қазақ тіліндегі білім беру және сұрақ-жауап сайттарының бастапқы веб-айнасы, көлемі 19.50 ГБ. Репозиторий сервер берген HTML беттерін, суреттерді және жүктелетін тіркемелерді мәтін тазалауға дейінгі күйінде сақтайды.
Құрамы
Сайт
Беттер
HTML көлемі… See the full description on the dataset page: https://huggingface.co/datasets/TilQazyna/Til-Web-Raw-KK-v1.
