datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
MM-Mind2Web-tilde_test_snapshot_20dist
MultiModal-Mind2Web~ (MM-Mind2Web~)
rabbit inc.
[Leaderboard & Blogpost to be released]
Configuration: test split, snapshot with seed 42, 20 distractors
Multimodal-Mind2Web is a dataset proposed by Boyuan et al.. It's designed for the development and evaluation of generalist web agents and includes various action trajectories of humans on real websites.
We've simplified the raw dump from both Multimodal-Mind2Web and Mind2Web into sequences of observation-action pairs. We've… See the full description on the dataset page: https://huggingface.co/datasets/rabbit-hmi/MM-Mind2Web-tilde_test_snapshot_20dist.Global-Ocean-Science-Corpus
🌊 Global-Ocean-Science-Corpus (v2.0 Curated & Cleaned)
A Highly Curated, Large-Scale Pre-Training & RAG Corpus for Deep Ocean Sciences, Marine Biology, and Oceanography
Language Note: This dataset is a 100% English-language scientific corpus (language: "en") aggregating peer-reviewed literature, deep-sea exploration dossiers, and technical oceanographic reports from leading global marine institutes.
Global-Ocean-Science-Corpus, derin okyanus bilimleri, deniz biyolojisi… See the full description on the dataset page: https://huggingface.co/datasets/tilikumotp/Global-Ocean-Science-Corpus.TILO.RA_CODER_Dataset
TILO.RA CODER Dataset
Объединённый русско-английский датасет для обучения и поиска по коду.
Формат — пары question / code: вопрос на естественном языке → готовый код-ответ.
Датасет собран для локального ассистента TILO.RA CODER — офлайн-помощника по программированию
Скачать по ссылке
https://github.com/thetemirbolatov/TILO.RA_CODER_Dataset/releases/download/v1.0.0/tilora_knowledge_merged.jsonl
Состав
Источник
Язык
Записей
English coding… See the full description on the dataset page: https://huggingface.co/datasets/thetemirbolatov/TILO.RA_CODER_Dataset.dataclaw-tillg
Claude Code Conversation Logs
Exported with DataClaw.
Tag: dataclaw — Browse all DataClaw datasets
Stats
Metric
Value
Sessions
123
Projects
18
Input tokens
596.1M
Output tokens
353K
Last updated
2026-02-25
Models
Model
Sessions
claude-opus-4-5-20251101
90
claude-opus-4-6
28
devstral:24b
2
gpt-oss:20b
2
claude-sonnet-4-5-20250929
1
Schema
Each line in conversations.jsonl is one conversation session:
{… See the full description on the dataset page: https://huggingface.co/datasets/tillg/dataclaw-tillg.SFinD-S
Dataset Description
This sample is part of the larger SFinD-S (Strative Financial Dataset - Synthetic), a comprehensive dataset designed for Retrieval-Augmented Generation (RAG) GenAI applications, Natural Language Processing (NLP), Large Language Models (LLM), and AI tasks in the financial domain. The full SFinD-S dataset contains over 20,000 records of realistic financial questions and verified answers, sourced from a wide variety of web content.
If you find this dataset useful or… See the full description on the dataset page: https://huggingface.co/datasets/tilmann-strative/SFinD-S.til-instruct-mix-v1
til-instruct-mix-v1
Көптілді instruction корпусы · Многоязычный instruction-корпус · Multilingual instruction corpus
Қазақша · Русский · English
Қазақша
til-instruct-mix-v1 — қазақ, орыс және ағылшын тілдеріндегі, сондай-ақ код пен математика тапсырмаларындағы instruction fine-tune деректерінің жинағы. Көлемі — 186.5 МБ, жиынтықта 352,651 user–assistant жұбы бар. Аралас материал көптілді instruction модельдерін оқытуға арналған.
Құрамы
Бөлік… See the full description on the dataset page: https://huggingface.co/datasets/TilQazyna/til-instruct-mix-v1.til-kk-summ-v1
til-kk-summ-v1
Қазақша мәтінді қысқаша мазмұндау · Краткое изложение казахского текста · Kazakh text summarization
Қазақша · Русский · English
Қазақша
til-kk-summ-v1 — қазақша мәтіннің қысқаша мазмұнын дайындауға арналған қазақ тіліндегі instruction-датасет. Көлемі — 5.4 МБ, жалпы саны — 11754 мысал. Деректер instruction fine-tune мен тиісті тапсырманы зерттеуге жарайды.
Құрамы мен форматы
Бөлік
Мысал саны
train
11520
validation
117… See the full description on the dataset page: https://huggingface.co/datasets/TilQazyna/til-kk-summ-v1.til-kk-classify-v1
til-kk-classify-v1
Мәтін тақырыбын жіктеу · Классификация темы текста · Text topic classification
Қазақша · Русский · English
Қазақша
til-kk-classify-v1 — мәтіннің саласын анықтауға арналған қазақ тіліндегі instruction-датасет. Көлемі — 4.3 МБ, жалпы саны — 11897 мысал. Деректер instruction fine-tune мен тиісті тапсырманы зерттеуге жарайды.
Құрамы мен форматы
Бөлік
Мысал саны
train
11661
validation
118
test
118
Барлығы
11897… See the full description on the dataset page: https://huggingface.co/datasets/TilQazyna/til-kk-classify-v1.til-kk-intent-v1
til-kk-intent-v1
Автор ниетін анықтау · Определение намерения автора · Author intent detection
Қазақша · Русский · English
Қазақша
til-kk-intent-v1 — сұрақ, шағым, ақпарат, пікір немесе команда түріндегі ниетті анықтауға арналған қазақ тіліндегі instruction-датасет. Көлемі — 3.6 МБ, жалпы саны — 10982 мысал. Деректер instruction fine-tune мен тиісті тапсырманы зерттеуге жарайды.
Құрамы мен форматы
Бөлік
Мысал саны
train
10764… See the full description on the dataset page: https://huggingface.co/datasets/TilQazyna/til-kk-intent-v1.til-kk-rephrase-v1
til-kk-rephrase-v1
Мәтінді ресми стильде қайта жазу · Перефразирование в официальном стиле · Official-style rewriting
Қазақша · Русский · English
Қазақша
til-kk-rephrase-v1 — мағынаны сақтап, мәтінді ресми әрі түсінікті етіп қайта жазуға арналған қазақ тіліндегі instruction-датасет. Көлемі — 6.7 МБ, жалпы саны — 12063 мысал. Деректер instruction fine-tune мен тиісті тапсырманы зерттеуге жарайды.
Құрамы мен форматы
Бөлік
Мысал саны
train… See the full description on the dataset page: https://huggingface.co/datasets/TilQazyna/til-kk-rephrase-v1.til-kk-qagen-v1
til-kk-qagen-v1
Мәтін бойынша сұрақ пен жауап құрастыру · Генерация вопроса и ответа по тексту · Text-grounded question and answer generation
Қазақша · Русский · English
Қазақша
til-kk-qagen-v1 — мәтінге сүйенген сұрақ пен жауап құрастыруға арналған қазақ тіліндегі instruction-датасет. Көлемі — 3.0 МБ, жалпы саны — 6241 мысал. Деректер instruction fine-tune мен тиісті тапсырманы зерттеуге жарайды.
Құрамы мен форматы
Бөлік
Мысал саны… See the full description on the dataset page: https://huggingface.co/datasets/TilQazyna/til-kk-qagen-v1.til-kk-sentiment-v1
til-kk-sentiment-v1
Мәтін тональділігін анықтау · Определение тональности текста · Text sentiment classification
Қазақша · Русский · English
Қазақша
til-kk-sentiment-v1 — оң, теріс немесе бейтарап тональділікті анықтауға арналған қазақ тіліндегі instruction-датасет. Көлемі — 2.2 МБ, жалпы саны — 6975 мысал. Деректер instruction fine-tune мен тиісті тапсырманы зерттеуге жарайды.
Құрамы мен форматы
Бөлік
Мысал саны
train
6837
validation… See the full description on the dataset page: https://huggingface.co/datasets/TilQazyna/til-kk-sentiment-v1.til-kk-normalize-v1
til-kk-normalize-v1
Қазақша мәтінді қалыпқа келтіру · Нормализация казахского текста · Kazakh text normalization
Қазақша · Русский · English
Қазақша
til-kk-normalize-v1 — қате, регистрі мен тыныс белгілері бұзылған мәтінді түзетуге арналған қазақ тіліндегі instruction-датасет. Көлемі — 5.0 МБ, жалпы саны — 10585 мысал. Деректер instruction fine-tune мен тиісті тапсырманы зерттеуге жарайды.
Құрамы мен форматы
Бөлік
Мысал саны
train
10375… See the full description on the dataset page: https://huggingface.co/datasets/TilQazyna/til-kk-normalize-v1.Til-Morphology
Til-Morphology
Қазақ тілінің морфологиялық деректері · Морфологические данные казахского языка · Kazakh morphological data
Қазақша · Русский · English
Қазақша
Til-Morphology — қазақ тіліндегі 3 767 518 морфологиялық талдау жолы жинақталған, көлемі 207.8 МБ датасет. Жолдар модель-сарапшы бағасына қарай premium және clean деңгейлеріне бөлінген.
Құрамы
Әр жазбада word, segmentation, n_morphemes, lang, category, score және text өрістері бар.… See the full description on the dataset page: https://huggingface.co/datasets/TilQazyna/Til-Morphology.til-kk-keywords-v1
til-kk-keywords-v1
Кілт сөздерді шығару · Извлечение ключевых слов · Keyword extraction
Қазақша · Русский · English
Қазақша
til-kk-keywords-v1 — қазақша мәтіннен кілт сөздерді шығаруға арналған қазақ тіліндегі instruction-датасет. Көлемі — 4.7 МБ, жалпы саны — 12158 мысал. Деректер instruction fine-tune мен тиісті тапсырманы зерттеуге жарайды.
Құрамы мен форматы
Бөлік
Мысал саны
train
11916
validation
121
test
121
Барлығы
12158… See the full description on the dataset page: https://huggingface.co/datasets/TilQazyna/til-kk-keywords-v1.til-kk-title-v1
til-kk-title-v1
Қазақша мәтінге тақырып ұсыну · Генерация заголовка к казахскому тексту · Kazakh title generation
Қазақша · Русский · English
Қазақша
til-kk-title-v1 — қазақша мәтінге қысқа әрі дәл тақырып ұсынуға арналған қазақ тіліндегі instruction-датасет. Көлемі — 3.9 МБ, жалпы саны — 10916 мысал. Деректер instruction fine-tune мен тиісті тапсырманы зерттеуге жарайды.
Құрамы мен форматы
Бөлік
Мысал саны
train
10698
validation
109… See the full description on the dataset page: https://huggingface.co/datasets/TilQazyna/til-kk-title-v1.til-kk-expand-v1
til-kk-expand-v1
Негізгі ойды кеңейту және түсіндіру · Расширение и объяснение основной мысли · Main-idea expansion and explanation
Қазақша · Русский · English
Қазақша
til-kk-expand-v1 — мәтіндегі негізгі ойды кеңейтіп түсіндіруге арналған қазақ тіліндегі instruction-датасет. Көлемі — 9.3 МБ, жалпы саны — 10962 мысал. Деректер instruction fine-tune мен тиісті тапсырманы зерттеуге жарайды.
Құрамы мен форматы
Бөлік
Мысал саны
train
10744… See the full description on the dataset page: https://huggingface.co/datasets/TilQazyna/til-kk-expand-v1.til-kk-rag-v1
til-kk-rag-v1
Үзіндіге сүйенген сұрақ-жауап · Вопросы и ответы по предоставленному отрывку · Passage-grounded question answering
Қазақша · Русский · English
Қазақша
til-kk-rag-v1 — берілген үзіндіден жауап тауып, дереккөзді көрсетуге арналған қазақ тіліндегі instruction-датасет. Көлемі — 4.6 МБ, жалпы саны — 10281 мысал. Деректер instruction fine-tune мен тиісті тапсырманы зерттеуге жарайды.
Құрамы мен форматы
Бөлік
Мысал саны
train… See the full description on the dataset page: https://huggingface.co/datasets/TilQazyna/til-kk-rag-v1.til-kk-gen-v1
til-kk-gen-v1
Қазақша мәтін құрастыру · Генерация текста на казахском · Kazakh text generation
Қазақша · Русский · English
Қазақша
til-kk-gen-v1 — ресми хаттар, жаңалықтар, тест тапсырмалары мен түсіндірмелер құрастыруға арналған қазақ тіліндегі instruction-датасет. Көлемі — 7.7 МБ, жалпы саны — 9527 мысал. Деректер instruction fine-tune мен тиісті тапсырманы зерттеуге жарайды.
Құрамы мен форматы
Бөлік
Мысал саны
train
9337
validation… See the full description on the dataset page: https://huggingface.co/datasets/TilQazyna/til-kk-gen-v1.Tilya
Dataset Card for Wikimedia Wikipedia
Dataset Summary
Wikipedia dataset containing cleaned articles of all languages.
The dataset is built from the Wikipedia dumps (https://dumps.wikimedia.org/)
with one subset per language, each containing a single train split.
Each example contains the content of one full Wikipedia article with cleaning to strip
markdown and unwanted sections (references, etc.).
All language subsets have already been processed for recent dump, and you… See the full description on the dataset page: https://huggingface.co/datasets/Tilya203/Tilya.til-kk-qa-v1
til-kk-qa-v1
Қазақша сұрақтарға жауап беру · Ответы на вопросы на казахском · Kazakh question answering
Қазақша · Русский · English
Қазақша
til-kk-qa-v1 — қазақша сұрақтарға кеңейтілген жауап дайындауға арналған қазақ тіліндегі instruction-датасет. Көлемі — 16.0 МБ, жалпы саны — 32909 мысал. Деректер instruction fine-tune мен тиісті тапсырманы зерттеуге жарайды.
Құрамы мен форматы
Бөлік
Мысал саны
train
32251
validation
329
test
329… See the full description on the dataset page: https://huggingface.co/datasets/TilQazyna/til-kk-qa-v1.til-kk-simplify-v1
til-kk-simplify-v1
Қазақша мәтінді жеңілдету · Упрощение казахского текста · Kazakh text simplification
Қазақша · Русский · English
Қазақша
til-kk-simplify-v1 — күрделі мәтінді жеңіл әрі түсінікті тілмен қайта жазуға арналған қазақ тіліндегі instruction-датасет. Көлемі — 6.6 МБ, жалпы саны — 10289 мысал. Деректер instruction fine-tune мен тиісті тапсырманы зерттеуге жарайды.
Құрамы мен форматы
Бөлік
Мысал саны
train
10085
validation… See the full description on the dataset page: https://huggingface.co/datasets/TilQazyna/til-kk-simplify-v1.til-kk-ner-v1
til-kk-ner-v1
Атаулы мәндерді шығару · Извлечение именованных сущностей · Named-entity extraction
Қазақша · Русский · English
Қазақша
til-kk-ner-v1 — адамдарды, ұйымдарды, орындарды, күндер мен ақша мәндерін JSON түрінде шығаруға арналған қазақ тіліндегі instruction-датасет. Көлемі — 1.8 МБ, жалпы саны — 3675 мысал. Деректер instruction fine-tune мен тиісті тапсырманы зерттеуге жарайды.
Құрамы мен форматы
Бөлік
Мысал саны
train
3603… See the full description on the dataset page: https://huggingface.co/datasets/TilQazyna/til-kk-ner-v1.kazakh-morpho-grammar
kazakh-morpho-grammar
Қазақ морфологиясының ережелері мен оқыту деректері · Правила и обучающие данные по казахской морфологии · Kazakh morphology rules and training data
Қазақша · Русский · English
Қазақша
kazakh-morpho-grammar — қазақ тілінің грамматикалық ережелері мен морфологиялық талдауға арналған құрылымдалған үлгілерден тұратын 124.0 МБ деректер жинағы. Материалдар Qwen негізіндегі морфологиялық талдау жүйелеріне system prompt және оқыту деректері ретінде… See the full description on the dataset page: https://huggingface.co/datasets/TilQazyna/kazakh-morpho-grammar.Til-Instruct
Til-Instruct
Нұсқау бойынша жауап беруге арналған жинақ · Датасет инструкций и ответов · Instruction-following dataset
Қазақша · Русский · English
Қазақша
Til-Instruct — тілдік модельдерді нұсқау орындауға бейімдеуге арналған 2 563 966 жазбалық жинақ. Көлемі — 8.35 ГБ; қазақ және ағылшын тілдеріндегі жазбалар басым.
Құрамы мен деңгейлері
Әр жазбада messages, task, source, src_lang, score, category және lang өрістері сақталған. Модель-судья… See the full description on the dataset page: https://huggingface.co/datasets/TilQazyna/Til-Instruct.Til-Classification
Til-Classification
Қазақша мәтіндерді жіктеу жинағы · Датасет классификации казахских текстов · Kazakh text classification dataset
Қазақша · Русский · English
Қазақша
Til-Classification — мәтінді жіктеу міндеттеріне арналған, сарапшы-модель бағалап, сапа деңгейлеріне бөлген 91 766 жолдық жинақ. Репозиторий көлемі — 15.1 МБ.
Құрамы
Жолдарда text, label, task, source, score, category және judge_lang өрістері бар. Негізгі тіл — қазақ тілі; жинақта… See the full description on the dataset page: https://huggingface.co/datasets/TilQazyna/Til-Classification.kaz-morphology-sample
kaz-morphology-sample
Қазақ сөздерінің морфологиялық үлгісі · Образец морфологической разметки казахских слов · Kazakh word morphology sample
Қазақша · Русский · English
Қазақша
kaz-morphology-sample — қазақ сөздерінің морфологиялық талдауы бар 9.3 МБ деректер жинағы. Жинақта 10 000 жазба және 7 сөз табы қамтылған; оны морфологиялық талдау, леммалау және POS-tagging үлгілерін тексеруге қолдануға болады.
Деректер құрамы
Файл
Жазба… See the full description on the dataset page: https://huggingface.co/datasets/TilQazyna/kaz-morphology-sample.Til-Corpus
Til-Corpus
Қазақ тілі басым мәтін корпусы · Текстовый корпус с преобладанием казахского языка · Text corpus centered on Kazakh
Қазақша · Русский · English
Қазақша
Til-Corpus — тілдік модельдерді алдын ала оқытуға арналған 58 850 639 құжаттан тұратын, көлемі 204.20 ГБ мәтін корпусы. Негізгі бөлігі қазақ тілінде, сонымен бірге ағылшын, орыс және аралас мәтіндер бар.
Құрамы
Құжаттарды модель-сарапшы бағалап, сапа деңгейлеріне бөлген. premium, clean… See the full description on the dataset page: https://huggingface.co/datasets/TilQazyna/Til-Corpus.til-kk-mt-kk-en-v1
til-kk-mt-kk-en-v1
Қазақшадан ағылшыншаға аудару · Перевод с казахского на английский · Kazakh-to-English translation
Қазақша · Русский · English
Қазақша
til-kk-mt-kk-en-v1 — қазақша мәтінді ағылшын тіліне аударуға арналған қазақ тіліндегі instruction-датасет. Көлемі — 1.2 МБ, жалпы саны — 3858 мысал. Деректер instruction fine-tune мен тиісті тапсырманы зерттеуге жарайды.
Құрамы мен форматы
Бөлік
Мысал саны
train
3782
validation
38… See the full description on the dataset page: https://huggingface.co/datasets/TilQazyna/til-kk-mt-kk-en-v1.Til-Terminology
Til-Terminology
Бағаланған терминологиялық мәтіндер · Оценённые терминологические тексты · Scored terminology texts
Қазақша · Русский · English
Қазақша
Til-Terminology — терминологияға қатысты 317277 жолдан тұратын, сапа деңгейлері бойынша бөлінген мәтін жинағы. Репозиторий көлемі — 5.7 МБ; жинақты терминдерді зерттеуге және мәтін генерациясы міндеттеріне қолдануға болады.
Құрамы
Әр жазбада text, source, score, category және judge_lang өрістері… See the full description on the dataset page: https://huggingface.co/datasets/TilQazyna/Til-Terminology.
