CoolFace
Datasetpublic

Arailym-tleubayeva/sist-kazakh-corpus

SIST Kazakh Corpus Description SIST Kazakh Corpus is a curated dataset of Kazakh scientific articles collected for research in text similarity detection, plagiarism analysis, and low-resource NLP tasks. The dataset was created to support: Text similarity detection in agglutinative languages Kazakh NLP benchmarking Scientific text analysis Retrieval-Augmented Generation (RAG) research Dataset Structure The dataset is provided in CSV format. Columns… See the full description on the dataset page: https://huggingface.co/datasets/Arailym-tleubayeva/sist-kazakh-corpus.

sourceHugging Faceapache-2.0updated 8mo agoView on Hugging Face
1likes23downloads
Dataset Card

SIST Kazakh Corpus

Description

SIST Kazakh Corpus is a curated dataset of Kazakh scientific articles collected for research in text similarity detection, plagiarism analysis, and low-resource NLP tasks.

The dataset was created to support:

  • —Text similarity detection in agglutinative languages
  • —Kazakh NLP benchmarking
  • —Scientific text analysis
  • —Retrieval-Augmented Generation (RAG) research

Dataset Structure

The dataset is provided in CSV format.

Columns may include:

  • —id
  • —title
  • —abstract
  • —keywords
  • —full_text (if available)
  • —label (if annotated)

Intended Use

This dataset is intended for:

  • —Academic research
  • —NLP benchmarking
  • —Model training and evaluation

Citation

If you use this dataset, please cite:

Tleubayeva, A. (2025). SIST Kazakh Corpus. Hugging Face. https://huggingface.co/datasets/Arailym-tleubayeva/sist-kazakh-corpus