Arailym-tleubayeva/sist-kazakh-corpus
SIST Kazakh Corpus Description SIST Kazakh Corpus is a curated dataset of Kazakh scientific articles collected for research in text similarity detection, plagiarism analysis, and low-resource NLP tasks. The dataset was created to support: Text similarity detection in agglutinative languages Kazakh NLP benchmarking Scientific text analysis Retrieval-Augmented Generation (RAG) research Dataset Structure The dataset is provided in CSV format. Columns… See the full description on the dataset page: https://huggingface.co/datasets/Arailym-tleubayeva/sist-kazakh-corpus.
SIST Kazakh Corpus
Description
SIST Kazakh Corpus is a curated dataset of Kazakh scientific articles collected for research in text similarity detection, plagiarism analysis, and low-resource NLP tasks.
The dataset was created to support:
- Text similarity detection in agglutinative languages
- Kazakh NLP benchmarking
- Scientific text analysis
- Retrieval-Augmented Generation (RAG) research
Dataset Structure
The dataset is provided in CSV format.
Columns may include:
- id
- title
- abstract
- keywords
- full_text (if available)
- label (if annotated)
Intended Use
This dataset is intended for:
- Academic research
- NLP benchmarking
- Model training and evaluation
Citation
If you use this dataset, please cite:
Tleubayeva, A. (2025). SIST Kazakh Corpus. Hugging Face. https://huggingface.co/datasets/Arailym-tleubayeva/sist-kazakh-corpus
