Khedher111/QuranDataSet
نبذة عامة عن قاعدة بيانات القرآن الكريم الملخص تقدم هذه البيانات نسخة رقمية فائقة الدقة وموثقة وخالية تماماً من الأخطاء للمصحف الشريف، تم تصميمها وهندستها خصيصاً لتلبية متطلبات تدريب نماذج الذكاء الاصطناعي، معالجة اللغات الطبيعية (NLP)، وتطوير التطبيقات البرمجية واقتباس نصوص الآيات بدقة كلما كان هناك حاجة له. هذه البيانات مقدمة من "المعهد العالمي لحوسبة القرآن والعلوم الإسلامية" (ICIQIS)، ليكون بمثابة جسر يربط بين أصالة النص القرآني والقدرات التقنية الحديثة. مصدر النص القرآني إن النص القرآني… See the full description on the dataset page: https://huggingface.co/datasets/Khedher111/QuranDataSet.
نبذة عامة عن قاعدة بيانات القرآن الكريم
الملخص
تقدم هذه البيانات نسخة رقمية فائقة الدقة وموثقة وخالية تماماً من الأخطاء للمصحف الشريف، تم تصميمها وهندستها خصيصاً لتلبية متطلبات تدريب نماذج الذكاء الاصطناعي، معالجة اللغات الطبيعية (NLP)، وتطوير التطبيقات البرمجية واقتباس نصوص الآيات بدقة كلما كان هناك حاجة له. هذه البيانات مقدمة من "المعهد العالمي لحوسبة القرآن والعلوم الإسلامية" (ICIQIS)، ليكون بمثابة جسر يربط بين أصالة النص القرآني والقدرات التقنية الحديثة.
مصدر النص القرآني إن النص القرآني المعتمد في هذا المشروع مستخرج من مصحف المدينة المنورة، الصادر عن مجمع الملك فهد لطباعة المصحف الشريف وفق الرسم العثماني برواية حفص عن عاصم والعد الكوفي
أبرز الميزات والهيكل الأساسي للبيانات
الهيكلية الثنائية الموازية للنص: لحل المشكلات التقنية التي تواجه المطورين عند التعامل مع النصوص العربية في تعلم الآلة، توفر قاعدة البيانات حقلين متوازيين لكل الآيات البالغ عددها 6,236 آية: text: النص العثماني الأصيل بكامل علامات الضبط والتشكيل، وهو مثالي لواجهات العرض والتطبيقات والدراسات اللغوية. text_plain: نص مفرغ ونظيف ومبسط (مُعالج آلياً)، مخصص للعمليات الخلفية مثل فهرسة البحث، وبناء التضمينات اللغوية (Embeddings)، وتدريب نماذج الترميز وهو خال من علامات الضبط والتشكيل
تعدد الصيغ والامتدادات: تتاح البيانات كملفات كاملة مجمعة، لكل سور القرآن (114 سورة) بثلاث صيغ رئيسية: JSON وCSV وملفات نصية مفرغة (TXT).
سياسة الترخيص والاستخدام
هذه البيانات متاحة للمطورين والباحثين بتنزيل البيانات ومشاركتها مع الآخرين بشرط استخدام النص القرآني كما هو دون أي تعديل أو إعادة دمج تؤثر على سلامة النص الأصلي.
تعهد وإقرار بالاستخدام: يُتعهد المستخدم باستخدام هذه الملفات وفق صيغته الأصلية دون إجراء أي تعديل أو تحريف. وفي حال وجود أية ملاحظات أو حاجة للتعديل، يُرجى التواصل مباشرة مع مصدر البيانات.
أمثلة برمجية لاستدعاء البيانات (Code Examples)
- استدعاء البيانات من ملفات الـ CSV:
from qurancsvloader import getverse, getverse_plain
Fetch Surah 1 (Al-Fatihah), Verse 2
uthmani = getuthmaniverse(1, 2) plain = getplainverse(1, 2)
print("Uthmani:", uthmani) # Outputs: ٱلۡحَمۡدُ لِلَّهِ رَبِّ ٱلۡعَٰلَمِينَ print("Plain:", plain) # Outputs: الحمد لله رب العلمين
- استدعاء البيانات من ملفات الـ JSON:
from quranjsonloader import getverse, getverse_plain
Fetch Surah 1 (Al-Fatihah), Verse 2
uthmani = getuthmaniverse(1, 2) plain = getplainverse(1, 2)
print("Uthmani:", uthmani) # Outputs: ٱلۡحَمۡدُ لِلَّهِ رَبِّ ٱلۡعَٰلَمِينَ print("Plain:", plain) # Outputs: الحمد لله رب العلمين
Overview on Holy Quran Dataset
Summary
This data set deliver a highly precise, authenticated, and zero-error digital representation of the Holy Quran, specifically engineered for modern AI training, Natural Language Processing (NLP), and software application development. Managed and authenticated by the International Computing Institute for Quran and Islamic Sciences (ICIQIS), the dataset bridges the gap between divine text authenticity and advanced computational capabilities.
Quranic Text Source: The Quranic text provided in this dataset is sourced from the King Fahd Glorious Quran Printing Complex (Madinah Mushaf) according to Hafs recitation and Kufi counting.
Key Features & Structural Blueprint
- Dual-Column Parallel Text: To eliminate the challenges developers face with Arabic script in machine learning, the dataset provides two distinct parallel fields for all 6,236 verses:
- text: The rich, authentic Uthmani script with full diacritics and glyphs intact, perfect for frontend application display.
- text_plain: A cleaned, stripped, and normalized version optimized for backend search indexing, text embeddings, and tokenizer training.
- Multi-Format Delivery: The dataset is structured for flexible integration, available as consolidated files and segmented into JSON, CSV, and Plain Text (.txt) formats.
Licensing & Terms of Use
The dataset is officially released allowing users to download and share the dataset under the strict conditions of not modifying any part of it at all..
English Translation (Formal):
User Commitment & Modifications: Users undertake to utilize this file in its original form without any modifications. Should there be a need for adjustments or further inquiry, please contact the lead developer directly.
Code Verification Examples
- Loading Data via CSV Structure:
from qurancsvloader import getverse, getverse_plain
Fetch Surah 1 (Al-Fatihah), Verse 2
uthmani = getuthmaniverse(1, 2) plain = getplainverse(1, 2)
print("Uthmani:", uthmani) # Outputs: ٱلۡحَمۡدُ لِلَّهِ رَبِّ ٱلۡعَٰلَمِينَ print("Plain:", plain) # Outputs: الحمد لله رب العلمين
- Loading Data via JSON Structure:
from quranjsonloader import getverse, getverse_plain
Fetch Surah 1 (Al-Fatihah), Verse 2
uthmani = getuthmaniverse(1, 2) plain = getplainverse(1, 2)
print("Uthmani:", uthmani) # Outputs: ٱلۡحَمۡدُ لِلَّهِ رَبِّ ٱلۡعَٰلَمِينَ print("Plain:", plain) # Outputs: الحمد لله رب العلمين
