CoolFace
Datasetpublic

Shaer-AI-2/ashaar-with-descriptions-baseform-final-trimmed

Ashaar v1 SFT-Ready (Locked Prompt, <= 2048 tokens) This dataset is derived from Shaer-AI/ashaar-v1-base-form-with-descriptions and prepared for supervised fine-tuning (SFT) with the locked prompt from prompt_testing.ipynb. Locked Prompt SYSTEM_PROMPT أنت شاعر عربي تكتب الشعر العمودي الكلاسيكي. التزم بالبحر المحدد في كل شطر، واستلهم من الموضوع دون نقله حرفياً. أخرج الأبيات فقط دون مقدمة أو تعليق. USER_TEMPLATE البحر الأساسي:… See the full description on the dataset page: https://huggingface.co/datasets/Shaer-AI-2/ashaar-with-descriptions-baseform-final-trimmed.

sourceHugging Faceapache-2.0updated 7mo agoView on Hugging Face
0likes13downloads
Dataset Card

Ashaar v1 SFT-Ready (Locked Prompt, <= 2048 tokens)

This dataset is derived from Shaer-AI/ashaar-v1-base-form-with-descriptions and prepared for supervised fine-tuning (SFT) with the locked prompt from prompt_testing.ipynb.

Locked Prompt

SYSTEM_PROMPT

أنت شاعر عربي تكتب الشعر العمودي الكلاسيكي. التزم بالبحر المحدد في كل شطر، واستلهم من الموضوع دون نقله حرفياً. أخرج الأبيات فقط دون مقدمة أو تعليق.

USER_TEMPLATE

البحر الأساسي: {basemeter} الصيغة: {form} اسم البحر المطلوب: {meterlabel} الموضوع: {description}

اكتب {numlines} شطراً ملتزماً بصيغة {form} من بحر {basemeter} دون أي شرح إضافي.

Conditioning Rule

  • —meter_label = base_meter if form == "تام"
  • —else meter_label = "{form} {base_meter}"

Added Columns

  • —sft_prompt
  • —sft_completion
  • —sft_full_text
  • —sft_num_lines
  • —sft_total_tokens

Target Formatting

  • —sft_completion is built from poem verses using real newline characters.

Filtering

  • —Valid-row filtering: keep rows where poem verses is non-empty list of non-empty strings.
  • —Optional line cap applied: sft_num_lines <= 68.
  • —Token length filtering: keep rows with sft_total_tokens <= 2048.

Counts

  • —Source rows: 143022
  • —After row processing: 129688
  • —Removed by token filter (> 2048): 78
  • —Final rows kept: 129610

Notes

  • —This is a derived dataset repo; source dataset is unchanged.