Shaer-AI-2/ashaar-with-descriptions-baseform-final-trimmed-maxlen20
Ashaar v1 SFT-Ready (Locked Prompt, <= 2048 tokens, max 20 bayts) This dataset is derived from Shaer-AI/ashaar-with-descriptions-baseform-final-trimmed and prepared as a phase-1 GRPO subset by applying a maximum poem length filter of 20 complete bayts while keeping the same columns, prompt format, and general dataset structure as the source dataset. Locked Prompt SYSTEM_PROMPT أنت شاعر عربي تكتب الشعر العمودي الكلاسيكي. التزم بالبحر المحدد في كل… See the full description on the dataset page: https://huggingface.co/datasets/Shaer-AI-2/ashaar-with-descriptions-baseform-final-trimmed-maxlen20.
Ashaar v1 SFT-Ready (Locked Prompt, <= 2048 tokens, max 20 bayts)
This dataset is derived from Shaer-AI/ashaar-with-descriptions-baseform-final-trimmed and prepared as a phase-1 GRPO subset by applying a maximum poem length filter of 20 complete bayts while keeping the same columns, prompt format, and general dataset structure as the source dataset.
Locked Prompt
SYSTEM_PROMPT
أنت شاعر عربي تكتب الشعر العمودي الكلاسيكي. التزم بالبحر المحدد في كل شطر، واستلهم من الموضوع دون نقله حرفياً. أخرج الأبيات فقط دون مقدمة أو تعليق.
USER_TEMPLATE
البحر الأساسي: {basemeter} الصيغة: {form} اسم البحر المطلوب: {meterlabel} الموضوع: {description}
اكتب {numlines} شطراً ملتزماً بصيغة {form} من بحر {basemeter} دون أي شرح إضافي.
Conditioning Rule
meter_label = base_meterifform == "تام"- else
meter_label = "{form} {base_meter}"
Added Columns
sft_promptsft_completionsft_full_textsft_num_linessft_total_tokens
Target Formatting
sft_completionis built frompoem versesusing real newline characters.
Filtering
- Inherits the filtering already present in
Shaer-AI/ashaar-with-descriptions-baseform-final-trimmed. - Additional phase-1 filter applied: keep rows where the poem has
<= 20complete bayts, computed frompoem versesafter removing empty lines and pairing lines into bayts.
Counts
- Source rows from
Shaer-AI/ashaar-with-descriptions-baseform-final-trimmed: 129610 - Removed by
maxlen20bayt filter: 11734 - Final rows kept: 117876
- Retention: 90.95%
Notes
- This is a derived dataset repo; source dataset is unchanged.
- This subset is intended for phase-1 GRPO experiments where shorter poems are preferred for a more controlled RL setup.
- The schema and column names are kept identical to the source dataset.
