datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
1c_github1c-enterprise-script-clean-corpus
1C Enterprise Script Clean Corpus
Кратко
Это датасет для обучения моделей работе с кодом на 1C:Enterprise Script.
В репозитории есть два независимых поднабора:
pretrain: чистый корпус реального кода для continued pretraining / domain adaptation
sft_strict: instruction/chat датасет для SFT, построенный поверх очищенного корпуса
Состав
pretrain/train.jsonl
pretrain/validation.jsonl
sft_strict/train.jsonl
sft_strict/validation.jsonl
manifests/repos.jsonl… See the full description on the dataset page: https://huggingface.co/datasets/NickIBrody/1c-enterprise-script-clean-corpus.prism-smopPRISM-SMOP
Датасет генераций кода 1С:Предприятие (BSL) с четырёхосевой разметкой качества по метрике SMOP
🤗 Hugging Face ·
Бенчмарк PRISM ·
Лицензия CC BY 4.0 · Метрика SMOP
1225 генераций кода 1С:Предприятие (BSL) от 35 нейросетей на 35 задачах бенчмарка PRISM, размеченных по четырём осям метрики SMOP — синтаксис, смысл, оптимальность, платформа — автоматическим оценщиком L1. Внутри — SFT-подвыборка из 222 решений открытых моделей, прошедших все скрытые тесты.
1225 BSL… See the full description on the dataset page: https://huggingface.co/datasets/genlab-1c/prism-smop.
