inkoziev/paraphrases
Датасет перефразировок коротких фраз (читчат+поэзия) В датасете содержатся правильные и некорректные перефразировки коротких диалоговых реплик (проект диалоговой системы) и фрагментов стихов (проект генеративной поэзии). Датасет представляет из себя список сэмплов-кортежей. Каждый сэмпл состоит из двух списков: paraphrases - примеры правильных перефразировокdistractors - примеры неправильных перефразировок Датасет используется для создания моделей детектора перефразировок… See the full description on the dataset page: https://huggingface.co/datasets/inkoziev/paraphrases.
Датасет перефразировок коротких фраз (читчат+поэзия)
В датасете содержатся правильные и некорректные перефразировки коротких диалоговых реплик (проект диалоговой системы) и фрагментов стихов (проект генеративной поэзии).
Датасет представляет из себя список сэмплов-кортежей. Каждый сэмпл состоит из двух списков:
Датасет используется для создания моделей детектора перефразировок sbert_synonymy и генеративного поэтического перефразировщика.
Disclaimer
В датасете целенаправленно допускалась неконсервативность семантики перефразировок в определенных пределах. К примеру, правильными перефразировками считаются пары "Помолчи" и "Дружище, не говори ни слова!". Так как перефразировщик используется в проекте генеративной поэзии для создания датасетов, в нем есть некоторое количество метафоричных и достаточно вольных перефразировок. Эти особенности датасета могут сделать невозможным использование датасета и моделей на его основе в Ваших проектах.
Другие датасеты перефразировок
При обучении моделей вы можете совмещать этот датасет с данными из других датасетов перефразировок, например tapaco.
