CoolFace
Datasetpublic

CATIE-AQ/orange_sum_fr_prompt_text_generation_from_title_of_an_article

orange_sum_fr_prompt_text_generation_from_title_of_an_article Summary orange_sum_fr_prompt_text_generation_from_title_of_an_article is a subset of the Dataset of French Prompts (DFP).It contains 908,793 rows that can be used for a part-of-speech task.The original data (without prompts) comes from the dataset orange_sum by Eddine et al.A list of prompts (see below) was then applied in order to build the input and target columns and thus obtain the same format as… See the full description on the dataset page: https://huggingface.co/datasets/CATIE-AQ/orange_sum_fr_prompt_text_generation_from_title_of_an_article.

sourceHugging Facecc-by-sa-4.0updated 1y agoView on Hugging Face
0likes38downloads
Dataset Card

orangesumfrprompttextgenerationfromtitleofanarticle

Summary

orange_sum_fr_prompt_text_generation_from_title_of_an_article is a subset of the **Dataset of French Prompts (DFP)**. It contains 908,793 rows that can be used for a part-of-speech task. The original data (without prompts) comes from the dataset orange_sum by Eddine et al. A list of prompts (see below) was then applied in order to build the input and target columns and thus obtain the same format as the xP3 dataset by Muennighoff et al.

Prompts used

List

27 prompts were created for this dataset. The logic applied consists in proposing prompts in the indicative tense, in the form of tutoiement and in the form of vouvoiement.

'Rédiger un texte dont le titre est : "'+title+'".',
'Rédige un texte dont le titre est : "'+title+'".',
'Rédigez un texte dont le titre est : "'+title+'".',
'Rédiger une article dont le titre est : "'+title+'".',
'Rédige un article dont le titre est : "'+title+'".',
'Rédigez un article dont le titre est : "'+title+'".',
'Rédiger un document dont le titre est : "'+title+'".',
'Rédige un document dont le titre est : "'+title+'".',
'Rédigez un document dont le titre est : "'+title+'".',
‘Génèrer un texte dont le titre est : "'+title+'".\nTexte : ',
'Génère un texte dont le titre est : "'+title+'".\nTexte : ',
‘Génèrez un texte dont le titre est : "'+title+'".\nTexte : ',
‘Génèrer un article dont le titre est : "'+title+'".\nArticle : ',
‘Génère un article dont le titre est : "'+title+'".\nArticle : ',
‘Génèrez un article dont le titre est : "'+title+'".\nArticle : ',
‘Génèrer un document dont le titre est : "'+title+'".\nDocument : ',
'Génère un document dont le titre est : "'+title+'".\nDocument : ',
‘Génèrez un document dont le titre est : "'+title+'".\nDocument : ',
'"'+title +'"\n Ecrire un texte de 1 à 5 phrases sur le titre précédent : ',
'"'+title +'"\n Ecris un texte de 1 à 5 phrases sur le titre précédent : ',
'"'+title +'"\n Ecrivez un texte de 1 à 5 phrases sur le titre précédent : ',
'"'+title +'"\n Ecrire un article de 1 à 5 phrases sur le titre précédent : ',
'"'+title +'"\n Ecris un article de 1 à 5 phrases sur le titre précédent : ',
'"'+title +'"\n Ecrivez un article de 1 à 5 phrases sur le titre précédent : ',
'"'+title +'"\n Ecrire un document de 1 à 5 phrases sur le titre précédent : ',
'"'+title +'"\n Ecris un document de 1 à 5 phrases sur le titre précédent : ',
'"'+title +'"\n Ecrivez un document de 1 à 5 phrases sur le titre précédent : '

Features used in the prompts

In the prompt list above, title and targets have been constructed from:

orange_sum = load_dataset('orange_sum','title')
title = orange_sum['train'][i]['summary']
targets = orange_sum['train'][i]['text']

Splits

  • —train with 827,793 samples
  • —valid with 40,500 samples
  • —test with 40,500 samples

How to use?

from datasets import load_dataset
dataset = load_dataset("CATIE-AQ/orange_sum_fr_prompt_text_generation_from_title_of_an_article")

Citation

Original data

@article{eddine2020barthez,
  title={BARThez: a Skilled Pretrained French Sequence-to-Sequence Model},
  author={Eddine, Moussa Kamal and Tixier, Antoine J-P and Vazirgiannis, Michalis},
  journal={arXiv preprint arXiv:2010.12321},
  year={2020}
}

This Dataset

@misc {centre_aquitain_des_technologies_de_l'information_et_electroniques_2023,  
	author       = { {Centre Aquitain des Technologies de l'Information et Electroniques} },  
	title        = { DFP (Revision 1d24c09) },  
	year         = 2023,  
	url          = { https://huggingface.co/datasets/CATIE-AQ/DFP },  
	doi          = { 10.57967/hf/1200 },  
	publisher    = { Hugging Face }  
}

License

CC-BY-SA-4.0