Data-Gouv-ML/Robots-TXT-Des-Domaines-FR
Ce DataSet est concu pour que nous puissions crawler des sites, mais tout en respectant les regles en vigueur, Ainsi grace a un mapping des robots.txt nous pourrons savoir quel sites autorise ou refuse l'utlisation des données du site pour l'entrainement des modeles, et ce, pour la totalité des domaine en .fr Et d'ici pas long je l'espere nous aurons un dataset opensource a > 1T token , PUREMENT FRANCAIS ! serieux c'est normal que les gros dataset FR ont plus de 50% d'anglais ??? On… See the full description on the dataset page: https://huggingface.co/datasets/Data-Gouv-ML/Robots-TXT-Des-Domaines-FR.
Ce DataSet est concu pour que nous puissions crawler des sites, mais tout en respectant les regles en vigueur,
Ainsi grace a un mapping des robots.txt nous pourrons savoir quel sites autorise ou refuse l'utlisation des données du site pour l'entrainement des modeles, et ce, pour la totalité des domaine en .fr
Et d'ici pas long je l'espere nous aurons un dataset opensource a > 1T token , PUREMENT FRANCAIS !
serieux c'est normal que les gros dataset FR ont plus de 50% d'anglais ??? On devrait faire 50% de francais et 25% d'anglais nan ?
Les modeles francais sont performant en anglais qu'en francais, d'ou l'utlité d'avoir les robots.txt ;p
Références CNIL : <br> https://www.cnil.fr/fr/base-legale-interet-legitime-developpement-systeme <br> https://www.cnil.fr/fr/focus-interet-legitime-collecte-par-moissonnage
