Bretagne/commonvoice_brythonic
Description Audios en gallois et en cornique proche du breton d'après ce site. Plus précisément, nous avons récupéré toutes les lignes de la page web et gardé que celles où l'un des mots en breton/gallois/cornique est encore utilisé de nos jours.Puis nous avons récupéré les audios en gallois et en cornique de common voice.Finalement nous n'avons gardé que les audios de common voice contenant les mots proches en gallois/cornique du mot en breton sélectionné.Nous avons ajouté… See the full description on the dataset page: https://huggingface.co/datasets/Bretagne/commonvoice_brythonic.
Description
Audios en gallois et en cornique proche du breton d'après ce site.
Plus précisément, nous avons récupéré toutes les lignes de la page web et gardé que celles où l'un des mots en breton/gallois/cornique est encore utilisé de nos jours. Puis nous avons récupéré les audios en gallois et en cornique de common voice. Finalement nous n'avons gardé que les audios de common voice contenant les mots proches en gallois/cornique du mot en breton sélectionné. Nous avons ajouté ensuite une colonne "score" indiquant pour chacun des audios, le nombre de mots proches qui sont présents dans la transcription. Plus le score est élevé, plus l'audio est censé être proche du breton.
L'idée étant de se servir de ces audios pour initier l'entraînement d'un modèle d'ASR en breton avec ces données proches avant de poursuivre l'entraînement avec de vraies données en breton.
Statistiques
Par défaut le jeu de données contient toutes les lignes où le score est au moins de 1. Avec les statistiques suivantes, l'utilisateur peut sélectionner facilement le nombre de ligne à garder en fonction du score avec dataset_score_5 = dataset.filter(lambda row: row["score"] >= 5)
Gallois

Cornique

