Oriolshhh/parlabe-error-correccio-traduccions-1m
Dataset sintètic de parelles error-correcció (1M) Aquest dataset conté 1.111.000 parelles de frases en format: text_erroni,text_correcte Està dissenyat per a l'entrenament de models de correcció gramatical i semàntica en català. Com s'ha generat? A partir del dataset anglès C4_200M Synthetic, cada frase s'ha traduït al català dues vegades: Frase correcta: traduïda amb softcatala/translate-eng-cat, que manté estructura i sentit correctes. Frase errònia: traduïda… See the full description on the dataset page: https://huggingface.co/datasets/Oriolshhh/parlabe-error-correccio-traduccions-1m.
022
Dataset sintètic de parelles error-correcció (1M)
Aquest dataset conté 1.111.000 parelles de frases en format:
Està dissenyat per a **l'entrenament de models de correcció gramatical i semàntica** en català.
---
## Com s'ha generat?
A partir del dataset anglès **C4_200M Synthetic**, cada frase s'ha traduït al català dues vegades:
- **Frase correcta:** traduïda amb [`softcatala/translate-eng-cat`](https://huggingface.co/softcatala/translate-eng-cat), que manté estructura i sentit correctes.
- **Frase errònia:** traduïda amb [`Helsinki-NLP/opus-mt-en-ca`](https://huggingface.co/Helsinki-NLP/opus-mt-en-ca), que introdueix errors de sintaxi, concordança, lèxic i sentit.
Aquest mètode genera parelles realistes amb una frase amb **errors naturals de traducció** i una versió gramaticalment correcta.
---
## Format
- Llengua: Català (`ca`)
- Format: `.csv` amb dues columnes:
- `text_erroni`
- `text_correcte`
- Nombre de parelles: 1.111.000
---
