CoolFace
Datasetpublic

Oriolshhh/parlabe-error-correccio-traduccions-1m

Dataset sintètic de parelles error-correcció (1M) Aquest dataset conté 1.111.000 parelles de frases en format: text_erroni,text_correcte Està dissenyat per a l'entrenament de models de correcció gramatical i semàntica en català. Com s'ha generat? A partir del dataset anglès C4_200M Synthetic, cada frase s'ha traduït al català dues vegades: Frase correcta: traduïda amb softcatala/translate-eng-cat, que manté estructura i sentit correctes. Frase errònia: traduïda… See the full description on the dataset page: https://huggingface.co/datasets/Oriolshhh/parlabe-error-correccio-traduccions-1m.

sourceHugging Faceapache-2.0updated 1y agoView on Hugging Face
0likes22downloads
Dataset Card

Dataset sintètic de parelles error-correcció (1M)

Aquest dataset conté 1.111.000 parelles de frases en format:

text_erroni,text_correcte```


Està dissenyat per a **l'entrenament de models de correcció gramatical i semàntica** en català.

---

## Com s'ha generat?

A partir del dataset anglès **C4_200M Synthetic**, cada frase s'ha traduït al català dues vegades:

- **Frase correcta:** traduïda amb [`softcatala/translate-eng-cat`](https://huggingface.co/softcatala/translate-eng-cat), que manté estructura i sentit correctes.
- **Frase errònia:** traduïda amb [`Helsinki-NLP/opus-mt-en-ca`](https://huggingface.co/Helsinki-NLP/opus-mt-en-ca), que introdueix errors de sintaxi, concordança, lèxic i sentit.

Aquest mètode genera parelles realistes amb una frase amb **errors naturals de traducció** i una versió gramaticalment correcta.

---

## Format

- Llengua: Català (`ca`)
- Format: `.csv` amb dues columnes:
  - `text_erroni`
  - `text_correcte`
- Nombre de parelles: 1.111.000

---