CoolFace
Datasetpublic

Oriolshhh/parlabe-errors-varis-450k

Dataset mixt de correcció gramatical en català (450.000 parelles) Aquest dataset conté 450.000 parelles de frases en format: text_erroni,text_correcte Està pensat per entrenar models de correcció gramatical robusta en català, abastant una àmplia gamma d’errors habituals, tant d’aprenents com de parlants nadius o transcripcions automàtiques. Tipus d’errors inclosos Aquestes parelles cobreixen diferents tipus d’errors sintètics generats controladament:… See the full description on the dataset page: https://huggingface.co/datasets/Oriolshhh/parlabe-errors-varis-450k.

sourceHugging Faceapache-2.0updated 1y agoView on Hugging Face
0likes3downloads
Dataset Card

Dataset mixt de correcció gramatical en català (450.000 parelles)

Aquest dataset conté 450.000 parelles de frases en format:

text_erroni,text_correcte```


Està pensat per entrenar models de **correcció gramatical robusta en català**, abastant una àmplia gamma d’errors habituals, tant d’aprenents com de parlants nadius o transcripcions automàtiques.

---

## Tipus d’errors inclosos

Aquestes parelles cobreixen diferents tipus d’errors sintètics generats controladament:

- **Castellanismes**: estructures pròpies del castellà en frases catalanes  
  → Ex: *Tinc que fer els deures abans* → *He de fer els deures abans*

- **Errors de conjugació verbal**  
  → Ex: *Ells anava al cinema* → *Ells anaven al cinema*

- **Errors de gènere i nombre**  
  → Ex: *La pintor va exposar les seves obres* → *La pintora va exposar les seves obres*

- **Faltes ortogràfiques**  
  → Ex: *Aixó es un frasse molt mala* → *Això és una frase molt dolenta*

- **Errors mixtos**: combinació de diversos tipus en una mateixa frase  
  → Ex: *Tinc que estudia per l’examen de matematiques* → *He d’estudiar per l’examen de matemàtiques*

- **Errors d’accentuació**  
  → Ex: *L'ultim dia d'examens es demà* → *L'últim dia d'exàmens és demà*

- **Concordança i pronoms febles**  
  → Ex: *Aquest decisions ràpids porten problemes* → *Aquestes decisions ràpides porten problemes*

---

## Procés de generació

Les frases d’aquest dataset han estat generades mitjançant **l’API de GPT** a través d’un sistema automatitzat creat en **Python**, que:
- Genera errors de manera coherent segons patrons lingüístics definits
- Estableix la versió correcta per cada frase errònia
- Ha estat **revisat** dins del que cap per assegurar-ne la qualitat i coherència gramatical

A part de l'API de GPT també s'ha creat mitjançant scripts de python amb creació d'errors personalitzats. 

---

## Format

- Llengua: Català (`ca`)
- Format: `.csv` amb dues columnes:
  - `text_erroni`
  - `text_correcte`
- Nombre de parelles: 450.000

---