CoolFace
Datasetpublic

Oriolshhh/parlabe-errors-conjugacio-45k

Dataset d’errors de conjugació verbal (45.000 parelles) Aquest dataset conté 45.000 parelles de frases en format: text_erroni,text_correcte Està dissenyat per entrenar models de correcció d’errors de conjugació verbal en català, un problema habitual tant en l’escriptura espontània com en transcripcions automàtiques. Què inclou? El dataset cobreix diversos tipus d’errors verbals, com: Canvis de persona o temps verbal→ Nosaltres arribava tard → Nosaltres arribàvem… See the full description on the dataset page: https://huggingface.co/datasets/Oriolshhh/parlabe-errors-conjugacio-45k.

sourceHugging Faceapache-2.0updated 1y agoView on Hugging Face
0likes9downloads
Dataset Card

Dataset d’errors de conjugació verbal (45.000 parelles)

Aquest dataset conté 45.000 parelles de frases en format:

text_erroni,text_correcte```


Està dissenyat per entrenar models de **correcció d’errors de conjugació verbal** en català, un problema habitual tant en l’escriptura espontània com en transcripcions automàtiques.

---

## Què inclou?

El dataset cobreix diversos tipus d’errors verbals, com:
- Canvis de persona o temps verbal  
  → *Nosaltres arribava tard* → *Nosaltres arribàvem tard*
- Concordança incorrecta amb el subjecte  
  → *Ells camina junts* → *Ells caminen junts*
- Conjugacions inexistents o incorrectes  
  → *Jo sabria tot si estudiava més* → *Jo sabria tot si estudiés més*

---

## Procés de generació

Les parelles han estat generades mitjançant:
- **API de GPT** per crear frases amb errors naturals de conjugació
- **Automatització amb scripts Python** per augmentar i filtrar el contingut
- **Filtratge automàtic i revisió manual** per garantir coherència i qualitat

---

## Format

- Llengua: Català (`ca`)
- Format: `.csv` amb dues columnes:
  - `text_erroni`
  - `text_correcte`
- Nombre de parelles: 45.000