alvarotoledoupm/chatsubs-temporal-es-1990-2021
ChatSubs Temporal Spanish (1990-2021) Dataset Description Este dataset contiene una muestra estratificada de diálogos de películas en español, extraída del dataset ChatSubs (Kharitonova et al., 2023). Propósito Diseñado para análisis temporal del lenguaje cinematográfico en español, permitiendo estudiar la evolución de patrones lingüísticos a lo largo de tres décadas. Dataset Structure Data Fields Campo Tipo… See the full description on the dataset page: https://huggingface.co/datasets/alvarotoledoupm/chatsubs-temporal-es-1990-2021.
ChatSubs Temporal Spanish (1990-2021)
Dataset Description
Este dataset contiene una muestra estratificada de diálogos de películas en español, extraída del dataset ChatSubs (Kharitonova et al., 2023).
Propósito
Diseñado para análisis temporal del lenguaje cinematográfico en español, permitiendo estudiar la evolución de patrones lingüísticos a lo largo de tres décadas.
Dataset Structure
Data Fields
Data Splits
Distribución Temporal
- Período: 1990 - 2021
- Muestras por año: ~200
- Total años: 32
Dataset Creation
Curation Rationale
Se seleccionaron 200 películas aleatorias por año para garantizar una representación equilibrada a lo largo del período de estudio.
Source Data
- Fuente original: OpenSubtitles
- Dataset intermedio: ChatSubs (Kharitonova et al., 2023)
- Idioma filtrado: Español (spa)
Processing
- Extracción selectiva desde archivo TAR comprimido
- Muestreo estratificado por año
- Limpieza de diálogos (normalización de espacios, límite de caracteres)
- Conversión a formato Hugging Face Dataset
Considerations for Using the Data
Limitations
- Los subtítulos pueden contener errores de transcripción
- La longitud del texto está limitada a 10,000 caracteres
- Algunos años pueden tener menos de 200 muestras si no había suficientes datos
Licensing
Este dataset deriva de ChatSubs, que a su vez proviene de OpenSubtitles. Usar bajo los términos de la licencia CC-BY-NC-4.0.
Citation
@article{kharitonova2023chatsubs,
title={ChatSubs: A dataset of dialogues in Spanish and Spain's co-official languages},
author={Kharitonova et al.},
journal={Data in Brief},
year={2023},
publisher={Elsevier}
}Dataset Card Contact
Creado para el proyecto DCDC - Análisis de Diálogos Cinematográficos.
