CoolFace
Datasetpublic

alvarotoledoupm/chatsubs-temporal-es-1990-2021

ChatSubs Temporal Spanish (1990-2021) Dataset Description Este dataset contiene una muestra estratificada de diálogos de películas en español, extraída del dataset ChatSubs (Kharitonova et al., 2023). Propósito Diseñado para análisis temporal del lenguaje cinematográfico en español, permitiendo estudiar la evolución de patrones lingüísticos a lo largo de tres décadas. Dataset Structure Data Fields Campo Tipo… See the full description on the dataset page: https://huggingface.co/datasets/alvarotoledoupm/chatsubs-temporal-es-1990-2021.

sourceHugging Facecc-by-nc-4.0updated 9mo agoView on Hugging Face
0likes6downloads
Dataset Card

ChatSubs Temporal Spanish (1990-2021)

Dataset Description

Este dataset contiene una muestra estratificada de diálogos de películas en español, extraída del dataset ChatSubs (Kharitonova et al., 2023).

Propósito

Diseñado para análisis temporal del lenguaje cinematográfico en español, permitiendo estudiar la evolución de patrones lingüísticos a lo largo de tres décadas.

Dataset Structure

Data Fields

CampoTipoDescripción
idstringID único del archivo de subtítulos
yearintAño de estreno de la película
timestampstringFecha en formato ISO (YYYY-01-01)
textstringDiálogos concatenados y limpios
titlestringNombre de la película
imdb_idstringID de IMDB (formato tt0000000)

Data Splits

SplitEjemplos
train6327

Distribución Temporal

  • —Período: 1990 - 2021
  • —Muestras por año: ~200
  • —Total años: 32

Dataset Creation

Curation Rationale

Se seleccionaron 200 películas aleatorias por año para garantizar una representación equilibrada a lo largo del período de estudio.

Source Data

  • —Fuente original: OpenSubtitles
  • —Dataset intermedio: ChatSubs (Kharitonova et al., 2023)
  • —Idioma filtrado: Español (spa)

Processing

  1. 1.Extracción selectiva desde archivo TAR comprimido
  2. 2.Muestreo estratificado por año
  3. 3.Limpieza de diálogos (normalización de espacios, límite de caracteres)
  4. 4.Conversión a formato Hugging Face Dataset

Considerations for Using the Data

Limitations

  • —Los subtítulos pueden contener errores de transcripción
  • —La longitud del texto está limitada a 10,000 caracteres
  • —Algunos años pueden tener menos de 200 muestras si no había suficientes datos

Licensing

Este dataset deriva de ChatSubs, que a su vez proviene de OpenSubtitles. Usar bajo los términos de la licencia CC-BY-NC-4.0.

Citation

bibtex
@article{kharitonova2023chatsubs,
  title={ChatSubs: A dataset of dialogues in Spanish and Spain's co-official languages},
  author={Kharitonova et al.},
  journal={Data in Brief},
  year={2023},
  publisher={Elsevier}
}

Dataset Card Contact

Creado para el proyecto DCDC - Análisis de Diálogos Cinematográficos.