CoolFace
Datasetpublic

octaviomartinez/spanish-diccionary-lexicon

Dataset de Léxico y Definiciones en Español Este conjunto de datos recopila palabras en español, sus categorías gramaticales, definiciones y metadatos regionales o de origen. Fue diseñado para facilitar tareas de procesamiento del lenguaje natural (NLP), modelos de lenguaje, lexicografía y análisis lingüístico del español. Estructura del Dataset El dataset cuenta con los siguientes campos por cada registro: Campo Tipo Descripción term String La palabra… See the full description on the dataset page: https://huggingface.co/datasets/octaviomartinez/spanish-diccionary-lexicon.

sourceHugging Facecc-by-sa-4.0updated 19d agoView on Hugging Face
2likes134downloads
Dataset Card

Dataset de Léxico y Definiciones en Español

Este conjunto de datos recopila palabras en español, sus categorías gramaticales, definiciones y metadatos regionales o de origen. Fue diseñado para facilitar tareas de procesamiento del lenguaje natural (NLP), modelos de lenguaje, lexicografía y análisis lingüístico del español.

Estructura del Dataset

El dataset cuenta con los siguientes campos por cada registro:

CampoTipoDescripción
termStringLa palabra o entrada léxica analizada.
term_typeStringClasificación de la entrada (p. ej., palabra).
posStringCategoría gramatical / Part of Speech (p. ej., noun, prep, verb).
definitionStringSignificado o definición asociada al término.
regionStringVariante dialectal o región geográfica de uso (si aplica).
sourceStringFuente de donde proviene la información (p. ej., wiktionary).
source_urlStringEnlace directo a la fuente original del término.

Uso con la librería datasets

Puedes cargar este dataset directamente en Python mediante Hugging Face Datasets:

python
from datasets import load_dataset

dataset = load_dataset("octaviomartinez/FDCSDGSDJASG")

# Inspeccionar la primera fila del conjunto de entrenamiento
print(dataset["train"][0])