CoolFace
Datasetpublic

proxectonos/corpus_dominio_museistico_patrimonio

Corpus museístico-patrimonio Descripción general El corpus museístico-patrimonio reúne recursos especializados del ámbito museístico y patrimonial, incluyendo tesauros terminológicos, catálogos museísticos y colecciones descriptivas vinculadas al patrimonio cultural. El conjunto representa un registro técnico y descriptivo propio de la documentación patrimonial, la catalogación de bienes culturales y la organización conceptual del conocimiento museístico. El… See the full description on the dataset page: https://huggingface.co/datasets/proxectonos/corpus_dominio_museistico_patrimonio.

sourceHugging Facecc-by-4.0updated 4mo agoView on Hugging Face
0likes52downloads
Dataset Card

Corpus museístico-patrimonio

Descripción general

El corpus museístico-patrimonio reúne recursos especializados del ámbito museístico y patrimonial, incluyendo tesauros terminológicos, catálogos museísticos y colecciones descriptivas vinculadas al patrimonio cultural. El conjunto representa un registro técnico y descriptivo propio de la documentación patrimonial, la catalogación de bienes culturales y la organización conceptual del conocimiento museístico.

El corpus combina recursos en español y gallego. Incluye tres tesauros independientes en español, una versión en gallego del tesauro de bienes culturales, y dos recursos museísticos adicionales en gallego: el catálogo del Museo da Limia y el Museo Virtual de la Universidade de Santiago de Compostela.

El corpus está compuesto por los siguientes recursos:

  • —Tesauro de bienes culturales (español) (es_tesauro_bensculturais.jsonl)
  • —Tesauro de materias (español) (es_tesauro_materias.jsonl)
  • —Tesauro de técnicas (español) (es_tesauro_tecnicas.jsonl)
  • —Tesauro de bienes culturales (gallego) (gl_tesauro_bensculturais.jsonl)
  • —Catálogo del Museo da Limia (gallego) (gl_catalogo_museodalimia.json)
  • —Museo Virtual da USC (gallego) (gl_museo_virtual_usc.json)
  • —Catálogo de la Casa-Museo Emilia Pardo Bazán (gallego) (catalogo_museo_EPB.json)
  • —Catálogo del Museo da Real Academia Galega (gallego) (catalogo_museo_RAG.json)
  • —Metadatos de Galiciana (gallego) (galiciana_catalogo.json)

Fuente y creación del corpus

Los datos fueron extraídos automáticamente de las páginas web de los Tesauros del Patrimonio Cultural de España mediante procesos de scraping controlado. La extracción recorrió de forma recursiva la estructura jerárquica de cada tesauro a partir de sus entradas principales, identificando para cada concepto su denominación principal, equivalentes multilingües cuando están disponibles, definiciones, notas de alcance, relaciones jerárquicas (términos más generales y más específicos), términos relacionados e información complementaria asociada.

Cada entrada del corpus se almacena en formato JSONL, con un objeto por línea, preservando explícitamente la estructura conceptual del tesauro mediante campos como la ruta jerárquica completa desde la raíz hasta el término concreto. Este formato facilita su uso en tareas de procesamiento del lenguaje natural, construcción de ontologías, análisis terminológico y estudios sobre representación del conocimiento en el ámbito del patrimonio cultural.

El corpus no ha sido sometido a corrección lingüística manual ni a anotación semántica adicional, y conserva el contenido tal como aparece en las fuentes originales, salvo las operaciones mínimas de limpieza necesarias para su estructuración.

Recursos museísticos en gallego

Además de la versión gallega del tesauro de bienes culturales, esta publicación incorpora varios recursos museísticos y patrimoniales en gallego:

  • —Catálogo del Museo da Limia: recurso compuesto por fichas catalográficas y entradas descriptivas del Museo da Limia.
  • —Museo Virtual USC: recurso compuesto por fichas descriptivas procedentes del Museo Virtual de la Universidade de Santiago de Compostela.
  • —Catálogo de la Casa-Museo Emilia Pardo Bazán: recurso compuesto por fichas catalográficas procedentes de obras vinculadas a la Casa-Museo Emilia Pardo Bazán.
  • —Catálogo del Museo da Real Academia Galega: recurso compuesto por fichas catalográficas procedentes de la colección museística de la Real Academia Galega.
  • —Galiciana: recurso compuesto por metadatos bibliográficos procedentes de Galiciana.
  • — Estos recursos amplían la cobertura del corpus más allá de la terminología controlada de los tesauros, incorporando textos descriptivos, catalográficos y bibliográficos útiles para tareas de modelado de lenguaje especializado, recuperación de información, extracción de entidades, generación de descripciones y análisis terminológico en el dominio museístico-patrimonial.

Créditos de traducción

Traducción sintética de español a gallego realizada por el modelo de traducción inteligente del Proxecto Nós.

Revisión humana de la traducción al gallego hecha por André Taboada Casteleiro con la coordinación de Maos Innovación Social, S. Coop. Galega)

Formato de los datos

Los recursos se distribuyen en formato JSONL o JSON, según el origen de cada subconjunto. Los tesauros se proporcionan en formato JSONL, con un objeto JSON por línea. Los recursos museísticos adicionales se proporcionan en formato JSON.

Los campos pueden variar ligeramente según el tesauro y la disponibilidad de información en la fuente original, pero incluyen de forma general:

  • —identificador del término
  • —URL del término
  • —denominación principal en una o varias lenguas
  • —definición
  • —nota de alcance
  • —términos no descriptivos
  • —sinónimos o términos relacionados
  • —imágenes asociadas, cuando están disponibles
  • —término jerárquicamente superior
  • —ruta jerárquica completa
  • —términos más específicos

Ejemplo de entrada y formato

json
{
  "id": 1185037,
  "url": "https://tesauros.cultura.gob.es/tesauros/materias/1185037",
  "word_es": "Planta tintórea",
  "word_gl": "Planta tintórea",
  "word_ca": "Planta tintòria",
  "word_en": "Dye plant",
  "definition": "Planta empregada para obter colorantes naturais.",
  "scope_note": "Inclúe tanto as plantas que producen pigmentos como as que se usan para tintura textil.",
  "non_descriptive_terms": ["Planta de colorante"],
  "synonyms": [
    {
      "id": 1188947,
      "term": "Fibra",
      "url": "https://tesauros.cultura.gob.es/tesauros/materias/1188947"
    }
  ],
  "images": [
    {
      "image_url": "https://tesauros.cultura.gob.es/tesauros/images/thumbs/materias/preview/Planta%20tintorea_11591_Museo%20de%20America.JPG",
      "museum": "MUSEO DE AMÉRICA",
      "object_name": "Planta tintórea",
      "inventory": "11591"
    }
  ],
  "broader_term": "Materia",
  "hierarchy_path": ["Materia", "Planta tintórea"],
  "narrower_terms": []
}

Uso

Ejemplo con datasets:

python
from datasets import load_dataset

ds = load_dataset(
    "proxectonos/corpus_dominio_museistico_patrimonio",
    "gl_tesauro_bensculturais",
    split="train"
)

print(ds[0])

Usos previstos

Este conjunto de datos puede utilizarse para:

  • —modelado de lenguaje especializado en patrimonio cultural y museos
  • —análisis terminológico y lexicográfico
  • —construcción de ontologías y recursos de conocimiento
  • —experimentos de extracción y normalización terminológica
  • —investigación en PLN aplicada al patrimonio cultural
  • —desarrollo de recursos terminológicos en gallego y español
  • —generación y análisis de descripciones museísticas
  • —recuperación de información en catálogos patrimoniales en gallego

Limitaciones

  • —El corpus ha sido generado mediante procesos automáticos de extracción, limpieza y estructuración.
  • —No se ha realizado corrección lingüística manual ni anotación semántica adicional.
  • —Los campos disponibles pueden variar según el tesauro y la información ofrecida por la fuente original.
  • —La versión en gallego no está disponible todavía para todos los tesauros del corpus.
  • —El contenido refleja la estructura y redacción de las fuentes originales, con mínimas transformaciones para su conversión a JSONL.

Fuente, licencia y condiciones de reutilización

Los tesauros incluidos en el corpus museístico-patrimonio proceden de recursos oficiales publicados por el Ministerio de Cultura a través del portal de Tesauros del Patrimonio Cultural de España y del portal datos.gob.es, dentro del marco de reutilización de la información del sector público.

De acuerdo con las condiciones de uso establecidas por el Ministerio de Cultura, estos vocabularios se ofrecen para su uso libre y gratuito, incluida su reproducción, distribución, comunicación pública y transformación, siempre que se respete la mención expresa de la autoría y procedencia de los contenidos originales.

Las fuentes originales de los tesauros utilizados son las siguientes:

  • —Diccionario de Denominaciones de Bienes Culturales https://datos.gob.es/gl/catalogo/e05234201-diccionario-de-denominaciones-de-bienes-culturales
  • —Diccionario de Materias https://datos.gob.es/gl/catalogo/e05234201-diccionario-de-materias
  • —Diccionario de Técnicas https://datos.gob.es/gl/catalogo/e05234201-diccionario-de-tecnicas

El resto de recursos museísticos, catalográficos y bibliográficos incluidos en este corpus proceden de cesiones o acuerdos de colaboración con las entidades e instituciones mencionadas en la descripción del conjunto de datos.

Este corpus constituye una obra derivada, resultado de procesos de extracción automática, limpieza, reorganización y conversión a formatos JSON o JSONL, sin alteración del contenido semántico original. En todas las reutilizaciones se mantiene la atribución a las fuentes oficiales originales y a las instituciones proveedoras de los datos.

La estructura, el formato, la organización del conjunto de datos y los procesos de extracción y normalización aplicados se distribuyen bajo la licencia Creative Commons Attribution 4.0 International (CC BY 4.0), sin que ello implique respaldo institucional por parte del Ministerio de Cultura ni de las entidades o instituciones proveedoras de los recursos catalográficos y bibliográficos incluidos.

Financiación y agradecimientos

Esta publicación del proyecto Desarrollo de Modelos ALIA está financiada por el Ministerio para la Transformación Digital y de la Función Pública y por el Plan de Recuperación, Transformación y Resiliencia – Financiado por la Unión Europea – NextGenerationEU.

This work is funded by the Ministerio para la Transformación Digital y de la Función Pública - Funded by EU – NextGenerationEU within the framework of the project Desarrollo de Modelos ALIA.