apisdom/vulnerabilidades-ia-espanol
Vulnerabilidades CVE en sistemas de IA (espanol) Corpus de advisories CVE/GHSA que afectan a paquetes y SDKs de IA (langchain, openai, anthropic, llamaindex, etc.) traducido al espanol por LaAutopsIA (ApisDom Intelligence Group). Fuente principal: GitHub Advisory Database (CC-BY-4.0). Cifras del snapshot actual 14 vulnerabilidades publicadas en este snapshot. Mes archivado: 2026-08. Ultima edicion: 2026-09-01T21:35:37.468Z. Frecuencia: sincronizacion mensual.… See the full description on the dataset page: https://huggingface.co/datasets/apisdom/vulnerabilidades-ia-espanol.
Vulnerabilidades CVE en sistemas de IA (espanol)
Corpus de advisories CVE/GHSA que afectan a paquetes y SDKs de IA (langchain, openai, anthropic, llamaindex, etc.) traducido al espanol por LaAutopsIA (ApisDom Intelligence Group). Fuente principal: GitHub Advisory Database (CC-BY-4.0).
Cifras del snapshot actual
- 14 vulnerabilidades publicadas en este snapshot.
- Mes archivado: 2026-08.
- Ultima edicion: 2026-09-01T21:35:37.468Z.
- Frecuencia: sincronizacion mensual.
Para que sirve este dataset
Corpus mensual de vulnerabilidades CVE que afectan a sistemas y librerias de IA, traducido al espanol, con CVSS desglosado. Casos de uso:
- Equipos de seguridad: auditar exposicion de su stack IA (langchain, openai, anthropic, llamaindex, etc.) con CVEs filtrables por severidad CVSS, vector de ataque y estado de fix.
- CISOs y compliance: evidencia citable para informes de riesgo sobre dependencias IA en produccion.
- Pentesters y red teams: catalogo accesible de vectores conocidos en sistemas IA, con CWE y enlace al advisory original.
- Investigacion academica en seguridad IA: serie temporal mensual para estudios de evolucion de vulnerabilidades en el ecosistema IA.
- Desarrolladores: consulta rapida antes de integrar una libreria IA nueva en produccion.
- Reguladores y AESIA: insumo estructurado para evaluar madurez de seguridad del ecosistema IA en espanol.
Snapshots disponibles
La columna DOI Zenodo apunta al DOI vigente del snapshot agregador.
Que contiene cada snapshot
Cada mes se publican dos ficheros con el mismo contenido:
vulnerabilidades-ia-YYYY-MM.json: envoltura{ meta, data }, dondedata.rowses la lista dePublicFlatVulnerability(36 campos publicos estables).vulnerabilidades-ia-YYYY-MM.csv: filas planas, 36 columnas estables (RFC 4180 con BOM UTF-8, encapsulado total entre comillas dobles).
El README.md se sobrescribe cada mes con las cifras del snapshot vigente.
Estructura del dataset (36 columnas estables del CSV)
- Identidad:
avidId(GHSA),cveId(CVE),slug,sourceUrl(URL canonica GitHub Advisory). - Texto en espanol:
titleEs,descriptionEs,fullText(Markdown sin imagenes, regla 5). - Severidad CVSS:
severity(CRITICAL/HIGH/MEDIUM/LOW),cvssScore,cvssVersion,cvssVector. - Metricas CVSS desglosadas:
attackVector,attackComplexity,privilegesRequired,userInteraction,scope,confidentialityImpact,integrityImpact,availabilityImpact. - Debilidad CWE:
cweId,cweDescription. - Producto afectado:
developer(ecosistema),products(lista),vulnerableVersionRange,firstPatchedVersion. - Clasificacion editorial:
riskDomain,reportClass,reportType. - Fechas:
reportedDate(advisory original),publishedAt(ultima edicion). - Atribucion y referencias:
credit(investigadores publicos del advisory),references(URLs). - Geolocalizacion:
country,lat,lng. - Empresa responsable:
company.
Regla del dataset (cero invento): si un campo opcional no tiene valor, celda CSV vacia ("") y clave JSON omitida.
Source Data
Initial Data Collection and Normalization
Recoleccion diaria automatizada desde GitHub Advisory Database (https://github.com/advisories) filtrando por paquetes y SDKs de IA (langchain, openai, anthropic, llamaindex, etc.). Cada advisory GHSA se parsea para extraer: CVE ID (si existe), score y vector CVSS completo, metricas desglosadas (attackVector, attackComplexity, privilegesRequired, userInteraction, scope, confidentialityImpact, integrityImpact, availabilityImpact), CWE ID y descripcion. Se identifica el ecosistema y los paquetes afectados con su rango de versiones vulnerables y primera version parcheada.
Who are the source language producers?
Los textos originales provienen del propio advisory en GitHub Advisory Database, redactado por mantenedores del paquete o investigadores de seguridad reconocidos publicamente. La traduccion al espanol la genera modelo IA con revision editorial puntual. El campo credit cita a los investigadores ya acreditados publicamente en el advisory; el dataset no anade PII propia (EDPB Guidelines 1/2026, FAIR R1.2).
Fuentes oficiales
Traducciones al espanol por modelo IA (LaAutopsIA editorial).
Annotations
Annotation process
No hay anotacion editorial humana sobre los campos taxonomicos. Severity, CVSS, metricas CVSS desglosadas, CWE y ecosistema vienen directamente del advisory original sin reinterpretacion. La traduccion al espanol de titleEs, descriptionEs y fullText la genera modelo IA con revision editorial puntual; cveId y avidId apuntan siempre al advisory original para verificacion.
Who are the annotators?
No aplica. Sin anotadores humanos: el dataset preserva fielmente las clasificaciones publicadas en GitHub Advisory Database.
Data Splits
Sin splits. Cada snapshot mensual es el conjunto completo de advisories con reportedDate dentro del mes natural en UTC (YYYY-MM-01 hasta YYYY-(MM+1)-01 exclusivo). No hay particiones train/test/val: es dataset de auditoria de seguridad, no de entrenamiento.
Como usar
CSV con la libreria datasets:
from datasets import load_dataset
ds = load_dataset("apisdom/vulnerabilidades-ia-espanol", data_files="vulnerabilidades-ia-2026-08.csv")JSON crudo via HTTP:
import json, urllib.request
url = "https://huggingface.co/datasets/apisdom/vulnerabilidades-ia-espanol/resolve/main/vulnerabilidades-ia-2026-08.json"
with urllib.request.urlopen(url) as r:
snap = json.load(r)
print(snap["meta"], len(snap["data"]["rows"]))Considerations for Using the Data
Discussion of Biases
- Sesgo de fuente: solo GitHub Advisory Database. CVEs publicados solo en NVD u otros catalogos no aparecen.
- Sesgo de ecosistema: paquetes en npm/pip/go con buenas practicas de seguridad reportan mas vulnerabilidades que ecosistemas menos maduros, distorsionando comparaciones.
- Sesgo geografico: la mayoria de reportes vienen de investigadores y mantenedores anglosajones; vulnerabilidades en software regional o no-occidental pueden estar infrarrepresentadas.
Other Known Limitations
- Cobertura limitada a vulnerabilidades de paquetes/SDKs con relevancia para IA. CVEs de hardware, sistema operativo o productos no-IA no aparecen.
- Severidad CVSS y vectores estan tal cual los publica la fuente; revisiones posteriores del CVE pueden cambiar la puntuacion y NO se reflejan retroactivamente en snapshots anteriores.
- Traduccion al espanol generada por modelo IA: titulos y descripciones pueden tener matices distintos del original. El campo
cveIdapunta al advisory original para verificacion.
Recommended and Non-Recommended Uses
- Recomendado: auditoria de seguridad de proyectos IA, investigacion academica sobre patrones de vulnerabilidades, divulgacion sobre seguridad de IA.
- NO recomendado: evaluacion automatica de riesgo de compliance regulatorio sin revision humana. El dataset documenta vulnerabilidades publicas, no decide su impacto en un contexto especifico.
- NO recomendado: training de modelos. Es dataset de auditoria, no de entrenamiento.
Personal and Sensitive Information
El campo credit puede contener nombres de investigadores acreditados publicamente en el advisory original. El dataset no anade informacion personal sobre el operador ni sobre terceros.
Como citar
@dataset{laautopsia_vulnerabilidades_2026_08,
author = {Salvador Valdivieso, Juan Luis},
title = {Vulnerabilidades CVE en IA - Snapshot 2026-08},
year = {2026},
publisher = {Zenodo},
organization = {ApisDom Intelligence Group, laautopsia.com},
version = {2026-08},
doi = {10.5281/zenodo.21737709},
url = {https://huggingface.co/datasets/apisdom/vulnerabilidades-ia-espanol}
}Cada snapshot mensual emite un DOI nuevo permanente.
Dataset Curators
Mantenido por ApisDom Intelligence Group (apisdom.com) a traves del observatorio La AutopsIA (https://laautopsia.com). El equipo automatiza la recoleccion desde GitHub Advisory Database, parsea CVSS y CWE, traduce los advisories al espanol con modelo IA y revisa puntualmente para corregir matices de traduccion. El cveId apunta siempre al advisory original para verificacion.
Contributions
Las contribuciones se gestionan a traves del panel de discusiones del dataset en Hugging Face o por email a dataset@apisdom.com. Las aportaciones aceptadas se publican en el siguiente snapshot mensual con atribucion al autor. Tipos bienvenidos: correcciones de traduccion, deteccion de errores en metricas CVSS parseadas, reporte de paquetes IA no detectados por el filtro automatico.
Mantenimiento y contacto
- Frecuencia: snapshot mensual, dia 3 a las 09:00 UTC.
- Mantenedor: ApisDom Intelligence Group - apisdom.com.
- Observatorio: laautopsia.com.
- Contacto del dataset: dataset@apisdom.com.
- Contacto editorial: noticias-autopsia@apisdom.com.
- Fuentes primarias: GitHub Advisory Database, MITRE CVE, FIRST CVSS.
Licencia
Este dataset se publica bajo CC BY-SA 4.0. Las fuentes originales (GitHub Advisory Database CC-BY-4.0, MITRE CVE/CWE Public Domain) son compatibles con la redistribucion.
