EstebanCQ/gh-aw-workflows-dataset
GH-AW Workflows Dataset Dataset relacional con repositorios de GitHub que usan GitHub Agentic Workflows (GH-AW), y el contenido estructurado de sus archivos de workflow: el .md fuente (frontmatter YAML + body Markdown) y su .lock.yml/.lock.yaml compilado. Generado con Miner, una CLI en Python que identifica repositorios que usan GH-AW y extrae sus pares .md + .lock en un formato analítico. Repositorios incluidos: 338 Archivos de workflow incluidos: 1390 (cada uno con su .lock… See the full description on the dataset page: https://huggingface.co/datasets/EstebanCQ/gh-aw-workflows-dataset.
GH-AW Workflows Dataset
Dataset relacional con repositorios de GitHub que usan GitHub Agentic Workflows (GH-AW), y el contenido estructurado de sus archivos de workflow: el .md fuente (frontmatter YAML + body Markdown) y su .lock.yml/.lock.yaml compilado.
Generado con Miner, una CLI en Python que identifica repositorios que usan GH-AW y extrae sus pares .md + .lock en un formato analítico.
- Repositorios incluidos:
338 - Archivos de workflow incluidos:
1390(cada uno con su.lockcorrespondiente) - Fecha de generación:
2026-09-12
Estructura del dataset
El dataset está compuesto por 4 tablas Parquet relacionadas:
Esquema entidad-relación completo y diccionario de datos (tipos, PKs, FKs) disponibles en el repositorio de Miner: docs/er-diagram.md y docs/data-dictionary.md.
Cómo cargar el dataset
from datasets import load_dataset
files = load_dataset("EstebanCQ/gh-aw-workflows-dataset", data_files="workflow_files.parquet")
attrs = load_dataset("EstebanCQ/gh-aw-workflows-dataset", data_files="frontmatter_attributes.parquet")O directamente con pandas:
import pandas as pd
from huggingface_hub import hf_hub_download
path = hf_hub_download("EstebanCQ/gh-aw-workflows-dataset", "workflow_files.parquet", repo_type="dataset")
files = pd.read_parquet(path)Cómo se generó
- Se identificaron repositorios candidatos y se filtraron los que usan GH-AW (al menos un par
<nombre>.md+<nombre>.lock.ymlen.github/workflows/). - Para cada repositorio identificado, se descargó cada par
.md+.lockde workflow; el.mdse separó en frontmatter YAML y body Markdown, el.lockse conservó como texto plano. Un par solo se incluye si ambos archivos se descargaron con éxito, para garantizar la relación 1:1 entreworkflow_filesyworkflow_locks. - El frontmatter del
.mdse aplanó en pares clave-valor (tablafrontmatter_attributes) y se conservó completo como JSON enworkflow_files.raw_frontmatter, para no perder ningún campo.
Limitaciones
- Solo incluye repositorios públicos accesibles con un token de GitHub estándar al momento de la generación.
- Es una instantánea (snapshot): los workflows pueden cambiar o eliminarse después de la fecha de generación indicada arriba.
- Todo archivo de
workflow_filestiene exactamente un.lockenworkflow_locks(relación 1:1): solo se incluyen pares.md+.lock.yml/.lock.yamlconfirmados (la definición de "usa GH-AW" de este proyecto), y ambos deben haberse descargado con éxito.
Licencia
MIT — ten en cuenta que el contenido de cada workflow (el body Markdown y el frontmatter) es propiedad de sus respectivos repositorios de origen y puede tener su propia licencia; este dataset agrega y estructura metadatos públicos, no releva la licencia del código fuente original.
