ry-02/github-agentic-workflows-dataset
GitHub Agentic Workflows Dataset Este dataset contiene la información extraída y estructurada de archivos Markdown (.github/workflows/*.md) pertenecientes a repositorios de GitHub que implementan Agentic Workflows. Estructura del Dataset El dataset se organiza en 3 tablas relacionales en formato Apache Parquet: repositories.parquet: Identificadores y nombres de los repositorios procesados. workflow_files.parquet: Archivos .md localizados, con su ruta original y… See the full description on the dataset page: https://huggingface.co/datasets/ry-02/github-agentic-workflows-dataset.
GitHub Agentic Workflows Dataset
Este dataset contiene la información extraída y estructurada de archivos Markdown (.github/workflows/*.md) pertenecientes a repositorios de GitHub que implementan Agentic Workflows.
Estructura del Dataset
El dataset se organiza en 3 tablas relacionales en formato Apache Parquet:
- `repositories.parquet`: Identificadores y nombres de los repositorios procesados.
- `workflow_files.parquet`: Archivos
.mdlocalizados, con su ruta original y el contenido en Markdown (body_markdown). - `workflow_metadata.parquet`: Atributos parseados del Frontmatter en YAML de cada workflow (
name,description,tools, etc.).
Ejemplo de uso en Python
import pandas as pd
# Cargar las tablas desde Hugging Face
df_repos = pd.read_parquet("hf://datasets/ry-02/github-agentic-workflows-dataset/repositories.parquet")
df_files = pd.read_parquet("hf://datasets/ry-02/github-agentic-workflows-dataset/workflow_files.parquet")
df_meta = pd.read_parquet("hf://datasets/ry-02/github-agentic-workflows-dataset/workflow_metadata.parquet")
print(df_repos.head())