CoolFace
Datasetpublic

ry-02/github-agentic-workflows-dataset

GitHub Agentic Workflows Dataset Este dataset contiene la información extraída y estructurada de archivos Markdown (.github/workflows/*.md) pertenecientes a repositorios de GitHub que implementan Agentic Workflows. Estructura del Dataset El dataset se organiza en 3 tablas relacionales en formato Apache Parquet: repositories.parquet: Identificadores y nombres de los repositorios procesados. workflow_files.parquet: Archivos .md localizados, con su ruta original y… See the full description on the dataset page: https://huggingface.co/datasets/ry-02/github-agentic-workflows-dataset.

sourceHugging Facemitupdated 14d agoView on Hugging Face
0likes81downloads
Dataset Card

GitHub Agentic Workflows Dataset

Este dataset contiene la información extraída y estructurada de archivos Markdown (.github/workflows/*.md) pertenecientes a repositorios de GitHub que implementan Agentic Workflows.

Estructura del Dataset

El dataset se organiza en 3 tablas relacionales en formato Apache Parquet:

  1. 1.`repositories.parquet`: Identificadores y nombres de los repositorios procesados.
  2. 2.`workflow_files.parquet`: Archivos .md localizados, con su ruta original y el contenido en Markdown (body_markdown).
  3. 3.`workflow_metadata.parquet`: Atributos parseados del Frontmatter en YAML de cada workflow (name, description, tools, etc.).

Ejemplo de uso en Python

python
import pandas as pd

# Cargar las tablas desde Hugging Face
df_repos = pd.read_parquet("hf://datasets/ry-02/github-agentic-workflows-dataset/repositories.parquet")
df_files = pd.read_parquet("hf://datasets/ry-02/github-agentic-workflows-dataset/workflow_files.parquet")
df_meta = pd.read_parquet("hf://datasets/ry-02/github-agentic-workflows-dataset/workflow_metadata.parquet")

print(df_repos.head())