CoolFace
Datasetpublic

apa9s/gh-agentic-workflows

⛏️ PeakyMiner GH-AW Dataset Dataset estructurado y normalizado de GitHub Agentic Workflows (GH-AW) extraído de repositorios públicos de GitHub mediante PeakyMiner. 📊 Resumen del Dataset Este dataset contiene la especificación, instrucciones (prompts), metadatos y disparadores de flujos de trabajo de agentes autónomos basados en Markdown compilado a GitHub Actions (.md y .lock.yml). Estadísticas de Extracción Repositorios únicos analizados: 292… See the full description on the dataset page: https://huggingface.co/datasets/apa9s/gh-agentic-workflows.

sourceHugging Facemitupdated 15d agoView on Hugging Face
0likes62downloads
Dataset Card

⛏️ PeakyMiner GH-AW Dataset

Dataset estructurado y normalizado de GitHub Agentic Workflows (GH-AW) extraído de repositorios públicos de GitHub mediante PeakyMiner.

📊 Resumen del Dataset

Este dataset contiene la especificación, instrucciones (prompts), metadatos y disparadores de flujos de trabajo de agentes autónomos basados en Markdown compilado a GitHub Actions (.md y .lock.yml).

Estadísticas de Extracción

  • Repositorios únicos analizados: 292
  • Workflows de agentes extraídos: 1368
  • Disparadores (triggers) configurados: 3475

🏛️ Estructura Relacional (Apache Parquet)

El dataset está dividido en 3 tablas relacionales con compresión Snappy e identificadores deterministas UUIDv5:

1. repositories.parquet

Contiene metadatos a nivel de repositorio de GitHub:

  • repo_id (string, PK): UUIDv5 determinista derivado del nombre canónico.
  • owner (string), name (string), canonical_url (string).
  • stars_count (int64), forks_count (int64), primary_language (string, opcional).
  • is_fork (bool), license_spdx (string, opcional), default_branch (string).
  • scanned_at (timestamp[us]): Fecha y hora de la extracción.

2. workflows.parquet

Contiene la especificación completa del flujo de trabajo del agente:

  • workflow_id (string, PK): UUIDv5 determinista derivado de repo_id + file_path.
  • repo_id (string, FK -> repositories.repo_id).
  • file_path (string), basename (string), lock_path (string), blob_sha (string).
  • name (string, opcional), description (string, opcional).
  • model_engine (string, opcional): Motor de inferencia del agente.
  • tools (list<string>, opcional): Lista de herramientas y funciones habilitadas.
  • permissions (string, opcional): Matriz de permisos de GitHub en formato JSON.
  • raw_frontmatter (string, opcional): Bloque YAML original.
  • body_markdown (string, opcional): Prompt, instrucciones de sistema y directivas en Markdown.
  • body_word_count (int64), body_char_count (int64).
  • has_syntax_error (bool): Bandera de resiliencia ante errores de sintaxis YAML.

3. workflow_triggers.parquet

Contiene los eventos desnormalizados que activan cada workflow:

  • trigger_id (string, PK): UUIDv5 determinista derivado de workflow_id + event_type + índice.
  • workflow_id (string, FK -> workflows.workflow_id).
  • event_type (string): Tipo de evento de GitHub (ej. push, pull_request, schedule, workflow_dispatch).
  • trigger_config (string, opcional): Configuración en JSON (ramas, tags, cron, inputs).

💻 Uso con la librería datasets de Hugging Face

python
from datasets import load_dataset

# Cargar la tabla de workflows de agentes
workflows = load_dataset("usuario/gh-agentic-workflows", data_files="workflows.parquet")
print(workflows["train"][0])

# Cargar la tabla de repositorios
repos = load_dataset("usuario/gh-agentic-workflows", data_files="repositories.parquet")

🛡️ Licencia

Distribuido bajo la Licencia MIT.