CoolFace
Datasetpublic

orlandoju/heller-gpt-dataset

🧉 Heller-GPT Dataset Dataset de entrevistas de Heller en formato ChatML multi-turn, diseñado para fine-tuning de LLMs. 📋 Descripción Fuente: Entrevistas de YouTube (canales de noticias y política argentina) Procesamiento: Audio → Whisper (transcripción) → PyAnnote/SpeechBrain (diarización) → ChatML Formato: Conversaciones multi-turn con roles system, user (entrevistador), assistant (Heller) Idioma: Español rioplatense argentino 📊 Estadísticas… See the full description on the dataset page: https://huggingface.co/datasets/orlandoju/heller-gpt-dataset.

sourceHugging Facecc-by-sa-4.0updated 3mo agoView on Hugging Face
0likes9downloads
Dataset Card

🧉 Heller-GPT Dataset

Dataset de entrevistas de Heller en formato ChatML multi-turn, diseñado para fine-tuning de LLMs.

📋 Descripción

  • —Fuente: Entrevistas de YouTube (canales de noticias y política argentina)
  • —Procesamiento: Audio → Whisper (transcripción) → PyAnnote/SpeechBrain (diarización) → ChatML
  • —Formato: Conversaciones multi-turn con roles system, user (entrevistador), assistant (Heller)
  • —Idioma: Español rioplatense argentino

📊 Estadísticas

MétricaValor
Conversaciones131
Turnos promedio38
Duración total (horas)0.0

🔧 Uso

python
from datasets import load_dataset
dataset = load_dataset("orlandoju/heller-gpt-dataset")

📐 Formato

Cada fila tiene una columna messages con una lista de dicts:

json
[
  {"role": "system", "content": "Sos Heller-GPT..."},
  {"role": "user", "content": "¿Qué opinás sobre...?"},
  {"role": "assistant", "content": "Yo creo que..."}
]

🏗️ Pipeline

  1. 1.Scraping (yt-dlp) → audio de entrevistas de YouTube
  2. 2.Transcripción (WhisperX) → texto con timestamps
  3. 3.Diarización (PyAnnote + SpeechBrain) → identificación de speakers
  4. 4.Preparación → formato ChatML multi-turn

⚖️ Licencia

CC BY-SA 4.0 — El contenido original pertenece a los canales de YouTube y a Heller. Este dataset se distribuye con fines educativos y de investigación.