orlandoju/heller-gpt-dataset
🧉 Heller-GPT Dataset Dataset de entrevistas de Heller en formato ChatML multi-turn, diseñado para fine-tuning de LLMs. 📋 Descripción Fuente: Entrevistas de YouTube (canales de noticias y política argentina) Procesamiento: Audio → Whisper (transcripción) → PyAnnote/SpeechBrain (diarización) → ChatML Formato: Conversaciones multi-turn con roles system, user (entrevistador), assistant (Heller) Idioma: Español rioplatense argentino 📊 Estadísticas… See the full description on the dataset page: https://huggingface.co/datasets/orlandoju/heller-gpt-dataset.
🧉 Heller-GPT Dataset
Dataset de entrevistas de Heller en formato ChatML multi-turn, diseñado para fine-tuning de LLMs.
📋 Descripción
- Fuente: Entrevistas de YouTube (canales de noticias y política argentina)
- Procesamiento: Audio → Whisper (transcripción) → PyAnnote/SpeechBrain (diarización) → ChatML
- Formato: Conversaciones multi-turn con roles
system,user(entrevistador),assistant(Heller) - Idioma: Español rioplatense argentino
📊 Estadísticas
🔧 Uso
from datasets import load_dataset
dataset = load_dataset("orlandoju/heller-gpt-dataset")📐 Formato
Cada fila tiene una columna messages con una lista de dicts:
[
{"role": "system", "content": "Sos Heller-GPT..."},
{"role": "user", "content": "¿Qué opinás sobre...?"},
{"role": "assistant", "content": "Yo creo que..."}
]🏗️ Pipeline
- Scraping (yt-dlp) → audio de entrevistas de YouTube
- Transcripción (WhisperX) → texto con timestamps
- Diarización (PyAnnote + SpeechBrain) → identificación de speakers
- Preparación → formato ChatML multi-turn
⚖️ Licencia
CC BY-SA 4.0 — El contenido original pertenece a los canales de YouTube y a Heller. Este dataset se distribuye con fines educativos y de investigación.
