ejbejaranos/ITCL-ES-TTS-5voices-143ksamples
🗣️ ITCL-ES-TTS-5voices-143ksamples 📦 Descripción del Dataset Este dataset contiene 143,390 muestras en español compuestas por consultas y respuestas generadas por motores TTS (Text-to-Speech). Se generaron utilizando los modelos: 🗣️ Kokoro TTS (kokoro-82m) 🗣️ Coqui TTS (coqui) Las consultas y respuestas están basadas en el dataset ms-marco-es, y se generaron audios sintéticos para ambas partes. 🧬 Estructura del Dataset Cada muestra… See the full description on the dataset page: https://huggingface.co/datasets/ejbejaranos/ITCL-ES-TTS-5voices-143ksamples.
🗣️ ITCL-ES-TTS-5voices-143ksamples
<p align="center"> <img src="https://cdn-uploads.huggingface.co/production/uploads/6419c2f6b4adb0e101b17b6c/5NoKpO5P0mSbCbOegWFnl.png" alt="Descripción del proyecto" width="500"> </p>
📦 Descripción del Dataset
Este dataset contiene 143,390 muestras en español compuestas por consultas y respuestas generadas por motores TTS (Text-to-Speech). Se generaron utilizando los modelos:
- 🗣️ Kokoro TTS (
kokoro-82m) - 🗣️ Coqui TTS (
coqui)
Las consultas y respuestas están basadas en el dataset ms-marco-es, y se generaron audios sintéticos para ambas partes.
🧬 Estructura del Dataset
Cada muestra incluye los siguientes campos:
⚙️ Características Técnicas
- 📁 Número de muestras: 143,390
- 🎧 Formato de audio: MP3
- 📊 Frecuencia de muestreo: 22,050 Hz
- 🔁 Modelos TTS alternados para generar voces más variadas
- 👥 Voces diferenciadas para consulta y respuesta
- 🧼 Limpieza y filtrado de texto para evitar caracteres corruptos
🛠️ ¿Cómo se creó?
El dataset fue generado con un script personalizado en Python que incluye:
- 🧹 Limpieza de textos con expresiones regulares
- 📤 Filtrado desde el dataset `ms-marco-es`
- 🎙️ Generación de audios mediante una API TTS basada en OpenAI, utilizando voces de Kokoro y Coqui
- 🧪 Validación de archivos de audio (tamaño, duración, formato)
- 🧵 Procesamiento multihilo con
ThreadPoolExecutorpara acelerar la generación - 🔁 Reconversión automática con
ffmpegen caso de audios defectuosos - 🚀 Subida automática a Hugging Face Hub
🧪 Ejemplo de Carga
Puedes cargar el dataset directamente con Hugging Face datasets:
from datasets import load_dataset
dataset = load_dataset("ejbejaranos/ITCL-ES-TTS-5voices-Big200ksamples")✅ Buenas Prácticas Implementadas
✔️ Verificación de audios corruptos
✔️ Estandarización de frecuencia de muestreo
✔️ Multiprocesamiento para eficiencia
✔️ Asignación diversa de voces y modelos TTS
✔️ Documentación y trazabilidad del proceso
Información Adicional
- Número de muestras: 143390
🤝 Contribuciones
¡Se aceptan contribuciones! Reporta problemas o sugerencias en:
📬 Contacto
Edison Bejarano
- ✉️ Email: ejbejaranos@gmail.com
- 🏢 Institucional: edison.bejarano@itcl.es
<p align="center"> <img src="https://cdn-uploads.huggingface.co/production/uploads/6419c2f6b4adb0e101b17b6c/uH4GuNj1cGgfrtdiDQbMG.png" alt="ITCL Logo" width="300"> </p>
