CoolFace
Datasetpublic

ejbejaranos/ITCL-ES-TTS-5voices-143ksamples

🗣️ ITCL-ES-TTS-5voices-143ksamples 📦 Descripción del Dataset Este dataset contiene 143,390 muestras en español compuestas por consultas y respuestas generadas por motores TTS (Text-to-Speech). Se generaron utilizando los modelos: 🗣️ Kokoro TTS (kokoro-82m) 🗣️ Coqui TTS (coqui) Las consultas y respuestas están basadas en el dataset ms-marco-es, y se generaron audios sintéticos para ambas partes. 🧬 Estructura del Dataset Cada muestra… See the full description on the dataset page: https://huggingface.co/datasets/ejbejaranos/ITCL-ES-TTS-5voices-143ksamples.

sourceHugging Faceapache-2.0updated 1y agoView on Hugging Face
1likes359downloads
Dataset Card

🗣️ ITCL-ES-TTS-5voices-143ksamples

<p align="center"> <img src="https://cdn-uploads.huggingface.co/production/uploads/6419c2f6b4adb0e101b17b6c/5NoKpO5P0mSbCbOegWFnl.png" alt="Descripción del proyecto" width="500"> </p>

📦 Descripción del Dataset

Este dataset contiene 143,390 muestras en español compuestas por consultas y respuestas generadas por motores TTS (Text-to-Speech). Se generaron utilizando los modelos:

  • —🗣️ Kokoro TTS (kokoro-82m)
  • —🗣️ Coqui TTS (coqui)

Las consultas y respuestas están basadas en el dataset ms-marco-es, y se generaron audios sintéticos para ambas partes.


🧬 Estructura del Dataset

Cada muestra incluye los siguientes campos:

CampoTipoDescripción
instruction_audio🎧 AudioAudio MP3 de la consulta (22,050 Hz)
instruction_text📝 TextoTexto de la consulta
output_text📝 TextoTexto de la respuesta
output_audio🎧 AudioAudio MP3 de la respuesta (22,050 Hz)
speaker_instruction🔊 TextoVoz TTS usada para la consulta
speaker_answer🔊 TextoVoz TTS usada para la respuesta
gender_instruction🚻 TextoGénero de la voz para la consulta (female, male, neutral)
model🧠 TextoModelo TTS usado (kokoro-82m o coqui)

⚙️ Características Técnicas

  • —📁 Número de muestras: 143,390
  • —🎧 Formato de audio: MP3
  • —📊 Frecuencia de muestreo: 22,050 Hz
  • —🔁 Modelos TTS alternados para generar voces más variadas
  • —👥 Voces diferenciadas para consulta y respuesta
  • —🧼 Limpieza y filtrado de texto para evitar caracteres corruptos

🛠️ ¿Cómo se creó?

El dataset fue generado con un script personalizado en Python que incluye:

  1. 1.🧹 Limpieza de textos con expresiones regulares
  2. 2.📤 Filtrado desde el dataset `ms-marco-es`
  3. 3.🎙️ Generación de audios mediante una API TTS basada en OpenAI, utilizando voces de Kokoro y Coqui
  4. 4.🧪 Validación de archivos de audio (tamaño, duración, formato)
  5. 5.🧵 Procesamiento multihilo con ThreadPoolExecutor para acelerar la generación
  6. 6.🔁 Reconversión automática con ffmpeg en caso de audios defectuosos
  7. 7.🚀 Subida automática a Hugging Face Hub

🧪 Ejemplo de Carga

Puedes cargar el dataset directamente con Hugging Face datasets:

python
from datasets import load_dataset

dataset = load_dataset("ejbejaranos/ITCL-ES-TTS-5voices-Big200ksamples")

✅ Buenas Prácticas Implementadas

✔️ Verificación de audios corruptos

✔️ Estandarización de frecuencia de muestreo

✔️ Multiprocesamiento para eficiencia

✔️ Asignación diversa de voces y modelos TTS

✔️ Documentación y trazabilidad del proceso

Información Adicional

  • —Número de muestras: 143390

🤝 Contribuciones

¡Se aceptan contribuciones! Reporta problemas o sugerencias en:

📬 Contacto

Edison Bejarano

  • —✉️ Email: ejbejaranos@gmail.com
  • —🏢 Institucional: edison.bejarano@itcl.es

<p align="center"> <img src="https://cdn-uploads.huggingface.co/production/uploads/6419c2f6b4adb0e101b17b6c/uH4GuNj1cGgfrtdiDQbMG.png" alt="ITCL Logo" width="300"> </p>