CoolFace
Datasetpublic

ejbejaranos/MSMarco-ES-TTS-small4.5ksamples

MSMarco-ES-TTS-small4.5ksamples 🎙️📚 Este dataset contiene 4,500 muestras de consultas y respuestas en español generadas a partir del dataset MS Marco ES y convertidas a audio mediante un sistema de Text-to-Speech (TTS). Ejemplo de audio Puedes escuchar un ejemplo de audio generado a partir del dataset aquí: Instruction audio Tu navegador no soporta la reproducción de audio. Output audio Descripción El… See the full description on the dataset page: https://huggingface.co/datasets/ejbejaranos/MSMarco-ES-TTS-small4.5ksamples.

sourceHugging Facemitupdated 1y agoView on Hugging Face
1likes56downloads
Dataset Card

MSMarco-ES-TTS-small4.5ksamples 🎙️📚

Este dataset contiene 4,500 muestras de consultas y respuestas en español generadas a partir del dataset MS Marco ES y convertidas a audio mediante un sistema de Text-to-Speech (TTS).

Ejemplo de audio

Puedes escuchar un ejemplo de audio generado a partir del dataset aquí:

Instruction audio

<audio controls> <source src="https://datasets-server.huggingface.co/assets/ejbejaranos/MSMarco-ES-TTS-small4.5ksamples/--/88332936fb23d6d434af182330c0acec959e620b/--/default/train/0/instructionaudio/audio.mp3?Expires=1743172243&amp;Signature=DmjwNtIdl2nzjqDxq8CrpsEoJJQJA8OoMjtCBYbzgsPzkDDHxjjNfm-BZhMDKUEuPFmBrHi67kWRIyV~ZFfMHP4mAEuQjjXVucyl0jcVkVHmv3m6VR6Rv0dfM9WQ7v1Vs6MpyWMTo-0hBBbZ4EKEfS6Ci-SPJSxHOOUlm6QZ8BBnnOCeJGnwiJQ7zzbZCL7WhooyBsdJnAC7D7WyikFQvllAt-8CREdhjbefcT1BUsf7rZ8XXwVEN3rdw97U7nGSVlNw~BetraA4hbAeMmdaj-YkECiL4SSFrQyeUdRyc2usr3jSvYEeIKTfHJXraja8Ec70PTcNI3g3xJBCIRr9Dw_&amp;Key-Pair-Id=K3EI6M078Z3AC3" type="audio/mpeg"> Tu navegador no soporta la reproducción de audio. </audio>

Output audio

<audio controls> <source src="https://datasets-server.huggingface.co/assets/ejbejaranos/MSMarco-ES-TTS-small4.5ksamples/--/88332936fb23d6d434af182330c0acec959e620b/--/default/train/0/outputaudio/audio.mp3?Expires=1743172243&amp;Signature=ZLUS20L2Iax-WRTnE~8XVJOxEJl2eAdcCYPxw-P~Sbv9--sIsmBDKKRuyobXLxGk~JnyiZKysrAAERDy0XEoJhklrycrEwjzm7uy9GzVPBLGLH9amKIBt2BFT8GxaVUuM~hmg8tiIxWeEUoXrPjfnhKz08O1dms16Z50Z5MRCT0o1OpLlTFpvak5UgX1zgdaMFFSKeJV-xZAHm-ZJSGd9tUbh-FRTwTvTV4t3G76HJP-SZkBOmmjSRPOZgwaBX1MUAmirLIHJ5fi7th~rhY2RF~28thlG9HTc0b09RTTWZll6x96Q3CYsPPOdV3DIP5YMo5dAokdi5WL4WCDpBAutA_&amp;Key-Pair-Id=K3EI6M078Z3AC3" type="audio/mpeg"> </audio>

Descripción

El conjunto de datos fue construido filtrando preguntas del dataset original que comenzaban con "¿" o "?", alternando entre respuestas positivas y negativas. Posteriormente, las respuestas fueron convertidas en audio utilizando la API de TTS de ITCL con diferentes voces.

✨ Características del dataset:

  • —📊 Número total de muestras: 4,500
  • —🎵 Formato de audio: MP3
  • —📡 Frecuencia de muestreo: 22.05 kHz
  • —🗣️ Voces utilizadas: ef_dora, m_alex, em_santa
  • —🌍 Idioma: Español
  • —📂 Formato de almacenamiento:
  • —query: Pregunta en texto.
  • —response: Respuesta en texto.
  • —audio_path: Ruta al archivo de audio generado.

Uso

Puedes cargar el dataset directamente desde Hugging Face con:

python
from datasets import load_dataset

dataset = load_dataset("ejbejaranos/MSMarco-ES-TTS-small100ksamples")
print(dataset["train"][0])

Generación del dataset

El dataset fue creado utilizando las siguientes etapas:

  1. 1.Filtrado de consultas: Se extrajeron 10,000 preguntas del dataset original con sus respuestas alternando entre positivas y negativas.
  1. 1.Generación de audio: Se procesaron las respuestas usando un servicio TTS con tres voces diferentes.
  1. 1.Verificación de calidad: Se filtraron muestras con errores en la generación de audio o con archivos inválidos.
  1. 1.Subida a Hugging Face: Se almacenaron los datos en un repositorio de datasets en Hugging Face.

Ejemplo de muestra

{
  "query": "¿Cómo puedo mejorar mi salud cardiovascular?",
  "response": "Hacer ejercicio regularmente y mantener una dieta balanceada ayuda a mejorar la salud cardiovascular.",
  "audio_path": "audio_dataset/sample_0001.mp3"
}

Contacto

Para más información o reportar problemas con el dataset, puedes contactar a Edison Bejarano ejbejaranos@gmail.com edison.bejarano@itcl.es