ejbejaranos/MSMarco-ES-TTS-small4.5ksamples
MSMarco-ES-TTS-small4.5ksamples 🎙️📚 Este dataset contiene 4,500 muestras de consultas y respuestas en español generadas a partir del dataset MS Marco ES y convertidas a audio mediante un sistema de Text-to-Speech (TTS). Ejemplo de audio Puedes escuchar un ejemplo de audio generado a partir del dataset aquí: Instruction audio Tu navegador no soporta la reproducción de audio. Output audio Descripción El… See the full description on the dataset page: https://huggingface.co/datasets/ejbejaranos/MSMarco-ES-TTS-small4.5ksamples.
MSMarco-ES-TTS-small4.5ksamples 🎙️📚
Este dataset contiene 4,500 muestras de consultas y respuestas en español generadas a partir del dataset MS Marco ES y convertidas a audio mediante un sistema de Text-to-Speech (TTS).
Ejemplo de audio
Puedes escuchar un ejemplo de audio generado a partir del dataset aquí:
Instruction audio
<audio controls> <source src="https://datasets-server.huggingface.co/assets/ejbejaranos/MSMarco-ES-TTS-small4.5ksamples/--/88332936fb23d6d434af182330c0acec959e620b/--/default/train/0/instructionaudio/audio.mp3?Expires=1743172243&Signature=DmjwNtIdl2nzjqDxq8CrpsEoJJQJA8OoMjtCBYbzgsPzkDDHxjjNfm-BZhMDKUEuPFmBrHi67kWRIyV~ZFfMHP4mAEuQjjXVucyl0jcVkVHmv3m6VR6Rv0dfM9WQ7v1Vs6MpyWMTo-0hBBbZ4EKEfS6Ci-SPJSxHOOUlm6QZ8BBnnOCeJGnwiJQ7zzbZCL7WhooyBsdJnAC7D7WyikFQvllAt-8CREdhjbefcT1BUsf7rZ8XXwVEN3rdw97U7nGSVlNw~BetraA4hbAeMmdaj-YkECiL4SSFrQyeUdRyc2usr3jSvYEeIKTfHJXraja8Ec70PTcNI3g3xJBCIRr9Dw_&Key-Pair-Id=K3EI6M078Z3AC3" type="audio/mpeg"> Tu navegador no soporta la reproducción de audio. </audio>
Output audio
<audio controls> <source src="https://datasets-server.huggingface.co/assets/ejbejaranos/MSMarco-ES-TTS-small4.5ksamples/--/88332936fb23d6d434af182330c0acec959e620b/--/default/train/0/outputaudio/audio.mp3?Expires=1743172243&Signature=ZLUS20L2Iax-WRTnE~8XVJOxEJl2eAdcCYPxw-P~Sbv9--sIsmBDKKRuyobXLxGk~JnyiZKysrAAERDy0XEoJhklrycrEwjzm7uy9GzVPBLGLH9amKIBt2BFT8GxaVUuM~hmg8tiIxWeEUoXrPjfnhKz08O1dms16Z50Z5MRCT0o1OpLlTFpvak5UgX1zgdaMFFSKeJV-xZAHm-ZJSGd9tUbh-FRTwTvTV4t3G76HJP-SZkBOmmjSRPOZgwaBX1MUAmirLIHJ5fi7th~rhY2RF~28thlG9HTc0b09RTTWZll6x96Q3CYsPPOdV3DIP5YMo5dAokdi5WL4WCDpBAutA_&Key-Pair-Id=K3EI6M078Z3AC3" type="audio/mpeg"> </audio>
Descripción
El conjunto de datos fue construido filtrando preguntas del dataset original que comenzaban con "¿" o "?", alternando entre respuestas positivas y negativas. Posteriormente, las respuestas fueron convertidas en audio utilizando la API de TTS de ITCL con diferentes voces.
✨ Características del dataset:
- 📊 Número total de muestras: 4,500
- 🎵 Formato de audio: MP3
- 📡 Frecuencia de muestreo: 22.05 kHz
- 🗣️ Voces utilizadas:
ef_dora,m_alex,em_santa - 🌍 Idioma: Español
- 📂 Formato de almacenamiento:
query: Pregunta en texto.response: Respuesta en texto.audio_path: Ruta al archivo de audio generado.
Uso
Puedes cargar el dataset directamente desde Hugging Face con:
from datasets import load_dataset
dataset = load_dataset("ejbejaranos/MSMarco-ES-TTS-small100ksamples")
print(dataset["train"][0])Generación del dataset
El dataset fue creado utilizando las siguientes etapas:
- Filtrado de consultas: Se extrajeron 10,000 preguntas del dataset original con sus respuestas alternando entre positivas y negativas.
- Generación de audio: Se procesaron las respuestas usando un servicio TTS con tres voces diferentes.
- Verificación de calidad: Se filtraron muestras con errores en la generación de audio o con archivos inválidos.
- Subida a Hugging Face: Se almacenaron los datos en un repositorio de datasets en Hugging Face.
Ejemplo de muestra
{
"query": "¿Cómo puedo mejorar mi salud cardiovascular?",
"response": "Hacer ejercicio regularmente y mantener una dieta balanceada ayuda a mejorar la salud cardiovascular.",
"audio_path": "audio_dataset/sample_0001.mp3"
}Contacto
Para más información o reportar problemas con el dataset, puedes contactar a Edison Bejarano ejbejaranos@gmail.com edison.bejarano@itcl.es
