ejbejaranos/MSMarco-ES-TTS-Big95.1ksamples
MSMarco-ES-TTS-Big95.1ksamples 🎙️📖 Extensión del dataset ejbejaranos/MSMarco-ES-TTS-small4.5ksamples que contiene 95,108 muestras adicionales de pares pregunta-respuesta en español convertidos a audio mediante síntesis de voz (TTS). Los samples son distintos a los de la versión anterior, por lo que pueden usarse como extensión. 🔍 Vista rápida 🎧 Demostración de audio Audio de instrucción (pregunta): Tu navegador no soporta audio… See the full description on the dataset page: https://huggingface.co/datasets/ejbejaranos/MSMarco-ES-TTS-Big95.1ksamples.
MSMarco-ES-TTS-Big95.1ksamples 🎙️📖

Extensión del dataset ejbejaranos/MSMarco-ES-TTS-small4.5ksamples que contiene 95,108 muestras adicionales de pares pregunta-respuesta en español convertidos a audio mediante síntesis de voz (TTS). Los samples son distintos a los de la versión anterior, por lo que pueden usarse como extensión.
🔍 Vista rápida
<p align="center"> <img src="https://cdn-uploads.huggingface.co/production/uploads/6419c2f6b4adb0e101b17b6c/RMn8zYdo_w9YW27VX7agY.png" alt="Descripción del proyecto" width="300"> </p>
🎧 Demostración de audio
Audio de instrucción (pregunta): <audio controls> <source src="https://datasets-server.huggingface.co/assets/ejbejaranos/MSMarco-ES-TTS-small4.5ksamples/--/88332936fb23d6d434af182330c0acec959e620b/--/default/train/0/instruction_audio/audio.mp3" type="audio/mpeg"> Tu navegador no soporta audio HTML5. </audio>
Audio de respuesta: <audio controls> <source src="https://datasets-server.huggingface.co/assets/ejbejaranos/MSMarco-ES-TTS-small4.5ksamples/--/88332936fb23d6d434af182330c0acec959e620b/--/default/train/0/output_audio/audio.mp3" type="audio/mpeg"> </audio>
📚 Descripción
Dataset generado a partir de MS Marco ES mediante:
- Filtrado de preguntas que comienzan con "¿" o "?"
- Balanceo entre respuestas positivas/negativas
- Conversión a audio usando la API de TTS de ITCL con múltiples voces
🏷️ Características clave
- 🗃️ Muestras totales: 95,108
- 🔊 Formato audio: MP3 @ 22.05kHz
- 🗣️ Voces TTS:
ef_dora,m_alex,em_santa - 🌐 Idioma: Español (ES)
- 📦 Estructura:
{
"query": "texto de pregunta",
"response": "texto de respuesta",
"audio_path": "ruta/al/audio.mp3"
}```
## 💻 Uso
from datasets import load_dataset
dataset = load_dataset("ejbejaranos/MSMarco-ES-TTS-small95.1ksamples") print(dataset["train"][0]) # Muestra primera entrada
## 🛠️ Proceso de creación
El dataset fue creado utilizando las siguientes etapas:
1. Extracción: 95k+ preguntas del dataset original
2. Generación: Conversión TTS con rotación de voces
3. Validación: Filtrado de audios corruptos
4. Publicación: Carga a Hugging Face Hub
## 📝 Ejemplo completo
{ "query": "¿Cómo puedo mejorar mi salud cardiovascular?", "response": "Hacer ejercicio regularmente y mantener una dieta balanceada ayuda a mejorar la salud cardiovascular.", "audiopath": "audiodataset/sample_0001.mp3" }
## 🤝 Contribuciones
¡Se aceptan contribuciones! Reporta problemas o sugerencias en:
## 📬 Contacto
Edison Bejarano
- ✉️ Email: ejbejaranos@gmail.com
- 🏢 Institucional: edison.bejarano@itcl.es
<p align="center">
<img src="https://cdn-uploads.huggingface.co/production/uploads/6419c2f6b4adb0e101b17b6c/uH4GuNj1cGgfrtdiDQbMG.png" alt="ITCL Logo" width="300">
</p>
