data-lab-voice/echo-tts-en-benchmarks-v1
Echo-TTS English Benchmarks v1 Описание Датасет содержит результаты бенчмарка модели Echo-TTS на 720 предложениях из Harvard Sentences. Каждое предложение озвучено 14 спикерами — 5 встроенных голосов + 9 голосов клонированных из KaniTTS-2. Структура Поле Тип Описание text string Текст предложения echo_tts_af_bella audio Голос AF Bella (44100 Hz) echo_tts_af_heart audio Голос AF Heart (44100 Hz) echo_tts_am_fenrir audio Голос AM… See the full description on the dataset page: https://huggingface.co/datasets/data-lab-voice/echo-tts-en-benchmarks-v1.
Echo-TTS English Benchmarks v1
Описание
Датасет содержит результаты бенчмарка модели Echo-TTS на 720 предложениях из Harvard Sentences.
Каждое предложение озвучено 14 спикерами — 5 встроенных голосов + 9 голосов клонированных из KaniTTS-2.
Структура
Статистика
- Строк: 720
- Спикеров: 14
- Всего аудио: 10 080
- Sample rate: 44100 Hz
- Размер: 2.73 GB
Использование
from datasets import load_dataset
ds = load_dataset("Arsen2453/echo-tts-en-benchmarks-v1", split="train")
# Прослушать первое предложение голосом AF Bella
import soundfile as sf
audio = ds[0]["echo_tts_af_bella"]
sf.write("sample.wav", audio["array"], audio["sampling_rate"])Модель
- Echo-TTS — диффузионная TTS модель с поддержкой клонирования голоса
- Инференс: float16 на GPU (RTX 4090 / A100)
- Скорость: ~1.24 сек/сэмпл на RTX 4090
<!-- Last updated: 2026-03-18 -->
