CoolFace
Datasetpublic

data-lab-voice/echo-tts-en-benchmarks-v1

Echo-TTS English Benchmarks v1 Описание Датасет содержит результаты бенчмарка модели Echo-TTS на 720 предложениях из Harvard Sentences. Каждое предложение озвучено 14 спикерами — 5 встроенных голосов + 9 голосов клонированных из KaniTTS-2. Структура Поле Тип Описание text string Текст предложения echo_tts_af_bella audio Голос AF Bella (44100 Hz) echo_tts_af_heart audio Голос AF Heart (44100 Hz) echo_tts_am_fenrir audio Голос AM… See the full description on the dataset page: https://huggingface.co/datasets/data-lab-voice/echo-tts-en-benchmarks-v1.

sourceHugging Faceupdated 6mo agoView on Hugging Face
0likes78downloads
Dataset Card

Echo-TTS English Benchmarks v1

Описание

Датасет содержит результаты бенчмарка модели Echo-TTS на 720 предложениях из Harvard Sentences.

Каждое предложение озвучено 14 спикерами — 5 встроенных голосов + 9 голосов клонированных из KaniTTS-2.

Структура

ПолеТипОписание
textstringТекст предложения
echo_tts_af_bellaaudioГолос AF Bella (44100 Hz)
echo_tts_af_heartaudioГолос AF Heart (44100 Hz)
echo_tts_am_fenriraudioГолос AM Fenrir (44100 Hz)
echo_tts_am_michaelaudioГолос AM Michael (44100 Hz)
echo_tts_bf_emmaaudioГолос BF Emma (44100 Hz)
echo_tts_andrew_from_san_franciscoaudioКлон: Andrew из Сан-Франциско
echo_tts_baddy_from_liverpoolaudioКлон: Baddy из Ливерпуля
echo_tts_callum_from_glasgowaudioКлон: Callum из Глазго
echo_tts_chelsea_from_new_yorkaudioКлон: Chelsea из Нью-Йорка
echo_tts_frank_from_bostonaudioКлон: Frank из Бостона
echo_tts_jermaine_from_oaklandaudioКлон: Jermaine из Окленда
echo_tts_kore_from_geminiaudioКлон: Kore (Gemini)
echo_tts_puck_from_geminiaudioКлон: Puck (Gemini)
echo_tts_rory_from_glasgowaudioКлон: Rory из Глазго

Статистика

  • Строк: 720
  • Спикеров: 14
  • Всего аудио: 10 080
  • Sample rate: 44100 Hz
  • Размер: 2.73 GB

Использование

python
from datasets import load_dataset

ds = load_dataset("Arsen2453/echo-tts-en-benchmarks-v1", split="train")

# Прослушать первое предложение голосом AF Bella
import soundfile as sf
audio = ds[0]["echo_tts_af_bella"]
sf.write("sample.wav", audio["array"], audio["sampling_rate"])

Модель

  • Echo-TTS — диффузионная TTS модель с поддержкой клонирования голоса
  • Инференс: float16 на GPU (RTX 4090 / A100)
  • Скорость: ~1.24 сек/сэмпл на RTX 4090

<!-- Last updated: 2026-03-18 -->