CoolFace
Datasetpublic

Muckylixx/mucky-voice-final

Mucky Voice – Deutscher Einzelsprecher-Sprachdatensatz Ein kuratierter deutscher Sprachdatensatz mit Aufnahmen meiner eigenen Stimme. Der Datensatz enthält 11.817 geprüfte Audio-Text-Paare mit einer gesamten nutzbaren Sprachdauer von 43 Stunden, 43 Minuten und 37,1 Sekunden. Er eignet sich insbesondere für: deutsches Text-to-Speech-Training Sprecheranpassung und Voice Cloning automatische Spracherkennung Forschung zu spontaner Sprache Sprachbereinigung und Aussprachemodelle… See the full description on the dataset page: https://huggingface.co/datasets/Muckylixx/mucky-voice-final.

sourceHugging Facecc-by-4.0updated 2mo agoView on Hugging Face
0likes1kdownloads
Dataset Card

Mucky Voice – Deutscher Einzelsprecher-Sprachdatensatz

Ein kuratierter deutscher Sprachdatensatz mit Aufnahmen meiner eigenen Stimme.

Der Datensatz enthält 11.817 geprüfte Audio-Text-Paare mit einer gesamten nutzbaren Sprachdauer von 43 Stunden, 43 Minuten und 37,1 Sekunden.

Er eignet sich insbesondere für:

  • —deutsches Text-to-Speech-Training
  • —Sprecheranpassung und Voice Cloning
  • —automatische Spracherkennung
  • —Forschung zu spontaner Sprache
  • —Sprachbereinigung und Aussprachemodelle

Entstehung des Datensatzes

Dieser Datensatz entstand nicht durch das Vorlesen vorbereiteter Texte.

Über einen längeren Zeitraum wurden meine gesprochenen Eingaben an KI-Systeme automatisch mitprotokolliert und als Audiodateien gespeichert. Sämtliche Äußerungen wurden frei und spontan formuliert – also „frei Schnauze“ und ohne vorbereitetes Skript.

Dadurch enthält der Datensatz natürliche gesprochene Sprache mit typischen Merkmalen wie:

  • —spontanen Formulierungen
  • —natürlicher Satzmelodie
  • —Pausen und Denkpausen
  • —Selbstkorrekturen
  • —Satzabbrüchen
  • —Wiederholungen
  • —Füllwörtern und umgangssprachlichen Wendungen
  • —wechselnder Sprechgeschwindigkeit
  • —emotionaler und kontextabhängiger Betonung

Der Datensatz bildet reale Mensch-KI-Kommunikation und natürliche Alltagssprache ab, anstatt eine kontrollierte Vorlesesituation.

Inhalt

Jeder Eintrag enthält:

  • —eine Mono-WAV-Aufnahme mit 48 kHz
  • —das zugehörige normalisierte deutsche Transkript
  • —Datensatz- und Aufnahme-ID
  • —Informationen darüber, ob das Transkript während der Normalisierung verändert oder unverändert übernommen wurde

Die finale Version enthält:

  • —11.817 vollständige Audio-Text-Paare
  • —43:43:37,1 Stunden nutzbare Sprache
  • —0 fehlende Audiodateien
  • —0 fehlende Transkripte
  • —SHA-256-Prüfsummen für alle enthaltenen Dateien

Verarbeitung

Die Aufnahmen wurden über mehrere voneinander unabhängige Transkriptions-, Vergleichs-, Alignment- und Bereinigungsstufen verarbeitet, darunter:

  • —mehrere Whisper-Transkriptionsläufe
  • —WhisperX
  • —Forced Alignment
  • —regelbasierte Normalisierung
  • —Vergleich verschiedener Transkriptionsvarianten
  • —kontextbezogene LLM-Korrektur mit einem eigenen deutschen Wörterbuch

Uneindeutige Aufnahmen wurden aus dem finalen Trainingsbestand ausgeschlossen oder separat zur Prüfung abgelegt.

Dateistruktur

text
audio/Dataset_A/<recording_id>.wav
audio/Dataset_B/<recording_id>.wav
...
data/metadata.jsonl
data/metadata.csv

Das Feld audio in den Metadaten verweist auf die jeweilige WAV-Datei.

Sprecher und Einwilligung

Die Aufnahmen enthalten meine eigene Stimme und werden mit meiner ausdrücklichen Einwilligung veröffentlicht.

Sprecherprofil:

  • —Sprache: Deutsch
  • —Muttersprache: Deutsch
  • —Geschlecht: männlich
  • —Regionale Färbung: Brandenburg/Berlin
  • —Aussprache: überwiegend Standarddeutsch
  • —Sprechstil: spontan, natürlich und dialogorientiert

Geeignete Verwendung

Der Datensatz darf für Forschung, Entwicklung und Training von Sprachsystemen genutzt werden, einschließlich synthetischer Spracherzeugung.

Nutzer sind selbst dafür verantwortlich, geltendes Recht einzuhalten und synthetische oder geklonte Sprache angemessen kenntlich zu machen.

Der Datensatz darf nicht für Betrug, Identitätstäuschung, Belästigung, manipulative politische Kommunikation oder andere schädliche Zwecke eingesetzt werden.

Einschränkungen

Die Aufnahmen wurden nicht unter einheitlichen professionellen Studiobedingungen erstellt. Hintergrundgeräusche, Mikrofone, Sprechsituationen und Aufnahmebedingungen können variieren.

Da es sich um spontane Sprache handelt, können grammatikalisch unvollständige Sätze, Wiederholungen, Füllwörter und Selbstkorrekturen enthalten sein. Diese Eigenschaften sind bewusst Teil des Datensatzes und kein Fehler.

Trotz umfangreicher automatischer und halbautomatischer Prüfung können vereinzelt Transkriptions- oder Normalisierungsfehler verbleiben.

Lizenz

Dieser Datensatz wird unter der Creative Commons Attribution 4.0 International Lizenz (CC BY 4.0) veröffentlicht.

Namensnennung:

Mucky Voice German Speech Dataset, Maurice Hartmann / Muckylixx

Kontakt

Ersteller: Maurice Hartmann Hugging Face: Muckylixx


Mucky Voice – German Single-Speaker Speech Dataset

A curated German speech dataset created from recordings of my own voice.

The dataset contains 11,817 verified audio-text pairs, representing 43 hours, 43 minutes and 37.1 seconds of usable speech.

It is primarily intended for:

  • —German text-to-speech training
  • —speaker adaptation and voice cloning
  • —automatic speech recognition
  • —spontaneous speech research
  • —speech normalization and pronunciation modeling

Dataset origin

This dataset was not created by reading prepared scripts.

Over an extended period, my spoken inputs to AI systems were automatically logged and stored as audio recordings. All utterances were formulated freely and spontaneously, without a prepared script.

The recordings therefore contain natural spoken-language characteristics such as:

  • —spontaneous phrasing
  • —natural prosody
  • —pauses and thinking pauses
  • —self-corrections
  • —unfinished sentences
  • —repetitions
  • —filler words and colloquial expressions
  • —varying speaking speed
  • —emotional and context-dependent emphasis

The dataset reflects real human-AI interaction and everyday conversational speech rather than a controlled reading scenario.

Dataset content

Each entry contains:

  • —a 48 kHz mono WAV recording
  • —the corresponding normalized German transcript
  • —dataset and recording identifiers
  • —information indicating whether the transcript was changed or retained during normalization

The final release contains:

  • —11,817 complete audio-text pairs
  • —43:43:37.1 hours of usable speech
  • —0 missing audio files
  • —0 missing transcripts
  • —SHA-256 checksums for all included files

Processing

The recordings were processed through several independent transcription, comparison, alignment and normalization stages, including:

  • —multiple Whisper transcription passes
  • —WhisperX
  • —forced alignment
  • —rule-based normalization
  • —comparison of transcription variants
  • —contextual LLM-assisted correction using a custom German dictionary

Ambiguous recordings were excluded from the final training set or placed in a separate review section.

File structure

text
audio/Dataset_A/<recording_id>.wav
audio/Dataset_B/<recording_id>.wav
...
data/metadata.jsonl
data/metadata.csv

The audio field in the metadata points to the corresponding WAV file.

Speaker and consent

The recordings contain my own voice and are published with my explicit consent.

Speaker profile:

  • —Language: German
  • —Native language: German
  • —Gender: male
  • —Regional accent: Brandenburg/Berlin
  • —Pronunciation: mostly Standard German
  • —Speaking style: spontaneous, natural and conversational

Intended use

The dataset may be used for research, development and training of speech-processing systems, including synthetic speech generation.

Users are responsible for complying with applicable laws and for appropriately disclosing synthetic or cloned speech.

The dataset must not be used for fraud, impersonation, harassment, deceptive political communication or other malicious purposes.

Limitations

The recordings were not created under uniform professional studio conditions. Background noise, microphones, speaking situations and recording conditions may vary.

Because the dataset consists of spontaneous speech, it may contain incomplete grammatical structures, repetitions, filler words and self-corrections. These characteristics are intentionally preserved and should not be considered errors.

Although the dataset underwent extensive automated and semi-automated validation, occasional transcription or normalization errors may remain.

License

This dataset is released under the Creative Commons Attribution 4.0 International license (CC BY 4.0).

Attribution:

Mucky Voice German Speech Dataset, Maurice Hartmann / Muckylixx

Contact

Creator: Maurice Hartmann Hugging Face: Muckylixx

Muckylixx/mucky-voice-final · CoolFace