named entities
ghana-named-entities-tts-twi
This dataset is shared under CC BY-NC 4.0, which means you are free to use, share, and adapt it for non-commercial research and educational purposes with attribution. You can read the full license at https://creativecommons.org/licenses/by-nc/4.0/.
Ghana Named Entities TTS — Twi
A Twi-language speech dataset built from descriptions of Ghana named entities
(people, places, organisations, and concepts). Each audio clip is a synthesised
reading of a passage that describes several… See the full description on the dataset page: https://huggingface.co/datasets/ghanaopenai/ghana-named-entities-tts-twi.named-entities-tts-pt-br-audio-qwen3tts
Qwen3-TTS (checkpoint base) — áudio sintetizado de entidades nomeadas
Dataset de áudio gerado sinteticamente a partir do glossário de entidades nomeadas do
projeto de IC "Aprimoramento de modelos de reconhecimento automático de fala em relação
ao reconhecimento de nomes próprios", usando o modelo Qwen3-TTS (Qwen/Qwen3-TTS-12Hz-1.7B-Base) em seu
checkpoint base, sem fine-tuning — etapa de baseline do projeto.
Splits
Split
Nº de exemplos
train
17309… See the full description on the dataset page: https://huggingface.co/datasets/RodrigoLimaRFL/named-entities-tts-pt-br-audio-qwen3tts.named-entities-tts-pt-br-audio
YourTTS (checkpoint base) — áudio sintetizado de entidades nomeadas
Dataset de áudio gerado sinteticamente a partir do glossário de entidades nomeadas do
projeto de IC "Aprimoramento de modelos de reconhecimento automático de fala em relação
ao reconhecimento de nomes próprios", usando o modelo YourTTS (tts_models/multilingual/multi-dataset/your_tts) em seu
checkpoint base, sem fine-tuning — etapa de baseline do projeto.
Splits
Split
Nº de exemplos… See the full description on the dataset page: https://huggingface.co/datasets/RodrigoLimaRFL/named-entities-tts-pt-br-audio.named-entities-tts-pt-brNamed_Entities_Lexiconeng_latn_named_entities
Dataset Card for Tokenization Robustness
A comprehensive evaluation dataset for testing robustness of different tokenization strategies.
Dataset Details
Dataset Description
This dataset evaluates how robust language models are to different tokenization strategies and edge cases. It includes questions with multiple choice answers designed to test various aspects of tokenization handling.
Curated by: R3
Funded by [optional]: [More Information Needed]
Shared… See the full description on the dataset page: https://huggingface.co/datasets/r-three/eng_latn_named_entities.
