CoolFace
20 results

ptbr

opedromartins /ASR-datasets-ptbr 📚 Datasets de Áudio em Português (PT-BR) Este repositório reúne diversos corpora públicos de fala em português do Brasil, combinados em um único dataset para facilitar treinamentos e pesquisas em ASR (Automatic Speech Recognition). O objetivo é fornecer um recurso amplo, padronizado e de fácil acesso para a comunidade. 📂 Datasets Integrados A tabela abaixo lista todos os datasets incluídos, com suas informações: Dataset Config Name TOTAL train test validation… See the full description on the dataset page: https://huggingface.co/datasets/opedromartins/ASR-datasets-ptbr.audioautomatic-speech-recognition1M<n<10M13 likes2.5k downloads1y agoHugging Facedominguesm /mTEDx-ptbr Multilingual TEDx (Portuguese speech and transcripts) NOTE: This dataset contains only the Portuguese portion of the mTEDx dataset, already processed and segmented into parts. Multilingual TEDx (mTEDx) is a multilingual speech recognition and translation corpus to facilitate the training of ASR and SLT models in additional languages. The corpus comprises audio recordings and transcripts from TEDx Talks in 8 languages (Spanish, French, Portuguese, Italian, Russian, Greek, Arabic… See the full description on the dataset page: https://huggingface.co/datasets/dominguesm/mTEDx-ptbr.audioautomatic-speech-recognition1K<n<10K10 likes1k downloads3y agoHugging Facehistlearn /notas-comunidade-ptbr Community Notes BR: Enriched Portuguese Dataset for NLP and Text Mining Community Notes BR is a curated Portuguese-language subset of X Community Notes enriched for Natural Language Processing (PLN), text mining, and research on collaborative misinformation moderation. It combines note-level metadata, topic and macrotheme labels, named entities, source-domain extraction, Matrix Factorization scoring fields, an optional Universal Dependencies syntax layer, and automatic… See the full description on the dataset page: https://huggingface.co/datasets/histlearn/notas-comunidade-ptbr.tabulartext-classification1M<n<10M0 likes644 downloads26d agoHugging FacePatoFlamejanteTV /geral-edu-ptbrdocument1K<n<10K0 likes593 downloads7mo agoHugging Facedominguesm /Canarim-Instruct-PTBR-Dataset 🐥 🇧🇷 Canarim Instruct Dataset [🐱 Github] What's Canarim? Canarim is a dataset with over 300,000 instructions in Portuguese, ranging from simple instructions like "Descreva os efeitos do aquecimento global" to more complex instructions like "Nesta tarefa, você precisa ser capaz de resumir uma determinada lista de pontos-chave" where additional context is provided. Why it's called Canarim? "Canarim" is spoken in some regions of Brazil (mainly by… See the full description on the dataset page: https://huggingface.co/datasets/dominguesm/Canarim-Instruct-PTBR-Dataset.text100K<n<1M46 likes502 downloads3y agoHugging Facedominguesm /wikipedia-ptbr-20230601 Dataset Card for "wikipedia-ptbr-20230601" More Information needed text1M<n<10M11 likes457 downloads3y agoHugging Face