CoolFace
Datasetpublic

tiagoloeblein/GodVerb

📚 GigaVerbo Clean — Portuguese Text Cleaning & Dedup Pipeline Author: Tiago Loeblein Version: v76 Status: Active — production-grade cleaning pipeline for large-scale PT datasets License: Same as the source datasets (inherited) 🧠 Overview GigaVerbo Clean é um dataset processado a partir do TucanoBR/GigaVerbo, contendo bilhões de tokens em português. Este repositório não é o dataset original, mas sim uma contribuição independente oferecendo: pipeline robusto de limpeza, deduplicação exata via… See the full description on the dataset page: https://huggingface.co/datasets/tiagoloeblein/GodVerb.

sourceHugging Faceupdated 9mo agoView on Hugging Face
0likes328downloads

tiagoloeblein/GodVerb · main · files are served by the source, never re-hosted here