CoolFace
Datasetpublic

Magurofg/massive-pt-br

MASSIVE pt-BR — localização brasileira Localização para português do Brasil do split pt-PT do MASSIVE (Amazon; CC-BY-4.0) — o benchmark original não tem locale pt-BR. 15.852 frases (train 10.948 / validation 1.929 / test 2.930 aceitas), com anotação de slots preservada ([campo : valor]): a frase limpa é derivada da anotada por construção, então os valores de slot são literais por construção. Método: professor LLM recebe apenas a frase ANOTADA e devolve a versão pt-BR anotada;… See the full description on the dataset page: https://huggingface.co/datasets/Magurofg/massive-pt-br.

sourceHugging Facecc-by-4.0updated 2mo agoView on Hugging Face
0likes63downloads
Dataset Card

MASSIVE pt-BR — localização brasileira

Localização para português do Brasil do split pt-PT do MASSIVE (Amazon; CC-BY-4.0) — o benchmark original não tem locale pt-BR. 15.852 frases (train 10.948 / validation 1.929 / test 2.930 aceitas), com anotação de slots preservada ([campo : valor]): a frase limpa é derivada da anotada por construção, então os valores de slot são literais por construção.

Método: professor LLM recebe apenas a frase ANOTADA e devolve a versão pt-BR anotada; validação por código exige os mesmos nomes de campo e valores não vazios (99,7% de aceitação). Detalhes, auditorias de atalho e avaliações no repositório do projeto.

Números de referência medidos com este conjunto (decoder de 269M treinado do zero em pt-BR + SFT): 88,2% de intenção / 79,3 de slot F1 em fatia cega — contra 86,7/73,3 do XLM-R Base fine-tunado no split pt-PT oficial (comparável em tarefa e rótulos, não em conjunto de teste).

Derivado do MASSIVE © Amazon.com, sob CC-BY-4.0; esta localização mantém a licença. Cite o paper original do MASSIVE e este repositório.