Magurofg/massive-pt-br
MASSIVE pt-BR — localização brasileira Localização para português do Brasil do split pt-PT do MASSIVE (Amazon; CC-BY-4.0) — o benchmark original não tem locale pt-BR. 15.852 frases (train 10.948 / validation 1.929 / test 2.930 aceitas), com anotação de slots preservada ([campo : valor]): a frase limpa é derivada da anotada por construção, então os valores de slot são literais por construção. Método: professor LLM recebe apenas a frase ANOTADA e devolve a versão pt-BR anotada;… See the full description on the dataset page: https://huggingface.co/datasets/Magurofg/massive-pt-br.
MASSIVE pt-BR — localização brasileira
Localização para português do Brasil do split pt-PT do MASSIVE (Amazon; CC-BY-4.0) — o benchmark original não tem locale pt-BR. 15.852 frases (train 10.948 / validation 1.929 / test 2.930 aceitas), com anotação de slots preservada ([campo : valor]): a frase limpa é derivada da anotada por construção, então os valores de slot são literais por construção.
Método: professor LLM recebe apenas a frase ANOTADA e devolve a versão pt-BR anotada; validação por código exige os mesmos nomes de campo e valores não vazios (99,7% de aceitação). Detalhes, auditorias de atalho e avaliações no repositório do projeto.
Números de referência medidos com este conjunto (decoder de 269M treinado do zero em pt-BR + SFT): 88,2% de intenção / 79,3 de slot F1 em fatia cega — contra 86,7/73,3 do XLM-R Base fine-tunado no split pt-PT oficial (comparável em tarefa e rótulos, não em conjunto de teste).
Derivado do MASSIVE © Amazon.com, sob CC-BY-4.0; esta localização mantém a licença. Cite o paper original do MASSIVE e este repositório.
