SamuelMauli/parity-juridico-dataset-v3
parity-juridico-dataset-v3 Dataset jurídico brasileiro PURO — 100% texto jurídico de domínio, sem ruído de NLI genérico ou frases não-jurídicas. Volume Triplets: 195 Pairs: 445 Corpus: 957 textos jurídicos brutos Diferenças do v2 REMOVIDO: ASSIN2 (NLI genérico — "jóqueis montando cavalos" não é jurídico) ADICIONADO: filtro regex jurídico estrito em todas as fontes ADICIONADO: PNCP editais reais via API pública ADICIONADO: TCU acórdãos via… See the full description on the dataset page: https://huggingface.co/datasets/SamuelMauli/parity-juridico-dataset-v3.
parity-juridico-dataset-v3
Dataset jurídico brasileiro PURO — 100% texto jurídico de domínio, sem ruído de NLI genérico ou frases não-jurídicas.
Volume
- Triplets: 195
- Pairs: 445
- Corpus: 957 textos jurídicos brutos
Diferenças do v2
- REMOVIDO: ASSIN2 (NLI genérico — "jóqueis montando cavalos" não é jurídico)
- ADICIONADO: filtro regex jurídico estrito em todas as fontes
- ADICIONADO: PNCP editais reais via API pública
- ADICIONADO: TCU acórdãos via dados.tcu.gov.br (CKAN datasets)
- MANTIDO: LeNER-Br (com filtro mais estrito), legal-bench-br, editais Parity, curado v1
Filtro jurídico
Cada texto deve conter pelo menos 1 termo do vocabulário jurídico (70+ regex cobrindo: leis, artigos, tribunais, processos, licitação, direito tributário/trabalhista/administrativo, fomento, dispositivos).
Fontes
- parity-v1: triplets=131, pairs=313
- pierreguillou-lener-lm: corpus=772, descartados=14480
- legal-bench-br: corpus=0, areas=0, triplets=0, pairspos=0, pairsneg=0
- parity-editais: corpus=185, orgaos=119, triplets=66
Modelo treinado
`SamuelMauli/parity-embedding-juridico-br-v3`
Owner
Samuel Mauli (samuel.mauli@gmail.com), Doublethree / Parity.
