CoolFace
Datasetpublic

SamuelMauli/parity-juridico-dataset-v3

parity-juridico-dataset-v3 Dataset jurídico brasileiro PURO — 100% texto jurídico de domínio, sem ruído de NLI genérico ou frases não-jurídicas. Volume Triplets: 195 Pairs: 445 Corpus: 957 textos jurídicos brutos Diferenças do v2 REMOVIDO: ASSIN2 (NLI genérico — "jóqueis montando cavalos" não é jurídico) ADICIONADO: filtro regex jurídico estrito em todas as fontes ADICIONADO: PNCP editais reais via API pública ADICIONADO: TCU acórdãos via… See the full description on the dataset page: https://huggingface.co/datasets/SamuelMauli/parity-juridico-dataset-v3.

sourceHugging Faceapache-2.0updated 5mo agoView on Hugging Face
0likes20downloads
Dataset Card

parity-juridico-dataset-v3

Dataset jurídico brasileiro PURO — 100% texto jurídico de domínio, sem ruído de NLI genérico ou frases não-jurídicas.

Volume

  • —Triplets: 195
  • —Pairs: 445
  • —Corpus: 957 textos jurídicos brutos

Diferenças do v2

  • —REMOVIDO: ASSIN2 (NLI genérico — "jóqueis montando cavalos" não é jurídico)
  • —ADICIONADO: filtro regex jurídico estrito em todas as fontes
  • —ADICIONADO: PNCP editais reais via API pública
  • —ADICIONADO: TCU acórdãos via dados.tcu.gov.br (CKAN datasets)
  • —MANTIDO: LeNER-Br (com filtro mais estrito), legal-bench-br, editais Parity, curado v1

Filtro jurídico

Cada texto deve conter pelo menos 1 termo do vocabulário jurídico (70+ regex cobrindo: leis, artigos, tribunais, processos, licitação, direito tributário/trabalhista/administrativo, fomento, dispositivos).

Fontes

  • —parity-v1: triplets=131, pairs=313
  • —pierreguillou-lener-lm: corpus=772, descartados=14480
  • —legal-bench-br: corpus=0, areas=0, triplets=0, pairspos=0, pairsneg=0
  • —parity-editais: corpus=185, orgaos=119, triplets=66

Modelo treinado

`SamuelMauli/parity-embedding-juridico-br-v3`

Owner

Samuel Mauli (samuel.mauli@gmail.com), Doublethree / Parity.