datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
ipfs_paraguay_laws_ir
Paraguay legislation IR (CID-keyed sparse GraphRAG)
Research retrieval release of endomorphosis/ipfs_paraguay_laws (revision 2e8736d28819fbb4eb711f364e8343ae8b12b4c3) packaged as
country-laws-ir-graphrag/v1 (layout family skillcenter-huggingface-release/v3 / publicus-ir).
Not legal advice. This is a research snapshot. The official gazette /
authentic source of Paraguay prevails over this corpus. Retrieved documents
and graph edges are retrieval evidence only. No legal text was… See the full description on the dataset page: https://huggingface.co/datasets/justicedao/ipfs_paraguay_laws_ir.ipfs_paraguay_laws
Paraguay BACN Laws (bacn.gov.py)
Research snapshot of official national legislation from Biblioteca y Archivo del Congreso Nacional / BACN (bacn.gov.py).
Not legal advice. The official gazette / authentic source prevails over this corpus.
Snapshot
Field
Value
Snapshot date
2026-09-17
Coverage
catalog-backed incomplete
Source
Biblioteca y Archivo del Congreso Nacional / BACN (bacn.gov.py)
Collector
scrapers/collect_py.py
Laws / instruments
427… See the full description on the dataset page: https://huggingface.co/datasets/endomorphosis/ipfs_paraguay_laws.paraguay-newsparaguay-cultural-alignment
Paraguay Cultural Alignment
Dataset en español para alineamiento cultural paraguayo, con dos modalidades de entrenamiento:
SFT (Supervised Fine-Tuning) y DPO (Direct Preference Optimization).
Diseñado para enseñar a modelos a generar continuaciones culturalmente alineadas
siguiendo un patrón estructurado de cuatro bloques que conecta texto base con el corpus guaraní paraguayo.
Patrón de Generación
Cada chosen, rejected y response es una continuación completa… See the full description on the dataset page: https://huggingface.co/datasets/somosnlp-hackathon-2026/paraguay-cultural-alignment.corpus-cultura-paraguayadataset-preferencias-paraguay-v0dpo-cultura-paraguaya-ranking
DPO Cultura Paraguaya — Ranking de Fragmentos Culturales
Dataset de preferencias en español para entrenamiento con Direct Preference Optimization (DPO).
Diseñado para enseñar a modelos a seleccionar y rankear fragmentos culturales paraguayos
más relevantes dado un contexto conversacional.
Nota: Este dataset contiene los pares (prompt, chosen, rejected) en formato de ranking puro.
Una versión extendida con conclusiones narrativas culturales generadas
(transiciones tipo "esto me… See the full description on the dataset page: https://huggingface.co/datasets/thinkPy/dpo-cultura-paraguaya-ranking.ultrachat-es-corpus-paraguayultrachat-es-corpus-paraguay_ids
ultrachat-es-similarity-paraguay
Dataset que vincula mensajes de asistente del corpus UltraChat español con las explicaciones
y traducciones más similares del corpus de cultura paraguaya, usando similitud de oraciones.
Descripción
Para cada mensaje assistant del dataset thinkPy/ultrachat-es-30k-topics
(subset consensus_topics) se calcularon los top-10 y bottom-10 fragmentos más similares
del dataset thinkPy/corpus-cultura-paraguaya
(filtrado por tags… See the full description on the dataset page: https://huggingface.co/datasets/thinkPy/ultrachat-es-corpus-paraguay_ids.dpo_ultrachat_cultura_paraguaya
