CoolFace
Datasetpublic

Kukedlc/Personas-Argentinas-1k

Personas Argentinas — dataset sintético multipropósito Población sintética de 1000 personas argentinas, construida con rigor estadístico sobre fuentes oficiales. Cada persona integra demografía anclada en el censo y las encuestas oficiales, un perfil de personalidad, un posicionamiento de opinión y valores calibrado contra datos reales, y una biografía coherente. Pensada para investigación reproducible, simulación social y modelado de poblaciones. Primera versión; en expansión… See the full description on the dataset page: https://huggingface.co/datasets/Kukedlc/Personas-Argentinas-1k.

sourceHugging Facecc-by-4.0updated 4mo agoView on Hugging Face
0likes11downloads
Dataset Card

Personas Argentinas — dataset sintético multipropósito

Población sintética de 1000 personas argentinas, construida con rigor estadístico sobre fuentes oficiales. Cada persona integra demografía anclada en el censo y las encuestas oficiales, un perfil de personalidad, un posicionamiento de opinión y valores calibrado contra datos reales, y una biografía coherente. Pensada para investigación reproducible, simulación social y modelado de poblaciones. Primera versión; en expansión continua.

Por qué es distinta

La mayoría de los datasets de "personas" muestrean cada atributo por separado y producen perfiles inverosímiles (combinaciones que no existen en la población). Acá, en cambio:

  • —Representatividad real: cada persona se deriva de un caso real de microdatos oficiales mediante muestreo proporcional al ponderador poblacional, preservando las distribuciones conjuntas entre edad, educación, ocupación, ingreso, región y hogar.
  • —Opinión calibrada contra datos reales: el bloque de valores y posicionamiento se ancla por imputación estadística estratificada en una encuesta de opinión pública oficial; las distribuciones agregadas reproducen las observadas en la población real (por ejemplo, la estructura de intención de voto y de confianza institucional).
  • —Coherencia y diversidad controladas: cada perfil se audita para evitar contradicciones internas y homogeneización, conservando la heterogeneidad real de la población (incluidas las combinaciones atípicas que existen en la sociedad).

Fuentes y metodología

BloqueFuente oficialMétodo
Demografía y socioeconomíaEPH — Encuesta Permanente de Hogares (INDEC, 3T 2024)Muestreo proporcional al ponderador PONDERA; se preservan correlaciones conjuntas
Opinión, valores e ideologíaLatinobarómetro 2023 — ArgentinaImputación hot-deck por estratos demográficos (sexo x edad x educación)
Ocupación y rama de actividadCNO 2001 y CAES Mercosur (INDEC)Codificación oficial, con correspondencia a ISCO / CIIU
Referencia demográfica nacionalCenso Nacional 2022 (INDEC)Marco poblacional de referencia
PersonalidadModelo Big Five (OCEAN)Percentiles con efectos demográficos documentados

Enlaces a las fuentes:

  • —EPH — bases de datos (INDEC): https://www.indec.gob.ar/indec/web/Institucional-Indec-basesdedatosephamp
  • —Latinobarómetro — banco de datos: https://www.latinobarometro.org/datos.jsp
  • —Clasificador Nacional de Ocupaciones (CNO 2001, INDEC): https://www.indec.gob.ar/ftp/cuadros/menusuperior/clasificadores/definicionesconceptualescno.pdf
  • —CAES Mercosur (INDEC): https://www.indec.gob.ar/ftp/cuadros/menusuperior/eph/caesmercosur1.0.pdf
  • —Censo Nacional 2022 (INDEC): https://censo.gob.ar/
  • —INDEC (organismo): https://www.indec.gob.ar/

Estructura — 71 columnas

  • —Demografía (anclada en censo y EPH): edad, sexo, estado civil, región, aglomerado, nivel educativo, condición de actividad, categoría y rama ocupacional, calificación, códigos CNO/CAES, ingresos (individual, familiar, per cápita) y decil.
  • —Personalidad: los cinco rasgos OCEAN (apertura, responsabilidad, extraversión, amabilidad, neuroticismo), en percentil y banda.
  • —Opinión y valores: ideología izquierda-derecha, intención de voto en dos formas (la etiqueta original de la encuesta y una columna normalizada a los frentes electorales vigentes en 2023), confianza en ocho instituciones, apoyo y satisfacción con la democracia, religión y práctica, y posición sobre temas sociales.
  • —Biografía densa: historia de vida, línea de vida con eventos fechados, estilo de habla regional, relaciones, momentos formativos, rutina, intereses, habilidades, metas y una presentación en primera persona.

Dos formatos: personas_final.jsonl (un registro por línea, con los campos anidados nativos) y personas_final.parquet (tabular; los campos anidados se serializan como JSON).

Nota sobre la nomenclatura de partidos

La fuente de opinión (Latinobarómetro 2023) etiqueta el voto con sellos partidarios que en varios casos corresponden a etapas previas a las elecciones de 2023. Para preservar la fidelidad a la fuente y a la vez ofrecer utilidad analítica, el dataset incluye dos columnas: voto_intencion (la etiqueta literal de la encuesta) y voto_intencion_2023 (normalizada a los frentes vigentes en las presidenciales de 2023: Unión por la Patria, La Libertad Avanza, Juntos por el Cambio, Frente de Izquierda - Unidad).

Casos de uso

  • —Simulación de opinión pública y de comportamiento electoral.
  • —Encuestas y focus groups sintéticos; pre-test de mensajes y segmentación de audiencias.
  • —Ciencias sociales computacionales y experimentos reproducibles sobre una población común.
  • —Agentes con personalidad, diálogo y role-play en español rioplatense.

Validación y calidad

  • —Las marginales demográficas del muestreo reproducen las de la población de referencia.
  • —Las distribuciones de opinión y voto agregadas se alinean con la encuesta de origen.
  • —Cada biografía se valida por coherencia interna y corrección ortográfica (acentuación y eñes del español), y por diversidad para evitar el aplanamiento de la muestra.

Limitaciones

  • —La base socioeconómica (EPH) cubre población urbana de aglomerados; la calibración al total nacional, incluyendo población rural, se incorpora en versiones posteriores.
  • —Son perfiles sintéticos: útiles para simulación exploratoria, prototipado y testeo de hipótesis; no reemplazan la recolección de datos primarios ni constituyen evidencia concluyente sobre individuos reales.

Licencia y atribución

Publicado bajo CC BY 4.0 (uso comercial y no comercial con atribución). Las fuentes oficiales (INDEC, Latinobarómetro) conservan sus propias condiciones de uso; este dataset deriva de ellas distribuciones y perfiles sintéticos, no redistribuye sus microdatos.