Kukedlc/Personas-Argentinas-1k
Personas Argentinas — dataset sintético multipropósito Población sintética de 1000 personas argentinas, construida con rigor estadístico sobre fuentes oficiales. Cada persona integra demografía anclada en el censo y las encuestas oficiales, un perfil de personalidad, un posicionamiento de opinión y valores calibrado contra datos reales, y una biografía coherente. Pensada para investigación reproducible, simulación social y modelado de poblaciones. Primera versión; en expansión… See the full description on the dataset page: https://huggingface.co/datasets/Kukedlc/Personas-Argentinas-1k.
Personas Argentinas — dataset sintético multipropósito
Población sintética de 1000 personas argentinas, construida con rigor estadístico sobre fuentes oficiales. Cada persona integra demografía anclada en el censo y las encuestas oficiales, un perfil de personalidad, un posicionamiento de opinión y valores calibrado contra datos reales, y una biografía coherente. Pensada para investigación reproducible, simulación social y modelado de poblaciones. Primera versión; en expansión continua.
Por qué es distinta
La mayoría de los datasets de "personas" muestrean cada atributo por separado y producen perfiles inverosímiles (combinaciones que no existen en la población). Acá, en cambio:
- Representatividad real: cada persona se deriva de un caso real de microdatos oficiales mediante muestreo proporcional al ponderador poblacional, preservando las distribuciones conjuntas entre edad, educación, ocupación, ingreso, región y hogar.
- Opinión calibrada contra datos reales: el bloque de valores y posicionamiento se ancla por imputación estadística estratificada en una encuesta de opinión pública oficial; las distribuciones agregadas reproducen las observadas en la población real (por ejemplo, la estructura de intención de voto y de confianza institucional).
- Coherencia y diversidad controladas: cada perfil se audita para evitar contradicciones internas y homogeneización, conservando la heterogeneidad real de la población (incluidas las combinaciones atípicas que existen en la sociedad).
Fuentes y metodología
Enlaces a las fuentes:
- EPH — bases de datos (INDEC): https://www.indec.gob.ar/indec/web/Institucional-Indec-basesdedatosephamp
- Latinobarómetro — banco de datos: https://www.latinobarometro.org/datos.jsp
- Clasificador Nacional de Ocupaciones (CNO 2001, INDEC): https://www.indec.gob.ar/ftp/cuadros/menusuperior/clasificadores/definicionesconceptualescno.pdf
- CAES Mercosur (INDEC): https://www.indec.gob.ar/ftp/cuadros/menusuperior/eph/caesmercosur1.0.pdf
- Censo Nacional 2022 (INDEC): https://censo.gob.ar/
- INDEC (organismo): https://www.indec.gob.ar/
Estructura — 71 columnas
- Demografía (anclada en censo y EPH): edad, sexo, estado civil, región, aglomerado, nivel educativo, condición de actividad, categoría y rama ocupacional, calificación, códigos CNO/CAES, ingresos (individual, familiar, per cápita) y decil.
- Personalidad: los cinco rasgos OCEAN (apertura, responsabilidad, extraversión, amabilidad, neuroticismo), en percentil y banda.
- Opinión y valores: ideología izquierda-derecha, intención de voto en dos formas (la etiqueta original de la encuesta y una columna normalizada a los frentes electorales vigentes en 2023), confianza en ocho instituciones, apoyo y satisfacción con la democracia, religión y práctica, y posición sobre temas sociales.
- Biografía densa: historia de vida, línea de vida con eventos fechados, estilo de habla regional, relaciones, momentos formativos, rutina, intereses, habilidades, metas y una presentación en primera persona.
Dos formatos: personas_final.jsonl (un registro por línea, con los campos anidados nativos) y personas_final.parquet (tabular; los campos anidados se serializan como JSON).
Nota sobre la nomenclatura de partidos
La fuente de opinión (Latinobarómetro 2023) etiqueta el voto con sellos partidarios que en varios casos corresponden a etapas previas a las elecciones de 2023. Para preservar la fidelidad a la fuente y a la vez ofrecer utilidad analítica, el dataset incluye dos columnas: voto_intencion (la etiqueta literal de la encuesta) y voto_intencion_2023 (normalizada a los frentes vigentes en las presidenciales de 2023: Unión por la Patria, La Libertad Avanza, Juntos por el Cambio, Frente de Izquierda - Unidad).
Casos de uso
- Simulación de opinión pública y de comportamiento electoral.
- Encuestas y focus groups sintéticos; pre-test de mensajes y segmentación de audiencias.
- Ciencias sociales computacionales y experimentos reproducibles sobre una población común.
- Agentes con personalidad, diálogo y role-play en español rioplatense.
Validación y calidad
- Las marginales demográficas del muestreo reproducen las de la población de referencia.
- Las distribuciones de opinión y voto agregadas se alinean con la encuesta de origen.
- Cada biografía se valida por coherencia interna y corrección ortográfica (acentuación y eñes del español), y por diversidad para evitar el aplanamiento de la muestra.
Limitaciones
- La base socioeconómica (EPH) cubre población urbana de aglomerados; la calibración al total nacional, incluyendo población rural, se incorpora en versiones posteriores.
- Son perfiles sintéticos: útiles para simulación exploratoria, prototipado y testeo de hipótesis; no reemplazan la recolección de datos primarios ni constituyen evidencia concluyente sobre individuos reales.
Licencia y atribución
Publicado bajo CC BY 4.0 (uso comercial y no comercial con atribución). Las fuentes oficiales (INDEC, Latinobarómetro) conservan sus propias condiciones de uso; este dataset deriva de ellas distribuciones y perfiles sintéticos, no redistribuye sus microdatos.
