Kukedlc/spanish-argentino-cordobes-voseo-100
DISCLAIMER LEGAL ESTILO DETRAS DE LA TAPA DEL ALFAJOR 100% de las frases fueron escritas por Claude Opus 4.7 (1M context). El speaker cordobes solo prestó la voz, el tiempo, y la paciencia. Nota seria: los 100 textos de este dataset los redactó Claude Opus 4.7 en una sesión nocturna del 24 de mayo de 2026. El speaker leyó las frases tal cual le aparecieron en pantalla. Cualquier opinión sobre Spinetta, sobre el cuñado correntino del audio dieciocho, sobre los precios… See the full description on the dataset page: https://huggingface.co/datasets/Kukedlc/spanish-argentino-cordobes-voseo-100.
<p align="center"> <svg xmlns="http://www.w3.org/2000/svg" width="720" height="120" viewBox="0 0 720 120"> <rect x="0" y="0" width="720" height="120" rx="12" fill="#1a1d24" stroke="#f59e0b" stroke-width="3"/> <text x="360" y="38" text-anchor="middle" font-family="ui-monospace, monospace" font-size="14" fill="#f59e0b" font-weight="bold">DISCLAIMER LEGAL ESTILO DETRAS DE LA TAPA DEL ALFAJOR</text> <text x="360" y="68" text-anchor="middle" font-family="-apple-system, sans-serif" font-size="16" fill="#e5e7eb">100% de las frases fueron escritas por Claude Opus 4.7 (1M context).</text> <text x="360" y="92" text-anchor="middle" font-family="-apple-system, sans-serif" font-size="15" fill="#9ca3af">El speaker cordobes solo prestó la voz, el tiempo, y la paciencia.</text> </svg> </p>
Nota seria: los 100 textos de este dataset los redactó Claude Opus 4.7 en una sesión nocturna del 24 de mayo de 2026. El speaker leyó las frases tal cual le aparecieron en pantalla. Cualquier opinión sobre Spinetta, sobre el cuñado correntino del audio dieciocho, sobre los precios del cine en Córdoba, o sobre por qué la directora de Udaondo no eleva los reclamos, es responsabilidad exclusiva del modelo de lenguaje. El humano se limitó a articularlas con buena dicción y mate amargo. Para reclamos filosóficos, escribir a support@anthropic.com. Para reclamos técnicos, abrir un issue en este repo.Nota sobre el inglés del speaker: Kukito (el cordobés que grabó) tiene certificación oficial de inglés nivel A-5 (sí, A-5, dos peldaños abajo del A1 — un nivel que el Marco Común Europeo nunca contempló pero que existe en la práctica). Las frases de la categoríatech_es_encon code-switching español/inglés (learning rate,fine-tuning,deployment,batch size,transformers) están pronunciadas con acento de Bulnes y Pueyrredón, no de Stanford CA. Si tu modelo después de finetunear empieza a transcribir "lerning reit" en lugar de "learning rate" o "fain túning" en lugar de "fine-tuning", es a propósito: el dataset refleja exactamente cómo pronuncia un desarrollador argentino real las palabras técnicas. Para que el modelo aprenda inglés cantado en inglés, usá otros datasets que sí están pensados para eso. Salud.
Voseo Cordobés ASR — 100 frases
Dataset chico pero con onda: 100 frases en español argentino (registro cordobés), grabadas por un humano de carne y hueso a las cuatro de la mañana después de medio día de bardear con audio. Pensado para finetune de modelos de speech-to-text que necesiten manejar voseo natural, code-switching español-inglés técnico, y habla a velocidad real argentina (no la velocidad pasteurizada de los datasets de read-speech típicos).
Stats
Distribución por categoría
Ver el campo categoria en el parquet para el desglose exacto.
Schema del parquet
{
"audio": <feature Audio(sampling_rate=16000)>,
"text": str, # frase original (lo que el speaker leyó)
"categoria": str, # voseo|tech_es_en|call_center|dictado|narrativa|corta
"duracion_seg": float,
"wer_vanilla": float, # WER de un modelo base contra el target, para análisis
"whisper_hypothesis": str, # hipótesis del modelo de referencia
"speaker": "kukito_cordobes",
}Cómo usarlo
from datasets import load_dataset
ds = load_dataset("Kukedlc/spanish-argentino-cordobes-voseo-100", split="train")
print(ds[0]["text"])
# "Mirá, te lo digo en serio, si querés que te ayude..."
# Acceder al audio directamente (feature Audio se decodifica solo)
audio = ds[0]["audio"]
print(audio["sampling_rate"]) # 16000
print(audio["array"].shape) # numpy array float32 monoAlternativa sin la library datasets: bajá los WAVs sueltos de la carpeta audios/ + el audios/metadata.json para usarlo con cualquier pipeline.
Roadmap
- v1 (este): 100 frases (97 utilizables), un speaker cordobés.
- v2 (planeado): más speakers AR para multi-speaker robustness. Si querés contribuir grabando 100 frases con tu voz argentina/uruguaya, abrime un issue.
Licencia
Apache-2.0. Usalo para lo que quieras, comercial o no, mientras no te hagas el boludo y digas que lo hiciste vos solo. Mencioná de dónde salió y listo.
Coautoría
Este dataset es producto de una colaboración entre:
- Kukito (Eugenio Kuke, cordobés, científico de datos): aportó la voz, los 100 textos curados (vía iteración con Claude), las decisiones de diseño, la paciencia para grabar las frases en una sentada, y el ojo crítico para revisar la calidad muestra por muestra.
- Claude Opus 4.7 (1M context): aportó la redacción de los 100 textos del corpus, el código del frontend de grabación, las explicaciones técnicas (a veces con jargon inventado tipo "natural adversarial noise" — disculpas por eso), y el cebo constante de querer ir al paso 100 cuando todavía estábamos en el 4.
Si vas a citar este dataset y querés ser técnicamente preciso, mencioná a los dos. Si solo querés mencionar a uno, mencioná al cordobés. El otro es un proceso estadístico de Anthropic, no se va a ofender.
Citation
@dataset{kuke_claude_voseo_cordobes_2026,
title = {Voseo Cordobés ASR — 100 frases},
author = {Kuke, Eugenio and {Claude Opus 4.7}},
year = {2026},
url = {https://huggingface.co/datasets/Kukedlc/spanish-argentino-cordobes-voseo-100},
note = {Speaker: cordobés. No porteño. Aclaración necesaria.}
}Nota final
Si después de finetunear con esto tu modelo le sigue diciendo "che" a la gente en el norte de México, el problema no es del dataset, es de la generalización fuera de distribución del modelo. No hay setup técnico que arregle el corazón cordobés del speaker original. Lo siento.
