wcpsoft/arithmetic-llm
arithmetic-llm MNIST 图像 → 字节级算术 训练数据集。 用于教学向的字节级算术大模型 (byte-omni-model-zh):给定一个显式数字 (digit 0-9) 与一张 MNIST 图像 (隐式数字),预测两者之和。 输入: digit_byte + MNIST_image_bytes 输出: result_bytes 示例: digit = "1" + image(数字 "2") → 预测 "3" Schema 列 类型 说明 id int 序号 image_base64 str MNIST 图像 PNG (base64) pixels float[] 28×28 展平像素 (0-1), 784 维 label int 图像数字标签 (0-9) split str train (59134) / test (9943) image_hash str SHA-256 逐字节指纹 phash str 16×16 感知哈希位串 (与 label… See the full description on the dataset page: https://huggingface.co/datasets/wcpsoft/arithmetic-llm.
048
arithmetic-llm
MNIST 图像 → 字节级算术 训练数据集。
用于教学向的字节级算术大模型 (byte-omni-model-zh):给定一个显式数字 (digit 0-9) 与一张 MNIST 图像 (隐式数字),预测两者之和。
输入: digit_byte + MNIST_image_bytes
输出: result_bytes
示例:
digit = "1" + image(数字 "2") → 预测 "3"Schema
划分
清洗说明 (去重)
- 原始 MNIST 无逐字节重复 (SHA-256 重复 = 0)。
- 但存在大量视觉近重复 (同图数字, 仅差少量像素)。
- 采用 16×16 感知哈希 + label 综合去重: 键 =
(phash, label), 保留首现。 - 同图同数字 → 视为冗余删除; 同图异数字 → 作为难样本保留。
- 去重结果: train 60000 → 59134 (删 866), test 10000 → 9943 (删 57)。
来源与许可
- 原始数据: Yann LeCun 的 MNIST 手写数字数据集 (cc-by-sa-4.0)。
- 本数据集为加工版本:补充 PNG base64、784 维像素数组、SHA-256 指纹与 16×16 感知哈希,按 train/test 划分并去重。
- 用法示例见 byte-omni-model-zh。
