CoolFace
Datasetpublic

wcpsoft/arithmetic-llm

arithmetic-llm MNIST 图像 → 字节级算术 训练数据集。 用于教学向的字节级算术大模型 (byte-omni-model-zh):给定一个显式数字 (digit 0-9) 与一张 MNIST 图像 (隐式数字),预测两者之和。 输入: digit_byte + MNIST_image_bytes 输出: result_bytes 示例: digit = "1" + image(数字 "2") → 预测 "3" Schema 列 类型 说明 id int 序号 image_base64 str MNIST 图像 PNG (base64) pixels float[] 28×28 展平像素 (0-1), 784 维 label int 图像数字标签 (0-9) split str train (59134) / test (9943) image_hash str SHA-256 逐字节指纹 phash str 16×16 感知哈希位串 (与 label… See the full description on the dataset page: https://huggingface.co/datasets/wcpsoft/arithmetic-llm.

sourceHugging Facecc-by-sa-4.0updated 1mo agoView on Hugging Face
0likes48downloads
Dataset Card

arithmetic-llm

MNIST 图像 → 字节级算术 训练数据集。

用于教学向的字节级算术大模型 (byte-omni-model-zh):给定一个显式数字 (digit 0-9) 与一张 MNIST 图像 (隐式数字),预测两者之和。

text
输入: digit_byte + MNIST_image_bytes
输出: result_bytes

示例:
  digit = "1" + image(数字 "2") → 预测 "3"

Schema

类型说明
idint序号
image_base64strMNIST 图像 PNG (base64)
pixelsfloat[]28×28 展平像素 (0-1), 784 维
labelint图像数字标签 (0-9)
splitstrtrain (59134) / test (9943)
image_hashstrSHA-256 逐字节指纹
phashstr16×16 感知哈希位串 (与 label 综合去重)

划分

split行数
train59134
test9943
合计69077

清洗说明 (去重)

  • 原始 MNIST 无逐字节重复 (SHA-256 重复 = 0)。
  • 但存在大量视觉近重复 (同图数字, 仅差少量像素)。
  • 采用 16×16 感知哈希 + label 综合去重: 键 = (phash, label), 保留首现。
  • 同图同数字 → 视为冗余删除; 同图异数字 → 作为难样本保留。
  • 去重结果: train 60000 → 59134 (删 866), test 10000 → 9943 (删 57)。

来源与许可

  • 原始数据: Yann LeCun 的 MNIST 手写数字数据集 (cc-by-sa-4.0)。
  • 本数据集为加工版本:补充 PNG base64、784 维像素数组、SHA-256 指纹与 16×16 感知哈希,按 train/test 划分并去重。
  • 用法示例见 byte-omni-model-zh