Zek-Takai/glm53-flash-harvest
GLM-5.3-Flash On-Policy Harvest 86,006 responses / 246,034,910 generated tokens written by zai-org/GLM-5.3-Flash from its reference FP8 weights, across four harvest rounds, 15 registers and both serving modes (22,016 rows carry the model's inline <think>…</think> chain). It is on-policy text: the corpus records what the target model actually generates, which is what a speculative-decoding drafter (EAGLE-3 / DFlash / DSpark family) has to learn to predict. Everything here is MIT.… See the full description on the dataset page: https://huggingface.co/datasets/Zek-Takai/glm53-flash-harvest.
card: rewritten as one document (at-a-glance, config map first, four rounds, schema, truncation table, generation setup)
round 3+4 v2 (2/2): glm53_harvest_r3.parquet + provenance_r34.parquet — missed by the first v2 commit's glob
round 3+4 v2: prefer uncapped regenerations over pre-relaunch capped twins (523 rows); provenance_r34 joinable per (id, temp) with tokens/finish/legacy_cap/truncated; card rebuilt (four rounds, all configs declared, real numbers, no-cap wording)
round 3+4: card update
round 3+4: prompts/r3_prompts.jsonl
round 3+4: prompts/prompts34.jsonl
round 3+4: prompts/patch_chat_template.py
round 3+4: prompts/harvest34.py
round 3+4: prompts/build_prompts34.py
round 3+4: data/thinking/thinking_on.parquet
round 3+4: data/thinking/thinking_off.parquet
round 3+4: data/registers/structured.parquet
round 3+4: data/registers/reasoning.parquet
round 3+4: data/registers/prose.parquet
round 3+4: data/registers/music.parquet
round 3+4: data/registers/multiturn.parquet
round 3+4: data/registers/long_context.parquet
round 3+4: data/registers/deep_reasoning.parquet
round 3+4: data/registers/code_edit.parquet
round 3+4: data/registers/code.parquet
round 3+4: data/registers/chat.parquet
round 3+4: data/registers/agentic_tooling.parquet
round 3+4: data/registers/agentic_coding.parquet
round 3+4: data/registers/agentic.parquet
round 3+4: data/provenance_r34.parquet
round 3+4: data/glm53_harvest_r4.parquet
round 3+4: data/glm53_harvest_r3.parquet
Link companion internals profile
Config map: per-config rows/tokens/contents with pull syntax
Per-register and thinking-mode configs (re-shards of the same rows)
Unify schema across both parquets; viewer configs; card: facts only
Card: quick start, tags, use cases, citation; publish prompt banks + deterministic builders
Card: round 2 final stats — combined 65,469 rows / 117.4M tokens
Round 2 corpus: 18,858 rows / 56.43M tokens (thinking, reasoning, agentic, zh, multiturn)
Card: round 1 breakdown + round 2 (in progress) design
Final stats: 46,611 rows / 60.95M tokens, harvest complete
Full harvest corpus: 46,611 rows / 60.95M tokens, 0 errors (2026-08-30)
dataset card (upload in progress)
initial commit
