CoolFace
Datasetpublic

izlley2/llm0to1-pt-tokenized-en-edu-2025

LLM0to1 사전학습 토큰화본 — 영어 교육(2025 덤프) 10B 규모 한/영 이중언어 LLM LLM0to1-10b 를 바닥부터 학습할 때 실제로 투입된 영어 교육(2025 덤프) 코퍼스의 토큰화본. 총 28종 / 138.4B 토큰. 왜 원문 텍스트가 아니라 토큰화본인가 이 코퍼스들은 공개 데이터셋을 스트리밍으로 받아 곧바로 토큰화했고 중간 텍스트를 보관하지 않았다. 따라서 이 .ds 파일이 학습에 들어간 데이터의 유일한 사본이다. 단점만 있는 건 아니다. 토큰화본은 학습 입력 그 자체이므로, 재토큰화 과정에서 생길 수 있는 차이 없이 학습을 그대로 재현할 수 있다. 원본 출처 HuggingFaceFW/fineweb-edu 2025 덤프 영어 벤치마크 하락에 대응해 뒤늦게 편입한 '다양성 영어' 보강분이다. g00~`g15` 는 원본 shard 를 균등 분할한 것으로, 서로 다른 문서 집합이다.… See the full description on the dataset page: https://huggingface.co/datasets/izlley2/llm0to1-pt-tokenized-en-edu-2025.

sourceHugging Faceotherupdated 1mo agoView on Hugging Face
0likes401downloads
Dataset Card

LLM0to1 사전학습 토큰화본 — 영어 교육(2025 덤프)

10B 규모 한/영 이중언어 LLM LLM0to1-10b 를 바닥부터 학습할 때 실제로 투입된 영어 교육(2025 덤프) 코퍼스의 토큰화본. 총 28종 / 138.4B 토큰.

왜 원문 텍스트가 아니라 토큰화본인가

이 코퍼스들은 공개 데이터셋을 스트리밍으로 받아 곧바로 토큰화했고 중간 텍스트를 보관하지 않았다. 따라서 이 .ds 파일이 학습에 들어간 데이터의 유일한 사본이다.

단점만 있는 건 아니다. 토큰화본은 학습 입력 그 자체이므로, 재토큰화 과정에서 생길 수 있는 차이 없이 학습을 그대로 재현할 수 있다.

원본 출처

HuggingFaceFW/fineweb-edu 2025 덤프

영어 벤치마크 하락에 대응해 뒤늦게 편입한 '다양성 영어' 보강분이다. g00~g15 는 원본 shard 를 균등 분할한 것으로, 서로 다른 문서 집합이다.

수록 목록

코퍼스토큰
en_edu_2025_g005.61B
en_edu_2025_g085.61B
en_edu_2025_g095.61B
en_edu_2025_g015.61B
en_edu_2025_g105.60B
en_edu_2025_g115.59B
en_edu_2025_g135.58B
en_edu_2025_g125.58B
en_edu_2025_g075.44B
en_edu_2025_g065.43B
en_edu_2025_g055.36B
en_edu_2025_g045.35B
en_edu_2025_g035.34B
en_edu_2025_g025.33B
en_edu_2025_g155.25B
en_edu_2025_g145.24B
en_edu_2025b_g014.55B
en_edu_2025b_g004.55B
en_edu_2025b_g034.51B
en_edu_2025b_g024.51B
en_edu_2025b_g054.46B
en_edu_2025b_g044.46B
en_edu_2025b_g073.99B
en_edu_2025b_g063.99B
en_edu_2025b_g113.98B
en_edu_2025b_g093.97B
en_edu_2025b_g103.97B
en_edu_2025b_g083.97B

파일 형식

각 코퍼스는 <코퍼스명>.tar.zst 하나로 묶여 있다. 압축을 풀면:

<코퍼스명>/
  00000_unshuffled.ds            토큰 ID 연속열 (uint32, little-endian)
  00000_unshuffled.ds.index      문서 경계 오프셋
  00000_unshuffled.ds.metadata   원본 파일·행 매핑
  00001_unshuffled.ds ...

datatrove/nanotron 토큰화 산출물이다. zstd 로 약 14% 까지 줄어드는데, vocab 이 160k 라 uint32 의 상위 2바이트가 대부분 0 이기 때문이다.

사용법

1) 내려받아 압축 풀기

bash
huggingface-cli download izlley2/llm0to1-pt-tokenized-en-edu-2025 --repo-type dataset --local-dir ./tok
cd tok && for f in *.tar.zst; do zstd -d "$f" -c | tar -x; done

2) 텍스트로 되돌려 내용 확인

python
import numpy as np
from transformers import AutoTokenizer

tok = AutoTokenizer.from_pretrained("izlley2/llm0to1-tokenizer")   # vocab 160k, byte-level BPE
ids = np.fromfile("<코퍼스명>/00000_unshuffled.ds", dtype=np.uint32)
print(f"{len(ids):,} 토큰")
print(tok.decode(ids[:2000]))

3) 학습에 바로 투입 (nanotron)

압축 푼 디렉토리를 config 의 데이터 폴더로 지정한다:

yaml
data_stages:
  - name: my_stage
    start_training_step: 1
    data:
      dataset:
        dataset_folder:
          /path/to/tok/<코퍼스명>: 1.0      # 값은 믹스 가중치

주의

  • —토크나이저가 반드시 이것이어야 한다 — izlley2/llm0to1-tokenizer. vocab 크기가 다른 토크나이저로 디코딩하면 완전히 다른 텍스트가 나온다.
  • —.ds 는 문서 구분자 없이 이어붙인 토큰열이다. 문서 단위로 나누려면 .ds.index 를 함께 읽어야 한다.
  • —원본 데이터셋들의 라이선스가 각각 적용된다. 위 "원본 출처" 를 확인할 것.

관련

  • —`izlley2/llm0to1-repro-manifest` — 코퍼스 116종 전체의 출처·전처리 스크립트·토큰수·믹스 가중치
  • —izlley2/llm0to1-tokenizer — 토크나이저
  • —izlley2/LLM0to1-10b-step20000, -step83000 — 사전학습 체크포인트(HF 포맷)
  • —izlley2/LLM0to1-10b-step83000-nanotron — 같은 체크포인트(nanotron 포맷, 학습 재개용)

LLM0to1-10b 사전학습 재현용 아카이브.