CoolFace
Datasetpublic

SPAISS6F1/spai-ss6-corpus-thai-idioms-instruction

SPAI SS6 Thai Idioms Instruction Index Index repo for the Thai idioms instruction dataset mirrored in the canonical repo. This is a lightweight index dataset repo. It does not duplicate the full corpus. The full Parquet data lives in the canonical repository config below. Canonical Data Canonical repo: SPAISS6F1/spai-ss6-llm-1b-thai-corpus Canonical config: thai_idioms_instruction Rows in canonical config: 1,152 Parquet size in canonical config: 0.00 GB Source… See the full description on the dataset page: https://huggingface.co/datasets/SPAISS6F1/spai-ss6-corpus-thai-idioms-instruction.

sourceHugging Faceotherupdated 4mo agoView on Hugging Face
0likes9downloads
Dataset Card

SPAI SS6 Thai Idioms Instruction Index

Index repo for the Thai idioms instruction dataset mirrored in the canonical repo.

This is a lightweight index dataset repo. It does not duplicate the full corpus. The full Parquet data lives in the canonical repository config below.

Canonical Data

  • —Canonical repo: SPAISS6F1/spai-ss6-llm-1b-thai-corpus
  • —Canonical config: thai_idioms_instruction
  • —Rows in canonical config: 1,152
  • —Parquet size in canonical config: 0.00 GB
  • —Source license: cc-by-3.0
  • —License review status: usable_with_attribution_or_license_terms

Load The Full Data

python
from datasets import load_dataset

ds = load_dataset(
    "SPAISS6F1/spai-ss6-llm-1b-thai-corpus",
    name="thai_idioms_instruction",
    split="train",
    streaming=True,
)

Local Index File

data/index.parquet has one metadata row pointing to the canonical data.

Use Notes

  • —Check the canonical repo audit before training or release.
  • —This dataset card is not a legal opinion.
  • —Full model release/commercial use requires source-specific rights review.