CodeIsAbstract/sanskrit-samas-v1
Sanskrit Samas (Compound) Dataset — V1 Grammar-grounded training data for Sanskrit samas (compounds) covering all 7 samasa types, with laukik vigraha (natural paraphrase) and alaukik vigraha (Pāṇinian sUP analysis) on every row. Companion to sanskrit-sandhi-boundaries-v2 (sentence-level external sandhi). Merge both for a full sandhi+samas boundary training set. Dataset Rows: 258,408 Checksum: e7c0a804c109 Builder: benchmarks/build_samas_data.py (deterministic… See the full description on the dataset page: https://huggingface.co/datasets/CodeIsAbstract/sanskrit-samas-v1.
Sanskrit Samas (Compound) Dataset — V1
Grammar-grounded training data for Sanskrit samas (compounds) covering all 7 samasa types, with laukik vigraha (natural paraphrase) and alaukik vigraha (Pāṇinian sUP analysis) on every row.
Companion to `sanskrit-sandhi-boundaries-v2` (sentence-level external sandhi). Merge both for a full sandhi+samas boundary training set.
Dataset
- Rows: 258,408
- Checksum:
e7c0a804c109 - Builder:
benchmarks/build_samas_data.py(deterministic, seed 42) - Format: JSONL (one compound per line)
Schema (per row)
Samasa types covered
Construction (Pāṇinian)
- First member(s) lose their case endings → bare stem (prātipadika).
- Last member keeps its own case ending.
- Internal sandhi applies at the seam (same rules as external sandhi).
- The compound takes ONE case ending on the last member.
Alaukik vigraha is generated from vidyut prakriya derivation history — the exact sUP tags (su~, am, wA, Ne, Nasi~, Nas, Ni × Eka/Dvi/Bahu) are recovered from the Pāṇinian derivation steps.
Integrity
- 0 rows fail
"".join(pieces) == surface. - Every seam is rejoin-verified by the sandhi engine.
- Builder deterministic (seed 42): reproducible byte-for-byte.
