CoolFace
Datasetpublic

commul/ud_genre

UD Genre Labels full-ud-v1.1.1-ud2.18 Derived sentence-level genre annotations for the universal-dependencies/universal_dependencies Universal Dependencies dataset. These labels are produced by the bootstrapping pipeline and are not authoritative gold annotations. Dataset Summary This dataset provides a sentence-level genre layer aligned to the universal-dependencies/universal_dependencies Parquet release. Each row contains one derived genre label for one UD… See the full description on the dataset page: https://huggingface.co/datasets/commul/ud_genre.

sourceHugging Faceapache-2.0updated 16d agoView on Hugging Face
0likes101downloads
Dataset Card

UD Genre Labels full-ud-v1.1.1-ud2.18

Derived sentence-level genre annotations for the universal-dependencies/universal_dependencies Universal Dependencies dataset. These labels are produced by the bootstrapping pipeline and are not authoritative gold annotations.

Dataset Description

  • —Homepage: https://github.com/bot-zen/ud-genre-bootstrap
  • —Repository: https://github.com/bot-zen/ud-genre-bootstrap
  • —Source dataset: hf://universal-dependencies/universal_dependencies
  • —Paper: https://universaldependencies.org/udw26/papers/41_Paper.pdf
  • —Point of Contact: appliedlinguisticsdevs@eurac.edu

Dataset Summary

This dataset provides a sentence-level genre layer aligned to the universal-dependencies/universal_dependencies Parquet release. Each row contains one derived genre label for one UD sentence and can be joined back to the UD source data by (treebank, split, sent_id).

The export is a derived annotation layer, not a replacement for the UD treebanks and not a hand-validated gold genre dataset.

Label Coverage And Provenance

  • —Total UD sentences in artifact: 2,221,815
  • —Labeled sentences: 2,221,815 (100.0%)
  • —Unlabeled sentences: 0
  • —Genres exported: 18
  • —Metadata-derived labels: 1,334,339 (60.1% of labeled sentences)
  • —Clustering-derived labels: 887,476 (39.9% of labeled sentences)
MethodMeaningSentencesShare of labeled
cluster-derivedAssigned by cluster-to-reference genre similarity.887,47639.9%
single-genre-treebankDirectly inherited from a single-genre UD treebank.736,88733.2%
virtual-splitDirectly inherited from sentence/document metadata in a mixed treebank.597,45226.9%

For cluster-derived rows, confidence is the top-1 cluster-label similarity score. Direct metadata-derived rows use confidence 1.0.

  • —Mean confidence: 0.9835
  • —Median confidence: 1.0000

Genre Distribution

GenreSentencesShare of labeled
news688,56831.0%
nonfiction273,67112.3%
fiction252,86011.4%
spoken200,1519.0%
wiki110,8565.0%
poetry110,0565.0%
academic94,5984.3%
grammar-examples89,4294.0%
bible85,7763.9%
blog79,6293.6%
legal63,8812.9%
social47,3392.1%
reviews40,7421.8%
web34,1281.5%
learner-essays22,5321.0%
government12,7280.6%
medical9,3720.4%
email5,4990.2%

Loading

python
from datasets import load_dataset

genres = load_dataset(
    "commul/ud_genre",
    revision="2.18",
    split="train",
)

The train split is the single exported split containing all sentence-level genre labels for this artifact.

For immutable provenance, load the artifact tag:

python
genres = load_dataset(
    "commul/ud_genre",
    revision="artifact/full-ud-v1.1.1/ud2.18",
    split="train",
)

Joining With Universal Dependencies

python
from datasets import load_dataset

genres = load_dataset(
    "commul/ud_genre",
    revision="2.18",
    split="train",
)

ud = load_dataset(
    "universal-dependencies/universal_dependencies",
    "en_ewt",
    revision="2.18",
    split="train",
)

genre_by_key = {
    (row["treebank"], row["split"], row["sent_id"]): row["genre"]
    for row in genres
    if row["treebank"] == "en_ewt" and row["split"] == "train"
}

first = ud[0]
genre = genre_by_key.get(("en_ewt", "train", first["sent_id"]))

Release Identity

  • —Train ID: full-ud-v1.1.1
  • —Artifact key: full-ud-v1.1.1-ud2.18
  • —Inventory status: default_hotfix
  • —HF branches: 2.18
  • —HF tag: artifact/full-ud-v1.1.1/ud2.18
  • —HF default branch: main
  • —HF repo: commul/ud_genre
  • —UD version: 2.18
  • —Scope: full
  • —Label schema: ud
  • —Artifact version: v1.1.1
  • —Source repo: https://github.com/bot-zen/ud-genre-bootstrap
  • —Source commit: 36188cb591a9d3122dd95b67258dc8e1fc7dcd4f
  • —Source branch: release/full-ud-v1
  • —Source tag: source/full-ud-v1.1.1
  • —Config SHA-256: ba9d3e8ec173f90659422a07e536ad74de9db2f848c3636b6d00321327a56eb8
  • —Canonical labels: academic, bible, blog, email, fiction, government, grammar-examples, learner-essays, legal, medical, news, nonfiction, poetry, reviews, social, spoken, web, wiki

Release Configuration

  • —Config: 2.18-community-release
  • —Run ID: full-ud-v1.1.1-ud2.18
  • —UD source: hf://universal-dependencies/universal_dependencies
  • —UD source revision: 2.18
  • —Embeddings: intfloat/multilingual-e5-large / mean
  • —Clustering: gmm
  • —Reference weighting: sentence_count

Output Columns

  • —treebank, split, sent_id: primary join key back to UD
  • —genre: derived sentence label
  • —confidence: top-1 similarity score for cluster-derived rows; 1.0 for direct metadata-derived rows
  • —method: single-genre-treebank, virtual-split, or cluster-derived
  • —ud_version, model, pooling, clustering_method, config_name, run_id: compact row-level provenance

Evaluation Framing

  • —paper_parity is used only for comparison with the original GMM+L paper protocol.
  • —End-user quality is tracked with sentence-level generalization metrics, which are stricter and more directly relevant for downstream annotation use.
  • —Known limitation: some paper-era treebank genre inventories are not fully recoverable from current sentence-level metadata subsets.

Evaluation Summary

  • —Baseline: UD v2.18 all_available generalization baseline
  • —Scope: Locked evaluation baseline measured on UD 2.18.
  • —Protocol: generalization
  • —Treebank set: all_available
  • —Config: configs/releases/full-ud-v1.1.0.yaml
  • —Source log: output/logs/2.18-all_available-generalization-e5_large-k10-anchor_combined-baseline.log
MetricValue
Evaluated Sentences629900
Multi-Genre Treebank Splits79
Instance-Labeled Treebanks44
Instance-Labeled Treebank Splits79
Number of Folds10
Overall Acc / Micro-F10.3324
Macro-F10.2699
Mean Fold Micro-F10.3373
Std Fold Micro-F10.1300
Mean Fold Macro-F10.2837
Std Fold Macro-F10.1246
Purity (PUR)0.5190
Agreement (AGR)0.5062
Overlap Error (Delta BC)0.0760
  • —Missing anchor genres in this baseline: email

Release Summary

  • —Total sentences: 2,221,815
  • —Labeled sentences: 2,221,815
  • —Genres exported: 18
  • —Methods exported: cluster-derived, single-genre-treebank, virtual-split

Source Mapping Files

  • —configs/genre_mappings.json (sha256: a52bbd9d5be0ec267da69624930e5087f28359e0dea88d9f039534b0167cbe0e)
  • —configs/metadata_patterns.json (sha256: 2e0898fe402e72e6050a5efffd8f963696e6c693763325313c7b290540696d5c)
  • —configs/pud-patterns.json (sha256: 4b5ca652110604a9b567deea630115eda24a2b734359b4f48e71c0fee7b2034d)

Citation

Please cite the UD Workshop paper associated with this dataset: https://universaldependencies.org/udw26/papers/41_Paper.pdf

Contact

Point of Contact: appliedlinguisticsdevs@eurac.edu