TajikNLPWorld/tajik-farsi-transliteration-benchmark
🇹🇯🇮🇷 Tajik-Farsi Transliteration Benchmark Официальный бенчмарк машинной транслитерации между таджикским (кириллица) и фарси (персо-арабская графика).Результаты получены на 40k параллельных предложениях с оценкой по 3 случайным сидам, bootstrap 95% CI и парными статистическими тестами. 📊 Ключевые результаты (Top-5) Модель Направление chrF++ BLEU CER byt5-small Tj→Fa 87.35 ± 0.10 73.58 0.054 byt5-small Fa→Tj 80.07 ± 0.23 56.61 0.090… See the full description on the dataset page: https://huggingface.co/datasets/TajikNLPWorld/tajik-farsi-transliteration-benchmark.
🇹🇯🇮🇷 Tajik-Farsi Transliteration Benchmark
Официальный бенчмарк машинной транслитерации между таджикским (кириллица) и фарси (персо-арабская графика). Результаты получены на 40k параллельных предложениях с оценкой по 3 случайным сидам, bootstrap 95% CI и парными статистическими тестами.
📊 Ключевые результаты (Top-5)
Примечание: ByT5-small демонстрирует наивысшую стабильность (σ < 0.25). G2P-Transformer превосходит mBART/mT5 в направлении Tj→Fa при ~10× меньшем числе параметров.
📁 Структура репозитория
📦 tajik-farsi-transliteration-benchmark/
├── 📄 README.md ← Этот файл
├── 📊 results/
│ ├── aggregated_metrics.csv ← Сводная таблица метрик
│ ├── statistical_report.json ← p-значения, ранги, CI
│ └── inference_samples.json ← Примеры предсказаний
└── 📈 plots/
├── pareto_frontier.png ← Качество vs. время обучения
└── interactive_report.html ← HTML-отчёт с таблицами🛠 Как использовать результаты
import pandas as pd
from datasets import load_dataset
# Загрузить метрики
ds = load_dataset("TajikNLPWorld/tajik-farsi-transliteration-benchmark", split="train")
df = ds.to_pandas()
print(df.sort_values("chrF++_mean", ascending=False).head())📖 Citation
@misc{tajikfarsi_benchmark_2026,
author = {[Ваше Имя] и соавторы},
title = {Tajik-Farsi Transliteration Benchmark},
year = {2026},
publisher = {Hugging Face},
url = {https://huggingface.co/datasets/TajikNLPWorld/tajik-farsi-transliteration-benchmark}
}⚖️ License
MIT License. Код и данные открыты для исследовательского и коммерческого использования.
