AlsKozlov/legalbench-ru
LegalBench-RU Первый открытый многотрековый бенчмарк правового рассуждения для российского права. 846 задач, 4 трека: знание права (knowledge), рассуждение (reasoning), выбор инструмента к госреестрам (tool-use), устойчивость к устаревшим нормам (temporal). Собран многоагентной генерацией с заземлением в реальных источниках + адверсариальной верификацией; измеренный red-team error-rate — 3%. Что внутри трек кейсов что меряет источник knowledge 311… See the full description on the dataset page: https://huggingface.co/datasets/AlsKozlov/legalbench-ru.
LegalBench-RU
Первый открытый многотрековый бенчмарк правового рассуждения для российского права.
846 задач, 4 трека: знание права (knowledge), рассуждение (reasoning), выбор инструмента к госреестрам (tool-use), устойчивость к устаревшим нормам (temporal). Собран многоагентной генерацией с заземлением в реальных источниках + адверсариальной верификацией; измеренный red-team error-rate — 3%.
Что внутри
16 правовых доменов: гражданское, договорное, трудовое, налоговое, корпоративное, IP, банкротство/litigation, защита данных, потребительское, недвижимость, закупки, AML/комплаенс, AI-governance, административное и др.
Формат
Один JSON-объект на строку (legalbench_ru.jsonl). Поля:
task,domain,reasoning_type,answer_type,track,split;question,context?,choices?(для multiple_choice);answer— gold (строка / буква / список норм /{tool,args});accept?,gold_norm?(provenance),explanation?;norm_text?/distractor_text?/temporal_text?— для условий grounded / distractor / temporal;needs_expert_review.
Сплиты и анти-контаминация
split=public(674) — открытый.split=holdout(172, ~20%) — рекомендуется держать ответы приватно для чистых замеров; в пакете естьholdout_questions_only.jsonl(без gold) для сабмишена предсказаний.- В начало
legalbench_ru.jsonlвстроена canary-строка (_canary) — чтобы потом детектировать утечку датасета в обучающих корпусах. Не включайте этот датасет в обучение.
Условия прогона (главная фишка)
Один и тот же reasoning-кейс гоняется при разном поданном контексте: closed (память) / grounded (верная норма) / distractor (подставная неверная) / temporal (устаревшая редакция) / reject (нормы нет). Ценность — в дельтах: closed→grounded (упор в память ⇒ нужен RAG), grounded→distractor (ведётся ли на ложную норму), temporal (анкорится ли на старый закон).
Скоринг
Детерминированный (без LLM-судьи на скоринге → воспроизводимо): exact-match (binary/MC), normalized-match (extraction), norm-F1 (citation), AST-match (tool-call). Харнесс — в репозитории; oracle-прогон = 100%, stub = 0%.
python score.py --model oracle # проверка скорера
python score.py --model openai --model-name <модель> # своя модель (OpenAI-совместимый endpoint)
python score.py --model openai --model-name <модель> --mode grounded --track reasoningBaseline (closed, весь бенч, предварительно)
Узкое место у всех — знание права (21–62%), не рассуждение (76–91%).
Лицензия
Датасет — CC-BY-4.0. Код харнесса — Apache-2.0 (как репозиторий). Вопросы и gold-ответы оригинальные; нормы РФ — общественное достояние.
Цитирование
@misc{legalbench-ru-2026,
title = {LegalBench-RU: An Open Multi-Track Benchmark for Russian Legal Reasoning},
author = {ru-legal contributors},
year = {2026},
note = {v0.3, https://github.com/AlsKozlov/legalbench-ru}
}