FractalGPT/RRNCBPublic
RRNCB: Russian RAG Normative – Corporate Benchmark (Sample) 1. Доступ к данным и структура В данном репозитории представлена общедоступная часть (sample) первого российского бенчмарка для оценки RAG-решений. а) Ссылка на архив исходных документов: Файлы б) Ссылка на текущий репозиторий HF: Hugging-Face репозиторий в) Состав репозитория: dataset_sample.csv — таблица с вопросами и ответами. Архив — набор из 65 PDF-файлов, являющихся источниками знаний.… See the full description on the dataset page: https://huggingface.co/datasets/FractalGPT/RRNCBPublic.
RRNCB: Russian RAG Normative – Corporate Benchmark (Sample)
1. Доступ к данным и структура
В данном репозитории представлена общедоступная часть (sample) первого российского бенчмарка для оценки RAG-решений.
- а) Ссылка на архив исходных документов: Файлы
- б) Ссылка на текущий репозиторий HF: Hugging-Face репозиторий
- в) Состав репозитория:
dataset_sample.csv— таблица с вопросами и ответами.- Архив — набор из 65 PDF-файлов, являющихся источниками знаний.
2. Описание датасета
Данный набор данных представляет собой публичную выборку для ознакомления со структурой бенчмарка RRNCB.
Общая статистика выборки
Набор представляет собой 20% от полного датасета (общий объем полного датасета составляет 1,000 вопросов).
- а) Число вопросов: 200 пар (вопрос-ответ).
- б) Число документов: набор нормативно-правовых документов (22 кодекса, 43 ГОСТа и СНИПа).
в) Когорты и тематики документов
Датасет охватывает сложную нормативную, правовую и техническую документацию. Документы разделены на смысловые когорты.
г) Структура данных (Поля датасета)
Файл разметки содержит 3 колонки:
Пример данных:
{
"question": "Какие операции выполняются при прокладке стальных труб?",
"answer": "### Операции, выполняемые при прокладке стальных труб... (текст из снип)",
"document": "Data1_10_10339_index.pdf"
}О бенчмарке RRNCB
RRNCB (Russian RAG Normative – Corporate Benchmark) — это первый российский открытый бенчмарк для комплексной оценки RAG-решений (Retrieval Augmented Generation) при работе с нормативной, правовой и технической документацией компаний.
Цель и миссия
На рынке существуют десятки RAG-решений, однако отсутствовал единый стандарт оценки их качества. RRNCB призван устранить этот пробел, оценивая RAG как целостный продукт, а не просто как языковую модель.
При создании бенчмарка инициаторы (компания Аватар Машина) ориентировались на мировые стандарты (RAGBench, MERA, SuperGLUE), адаптируя их под специфику русскоязычного документооборота.
Ключевые особенности
- Сложные данные: Датасет сфокусирован на "тяжелых" доменах: строительство, юриспруденция, машиностроение. Это позволяет проверить бизнес-применимость решений.
- Прозрачные метрики: Оценка производится с использованием автоматических метрик (ROUGE), LLM-судьи (LLM-as-a-judge), а также замеров скорости и склонности к галлюцинациям.
- Разнообразие задач:
- Navigational queries: навигационные вопросы (Представлены в публичной версии).
- Multi-hop: вопросы, требующие синтеза информации из разных частей документа (Не представлены в публичной версии).
- Работа с таблицами и списками (Представлены в публичной версии).
Для кого этот бенчмарк
- AI-инженеров: Для выбора оптимального стека RAG (векторные БД, reranker, LLM).
- Data Scientists: Для тестирования гипотез по улучшению retrieval и генерации.
- Бизнеса: Для объективного выбора вендора RAG-решений на основе независимого лидерборда.
- Создание бенчмарка инициировано ИИ компанией Аватар Машина.
