brics-edtech/nornikel-metallurgy-rag-index
Nornikel Metallurgy RAG Knowledge Base (для векторного индекса) Дедуплицированный корпус текстовых фрагментов (и связанных изображений) из технической базы знаний по металлургии/горному делу/обогащению — источник для построения векторного индекса (Annoy) в пайплайне RAG. Индекс НЕ включён в этот репозиторий — эмбеддинги и Annoy-индекс строятся во время выполнения ноутбука Google Colab (на GPU, это быстрее, чем на CPU), используя corpus.jsonl как исходные данные. Модель… See the full description on the dataset page: https://huggingface.co/datasets/brics-edtech/nornikel-metallurgy-rag-index.
Nornikel Metallurgy RAG Knowledge Base (для векторного индекса)
Дедуплицированный корпус текстовых фрагментов (и связанных изображений) из технической базы знаний по металлургии/горному делу/обогащению — источник для построения векторного индекса (Annoy) в пайплайне RAG.
Индекс НЕ включён в этот репозиторий — эмбеддинги и Annoy-индекс строятся во время выполнения ноутбука Google Colab (на GPU, это быстрее, чем на CPU), используя corpus.jsonl как исходные данные. Модель дообучается отдельно и позже подключается к этому индексу в пайплайне RAG.
Файлы
corpus.jsonl— 76 252 дедуплицированных фрагмента:{"id": int, "source_path": str, "chunk_id": str, "file_type": str, "text": str, "images": [str]}images/shard_00 … shard_04/— 24 480 изображений (схемы, таблицы, диаграммы из исходных документов; фото с людьми исключены детекцией лиц)
Как использовать (кратко, подробности в ноутбуке)
from huggingface_hub import snapshot_download
local_dir = snapshot_download(repo_id="brics-edtech/nornikel-metallurgy-rag-index",
repo_type="dataset")
# затем: посчитать эмбеддинги corpus.jsonl (например, intfloat/multilingual-e5-base)
# и построить индекс Annoy поверх них