CoolFace
Datasetpublic

brics-edtech/nornikel-metallurgy-rag-index

Nornikel Metallurgy RAG Knowledge Base (для векторного индекса) Дедуплицированный корпус текстовых фрагментов (и связанных изображений) из технической базы знаний по металлургии/горному делу/обогащению — источник для построения векторного индекса (Annoy) в пайплайне RAG. Индекс НЕ включён в этот репозиторий — эмбеддинги и Annoy-индекс строятся во время выполнения ноутбука Google Colab (на GPU, это быстрее, чем на CPU), используя corpus.jsonl как исходные данные. Модель… See the full description on the dataset page: https://huggingface.co/datasets/brics-edtech/nornikel-metallurgy-rag-index.

sourceHugging Faceotherupdated 3mo agoView on Hugging Face
0likes964downloads
Dataset Card

Nornikel Metallurgy RAG Knowledge Base (для векторного индекса)

Дедуплицированный корпус текстовых фрагментов (и связанных изображений) из технической базы знаний по металлургии/горному делу/обогащению — источник для построения векторного индекса (Annoy) в пайплайне RAG.

Индекс НЕ включён в этот репозиторий — эмбеддинги и Annoy-индекс строятся во время выполнения ноутбука Google Colab (на GPU, это быстрее, чем на CPU), используя corpus.jsonl как исходные данные. Модель дообучается отдельно и позже подключается к этому индексу в пайплайне RAG.

Файлы

  • —corpus.jsonl — 76 252 дедуплицированных фрагмента: {"id": int, "source_path": str, "chunk_id": str, "file_type": str, "text": str, "images": [str]}
  • —images/shard_00 … shard_04/ — 24 480 изображений (схемы, таблицы, диаграммы из исходных документов; фото с людьми исключены детекцией лиц)

Как использовать (кратко, подробности в ноутбуке)

python
from huggingface_hub import snapshot_download
local_dir = snapshot_download(repo_id="brics-edtech/nornikel-metallurgy-rag-index",
                               repo_type="dataset")
# затем: посчитать эмбеддинги corpus.jsonl (например, intfloat/multilingual-e5-base)
# и построить индекс Annoy поверх них
brics-edtech/nornikel-metallurgy-rag-index · CoolFace