CoolFace
Datasetpublic

Jesusrodriguezf90/chemistry-organometallic-qa

chemistry-organometallic-qa Dataset de 167 pares pregunta-respuesta en formato conversacional para fine-tuning de LLMs especializados en química organometálica. Construido sobre el paper PMC10967698 como parte del proyecto chem-rag-assistant. Repositorio: chem-rag-assistantNotebook de construcción: 05_dataset.ipynb Estructura del dataset Formato messages compatible con el chat template de Qwen2.5-Instruct y modelos instruction-tuned similares: { "messages": [… See the full description on the dataset page: https://huggingface.co/datasets/Jesusrodriguezf90/chemistry-organometallic-qa.

sourceHugging Facemitupdated 4mo agoView on Hugging Face
0likes29downloads
Dataset Card

chemistry-organometallic-qa

Dataset de 167 pares pregunta-respuesta en formato conversacional para fine-tuning de LLMs especializados en química organometálica. Construido sobre el paper PMC10967698 como parte del proyecto chem-rag-assistant.

Repositorio: chem-rag-assistant Notebook de construcción: 05_dataset.ipynb


Estructura del dataset

Formato messages compatible con el chat template de Qwen2.5-Instruct y modelos instruction-tuned similares:

python
{
    "messages": [
        {"role": "system",    "content": "You are a specialized scientific assistant in organometallic chemistry..."},
        {"role": "user",      "content": "What metals are used in the NHC complexes studied?"},
        {"role": "assistant", "content": "The NHC complexes studied contain palladium (Pd), platinum (Pt) and gold (Au)..."}
    ],
    "calidad": "alta"  # "alta" | "media"
}

Composición

CapaOrigenParesCalidad
Ground truthVerificados manualmente — preguntas de evaluación del pipeline RAG5Alta
Chunk QAGenerados automáticamente con Qwen3 (2 pares por chunk)154Media
ConceptosPares de instrucción sobre terminología clave, escritos manualmente8Alta
Total167
Nota: 154 pares de calidad media fueron generados automáticamente con Qwen3-8B vía HF Inference API sobre los 77 chunks del paper. La generación automática garantiza cobertura del contenido pero puede introducir imprecisiones. Los 13 pares de calidad alta fueron escritos o verificados manualmente.

Uso

python
from datasets import load_dataset

dataset = load_dataset("Jesusrodriguezf90/chemistry-organometallic-qa")
print(dataset["train"][0])
# {
#   "messages": [
#     {"role": "system",    "content": "You are a specialized scientific assistant..."},
#     {"role": "user",      "content": "What metals are used in the NHC complexes studied?"},
#     {"role": "assistant", "content": "The NHC complexes studied contain palladium (Pd)..."}
#   ],
#   "calidad": "alta"
# }

Fine-tuning con SFTTrainer

python
from trl import SFTTrainer, SFTConfig
from datasets import load_dataset

dataset = load_dataset("Jesusrodriguezf90/chemistry-organometallic-qa")

sft_config = SFTConfig(
    output_dir="./output",
    num_train_epochs=10,
    per_device_train_batch_size=2,
    gradient_accumulation_steps=4,
    learning_rate=5e-4,
    max_seq_length=512,
)

trainer = SFTTrainer(
    model=model,           # modelo cargado con PEFT/QLoRA
    args=sft_config,
    train_dataset=dataset["train"],
    processing_class=tokenizer,
)
trainer.train()

Documento origen

PMC10967698 — paper sobre complejos NHC tetradentados de Pd(II), Pt(II) y Au(III) con actividad citotóxica frente a líneas celulares resistentes a cisplatino.

El paper se procesó en el pipeline RAG del proyecto:

  1. 1.Extracción con Docling → 01_ingesta.ipynb
  2. 2.Chunking semántico con LangChain → 02_embeddings.ipynb
  3. 3.Generación de pares QA sobre los 77 chunks → 05_dataset.ipynb

Limitaciones

  • —Dataset construido sobre un único paper — el conocimiento está limitado al dominio específico de PMC10967698
  • —92% de los pares son de calidad media (generación automática) — pueden contener imprecisiones
  • —Fine-tuning con este dataset sobre Qwen2.5-1.5B-Instruct produjo overfitting severo (loss=0.0000) sin mejora significativa sobre el modelo base — ver modelo fine-tuned
  • —No recomendado para uso en producción sin validación adicional

Licencia

MIT