CoolFace
Apppublic

PKU-JX-LAB/Molecular-Dynamics-Benchmark

sourceHugging Faceapache-2.0updated 6mo agoView on Hugging Face
1likes
App README

MD-EvalBench: Molecular Dynamics LLM Benchmark

The first comprehensive benchmark for evaluating Large Language Models in the Molecular Dynamics domain, from the paper "MDAgent2: Large Language Model for Code Generation and Knowledge Q&A in Molecular Dynamics".

Benchmark Components

  • MD-KnowledgeEval (336 questions): Theoretical knowledge in molecular dynamics
  • LAMMPS-SyntaxEval (368 questions): LAMMPS command and syntax understanding
  • LAMMPS-CodeGenEval (566 tasks): Automatic LAMMPS code generation

Leaderboard Tabs

  1. 1.QA Benchmark: Knowledge and syntax QA performance comparison
  2. 2.Code Generation: LAMMPS code generation performance across methods (Direct Prompting, MDAgent, MDAgent2-RUNTIME)

Configuration

  • Main leaderboard data is in app.py
  • Task definitions in src/about.py
  • Column definitions in src/display/utils.py