PKU-JX-LAB/Molecular-Dynamics-Benchmark
1
MD-EvalBench: Molecular Dynamics LLM Benchmark
The first comprehensive benchmark for evaluating Large Language Models in the Molecular Dynamics domain, from the paper "MDAgent2: Large Language Model for Code Generation and Knowledge Q&A in Molecular Dynamics".
Benchmark Components
- MD-KnowledgeEval (336 questions): Theoretical knowledge in molecular dynamics
- LAMMPS-SyntaxEval (368 questions): LAMMPS command and syntax understanding
- LAMMPS-CodeGenEval (566 tasks): Automatic LAMMPS code generation
Leaderboard Tabs
- QA Benchmark: Knowledge and syntax QA performance comparison
- Code Generation: LAMMPS code generation performance across methods (Direct Prompting, MDAgent, MDAgent2-RUNTIME)
Configuration
- Main leaderboard data is in
app.py - Task definitions in
src/about.py - Column definitions in
src/display/utils.py
