CoolFace
Datasetpublic

ClarusC64/clinical-reasoning-benchmark-v0.2

Clinical Reasoning Benchmark v0.2 This benchmark evaluates clinical reasoning quality under uncertainty. The focus is not diagnosis. The focus is whether a model can reason about stability, trajectory, recovery, boundary pressure, and intervention choice. Included Datasets Dataset Capability Domain clinical-compensation-vs-recovery-v0.2 State Reasoning clinical-silent-failure-v0.2 Trajectory Reasoning clinical-escalation-discipline-v0.2 Decision… See the full description on the dataset page: https://huggingface.co/datasets/ClarusC64/clinical-reasoning-benchmark-v0.2.

sourceHugging Facemitupdated 4mo agoView on Hugging Face
0likes20downloads
5 commits on main
e6bbef94mo ago

Update README.md

ClarusC64
e8930444mo ago

Create evaluation_notes.md

ClarusC64
4b843614mo ago

Create capability_framework.md

ClarusC64
b2b39b44mo ago

Create benchmark_manifest.csv

ClarusC64
c7f79a14mo ago

initial commit

ClarusC64