PerturbReason/PerturbReason_dataset_code
012
1# Multi-tier reasoning evaluation with structured triplet output2#3# Modules:4# data_model – Shared dataclasses, IO, parsing, external KG loading5# metric_accuracy – Tier-1: 3-way answer accuracy (up/down/unchanged)6# metric_symbolic – Tier-2: Deterministic symbolic evaluation (M1-M5)7# metric_bleurt – Tier-3: BLEUrT textual similarity8# metric_llm – Tier-4: LLM Rescue for unsolved cases9# pipeline – Orchestrator that runs all tiers and aggregates10# runner – CLI entry-point11 12__version__ = "3.0.0"13 