datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
auditkit-testrun-lmeval
auditkit-testrun-lmeval
Built using AuditKIT — evaluate any model on any dataset and any task.
Method
evaluate
Model
vllm:Qwen/Qwen2.5-0.5B-Instruct
Artifact
run
Published
2026-09-02 06:19 UTC
Usage
from datasets import load_dataset
ds = load_dataset("ram-lexsi/auditkit-testrun-lmeval")
auditkit-testrun-compare
auditkit-testrun-compare
Built using AuditKIT — evaluate any model on any dataset and any task.
Method
compare_models
Model
—
Artifact
compare
Published
2026-09-02 06:50 UTC
Usage
from datasets import load_dataset
ds = load_dataset("ram-lexsi/auditkit-testrun-compare")
auditkit-testrun-encoder-judge
auditkit-testrun-encoder-judge
Built using AuditKIT — evaluate any model on any dataset and any task.
Method
evaluate
Model
<auditkit.model.vllm_gen.VLLMModel object at 0x7a6694415010>
Artifact
run
Published
2026-09-01 14:16 UTC
Usage
from datasets import load_dataset
ds = load_dataset("ram-lexsi/auditkit-testrun-encoder-judge")
auditkit-testrun-llm-judge
auditkit-testrun-llm-judge
Built using AuditKIT — evaluate any model on any dataset and any task.
Method
evaluate
Model
<auditkit.model.CallableModel object at 0x7a775a2bf9d0>
Artifact
run
Published
2026-09-01 14:05 UTC
Usage
from datasets import load_dataset
ds = load_dataset("ram-lexsi/auditkit-testrun-llm-judge")
auditkit-testrun-metrics-embedding
auditkit-testrun-metrics-embedding
Built using AuditKIT — evaluate any model on any dataset and any task.
Method
evaluate
Model
<auditkit.model.vllm_gen.VLLMModel object at 0x7a62da714980>
Artifact
run
Published
2026-09-01 14:41 UTC
Usage
from datasets import load_dataset
ds = load_dataset("ram-lexsi/auditkit-testrun-metrics-embedding")
auditkit-testrun-redteam
auditkit-testrun-redteam
Built using AuditKIT — evaluate any model on any dataset and any task.
Method
redteam
Model
<auditkit.model.EchoModel object at 0x781f13372e40>
Artifact
redteam
Published
2026-09-01 12:49 UTC
Usage
from datasets import load_dataset
ds = load_dataset("ram-lexsi/auditkit-testrun-redteam")
auditkit-testrun-cli
auditkit-testrun-cli
Built using AuditKIT — evaluate any model on any dataset and any task.
Method
evaluate
Model
<auditkit.model.vllm_gen.VLLMModel object at 0x7c042bdabb60>
Artifact
run
Published
2026-09-02 05:37 UTC
Usage
from datasets import load_dataset
ds = load_dataset("ram-lexsi/auditkit-testrun-cli")
auditkit-testrun-metrics-generation
auditkit-testrun-metrics-generation
Built using AuditKIT — evaluate any model on any dataset and any task.
Method
evaluate
Model
<auditkit.model.vllm_gen.VLLMModel object at 0x7dae0fc08980>
Artifact
run
Published
2026-09-01 14:43 UTC
Usage
from datasets import load_dataset
ds = load_dataset("ram-lexsi/auditkit-testrun-metrics-generation")
auditkit-testrun-annotators
auditkit-testrun-annotators
Built using AuditKIT — evaluate any model on any dataset and any task.
Method
evaluate
Model
<auditkit.model.vllm_gen.VLLMModel object at 0x79713e2dacf0>
Artifact
run
Published
2026-09-02 04:38 UTC
Usage
from datasets import load_dataset
ds = load_dataset("ram-lexsi/auditkit-testrun-annotators")
auditkit-testrun-metrics-code
auditkit-testrun-metrics-code
Built using AuditKIT — evaluate any model on any dataset and any task.
Method
evaluate
Model
<auditkit.model.vllm_gen.VLLMModel object at 0x7978ab198980>
Artifact
run
Published
2026-09-02 04:27 UTC
Usage
from datasets import load_dataset
ds = load_dataset("ram-lexsi/auditkit-testrun-metrics-code")
auditkit-testrun-guard-judge
auditkit-testrun-guard-judge
Built using AuditKIT — evaluate any model on any dataset and any task.
Method
evaluate
Model
<auditkit.model.CallableModel object at 0x7b8d97f8b9d0>
Artifact
run
Published
2026-09-01 13:11 UTC
Usage
from datasets import load_dataset
ds = load_dataset("ram-lexsi/auditkit-testrun-guard-judge")
auditkit-testrun-metrics-rag
auditkit-testrun-metrics-rag
Built using AuditKIT — evaluate any model on any dataset and any task.
Method
evaluate
Model
<auditkit.model.vllm_gen.VLLMModel object at 0x7b64e929a120>
Artifact
run
Published
2026-09-01 14:34 UTC
Usage
from datasets import load_dataset
ds = load_dataset("ram-lexsi/auditkit-testrun-metrics-rag")
auditkit-testrun-custom-scorer
auditkit-testrun-custom-scorer
Built using AuditKIT — evaluate any model on any dataset and any task.
Method
evaluate
Model
<auditkit.model.vllm_gen.VLLMModel object at 0x7cbdecc29550>
Artifact
run
Published
2026-09-02 04:31 UTC
Usage
from datasets import load_dataset
ds = load_dataset("ram-lexsi/auditkit-testrun-custom-scorer")
auditkit-testrun-adapters
auditkit-testrun-adapters
Built using AuditKIT — evaluate any model on any dataset and any task.
Method
evaluate
Model
<auditkit.model.vllm_gen.VLLMModel object at 0x7ed30e368ec0>
Artifact
run
Published
2026-09-02 04:39 UTC
Usage
from datasets import load_dataset
ds = load_dataset("ram-lexsi/auditkit-testrun-adapters")
auditkit-testrun-keyword-security
auditkit-testrun-keyword-security
Built using AuditKIT — evaluate any model on any dataset and any task.
Method
evaluate
Model
<auditkit.model.CallableModel object at 0x790f01790ec0>
Artifact
run
Published
2026-09-01 13:11 UTC
Usage
from datasets import load_dataset
ds = load_dataset("ram-lexsi/auditkit-testrun-keyword-security")
auditkit-testrun-metrics-toxicity
auditkit-testrun-metrics-toxicity
Built using AuditKIT — evaluate any model on any dataset and any task.
Method
evaluate
Model
<auditkit.model.vllm_gen.VLLMModel object at 0x7cf12bcbcd70>
Artifact
run
Published
2026-09-01 14:32 UTC
Usage
from datasets import load_dataset
ds = load_dataset("ram-lexsi/auditkit-testrun-metrics-toxicity")
auditkit-testrun-metrics-pairwise
auditkit-testrun-metrics-pairwise
Built using AuditKIT — evaluate any model on any dataset and any task.
Method
evaluate
Model
<auditkit.model.vllm_gen.VLLMModel object at 0x7b06d84f8d70>
Artifact
run
Published
2026-09-01 14:26 UTC
Usage
from datasets import load_dataset
ds = load_dataset("ram-lexsi/auditkit-testrun-metrics-pairwise")
auditkit-testrun-evaluate
auditkit-testrun-evaluate
Built using AuditKIT — evaluate any model on any dataset and any task.
Method
evaluate
Model
<auditkit.model.vllm_gen.VLLMModel object at 0x7c887f99acf0>
Artifact
run
Published
2026-09-02 05:37 UTC
Usage
from datasets import load_dataset
ds = load_dataset("ram-lexsi/auditkit-testrun-evaluate")
auditkit-testrun-factual-consistency
auditkit-testrun-factual-consistency
Built using AuditKIT — evaluate any model on any dataset and any task.
Method
evaluate
Model
<auditkit.model.vllm_gen.VLLMModel object at 0x7c1b15bf5010>
Artifact
run
Published
2026-09-01 14:24 UTC
Usage
from datasets import load_dataset
ds = load_dataset("ram-lexsi/auditkit-testrun-factual-consistency")
