latkes/inside-out-replication-v2-external-scores
inside-out-replication-v2-external-scores Per (question, answer) external scores with judge labels for Inside-Out V2. Covers P(a|q), P_norm(a|q), P(True) and two verification-prompt variants. Used to compute external K/K*. Dataset Info Rows: 1752198 Columns: 20 Columns Column Type Description question_id Value('string') Question identifier, e.g. P26_test_0000 answer Value('string') Full sampled answer text (never truncated) label… See the full description on the dataset page: https://huggingface.co/datasets/latkes/inside-out-replication-v2-external-scores.
inside-out-replication-v2-external-scores
Per (question, answer) external scores with judge labels for Inside-Out V2. Covers P(a|q), P_norm(a|q), P(True) and two verification-prompt variants. Used to compute external K/K*.
Dataset Info
- Rows: 1752198
- Columns: 20
Columns
Generation Parameters
{
"script_name": "04_external_scores.py",
"model": "Llama-3-8B / Mistral-7B-v0.3 / Gemma-2-9B",
"description": "Per (question, answer) external scores with judge labels for Inside-Out V2. Covers P(a|q), P_norm(a|q), P(True) and two verification-prompt variants. Used to compute external K/K*.",
"input_datasets": [
"inside-out-replication-v2-judge-labels"
],
"experiment_name": "inside-out-replication-v2",
"job_id": "mll:27608-27621",
"cluster": "mll",
"artifact_status": "final",
"canary": false,
"hyperparameters": {}
}Usage
from datasets import load_dataset
dataset = load_dataset("latkes/inside-out-replication-v2-external-scores", split="train")
print(f"Loaded {len(dataset)} rows")