strategy-scope/si_et_al-ideation-gpt41mini-20260414_221654
si_et_al-ideation-gpt41mini-20260414_221654 Benchmark: si_et_al Generated: 2026-04-14T22:21:29.593222 Parameters model: gpt-4.1-mini-2025-04-14 judge_model: gpt-4o-mini-2024-07-18 strategy: none n_ideas_per_run: 5 n_runs: 3 n_topics: 3 rag: False Overall Averages Topics: 3 Total ideas: 45 Generation model: gpt-4.1-mini-2025-04-14 Judge model: gpt-4o-mini-2024-07-18 Runs per topic: 3 Ideas per run: 5 Metric Mean Novelty 7.98… See the full description on the dataset page: https://huggingface.co/datasets/strategy-scope/si_et_al-ideation-gpt41mini-20260414_221654.
03
sietal-ideation-gpt41mini-20260414_221654
Benchmark: sietal Generated: 2026-04-14T22:21:29.593222
Parameters
- model: gpt-4.1-mini-2025-04-14
- judge_model: gpt-4o-mini-2024-07-18
- strategy: none
- n_ideas_per_run: 5
- n_runs: 3
- n_topics: 3
- rag: False
Overall Averages
- Topics: 3
- Total ideas: 45
- Generation model: gpt-4.1-mini-2025-04-14
- Judge model: gpt-4o-mini-2024-07-18
- Runs per topic: 3
- Ideas per run: 5
Per-Topic Results
Columns
- topic: NLP topic (bias, coding, factuality, math, multilingual, safety, uncertainty)
- runs: list of per-run generation records (prompt, raw_response, ideas, usage, seed)
- ideas: pooled idea texts across all runs
- n_ideas: total ideas after pooling
- evaluation: quality (LLM-judge 1-10 on 5 axes) + cosine + Jaccard diversity
