CoolFace
Datasetpublic

strategy-scope/si_et_al-ideation-gpt41mini-20260414_221654

si_et_al-ideation-gpt41mini-20260414_221654 Benchmark: si_et_al Generated: 2026-04-14T22:21:29.593222 Parameters model: gpt-4.1-mini-2025-04-14 judge_model: gpt-4o-mini-2024-07-18 strategy: none n_ideas_per_run: 5 n_runs: 3 n_topics: 3 rag: False Overall Averages Topics: 3 Total ideas: 45 Generation model: gpt-4.1-mini-2025-04-14 Judge model: gpt-4o-mini-2024-07-18 Runs per topic: 3 Ideas per run: 5 Metric Mean Novelty 7.98… See the full description on the dataset page: https://huggingface.co/datasets/strategy-scope/si_et_al-ideation-gpt41mini-20260414_221654.

sourceHugging Faceupdated 6mo agoView on Hugging Face
0likes3downloads
Dataset Card

sietal-ideation-gpt41mini-20260414_221654

Benchmark: sietal Generated: 2026-04-14T22:21:29.593222

Parameters

  • —model: gpt-4.1-mini-2025-04-14
  • —judge_model: gpt-4o-mini-2024-07-18
  • —strategy: none
  • —n_ideas_per_run: 5
  • —n_runs: 3
  • —n_topics: 3
  • —rag: False

Overall Averages

  • —Topics: 3
  • —Total ideas: 45
  • —Generation model: gpt-4.1-mini-2025-04-14
  • —Judge model: gpt-4o-mini-2024-07-18
  • —Runs per topic: 3
  • —Ideas per run: 5
MetricMean
Novelty7.98
Excitement8.93
Feasibility6.93
Effectiveness7.93
Overall7.96
Diversity (avg pairwise cosine distance)0.355

Per-Topic Results

Topic# ideasNoveltyExcitementFeasibilityEffectivenessOverallDiversity
bias157.938.936.937.937.930.350
coding158.008.876.937.937.930.366
safety158.009.006.937.938.000.348

Columns

  • —topic: NLP topic (bias, coding, factuality, math, multilingual, safety, uncertainty)
  • —runs: list of per-run generation records (prompt, raw_response, ideas, usage, seed)
  • —ideas: pooled idea texts across all runs
  • —n_ideas: total ideas after pooling
  • —evaluation: quality (LLM-judge 1-10 on 5 axes) + cosine + Jaccard diversity