GlimmaryKarl/DualBlind
GlimmaryKarl/DualBlind Curated Frontier Reasoning and Direct Preference Optimization (DPO) Dataset Generated from Double-Blind Multi-Agent Arena Evaluations. This dataset was generated using the DualBlind AI Benchmark Arena. In this setup, two independent frontier AI models engage in multi-turn double-blind dialogue to solve extreme-difficulty benchmark problems, verifying their peer's proofs, raising counter-examples, and reaching mathematical consensus. Dataset… See the full description on the dataset page: https://huggingface.co/datasets/GlimmaryKarl/DualBlind.
Upload 100% verified DualBlind dataset (2962 SFT traces, 2961 DPO pairs)
Upload 100% verified DualBlind dataset (1502 SFT traces, 1501 DPO pairs)
Upload 100% verified DualBlind dataset (1428 SFT traces, 1427 DPO pairs)
Upload 100% verified DualBlind dataset (996 SFT traces, 995 DPO pairs)
Upload 100% verified DPO preference pairs (995 pairs)
Upload 100% verified SFT reasoning traces (996 records)
Initialize GlimmaryKarl/DualBlind dataset documentation and training scripts
Create README.md
Upload 100% verified DPO preference pairs (995 pairs)
Upload 100% verified SFT reasoning traces (996 records)
Initialize GlimmaryKarl/DualBlind dataset documentation and training scripts
Upload 100% verified DPO preference pairs (995 pairs)
Upload 100% verified SFT reasoning traces (996 records)
Initialize GlimmaryKarl/DualBlind dataset documentation and training scripts
Upload 100% verified DPO preference pairs (995 pairs)
Upload 100% verified SFT reasoning traces (996 records)
Initialize GlimmaryKarl/DualBlind dataset documentation and training scripts
initial commit
