m-a-p/AetherCode
AetherCode: Evaluating LLMs' Ability to Win In Premier Programming Competitions Introduction Competitive programming has emerged as a critical benchmark for evaluating the reasoning and coding capabilities of Large Language Models (LLMs). Despite impressive progress on existing benchmarks, we argue that current evaluations overstate model proficiency, masking a substantial gap between LLMs and elite human programmers. This gap… See the full description on the dataset page: https://huggingface.co/datasets/m-a-p/AetherCode.
8663
../
test-00000-of-00041.parquetdownload
test-00001-of-00041.parquetdownload
test-00002-of-00041.parquetdownload
test-00003-of-00041.parquetdownload
test-00004-of-00041.parquetdownload
test-00005-of-00041.parquetdownload
test-00006-of-00041.parquetdownload
test-00007-of-00041.parquetdownload
test-00008-of-00041.parquetdownload
test-00009-of-00041.parquetdownload
test-00010-of-00041.parquetdownload
test-00011-of-00041.parquetdownload
test-00012-of-00041.parquetdownload
test-00013-of-00041.parquetdownload
test-00014-of-00041.parquetdownload
test-00015-of-00041.parquetdownload
test-00016-of-00041.parquetdownload
test-00017-of-00041.parquetdownload
test-00018-of-00041.parquetdownload
test-00019-of-00041.parquetdownload
test-00020-of-00041.parquetdownload
test-00021-of-00041.parquetdownload
test-00022-of-00041.parquetdownload
test-00023-of-00041.parquetdownload
test-00024-of-00041.parquetdownload
test-00025-of-00041.parquetdownload
test-00026-of-00041.parquetdownload
test-00027-of-00041.parquetdownload
test-00028-of-00041.parquetdownload
test-00029-of-00041.parquetdownload
test-00030-of-00041.parquetdownload
test-00031-of-00041.parquetdownload
test-00032-of-00041.parquetdownload
test-00033-of-00041.parquetdownload
test-00034-of-00041.parquetdownload
test-00035-of-00041.parquetdownload
test-00036-of-00041.parquetdownload
test-00037-of-00041.parquetdownload
test-00038-of-00041.parquetdownload
test-00039-of-00041.parquetdownload
test-00040-of-00041.parquetdownload
