llm-eval
llm-evals-2-79b954ef-4798-4994-be72-a88d46b8eccallm-evals-2-a56b96e9-5b1a-4351-9b07-3c46a9e2bfe6LLM-Compe-structured-eval-t-qwen3-4b.v4LLM-Compe-structured-eval-t-qwen3-4b.v14Tweet_Eval_Sentiment_LLM_Full_Fine-tuningLLM-Compe-structured-eval-t-qwen3-4b.v3qwen3-32b-llm-as-an-evaluator-vsdLLM-Compe-structured-eval-t-qwen3-4b.v12
Datasets
All datasets matching “llm-eval”eval-Qwen3-32B-HLEtest-datachain-llm-evalpeacock-data-public-datasets-idc-llm_evalhle_eval_datasettest_eval_hle生徒モデル選定目的でtakaさん評価コード(運営から提供されたコードを動作するように変更版)で評価してみた結果(佐々木分)です。https://www.notion.so/23de14b94af5807a87b5c6292a3d3520https://matsuokenllmcommunity.slack.com/archives/C095PS80YTE/p1753979349212189?thread_ts=1753437729.053739&cid=C095PS80YTE
<predictionsフォルダ>素の Qwen3で hle_eval推論した結果hle_Qwen3-14B.jsonhle_Qwen3-32B.jsonhle_Qwen3-235B-A228B.json(441問回答版)、この後に追加で100問程度推論したファイルも別途あり(判定は未だ行っていない)(再度、推論するとpredictionsフォルダに入っている推論済の問題以外を追加で推論してくれる動作になっている)
<judgedフォルダ>素の Qwen3で… See the full description on the dataset page: https://huggingface.co/datasets/llm-compe-2025-kato/test_eval_hle.llm-eval-flakiness-trajectories
Llm Eval Flakiness Trajectories
Rights & intended use: legacy public research corpus / portfolio
artifact. Hosted frontier-model outputs are research-only inputs under
project policy (synthetic-factory#161):
intended_use: research_only, project_training_policy: blocked. Not
training data for any model-weight update. Machine-readable record:
rights.json.
Release status: The raw, uncurated payload is now published under
data/raw/. It is available for inspection and… See the full description on the dataset page: https://huggingface.co/datasets/rmems/llm-eval-flakiness-trajectories.
