CoolFace
30 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01CoIR-Retrieval /codefeedback-stEmploying the MTEB evaluation framework's dataset version, utilize the code below for assessment: import mteb import logging from sentence_transformers import SentenceTransformer from mteb import MTEB logger = logging.getLogger(__name__) model_name = 'intfloat/e5-base-v2' model = SentenceTransformer(model_name) tasks = mteb.get_tasks( tasks=[ "AppsRetrieval", "CodeFeedbackMT", "CodeFeedbackST", "CodeTransOceanContest", "CodeTransOceanDL"… See the full description on the dataset page: https://huggingface.co/datasets/CoIR-Retrieval/codefeedback-st.text100K<n<1M0 likes1.9k downloads2y agoHugging Face02CoIR-Retrieval /codefeedback-mtEmploying the MTEB evaluation framework's dataset version, utilize the code below for assessment: import mteb import logging from sentence_transformers import SentenceTransformer from mteb import MTEB logger = logging.getLogger(__name__) model_name = 'intfloat/e5-base-v2' model = SentenceTransformer(model_name) tasks = mteb.get_tasks( tasks=[ "AppsRetrieval", "CodeFeedbackMT", "CodeFeedbackST", "CodeTransOceanContest", "CodeTransOceanDL"… See the full description on the dataset page: https://huggingface.co/datasets/CoIR-Retrieval/codefeedback-mt.text100K<n<1M0 likes1.4k downloads2y agoHugging Face03CoIR-Retrieval /codefeedback-st-queries-corpusEmploying the CoIR evaluation framework's dataset version, utilize the code below for assessment: import coir from coir.data_loader import get_tasks from coir.evaluation import COIR from coir.models import YourCustomDEModel model_name = "intfloat/e5-base-v2" # Load the model model = YourCustomDEModel(model_name=model_name) # Get tasks #all task ["codetrans-dl","stackoverflow-qa","apps","codefeedback-mt","codefeedback-st","codetrans-contest","synthetic- # text2sql","cosqa","codesearchnet"… See the full description on the dataset page: https://huggingface.co/datasets/CoIR-Retrieval/codefeedback-st-queries-corpus.text100K<n<1M0 likes670 downloads2y agoHugging Face04CoIR-Retrieval /codefeedback-st-qrels Dataset Card for "codefeedback-st-qrels" More Information needed text100K<n<1M0 likes648 downloads2y agoHugging Face05HuggingFaceH4 /Code-Feedback Dataset Card for CodeFeedback This is a formatted version of m-a-p/Code-Feedback to store the conversations in the same format as the OpenAI SDK. text10K<n<100K9 likes610 downloads3y agoHugging Face06feedback-to-code /SWE-bench__style-3__fs-oracle_large_tokenlength Dataset Card for "SWE-bench__style-3__fs-oracle" More Information needed textn<1K0 likes431 downloads3y agoHugging Face07feedback-to-code /SWE-bench__style-3__fs-oracle Dataset Card for "SWE-bench__style-3__fs-oracle" More Information needed textn<1K0 likes387 downloads3y agoHugging Face08LimYeri /CodeFeedback-Filtered-Instruction-Pythontext100K<n<1M0 likes154 downloads2y agoHugging Face09fxmeng /CodeFeedback-Python105K Note This subset is derived from the m-a-p/CodeFeedback-Filtered-Instruction dataset, which contains 156,526 samples. CodeFeedback-Filtered-Instruction is a curated collection of code instruction queries extracted from four prominent open-source code instruction tuning datasets: Magicoder-OSS-Instruct, Python code subset of ShareGPT, Magicoder-Evol-Instruct, and Evol-Instruct-Code. From this dataset, we specifically selected only the 104,848 samples that are written in Python.… See the full description on the dataset page: https://huggingface.co/datasets/fxmeng/CodeFeedback-Python105K.textquestion-answering100K<n<1M6 likes153 downloads2y agoHugging Face10mteb /CodeFeedbackMT CodeFeedbackMT An MTEB dataset Massive Text Embedding Benchmark The dataset is a collection of user queries and assistant responses. The task is to retrieve the most relevant response for a given query. Task category t2t Domains Programming, Written Reference https://arxiv.org/abs/2402.14658 How to evaluate on this task You can evaluate an embedding model on this dataset using the following code: import mteb task = mteb.get_tasks(["CodeFeedbackMT"])… See the full description on the dataset page: https://huggingface.co/datasets/mteb/CodeFeedbackMT.texttext-retrieval10K<n<100K0 likes90 downloads1y agoHugging Face11DCAgent2 /g1_top8_no_swebench_code_feedback_glm47_traces DCAgent2/g1_top8_no_swebench_code_feedback_glm47_traces 89,094 rows. Aggressively SWE-bench-decontaminated variant of DCAgent/g1_min_episodes_top8_100k_glm47_traces: the entire issue subset (13,783 rows, of which 7,824 were SWE-bench-derived) is dropped and partially replaced with code_feedback traces filtered to ≥5 episodes. What was changed Original top8_100k This dataset Total rows 100,110 89,094 Issue subset rows 13,783 (with 7,824 from SWE-bench: 2,442… See the full description on the dataset page: https://huggingface.co/datasets/DCAgent2/g1_top8_no_swebench_code_feedback_glm47_traces.text10K<n<100K0 likes88 downloads5mo agoHugging Face12mteb /codefeedback-mttext100K<n<1M1 likes80 downloads2y agoHugging Face13CoIR-Retrieval /codefeedback-mt-queries-corpusEmploying the CoIR evaluation framework's dataset version, utilize the code below for assessment: import coir from coir.data_loader import get_tasks from coir.evaluation import COIR from coir.models import YourCustomDEModel model_name = "intfloat/e5-base-v2" # Load the model model = YourCustomDEModel(model_name=model_name) # Get tasks #all task ["codetrans-dl","stackoverflow-qa","apps","codefeedback-mt","codefeedback-st","codetrans-contest","synthetic- # text2sql","cosqa","codesearchnet"… See the full description on the dataset page: https://huggingface.co/datasets/CoIR-Retrieval/codefeedback-mt-queries-corpus.text100K<n<1M0 likes73 downloads2y agoHugging Face14CoIR-Retrieval /codefeedback-mt-qrels Dataset Card for "codefeedback-mt-qrels" More Information needed text10K<n<100K0 likes64 downloads2y agoHugging Face15banksy235 /Code-Feedback-Cleantabular10K<n<100K1 likes63 downloads2y agoHugging Face16mteb /CodeFeedbackST CodeFeedbackST An MTEB dataset Massive Text Embedding Benchmark The dataset is a collection of user queries and assistant responses. The task is to retrieve the most relevant response for a given query. Task category t2t Domains Programming, Written Reference https://arxiv.org/abs/2407.02883 How to evaluate on this task You can evaluate an embedding model on this dataset using the following code: import mteb task = mteb.get_task("CodeFeedbackST")… See the full description on the dataset page: https://huggingface.co/datasets/mteb/CodeFeedbackST.texttext-retrieval100K<n<1M0 likes58 downloads1y agoHugging Face17pvduy /code-feedback-deepseekv2-critictext100K<n<1M1 likes54 downloads2y agoHugging Face18pvduy /code-feedback-10k-deepseekv2-critictext10K<n<100K0 likes53 downloads2y agoHugging Face19mlfoundations-dev /a1_code_codefeedbacktext10K<n<100K0 likes51 downloads1y agoHugging Face20mlfoundations-dev /seed_code_codefeedback_exploittext10K<n<100K0 likes50 downloads2y agoHugging Face21DCAgent /neulab-code-feedback-sandboxes-traces-terminus-2text1K<n<10K0 likes49 downloads11mo agoHugging Face22DCAgent2 /DCAgent2_terminal_bench_2_DCAgent2_neulab-code-feedback-sandboxes-traces-termineeb38555textn<1K0 likes49 downloads10mo agoHugging Face23nayohan /CodeFeedback-Filtered-Instruction-ko Dataset Card for "CodeFeedback-Filtered-Instruction-ko" Translated m-a-p/CodeFeedback-Filtered-Instruction using nayohan/llama3-instrucTrans-enko-8b. text100K<n<1M2 likes47 downloads2y agoHugging Face24ai2-adapt-dev /codefeedback-single-turn-reformat-magicodertext10K<n<100K0 likes42 downloads2y agoHugging Face25laurentiubp /codefeedback-scoredtext100K<n<1M0 likes40 downloads2y agoHugging Face26pvduy /m-a-p-codefeedback-mistral-largetext100K<n<1M0 likes40 downloads2y agoHugging Face27mteb /codefeedback-sttext100K<n<1M0 likes39 downloads2y agoHugging Face28DCAgent /neulab-code-feedback-sandboxestext10K<n<100K0 likes38 downloads10mo agoHugging Face29mizinovmv /ru_codefeedbacktexttext-generation100K<n<1M1 likes37 downloads2y agoHugging Face30feedback-to-code /mozzarella Mozzarella-0.3.1 Motivation Mozzarella is a dataset matching issues (= problem statements) and corresponding pull requests (PRs = problem solutions) of a selection of well maintained Java GitHub repositories. The original purpose was to serve as training and evaluation data for ML models concerned with fault localization and automated program repair of complex code bases. However, there might be more use cases that could benefit from this data. Inspired by SWEBench… See the full description on the dataset page: https://huggingface.co/datasets/feedback-to-code/mozzarella.text1K<n<10K1 likes35 downloads2y agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.