datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
llama4-maverick-coco-captionsllama4-scout-coco-captionsllama-4-eval-logs-and-scores
Dataset Card for llama-4-eval-logs-and-scores
This repository contains the detailed evaluation results of Llama 4 models, tested using Twinkle Eval, a robust and efficient AI evaluation tool developed by Twinkle AI. Each entry includes per-question scores across multiple benchmark suites.
Dataset Details
Dataset Description
This dataset provides the complete evaluation logs and per-question scores of various Llama 4 models, including Scout and… See the full description on the dataset page: https://huggingface.co/datasets/twinkle-ai/llama-4-eval-logs-and-scores.earnings-call-llama4-maverick-summary
Earnings Call Summary Dataset (Llama-4-Maverick-17B-128E-Instruct-FP8)
Dataset Description
This dataset contains comprehensive summaries of corporate earnings call transcripts generated using the Llama-4-Maverick-17B-128E-Instruct-FP8 model. Each summary provides structured insights into company performance, strategic initiatives, market conditions, and forward-looking guidance.
Dataset Features
High-quality summaries: Generated using… See the full description on the dataset page: https://huggingface.co/datasets/PursuitOfDataScience/earnings-call-llama4-maverick-summary.arxiv-llama4-maverick-abstract
arXiv Abstract Dataset (Llama-4-Maverick-17B-128E-Instruct-FP8)
Dataset Description
This dataset contains high-quality abstracts for scientific papers from the arXiv repository, generated using the Llama-4-Maverick-17B-128E-Instruct-FP8 model. Each abstract provides a concise, accurate overview of the research paper while preserving key technical details and contributions.
Dataset Features
High-quality abstracts: Generated using… See the full description on the dataset page: https://huggingface.co/datasets/PursuitOfDataScience/arxiv-llama4-maverick-abstract.govreport-llama4-maverick-summary
Government Report Summary Dataset (Llama-4-Maverick-17B-128E-Instruct-FP8)
Dataset Description
This dataset contains high-quality summaries for government reports and documents, generated using the Llama-4-Maverick-17B-128E-Instruct-FP8 model. Each summary provides a concise, accurate overview of government reports while preserving key policy implications, findings, and recommendations.
Dataset Features
High-quality summaries: Generated using… See the full description on the dataset page: https://huggingface.co/datasets/PursuitOfDataScience/govreport-llama4-maverick-summary.Llama4_SFTLlama4000-5000dataset_dpo_llama4xsum-llama4-maverick-summary
XSum Summary Dataset (Llama-4-Maverick-17B-128E-Instruct-FP8)
Dataset Description
This dataset contains high-quality summaries of BBC news articles from the XSum (Extreme Summarization) dataset, generated using the Llama-4-Maverick-17B-128E-Instruct-FP8 model. Each summary provides a concise, accurate overview of the main story while preserving key facts and context.
Dataset Features
High-quality summaries: Generated using… See the full description on the dataset page: https://huggingface.co/datasets/PursuitOfDataScience/xsum-llama4-maverick-summary.Llama_4_Maverick_Distilled_5k
Llama_4_Maverick_Distilled – 5,000 Reasoning Traces
High-quality distilled dataset built to mirror the thinking and reasoning traces of Llama 4 Maverick class models. Created for training student LLMs to reproduce Llama_4_Maverick_Distilled style step-by-step reasoning.
Version: 1.0Date: May 24, 2026Source: Synthetic generation by Meta AI
Purpose
This dataset captures the explicit chain-of-thought pattern characteristic of Llama_4_Maverick_Distilled: state the… See the full description on the dataset page: https://huggingface.co/datasets/WithinUsAI/Llama_4_Maverick_Distilled_5k.llama_4_fsdptrain_dpo_llama4bbc-news-llama4-maverick-summary
BBC News Summary Dataset (Llama-4-Maverick-17B-128E-Instruct-FP8)
Dataset Description
This dataset contains high-quality summaries for BBC news articles from the CC-MAIN-2013-20 web crawl, generated using the Llama-4-Maverick-17B-128E-Instruct-FP8 model. Each summary provides a concise, accurate overview of BBC news stories while preserving journalistic integrity and essential information.
Dataset Features
High-quality summaries: Generated using… See the full description on the dataset page: https://huggingface.co/datasets/PursuitOfDataScience/bbc-news-llama4-maverick-summary.Llama-4-Maverick-17B-128E-Instruct-FP8-OpenR1-Math-220kcnn-dailymail-llama4-maverick-summary
CNN/DailyMail Summary Dataset (Llama-4-Maverick-17B-128E-Instruct-FP8)
Dataset Description
This dataset contains high-quality summaries of CNN and DailyMail news articles generated using the Llama-4-Maverick-17B-128E-Instruct-FP8 model. Each summary provides a concise, accurate overview of the main story while preserving key facts and context.
Dataset Features
High-quality summaries: Generated using Llama-4-Maverick-17B-128E-Instruct-FP8 model
Comprehensive… See the full description on the dataset page: https://huggingface.co/datasets/PursuitOfDataScience/cnn-dailymail-llama4-maverick-summary.Llama-4-Maverick-17B-128E-Instruct-FP8-alpaca-cleanedshowdown-distill-llama4Generated using this script:
import re
import json
from datasets import load_dataset, concatenate_datasets
import os
import base64
from groq import Groq
from PIL import Image
from io import BytesIO
import dotenv
dotenv.load_dotenv('./.env')
# Initialize Groq client
client = Groq(api_key=os.getenv("GROQ_API_KEY"))
def load_showdown_dataset():
"""
Load the Showdown dataset from HuggingFace.
"""
print("Loading Showdown dataset from HuggingFace...")
dataset =… See the full description on the dataset page: https://huggingface.co/datasets/ddupont/showdown-distill-llama4.Llama-4-Scout-17B-16E-Instruct-FP8-Instruct-FP8-ProcessedOpenAssistantLlama-4-Scout-17B-16E-Instruct-FP8-OpenR1-Math-220kllama45trainconceptbench_path_vqa_result_2_llama4_16x17bLlama-4-Maverick-03-26-Experimental-battles
LMArena Llama-4 battle results
This is the data from https://huggingface.co/spaces/lmarena-ai/Llama-4-Maverick-03-26-Experimental_battles shared as Parquet to make it easier to use in Polars, DuckDB, Pandas etc.
Background
We've seen questions from the community about the latest release of Llama-4 on Arena. To ensure full transparency, we're releasing 2,000+ head-to-head battle results for public review. This includes user prompts, model responses, and user preferences. (link in… See the full description on the dataset page: https://huggingface.co/datasets/davanstrien/Llama-4-Maverick-03-26-Experimental-battles.Llama-4-Scout-Convsllama405B-generated-smallLlama-4-Maverick-17B-128E-Instruct-FP8-databricks-dolly-15kllama405B-sudoku-sftconceptbench_path_vqa_result_2_llama4_16x17b_evaluatedopenassistant-guanaco-llama4-1kLlama-4-Scout-17B-16E-Instruct-FP8-alpaca-cleaned
