northriverfence/varxipod-k8s-remediation
VarXiPod K8s Remediation Dataset Dataset Description Synthetic dataset for training agentic K8s remediation models. Contains event diagnosis, remediation planning, tool calling, runbook execution, and confidence scoring examples. Generated from VarXiPod operator domain knowledge. This dataset is designed to fine-tune language models for autonomous Kubernetes cluster remediation. Each example represents a realistic scenario drawn from production operator experience… See the full description on the dataset page: https://huggingface.co/datasets/northriverfence/varxipod-k8s-remediation.
VarXiPod K8s Remediation Dataset
Dataset Description
Synthetic dataset for training agentic K8s remediation models. Contains event diagnosis, remediation planning, tool calling, runbook execution, and confidence scoring examples. Generated from VarXiPod operator domain knowledge.
This dataset is designed to fine-tune language models for autonomous Kubernetes cluster remediation. Each example represents a realistic scenario drawn from production operator experience, including cascading failures, resource exhaustion, networking misconfigurations, and workload scheduling issues.
Categories
The dataset contains five distinct example categories:
Total: ~900 examples
Format
Each example is stored as a JSON Lines (.jsonl) record with the following schema:
{
"id": "diag-001",
"category": "event_diagnosis",
"system_prompt": "You are a Kubernetes remediation agent...",
"messages": [
{ "role": "user", "content": "Pod nginx-7d4f8b... is in CrashLoopBackOff..." },
{ "role": "assistant", "content": "Root cause: OOMKilled. The container..." }
],
"metadata": {
"cluster_version": "1.29",
"namespace": "production",
"severity": "critical",
"resources_involved": ["Pod", "Deployment", "ReplicaSet"],
"tools_used": ["kubectl_describe", "kubectl_logs"]
}
}Field Descriptions
- id: Unique identifier with category prefix (
diag-,plan-,tool-,run-,conf-). - category: One of
event_diagnosis,remediation_planning,tool_calling,runbook_execution,confidence_scoring. - system_prompt: The system instruction establishing agent role and constraints.
- messages: Conversation turns in OpenAI chat format.
- metadata: Structured context including cluster version, namespace, severity, involved resources, and tools referenced.
Usage
Loading with Hugging Face Datasets
from datasets import load_dataset
# From Hugging Face Hub
dataset = load_dataset("SingulioDev/varxipod-k8s-remediation")
# Filter by category
diagnosis_examples = dataset["train"].filter(lambda x: x["category"] == "event_diagnosis")
# Iterate
for example in dataset["train"]:
print(example["id"], example["category"])Loading from Local JSONL
from datasets import load_dataset
dataset = load_dataset("json", data_files="train.jsonl")Intended Use
Primary Use Cases
- Fine-tuning agentic remediation models: Train models that can autonomously diagnose and remediate Kubernetes cluster issues.
- Tool-calling alignment: Teach models to emit structured tool calls (kubectl, Helm, cloud provider APIs) in the correct sequence.
- Runbook automation: Enable models to follow and adapt multi-step operational runbooks with conditional logic.
- Confidence calibration: Train models to assess risk and estimate success probability before executing remediation actions.
Out of Scope
- This dataset is not intended for production use without human-in-the-loop validation.
- Examples are synthetic and may not cover every edge case in real-world clusters.
- The dataset does not contain any real cluster data, credentials, or PII.
Citation
@dataset{varxipod_k8s_remediation_2026,
title = {VarXiPod K8s Remediation Dataset},
author = {SingulioDev},
year = {2026},
url = {https://huggingface.co/datasets/SingulioDev/varxipod-k8s-remediation},
license = {Apache-2.0}
}