CoolFace
Datasetpublic

JollyFraud/crimeopus-distill-v2

CrimeOpus 4.7 — Distilled Coding Dataset Dataset di fine-tuning per CrimeOpus 4.7-v2 (LoRA training). Sources Source Count Type DeepSeek-Chat distillation 157 Multi-domain coding/reasoning Git commit-diff (CrimeCode-IDE) 91 Real codebase patterns Uncensored seed (toxic-dpo + orpo-mix) 179 Refusal-free helpfulness Total 427 Format ChatML messages array: { "messages": [ {"role": "system", "content": "..."}, {"role":… See the full description on the dataset page: https://huggingface.co/datasets/JollyFraud/crimeopus-distill-v2.

sourceHugging Faceapache-2.0updated 5mo agoView on Hugging Face
0likes19downloads
Dataset Card

CrimeOpus 4.7 — Distilled Coding Dataset

Dataset di fine-tuning per CrimeOpus 4.7-v2 (LoRA training).

Sources

SourceCountType
DeepSeek-Chat distillation157Multi-domain coding/reasoning
Git commit-diff (CrimeCode-IDE)91Real codebase patterns
Uncensored seed (toxic-dpo + orpo-mix)179Refusal-free helpfulness
Total427

Format

ChatML messages array:

json
{
  "messages": [
    {"role": "system", "content": "..."},
    {"role": "user", "content": "..."},
    {"role": "assistant", "content": "..."}
  ]
}

Stats

  • —Avg user message: ~281 chars
  • —Avg assistant response: ~2745 chars
  • —Total tokens (est): ~323k
  • —Languages: Italian + English + code
  • —Refusals filtered: yes (zero detected)

Use

python
from datasets import load_dataset
ds = load_dataset("JollyFraud/crimeopus-distill-v2", split="train")

Used for QLoRA fine-tuning of huihui-ai/Huihui-Qwen3.6-35B-A3B-Claude-4.7-Opus-abliterated.