CoolFace
Datasetpublic

Davizig10jojo/Kimi-K3-And-DeepSeek-V4-Pro-0813-Distillation-in-PT-BR

🇧 Destilação PT-BR com Raciocínio (Chain-of-Thought) Este dataset contém exemplos de alta qualidade gerados através da destilação de modelos de ponta (Teacher Models) disponíveis via NVIDIA NIM, focados em instrução, raciocínio lógico e naturalidade em Português Brasileiro (PT-BR). O grande diferencial deste dataset é a inclusão explícita do processo de pensamento (Chain-of-Thought / thinking) dos modelos professores, permitindo treinar modelos menores (Student Models) não… See the full description on the dataset page: https://huggingface.co/datasets/Davizig10jojo/Kimi-K3-And-DeepSeek-V4-Pro-0813-Distillation-in-PT-BR.

sourceHugging Facemitupdated 14d agoView on Hugging Face
0likes57downloads
Dataset Card

🇧 Destilação PT-BR com Raciocínio (Chain-of-Thought)

Este dataset contém exemplos de alta qualidade gerados através da destilação de modelos de ponta (Teacher Models) disponíveis via NVIDIA NIM, focados em instrução, raciocínio lógico e naturalidade em Português Brasileiro (PT-BR).

O grande diferencial deste dataset Ă© a inclusĂŁo explĂ­cita do processo de pensamento (Chain-of-Thought / `thinking`) dos modelos professores, permitindo treinar modelos menores (Student Models) nĂŁo apenas para dar a resposta certa, mas para raciocinar antes de responder.

Destaques

  • —RaciocĂ­nio ExplĂ­cito (`thinking`): Captura o passo-a-passo lĂłgico, planejamento e auto-correção dos modelos professores antes da resposta final.
  • —Honestidade e Segurança: Exemplos intencionais onde o modelo se recusa a alucinar (especialmente em atualidades_br sem contexto web), ensinando o modelo aluno a dizer "nĂŁo sei" com base nos dados fornecidos.
  • —Professores de Ponta: Gerado utilizando deepseek-ai/deepseek-v4-pro-0813 (SOTA em cĂłdigo/matemática) e moonshotai/kimi-k3 (excelente em empatia, cultura e conversação).
  • —DomĂ­nios Diversos: CĂłdigo, Matemática Rigorosa, Conversação Empática, Cultura Brasileira e Atualidades.

🏗️ Metodologia de Geração

Os dados foram gerados usando um pipeline assĂ­ncrono em Python com as seguintes caracterĂ­sticas:

  1. 1.Geração de Prompts: Utilização do deepseek-ai/deepseek-v4-flash-0731 para criar prompts variados e naturais em PT-BR.
  2. 2.Contexto Web Real (RAG): Para o domĂ­nio atualidades_br, o pipeline realizou buscas reais via DuckDuckGo (focadas em fontes brasileiras) e injetou o contexto no prompt.
  3. 3.Destilação com Fallback: As requisições foram enviadas aos Teacher Models via API da NVIDIA NIM. Se o modelo principal falhasse ou gerasse uma resposta/pensamento muito curto (filtro de qualidade), o pipeline tentava automaticamente o modelo de fallback.
  4. 4.Extração de CoT: O campo reasoning_content retornado pela API compatível com OpenAI foi extraído e separado da resposta final.

Modelos Professores (Teachers)

DomínioTeacher PrimárioTeacher Fallback
codigoDeepSeek V4 Pro 0813Kimi K3
matematicaDeepSeek V4 Pro 0813Kimi K3
conversa_ptbrKimi K3DeepSeek V4 Pro 0813
cultura_brKimi K3DeepSeek V4 Pro 0813
atualidades_brKimi K3DeepSeek V4 Pro 0813

📊 Estrutura dos Dados

O dataset está disponível em formato CSV (Destilação.csv / distill_ptbr_dataset.csv) com as seguintes colunas:

  • —domain: Categoria do prompt (codigo, matematica, conversa_ptbr, cultura_br, atualidades_br).
  • —teacher_model: ID do modelo professor que gerou a resposta.
  • —system_prompt: A instrução de sistema usada para guiar o persona do professor.
  • —user_prompt: A pergunta ou comando do usuário (inclui contexto web injetado quando aplicável).
  • —thinking: O processo de raciocĂ­nio interno (Chain-of-Thought) do modelo.
  • —answer: A resposta final formatada para o usuário.
  • —used_web_search: Booleano indicando se houve injeção de contexto web (DuckDuckGo).
  • —generated_at: Timestamp UTC da geração.
  • —answer_chars / thinking_chars: MĂ©tricas de tamanho para facilitar filtragem.

đź’» Como Usar

Carregando com Pandas

python
import pandas as pd

# Carregar o dataset
df = pd.read_csv("seu_usuario/nome_do_dataset/Destilação.csv")

# Visualizar um exemplo de raciocínio matemático
exemplo = df[df['domain'] == 'matematica'].iloc[0]
print(f"Pergunta: {exemplo['user_prompt']}\n")
print(f"Pensamento:\n{exemplo['thinking']}\n")
print(f"Resposta:\n{exemplo['answer']}")

Preparando para Fine-Tuning (Formato ChatML / LLaMA-Factory)

Para treinar modelos como Qwen 2.5, Llama 3 ou Mistral usando frameworks como LLaMA-Factory ou Axolotl, vocĂŞ deve combinar o thinking e o answer no formato esperado pelo modelo (geralmente usando tags <think>).

python
import json
import pandas as pd

df = pd.read_csv("Destilação.csv")
dataset_jsonl = []

for _, row in df.iterrows():
    # Ignora linhas onde o pensamento ou resposta estĂŁo vazios/curtos demais
    if len(str(row['thinking'])) < 50 or len(str(row['answer'])) < 50:
        continue
        
    dataset_jsonl.append({
        "messages": [
            {"role": "system", "content": row['system_prompt']},
            {"role": "user", "content": row['user_prompt']},
            # Combina o CoT e a resposta final
            {"role": "assistant", "content": f"<think>\n{row['thinking']}\n</think>\n\n{row['answer']}"}
        ]
    })

# Salvar no formato JSONL
with open("train_data.jsonl", "w", encoding="utf-8") as f:
    for item in dataset_jsonl:
        f.write(json.dumps(item, ensure_ascii=False) + "\n")

print(f"Gerados {len(dataset_jsonl)} exemplos prontos para treino.")

⚠️ Limitações e Considerações Éticas

  • —Alucinação em Atualidades: Embora o pipeline tenha usado busca web, o DuckDuckGo ocasionalmente falhou em retornar resultados no ambiente de execução (Kaggle). Nesses casos, os Teacher Models foram instruĂ­dos a nĂŁo inventar fatos. Esses exemplos (onde a resposta indica falta de contexto) foram mantidos propositalmente para ensinar o modelo aluno a ser seguro e honesto.
  • —ViĂ©s dos Professores: O dataset herda os vieses e limitações dos modelos DeepSeek V4 Pro e Kimi K3.
  • —Uso NĂŁo Comercial (Dependente): Verifique as licenças originais dos modelos professores no Hugging Face/NVIDIA NIM antes de utilizar este dataset destilado para fins estritamente comerciais.

🙏 Agradecimentos

  • —NVIDIA NIM pela infraestrutura de inferĂŞncia gratuita para desenvolvedores.
  • —DeepSeek AI e Moonshot AI (Kimi) pelos incrĂ­veis modelos abertos.
  • —DuckDuckGo pela API de busca nĂŁo rastreada.

Dataset gerado por [Seu Nome/Usuário] usando pipeline customizado em Python.