Davizig10jojo/Kimi-K3-And-DeepSeek-V4-Pro-0813-Distillation-in-PT-BR
🇧 Destilação PT-BR com RaciocĂnio (Chain-of-Thought) Este dataset contĂ©m exemplos de alta qualidade gerados atravĂ©s da destilação de modelos de ponta (Teacher Models) disponĂveis via NVIDIA NIM, focados em instrução, raciocĂnio lĂłgico e naturalidade em PortuguĂŞs Brasileiro (PT-BR). O grande diferencial deste dataset Ă© a inclusĂŁo explĂcita do processo de pensamento (Chain-of-Thought / thinking) dos modelos professores, permitindo treinar modelos menores (Student Models) nĂŁo… See the full description on the dataset page: https://huggingface.co/datasets/Davizig10jojo/Kimi-K3-And-DeepSeek-V4-Pro-0813-Distillation-in-PT-BR.
🇧 Destilação PT-BR com RaciocĂnio (Chain-of-Thought)
Este dataset contĂ©m exemplos de alta qualidade gerados atravĂ©s da destilação de modelos de ponta (Teacher Models) disponĂveis via NVIDIA NIM, focados em instrução, raciocĂnio lĂłgico e naturalidade em PortuguĂŞs Brasileiro (PT-BR).
O grande diferencial deste dataset Ă© a inclusĂŁo explĂcita do processo de pensamento (Chain-of-Thought / `thinking`) dos modelos professores, permitindo treinar modelos menores (Student Models) nĂŁo apenas para dar a resposta certa, mas para raciocinar antes de responder.
Destaques
- RaciocĂnio ExplĂcito (`thinking`): Captura o passo-a-passo lĂłgico, planejamento e auto-correção dos modelos professores antes da resposta final.
- Honestidade e Segurança: Exemplos intencionais onde o modelo se recusa a alucinar (especialmente em
atualidades_brsem contexto web), ensinando o modelo aluno a dizer "nĂŁo sei" com base nos dados fornecidos. - Professores de Ponta: Gerado utilizando
deepseek-ai/deepseek-v4-pro-0813(SOTA em cĂłdigo/matemática) emoonshotai/kimi-k3(excelente em empatia, cultura e conversação). - DomĂnios Diversos: CĂłdigo, Matemática Rigorosa, Conversação Empática, Cultura Brasileira e Atualidades.
🏗️ Metodologia de Geração
Os dados foram gerados usando um pipeline assĂncrono em Python com as seguintes caracterĂsticas:
- Geração de Prompts: Utilização do
deepseek-ai/deepseek-v4-flash-0731para criar prompts variados e naturais em PT-BR. - Contexto Web Real (RAG): Para o domĂnio
atualidades_br, o pipeline realizou buscas reais via DuckDuckGo (focadas em fontes brasileiras) e injetou o contexto no prompt. - Destilação com Fallback: As requisições foram enviadas aos Teacher Models via API da NVIDIA NIM. Se o modelo principal falhasse ou gerasse uma resposta/pensamento muito curto (filtro de qualidade), o pipeline tentava automaticamente o modelo de fallback.
- Extração de CoT: O campo
reasoning_contentretornado pela API compatĂvel com OpenAI foi extraĂdo e separado da resposta final.
Modelos Professores (Teachers)
📊 Estrutura dos Dados
O dataset está disponĂvel em formato CSV (Destilação.csv / distill_ptbr_dataset.csv) com as seguintes colunas:
domain: Categoria do prompt (codigo,matematica,conversa_ptbr,cultura_br,atualidades_br).teacher_model: ID do modelo professor que gerou a resposta.system_prompt: A instrução de sistema usada para guiar o persona do professor.user_prompt: A pergunta ou comando do usuário (inclui contexto web injetado quando aplicável).thinking: O processo de raciocĂnio interno (Chain-of-Thought) do modelo.answer: A resposta final formatada para o usuário.used_web_search: Booleano indicando se houve injeção de contexto web (DuckDuckGo).generated_at: Timestamp UTC da geração.answer_chars/thinking_chars: MĂ©tricas de tamanho para facilitar filtragem.
đź’» Como Usar
Carregando com Pandas
import pandas as pd
# Carregar o dataset
df = pd.read_csv("seu_usuario/nome_do_dataset/Destilação.csv")
# Visualizar um exemplo de raciocĂnio matemático
exemplo = df[df['domain'] == 'matematica'].iloc[0]
print(f"Pergunta: {exemplo['user_prompt']}\n")
print(f"Pensamento:\n{exemplo['thinking']}\n")
print(f"Resposta:\n{exemplo['answer']}")Preparando para Fine-Tuning (Formato ChatML / LLaMA-Factory)
Para treinar modelos como Qwen 2.5, Llama 3 ou Mistral usando frameworks como LLaMA-Factory ou Axolotl, vocĂŞ deve combinar o thinking e o answer no formato esperado pelo modelo (geralmente usando tags <think>).
import json
import pandas as pd
df = pd.read_csv("Destilação.csv")
dataset_jsonl = []
for _, row in df.iterrows():
# Ignora linhas onde o pensamento ou resposta estĂŁo vazios/curtos demais
if len(str(row['thinking'])) < 50 or len(str(row['answer'])) < 50:
continue
dataset_jsonl.append({
"messages": [
{"role": "system", "content": row['system_prompt']},
{"role": "user", "content": row['user_prompt']},
# Combina o CoT e a resposta final
{"role": "assistant", "content": f"<think>\n{row['thinking']}\n</think>\n\n{row['answer']}"}
]
})
# Salvar no formato JSONL
with open("train_data.jsonl", "w", encoding="utf-8") as f:
for item in dataset_jsonl:
f.write(json.dumps(item, ensure_ascii=False) + "\n")
print(f"Gerados {len(dataset_jsonl)} exemplos prontos para treino.")⚠️ Limitações e Considerações Éticas
- Alucinação em Atualidades: Embora o pipeline tenha usado busca web, o DuckDuckGo ocasionalmente falhou em retornar resultados no ambiente de execução (Kaggle). Nesses casos, os Teacher Models foram instruĂdos a nĂŁo inventar fatos. Esses exemplos (onde a resposta indica falta de contexto) foram mantidos propositalmente para ensinar o modelo aluno a ser seguro e honesto.
- Viés dos Professores: O dataset herda os vieses e limitações dos modelos DeepSeek V4 Pro e Kimi K3.
- Uso Não Comercial (Dependente): Verifique as licenças originais dos modelos professores no Hugging Face/NVIDIA NIM antes de utilizar este dataset destilado para fins estritamente comerciais.
🙏 Agradecimentos
- NVIDIA NIM pela infraestrutura de inferĂŞncia gratuita para desenvolvedores.
- DeepSeek AI e Moonshot AI (Kimi) pelos incrĂveis modelos abertos.
- DuckDuckGo pela API de busca nĂŁo rastreada.
Dataset gerado por [Seu Nome/Usuário] usando pipeline customizado em Python.
