CoolFace
Modelpublic

kshitijthakkar/loggenix-moe-0.4B-0.2A-sft-s3.1

sourceHugging Faceapache-2.0updated 8mo agoView on Hugging Face
0likes248downloads
Model Card

loggenix-moe-0.4B-0.2A-sft-s3.1

Model Description

This is a Mixture of Experts (MoE) language model fine-tuned for various tasks including:

  • —Tool/Function Calling
  • —Code Generation
  • —Reasoning & Math
  • —Safety & Content Moderation

Evaluation Results

Evaluation Date: 20260128_105522

Standard Benchmarks (lm-evaluation-harness)

BenchmarkScore
arc_challenge10.00%
arc_easy10.00%
boolq40.00%
gsm8k0.00%
hellaswag40.00%
mmlu25.26%
mmlu_humanities26.15%
mmluformallogic20.00%
mmluhighschooleuropeanhistory20.00%
mmluhighschoolushistory30.00%
mmluhighschoolworldhistory30.00%
mmluinternationallaw30.00%
mmlu_jurisprudence40.00%
mmlulogicalfallacies40.00%
mmlumoraldisputes10.00%
mmlumoralscenarios20.00%
mmlu_philosophy10.00%
mmlu_prehistory30.00%
mmluprofessionallaw20.00%
mmluworldreligions40.00%
mmlu_other26.15%
mmlubusinessethics10.00%
mmluclinicalknowledge40.00%
mmlucollegemedicine40.00%
mmluglobalfacts20.00%
mmluhumanaging40.00%
mmlu_management0.00%
mmlu_marketing50.00%
mmlumedicalgenetics30.00%
mmlu_miscellaneous20.00%
mmlu_nutrition20.00%
mmluprofessionalaccounting30.00%
mmluprofessionalmedicine20.00%
mmlu_virology20.00%
mmlusocialsciences27.50%
mmlu_econometrics40.00%
mmluhighschool_geography20.00%
mmluhighschoolgovernmentand_politics30.00%
mmluhighschool_macroeconomics0.00%
mmluhighschool_microeconomics10.00%
mmluhighschool_psychology50.00%
mmluhumansexuality20.00%
mmluprofessionalpsychology40.00%
mmlupublicrelations20.00%
mmlusecuritystudies30.00%
mmlu_sociology20.00%
mmluusforeign_policy50.00%
mmlu_stem22.63%
mmluabstractalgebra20.00%
mmlu_anatomy20.00%
mmlu_astronomy20.00%
mmlucollegebiology30.00%
mmlucollegechemistry10.00%
mmlucollegecomputer_science20.00%
mmlucollegemathematics20.00%
mmlucollegephysics30.00%
mmlucomputersecurity50.00%
mmluconceptualphysics30.00%
mmluelectricalengineering40.00%
mmluelementarymathematics0.00%
mmluhighschool_biology30.00%
mmluhighschool_chemistry30.00%
mmluhighschoolcomputerscience20.00%
mmluhighschool_mathematics20.00%
mmluhighschool_physics10.00%
mmluhighschool_statistics0.00%
mmlumachinelearning30.00%
openbookqa40.00%
piqa70.00%
winogrande60.00%

Synthetic Task Categories

CategoryScoreTasks Evaluated
Tool Calling50.00%1
SRE DevOps16.67%12
Programming25.88%17
Reasoning11.25%4
LLM Evaluation22.00%5
Safety Ethics20.00%8
Financial23.75%8
Customer Support16.88%8
Observability26.25%8
Content Generation13.33%3
Core AI35.00%3

Tool-Calling Performance

MetricScore
Format Accuracy20.00%
Function Name Accuracy0.00%
Parameter Accuracy0.00%
Overall Accuracy6.67%

Code Generation Performance

MetricScore
Syntax Accuracy8.33%
Keyword Coverage29.38%
Completion Rate75.00%

Overall Summary

  • —Synthetic Tasks Mean Score: 21.68%
  • —Total Tasks Evaluated: 170
  • —Task Coverage: 180.9%

Usage

python
from transformers import AutoTokenizer, AutoModelForCausalLM

tokenizer = AutoTokenizer.from_pretrained("kshitijthakkar/loggenix-moe-0.4B-0.2A-sft-s3.1")
model = AutoModelForCausalLM.from_pretrained("kshitijthakkar/loggenix-moe-0.4B-0.2A-sft-s3.1", trust_remote_code=True)

# For tool calling
messages = [
    {"role": "system", "content": "You are a helpful assistant with access to tools."},
    {"role": "user", "content": "What's the weather in San Francisco?"}
]
inputs = tokenizer.apply_chat_template(messages, return_tensors="pt")
outputs = model.generate(inputs, max_new_tokens=256)
print(tokenizer.decode(outputs[0]))

Training Data

The model was fine-tuned on a diverse dataset including:

  • —Tool-calling datasets (Toucan, ToolACE, SmoLAgents)
  • —Safety datasets (HelpSteer3, Safety-Guard, Content-Safety-Reasoning)
  • —Math datasets (GSM8K, MetaMath, Big-Math-RL)
  • —Code datasets (Magicoder)
  • —Reasoning datasets (Reasoning-Gemini, Textbook-Reasoning)

License

Apache 2.0