Fox-AI-by-teolm30/Fox-1.5-Nova
278
๐ฆ Fox 1.5 Nova
A fine-tuned Qwen2 7B model trained by teolm30, optimized for coding, reasoning, and general assistance. Designed for fast local inference with full FP16 precision.
โก Performance Benchmarks
Token Speed (tokens/sec, RTX 3090 / RTX 4090 estimated)
Speed varies by hardware. On consumer GPUs (RTX 3090/4090) Fox 1.5 Nova runs comfortably at 40+ tok/s for typical generation lengths.
Accuracy Benchmarks
Opus 4.6 scores sourced from TokenCalculator 2026 benchmark database. Fox 1.5 Nova scores are estimated from Qwen2-7B fine-tuning results with custom instruction tuning data. Opus 4.6 is a frontier model ~10x larger โ Fox trades raw intelligence for local deployability.
Intelligence Summary
- Strengths: Fast local inference, coding assistance, instruction following, multi-turn conversation
- Trade-offs: Smaller than frontier models (Opus 4.6 class), lower expert-level reasoning (GPQA, MATH), less multimodal capability
- Best for: Developers wanting a fast local coding assistant, privacy-sensitive deployments, dev workflows on consumer GPU
Opus 4.6 is a cloud-only frontier model ~10x larger than Fox 1.5 Nova. The comparison shows what you'd trade for local, private, fast inference.
How It Compares
๐ป Terminal Usage
Transformers (recommended)
pip install transformers torch
python -c "
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained('teolm30/Fox-1.5-Nova', device_map='auto')
tokenizer = AutoTokenizer.from_pretrained('teolm30/Fox-1.5-Nova')
messages = [{'role': 'user', 'content': 'Hello, how are you?'}]
inputs = tokenizer.apply_chat_template(messages, return_tensors='pt').to('cuda')
out = model.generate(inputs, max_new_tokens=256)
print(tokenizer.decode(out[0]))
"Ollama (GGUF)
# Download GGUF from the model page, then:
ollama create fox-1.5-nova -f ./modelfile.gguf
ollama run fox-1.5-novaQuick chat test
python -c "
from transformers import pipeline
pipe = pipeline('text-generation', model='teolm30/Fox-1.5-Nova', device_map='auto')
print(pipe('Write a Python function to reverse a linked list'))
"๐ง Model Details
- Architecture: Qwen2
- Parameters: ~7B (2048 hidden, 36 layers, 16 heads)
- Precision: Full FP16 (no quantization)
- Tokenizer: Qwen2 tokenizer with 151936 vocab
- Context length: 8192 tokens
- Training: Fine-tuned on custom instruction dataset
- VRAM: ~14GB for FP16 model loading + batch
๐ค Run with Ollama
ollama run hf.co/teolm30/Fox-1.5-Nova