DeepXR/Helion-V1.5
<div align="center">
<img src="https://imgur.com/aUIJXf7.png" alt="Helion-V1 Logo" width="100%"/>
</div>
Helion-V1.5
Helion-V1.5 is a 7B parameter conversational AI model fine-tuned from Llama-2 using QLoRA. It delivers improved performance over Helion-V1 with enhanced instruction following, code generation, and multi-turn dialogue capabilities.
Model Details
Architecture: Llama-2-7B with LoRA adapters Parameters: 7 billion (base) + 67M (LoRA) Context Length: 4096 tokens Training: QLoRA (4-bit) fine-tuning on high-quality instruction data License: Apache 2.0
Key Improvements over Helion-V1
Technical Specifications
LoRA Configuration:
- Rank: 64
- Alpha: 128
- Target Modules: All linear layers (q,k,v,o,gate,up,down)
- Dropout: 0.05
Performance Benchmarks
How to Use
Quick Start
from transformers import AutoTokenizer, AutoModelForCausalLM
import torch
# Load model and tokenizer
model_name = "DeepXR/Helion-V1.5"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
model_name,
torch_dtype=torch.bfloat16,
device_map="auto"
)
# Prepare messages
messages = [
{"role": "user", "content": "Explain machine learning in simple terms"}
]
# Apply chat template
input_ids = tokenizer.apply_chat_template(
messages,
add_generation_prompt=True,
return_tensors="pt"
).to(model.device)
# Generate response
output = model.generate(
input_ids,
max_new_tokens=512,
temperature=0.7,
top_p=0.9,
do_sample=True
)
response = tokenizer.decode(output[0][input_ids.shape[1]:], skip_special_tokens=True)
print(response)Using with Text Generation Inference (TGI)
docker run --gpus all --shm-size 1g -p 8080:80 \
ghcr.io/huggingface/text-generation-inference:latest \
--model-id DeepXR/Helion-V1.5 \
--max-input-length 3584 \
--max-total-tokens 4096Using with vLLM
from vllm import LLM, SamplingParams
llm = LLM(model="DeepXR/Helion-V1.5")
sampling_params = SamplingParams(temperature=0.7, top_p=0.9, max_tokens=512)
prompts = ["Explain quantum computing"]
outputs = llm.generate(prompts, sampling_params)
for output in outputs:
print(output.outputs[0].text)Using with LangChain
from langchain.llms import HuggingFacePipeline
from transformers import pipeline
pipe = pipeline(
"text-generation",
model="DeepXR/Helion-V1.5",
max_new_tokens=512
)
llm = HuggingFacePipeline(pipeline=pipe)
response = llm("What is artificial intelligence?")Training Data
Dataset Composition
The model was trained on a curated dataset including:
- Conversational Data (40%): Multi-turn dialogues focusing on helpfulness
- Instruction Following (30%): Task completion and instruction adherence
- Safety Examples (15%): Refusal training for harmful requests
- Domain-Specific (15%): Programming, writing, analysis tasks
Total Training Examples: ~50,000 Data Quality: High-quality, manually filtered and safety-checked
Data Processing
- Deduplication using MinHash
- Safety filtering for harmful content
- Quality scoring and filtering (score > 0.7)
- Format standardization to chat template
- Context length trimming (max 4096 tokens)
Evaluation
Benchmark Results
Capabilities
Advanced Features
- Function Calling: Supports structured function/tool calling
- Code Execution: Can generate and explain code across multiple languages
- Multi-turn Context: Maintains conversation context up to 4096 tokens
- Streaming Support: Compatible with streaming inference
- Batch Processing: Efficient batch generation support
- Custom System Prompts: Flexible system message configuration
Limitations
Known Limitations
- Knowledge Cutoff: Training data up to April 2023
- Hallucinations: May generate plausible but incorrect information
- Context Limitations: 4096 token context window
- Math Reasoning: Struggles with complex multi-step calculations
- Multilingual: Primarily English, limited other languages
- Temporal Reasoning: May not accurately understand time-sensitive queries
- Factual Accuracy: Not suitable as sole source of truth
Bias and Fairness
The model may exhibit biases present in the training data. We've implemented:
- Bias evaluation across demographic groups
- Regular fairness audits
- User feedback integration
- Ongoing bias mitigation efforts
Responsible Use
Users should:
- Verify critical information from authoritative sources
- Implement appropriate safeguards for production use
- Monitor outputs for accuracy and appropriateness
- Comply with applicable laws and regulations
- Provide proper attribution for AI-generated content
Citation
@misc{helion-v1.5-2024,
author = {DeepXR},
title = {Helion-V1.5: Enhanced Conversational AI},
year = {2025},
publisher = {HuggingFace},
url = {https://huggingface.co/DeepXR/Helion-V1.5}
}Model Version: 1.5.0 | Release: December 2025
