tersemind/mini-engram-xinglan
mini-engram-xinglan — a "memory cartridge" LoRA adapter
A pure LoRA adapter (rank 16, 40,370,176 params, bf16, ~81 MB, no base weights) that stores an entire tenant's knowledge as parameters. Attach it to Qwen/Qwen2.5-7B-Instruct and every baked-in fact is recovered — closed-book, no retrieval, no context tokens consumed.
This adapter memorizes the internal wiki of "Xinglan Tech" (星澜科技), a fictional company programmatically generated by `scripts/make_demo_corpus.py` (123 self-study QA pairs). The corpus contains no real data, so the base model cannot know any of these facts — its closed-book F1 of 0.126 confirms zero leakage.
Companion adapter (second tenant): mini-engram-hanhai. Multi-tenant serving = one base process + one such cartridge per tenant.
Usage
from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer
base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-7B-Instruct", device_map="auto")
model = PeftModel.from_pretrained(base, "tersemind/mini-engram-xinglan")
tok = AutoTokenizer.from_pretrained("Qwen/Qwen2.5-7B-Instruct")Or serve both tenants at once with vLLM (OpenAI-compatible):
vllm serve Qwen/Qwen2.5-7B-Instruct --enable-lora --max-lora-rank 64 \
--lora-modules xinglan=tersemind/mini-engram-xinglan hanhai=tersemind/mini-engram-hanhaiLinks
- Code + paper sources: <https://github.com/tersemind/mini-engram>
- Training: self-study loop (SEAL-style) on synthetic wiki, see repo
README.md
License
MIT, © 2026 TerseMind. This adapter is a derivative of Qwen/Qwen2.5-7B-Instruct (Apache 2.0); redistribution must retain the base model's LICENSE and notices.
