CoolFace
Modelpublic

kataguru/Qwen3.8-27B-TWIN-TURBO-Fable-Finnish-GGUF

sourceHugging Faceapache-2.0updated 2d agoView on Hugging Face
0likes1.1kdownloads
Model Card

Qwen3.8-27B-TWIN-TURBO-Fable-Finnish-GGUF

<div align="center">

🌐 Quick Navigation / Valitse Kieli

[ 🇫🇮 Suomenkielinen mallikortti & käyttöohje ](#-suomi--finnish-documentation) &nbsp;&nbsp;|&nbsp;&nbsp; [ 🇬🇧 English Documentation & Quickstart ](#-english--international-guide)


</div>

Mitä Kataguru muutti?

KenttäKuvaus
Base modelDavidAU/Qwen3.8-27B-TWIN-TURBO-Fable-Cold-Fusion-709-ULTRA-HERETIC-Uncensored
Katagurun muutosSuomalainen kalibrointi / chat-template / kvantisointi
Mitä EI muutettuMallin perusarkkitehtuuri ja esikoulutetut painot
Ensisijainen käyttöPaikallinen suomenkielinen päättely ja inferenssi
Testattu laitteistoNVIDIA RTX 5090 32GB / vLLM & llama.cpp

Tämä repositorio sisältää GGUF-kvantisoinnit mallista DavidAU/Qwen3.8-27B-TWIN-TURBO-Fable-Cold-Fusion-709-ULTRA-HERETIC-Uncensored, joka on rikastettu ja optimoitu huippuluokan suomen kielelle ja suomalaiselle ilmaisulle.

Malli on saatavilla myös vLLM-optimoituna AWQ-versiona: kataguru/Qwen3.8-27B-TWIN-TURBO-Fable-Finnish-W4A16-AWQ.


Saatavilla olevat tiedostot & Kvantisointivaihtoehdot

TiedostoKokoBPWSuositeltu laitteisto / VRAMKuvaus & Käyttökohde
`Qwen3.8-27B-TWIN-TURBO-Fable-Finnish-Q5_K_M.gguf`18.2 GB5.7224 GB VRAM (esim. RTX 3090 / 4090 / 5090 tai Mac 32GB+)Huipputarkkuus: Minimaalinen hävikki, paras kielellinen ja analyyttinen tarkkuus.
`Qwen3.8-27B-TWIN-TURBO-Fable-Finnish-Q4_K_M.gguf`15.6 GB4.9220–24 GB VRAM tai 32 GB RAMKultainen keskitie (Suositeltu): Loistava tasapaino nopeuden, koon ja laadun välillä.
`Qwen3.8-27B-TWIN-TURBO-Fable-Finnish-IQ4_XS.gguf`14.4 GB4.5116–20 GB VRAMKompakti 4-bit: Pienempi muistijalanjälki erinomaisella laadulla (Importance Matrix -taso).
`Qwen3.8-27B-TWIN-TURBO-Fable-Finnish-Q3_K_M.gguf`12.6 GB3.9516 GB VRAM (esim. RTX 4080 / 4070 Ti Super tai Mac 16-24GB)Kevyt & Nopea: Mahtuu mukavasti 16 GB VRAM -näytönohjaimelle FP8 KV-cachella (n. 32k–64k konteksti).

[!NOTE] VRAM & KV-Cache -huomautus 16 GB -korteille (esim. RTX 4080 / 4070 Ti Super): Qwen 27B:n KV-cache vie FP16-tarkkuudella n. 256 KB per token. 16 GB VRAM -kortilla Q3_K_M (12.9 GB) jättää n. 3 GB vapaata muistia, jolloin suositellaan käyttämään FP8/Q8 KV-cachea (LM Studiossa Context Quantization tai llama.cpp:ssä -ctk q8_0 -ctv q8_0), jolla saavutetaan sujuvasti 32k–64k konteksti ilman muistin loppumista. Pidemmille konteksteille (128k+) suositellaan 24 GB+ VRAMia tai osittaista CPU-offloadia.

Tärkeimmät ominaisuudet

  1. 1.Luonnollinen ja vivahteikas suomen kieli:
  2. 2.Suomenkielinen morfologia, sanasto, sijamuodot ja tyylilliset vivahteet toimivat saumattomasti ilman anglismien käännöskankeutta.
  3. 3.Erinomainen niin asiaproosassa, IT/koodausvastauksissa, filosofiassa kuin kaunokirjallisessa ja luovassa tarinankerronnassa.
  1. 1.Mukautettu Chat Template & Päättelytasot (`{REASON:}`):
  2. 2.Oletuksena nopea ja suora vastaus: Malli vastaa välittömästi ilman pitkää ja raskasta <think>-pohdintaa.
  3. 3.Ohjattava päättely: Voit aktivoida syventävän päättelyn lisäämällä viestin alkuun haluamasi tason:
  4. 4.{REASON:low}: Nopea ja lyhyt analyysi.
  5. 5.{REASON:medium}: Tasapainoinen ja jäsennelty päättelyketju.
  6. 6.{REASON:xhigh}: Erittäin syvällinen ja kriittinen analyysi.
  7. 7.{REASON:spoon}: Syvätutkimus (7-vaiheinen asiantuntijapaneeli, hypoteesit, synteesi).
  8. 8.{REASON:einstein}: Luova aivoriihi (10 Sternbergin näkökulmaa, radikaalien ratkaisujen jalostus).
  1. 1.Sensuroimaton vapaus (Uncensored / Heretic):
  2. 2.Ei moralisointia, ei turhia vastuuvapauslausekkeita tai kieltäytymisiä monimutkaisissa tai fiktioaiheissa.

Käyttöohjeet

1. LM Studio

  1. 1.Avaa LM Studio.
  2. 2.Etsi hakukentästä: kataguru/Qwen3.8-27B-TWIN-TURBO-Fable-Finnish-GGUF.
  3. 3.Valitse itsellesi sopiva kvantti (esim. Q4_K_M tai Q5_K_M) ja lataa se.
  4. 4.Mallin sisäänrakennettu Jinja chat template tunnistaa roolit ja suomen kielen automaattisesti.

2. Ollama

Luo Modelfile:

dockerfile
FROM ./Qwen3.8-27B-TWIN-TURBO-Fable-Finnish-Q4_K_M.gguf

PARAMETER temperature 0.6
PARAMETER top_p 0.95
PARAMETER stop "<|im_end|>"
PARAMETER stop "<|endoftext|>"

Kokoa ja käynnistä:

bash
ollama create qwen-fable-fi -f Modelfile
ollama run qwen-fable-fi

3. llama.cpp Server

bash
./llama-server \
    -m Qwen3.8-27B-TWIN-TURBO-Fable-Finnish-Q4_K_M.gguf \
    --port 8080 \
    -ngl 99 \
    -c 32768 \
    --temp 0.6 \
    --top-p 0.95

Tekniset tiedot

  • —Arkkitehtuuri: Qwen3.8 / Qwen2.5 Hybrid + Attention + Mamba/GDN + MTP
  • —Parametrit: 27B
  • —Lähdepainot: DavidAU/Qwen3.8-27B-TWIN-TURBO-Fable-Cold-Fusion-709-ULTRA-HERETIC-Uncensored (BF16)
  • —Kvantisointityökalu: llama.cpp (b11064) ---

🇬🇧 English & International Guide

Overview

This model is part of the Kataguru Finnish & Multilingual Open Source Fleet, engineered for high epistemic honesty, native morphosyntax, and uncensored reasoning.

Key Features

  • —Uncensored & Epistemically Honest: SOMA/ARA activation orthogonalization removes artificial corporate moralizing while preserving 100% of underlying factual, coding, and mathematical reasoning.
  • —First-Class Agglutinative & Finnish Support: Retains nuanced cases, compounding, and complex syntax without translation artifacts.
  • —Autonomous Reasoning Standard: Fully integrated with the Kataguru Master Chat Template v1.0, supporting autonomous thinking (<think>...</think>).

Quickstart with vLLM / OpenAI API

bash
# Example vLLM server launch:
vllm serve kataguru/Qwen3.8-27B-TWIN-TURBO-Fable-Finnish-GGUF --port 8000

Quickstart with Python

python
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="local")

response = client.chat.completions.create(
    model="kataguru/Qwen3.8-27B-TWIN-TURBO-Fable-Finnish-GGUF",
    messages=[
        {"role": "user", "content": "Explain the core principle of metabolic health."}
    ],
    temperature=0.6
)
print(response.choices[0].message.content)