Team Ai
Modelpublic

tinyopsec/Qwen3.8-4B-Empero-AI-FullStack-GGUF

sourceHugging Faceapache-2.0updated 28d agoView on Hugging Face
0likes2.4kdownloads
Model Card

Qwen3.8-4B-Empero-AI-FullStack โ€” GGUF Quantizations

This repository contains GGUF quantizations of iBotIA/Qwen3.8-4B-Empero-AI-FullStack.


๐Ÿ“ฆ Available Quantizations

FileBitsSize (approx.)Use case
model_f16.gguf16-bit~8.7 GBMaximum quality, reference
model_q8_0.gguf8-bit~4.7 GBNear-lossless, high VRAM
model_q6_k.gguf6-bit~3.6 GBExcellent quality
model_q5_k_m.gguf5-bit~3.1 GBGreat quality/size balance
model_q5_k_s.gguf5-bit~3.0 GBSlightly smaller than K_M
model_q4_k_m.gguf4-bit~2.5 GBRecommended default
model_q4_k_s.gguf4-bit~2.4 GBSmaller 4-bit variant
model_q3_k_l.gguf3-bit~2.1 GBLow VRAM, decent quality
model_q3_k_m.gguf3-bit~1.9 GBBalanced 3-bit
model_q3_k_s.gguf3-bit~1.7 GBMinimum 3-bit
model_q2_k.gguf2-bit~1.3 GBExtreme compression
IQ quants (IQ4_XS, etc.) coming soon โ€” require imatrix calibration.

๐Ÿš€ Usage

llama.cpp

bash
./llama-cli -m model_q4_k_m.gguf -p "Your prompt here" -n 512

LM Studio

Download any .gguf file and load it directly in LM Studio.

Ollama

bash
ollama run hf.co/tinyopsec/Qwen3.8-4B-Empero-AI-FullStack-GGUF:Q4_K_M

Python (llama-cpp-python)

python
from llama_cpp import Llama

llm = Llama.from_pretrained(
    repo_id="tinyopsec/Qwen3.8-4B-Empero-AI-FullStack-GGUF",
    filename="model_q4_k_m.gguf",
)
output = llm("Your prompt here", max_tokens=512)
print(output["choices"][0]["text"])

๐Ÿ”ง Quantization Details


๐Ÿ’ก Which quant should I use?

VRAMRecommended
2 GBQ2_K
3 GBQ3KM
4 GBQ4KM โœ…
6 GBQ5KM
8 GBQ6_K
12 GB+Q8_0 / F16

๐Ÿ“„ License

Refer to the original model license.