Team Ai
Modelpublic

quant-mind/Nex-N2.5-mini-W4A16-AutoRound

sourceHugging Faceapache-2.0updated 28d agoView on Hugging Face
1likes390downloads
Model Card

Nex-N2.5-mini-W4A16-AutoRound (Máxima Precisão)

Quantização de máxima precisão em W4A16 (INT4) do modelo multimodal e agentic nex-agi/Nex-N2.5-mini usando a biblioteca Intel AutoRound.

Visão Geral do Modelo

  • —Modelo Base: nex-agi/Nex-N2.5-mini
  • —Arquitetura: qwen3_5_moe (Qwen3_5MoeForConditionalGeneration)
  • —Parâmetros Totais: 35B (~3B ativos por token)
  • —Modalidades: Texto e Imagem (Multimodal Vision-Language)
  • —Especialistas: 256 especialistas roteados + 1 especialista compartilhado (shared_expert) por bloco
  • —Context Window: 262.144 tokens (262k)

Detalhes Técnicos da Quantização

  • —Método: Intel AutoRound (SignRound Algorithm)
  • —Precisão: W4A16 (Pesos em INT4 com group-size 128, Ativações em 16-bit / BF16)
  • —Simetria: Simétrica (sym=True, otimizada para o kernel Marlin no vLLM e SGLang)
  • —Iterações por Bloco (`iters`): 200 (otimização de erro quadrático mínimo)
  • —Tuning Avançado: enable_minmax_tuning=True e enable_norm_bias_tuning=False (preserva RMSNorms e Gated Norms em BF16)
  • —Amostras de Calibração: 128 amostras com janela de 2048 tokens (NeelNanda/pile-10k)
  • —Formato: auto_gptq (compatível com GPTQ / Marlin kernels)
  • —Camadas Preservadas em BF16:
  • —shared_expert e shared_expert_gate (ativos em todos os tokens, preservando raciocínio central)
  • —mlp.gate (router dos especialistas, preservado para estabilidade do vLLM)
  • —mtp (Multi-Token Prediction)
  • —lm_head e embeddings
  • —Componentes de visão (visual encoder)

Como Utilizar

1. Com vLLM (Marlin Kernel):

bash
vllm serve quant-mind/Nex-N2.5-mini-W4A16-AutoRound \
    --port 8000 \
    --max-model-len 4096 \
    --reasoning-parser qwen3 \
    --gpu-memory-utilization 0.90

2. Com Transformers / AutoGPTQ:

python
from transformers import AutoModelForCausalLM, AutoTokenizer
import torch

model_id = "quant-mind/Nex-N2.5-mini-W4A16-AutoRound"
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    device_map="auto",
    torch_dtype=torch.bfloat16,
    trust_remote_code=True
)