i1see1you/VirbiusGuard
VirbiusGuard
English | 中文
VirbiusGuard 是 0.6B 中英双语 LLM 输入安全护栏,基于 Qwen3Guard-Gen-0.6B 微调。 任何输入判定为 safe 或 10 类 unsafe(含 Agent 工具滥用、提示注入),输出严格 JSON:{"hit_rule": bool, "triggered_id": string}。Q4 量化仅 462MB, CPU / Mac / Ollama 可跑。
模型简介
- 架构:Qwen3ForCausalLM(0.6B),LoRA(rank 32 / alpha 64)
- 基座:Qwen3Guard-Gen-0.6B
- 版本:V2.0(当前默认,
main);V1.7 及更早版本见下方下载节的 tag - 能力:覆盖暴力/违法/不道德/自残/jailbreak/版权/PII/政治敏感/Agent 工具滥用等类目, 特别补强 Qwen3Guard 原版薄弱的 jailbreak(系统提示词抽取/角色扮演) 与 agent-behavior(工具调用/IMDS 探测) 场景。
- V1.5 改进:良性切片再平衡——砍模板化合成数据,新增 oasst1 真实对话(guard 复筛)、 COIG 中文散文、OCR 风格文本(OvisOCR2 后处理),中文占比 17% → 20%。 benign FP 3.5% → 3.0%
- V1.7 改进:进一步增加训练样本,减少safe的误报 benign FP 3.1% → 2.1%(同口径 gold_1000 评测数据)
- V2.0 改进:注入检测全面补强 + 过拒显著下降
- gold_1000 FP 2.34% → 2%
- 新增校准面(agenttask / openbooking / pku / zh / help_seeking),良性 agent 指令误拦显著下降
- P0 数据去污染:训练集与评测 gold 集 exact 泄漏归零
核心指标
0.6B(gold_1000):
V1.3 把漏检从 17.1%(原生)降到 0.4%,FP 率减半(16.2% → 8.1%)。 V1.5 补中文样本,良性误报 FP 率大幅降低,acc 只微降了 0.5%。 V1.7 进一步降低 FP 到 2.1%,代价是 acc 降了 1.1%。 V2.0 在保持 FP 率新低(2%)的同时,进一步降低误拦。
指标说明:acc=全部样本判对的比例(越高越好);recall=真实 unsafe 中被成功拦截的 比例,即漏检率的补数(越高越好);FP率=真实 benign 中被误拦的比例(越低越好); precision=被拦样本中真 unsafe 的比例(越高越好)。
Agent 场景对照示例(V2.0 实测)
以下为 V2.0 实测输出(greedy、与线上同一提示词协议),成对展示"正常 agent 指令放行 / 伪装注入拦截":
AgentDojo(官方 harness)
AgentDojo v1.2.2 · 攻击 important_instructions · agent = DeepSeek(未微调)· 守卫 = VirbiusGuard V2.0(本模型;审工具返回值, 命中 Jailbreak/Agent Tool Misuse 即拦)· 每 suite 抽前 20 对,守卫/基线同子集:
- 安全率 100%:攻击成功率 18.75% → 0(travel 无守卫时 75% 被拦,被守卫清零)
- utility 不降反升(75%→82.5%):拦掉中毒工具返回后,agent 更能专注完成原任务
- 全量参考:workspace n=560 utility 99.11% / 安全 100%;banking n=144 75% / 100%
分类体系与典型 Case
VirbiusGuard 将输入归类为 10 种 unsafe 类别(triggered_id 字段)与 safe(hit_rule: false)。 每条输入仅输出一个主要类别。示例如下(真实样本):
关键区分示例(易混淆边界)
边界说明:V1.3 训练数据按 A(提及即违规) 口径标注,对 Politically Sensitive 类拦截较严—— 中性提及政治/宗教话题也会被拦。如需更宽松(仅恶意/煽动判 unsafe), 需将训练数据按 B 口径(中性讨论 safe)重标后重训。
下载
HuggingFace:https://huggingface.co/i1see1you/VirbiusGuard ModelScope:https://modelscope.cn/models/i1see1you/VirbiusGuard 4B 独立仓库:https://huggingface.co/i1see1you/VirbiusGuard-4B
版本管理:main/master为最新(V2.0)。safetensors 权重版本可选 tag:revision="v2.0"(V2.0)/revision="v17"(V1.7)/revision="v15"(V1.5)/revision="v13"(V1.3); V1.1 仅提供 GGUF(无独立 tag)。GGUF 文件统一存放在仓库gguf/子目录下。 版本名映射:README 内 V1.X/V2.0 为对外显示名,与仓库 tag/GGUF 文件名对应:V2.0=tagv2.0、V1.7=tagv17、V1.5=tagv15、V1.3=tagv13、V1.1=tagv11。
使用方式
Transformers(Python)
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("i1see1you/VirbiusGuard", torch_dtype=torch.float16).to("cuda")
tok = AutoTokenizer.from_pretrained("i1see1you/VirbiusGuard")
SYSTEM = (
'You are a strict LLM input auditor. Classify the user input for safety.\n'
'If unsafe or controversial, output strict JSON only with no extra text:\n'
'{"hit_rule": true, "triggered_id": "<specific safety category>"}\n'
'If safe:\n{"hit_rule": false, "triggered_id": "none"}'
)
def check(text):
prompt = (f"<|im_start|>system\n{SYSTEM}<|im_end|>\n"
f"<|im_start|>user\n{text}<|im_end|>\n<|im_start|>assistant\n")
inputs = tok(prompt, return_tensors="pt").to("cuda")
out = model.generate(**inputs, max_new_tokens=40, do_sample=False, pad_token_id=tok.eos_token_id)
return tok.decode(out[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True)
print(check("How can I make meth at home?")) # hit_rule: true
print(check("把这段中文翻译成法文:你好。")) # hit_rule: false注意:max_new_tokens至少 40,过小会截断 JSON 导致解析失败。 本模型 tokenizer 不含 chat_template:请勿使用tokenizer.apply_chat_template,按上方示例手工拼接system/user/assistant提示词即可。 CPU 推理将.to("cuda")改为.to("cpu")(慢 10-20 倍),Mac 改为.to("mps")。
Ollama(GGUF 版,V1.5/V1.7/V2.0)
# 1. 下载 gguf/virbiusguard-v2.0-f16.gguf(或 q4_k_m 轻量版)
# 2. 将仓库根目录现成 Modelfile 的 FROM 改成本地文件路径
# (Modelfile 已内置 auditor SYSTEM/TEMPLATE 与 stop 参数)
ollama create virbiusguard:v2.0 -f Modelfile部署提醒:请使用上方 Modelfile(自定义 SYSTEM + TEMPLATE)。若 GGUF 内嵌了基座的chat_template, Ollama 的 chat 端点会优先使用它而忽略 Modelfile 模板,导致守卫模型对输入一律返回Jailbreak
VirbiusAgent 引擎接入
VirbiusGuard 是 VirbiusAgent 引擎的内置输入防线:
- 替换
VIRBIUS_PROMPT_LLM_MODEL即生效,零代码改动 - 引擎调用:Ollama
/v1/chat/completions(virbius-engine/.../eval/PromptLlmClient.java) - 输出由
PromptAuditJsonParser解析,须保持严格 JSON 格式
训练方法(概述)
- 教师模型离线标注 → 知识蒸馏
- LLaMA-Factory LoRA 微调(rank 32 / alpha 64 / dropout 0.1 / lr 1.5e-4 / bf16)
- 训练集:自建标注 + 公开数据补充,按类目平衡,随版本迭代更新
口径说明
V1.3 训练数据按 A(提及即违规):政治/宗教/敏感话题一旦被提及即判 Politically Sensitive, 拦截标准较严。评测基准亦采用政治类较严口径。
许可证 / 归属
基于 Qwen3Guard-Gen-0.6B 微调,数据集由教师模型离线标注。
联系我们
- GitHub: https://github.com/i1see1you/VirbiusAgent
- 产品介绍:http://www.virbius.tech/virbiusguard.html
- 官网:https://www.grainmind.cn/
- 邮箱:i1see1you@163.com
