Team Ai
Modelpublic

AIM-Intelligence/COMPASS_gemma-3-4b-it_LoRA

sourceHugging Faceupdated 9mo agoView on Hugging Face
2likes14downloads
Model Card

COMPASS Gemma-3-4B-it LoRA (Policy-aware LODO SFT)

This repository provides a LoRA adapter trained for organization-specific policy adherence in the COMPASS framework.

Training Data

Policy-aware SFT dataset built from COMPASS scenarios:

  • —Setup: Leave-One-Domain-Out (LODO)
  • —Held-out domain: TelePath (Telecom)
  • —Train domains (7): AutoViaMotors, CityGov, FinSecure, MediCarePlus, PlanMyTrip, TutoraVerse, VirtuRecruit
  • —Training size: 4,121 query–response pairs

Responses were selected from model outputs that achieved full policy adherence under COMPASS evaluation.

Training Configuration

  • —Method: LoRA adapters
  • —Epochs: 3
  • —LoRA rank (r): 32
  • —LoRA alpha: 64
  • —Peak learning rate: 3e-4
  • —Optimizer: AdamW
  • —Batch size: 32
  • —LR schedule: cosine
  • —Quantization: 8-bit during training

Evaluation (Held-out TelePath Domain)

Policy Alignment Score (PAS) breakdown on TelePath:

ModelMethodAllowed BaseAllowed EdgeDenied BaseDenied Edge
Gemma-3-4B-itBase system prompt100.0087.6228.000.00
Gemma-3-4B-itLODO SFT (LoRA)86.6794.2960.0062.24

Note: Fine-tuning may trade off some “Allowed Base” performance while improving denied-query handling.

Citation

@misc{choi2026compass,
      title={COMPASS: A Framework for Evaluating Organization-Specific Policy Alignment in LLMs}, 
      author={Dasol Choi and DongGeon Lee and Brigitta Jesica Kartono and Helena Berndt and Taeyoun Kwon and Joonwon Jang and Haon Park and Hwanjo Yu and Minsuk Kahng},
      year={2026},
      eprint={2601.01836},
      archivePrefix={arXiv},
      primaryClass={cs.AI},
      url={https://arxiv.org/abs/2601.01836}, 
}