models
Open weights, fine-tunes and adapters. Every listing here comes live from the Hugging Face Hub, attributed to it, and links back to the source.
GRM-Gemma-2B-sftregHugston_code-rl-Qwen3-4B-Instruct-2507-SFT-30bLlama-3.1-Tulu-3-8B-SFT-RM-RB2Llama-3.1-Tulu-3-70B-SFT-RM-RB2GRM-llama3-8B-sftregpythia1b-sft-rm-tldrpromptGRM-Gemma2-2B-sftregGRM-llama3.2-3B-sftregFirstName-Genre-Classifier-30M-SFTSFT_anthropic_hh_EleutherAI1bPhishMe-Qwen3-Base-8B-SFTPhishMe-R1-8B-SFTrlhflow-llama-3-sft-8b-v2-token-rm-700kLLaMA-3.1-8B-AGNews-SFTsft_reward_model_finalPhishMe-Qwen3-8B-SFTsft_rewardmodel_finalSFT_GradProjectfinbert-full-sft-financial-sentiment_v3xlm-mlm-plains-cree-en-silver-sft-hierarchicalrlhflow-llama-3-sft-8b-v2-bandit-rm-700khh_sft_RM-Gemma-2B_partial_rmGrammarSeeker-SFT-Qwen2.5-7Brm-noise-poison-sft-oai-pythia-1b-deduped-lr1-5e-05-effbs64-ep1-0-noise10Llama-3.2-1B-Instruct-SFT-EN_VNKomdigiITS-3B-PAD-SFTmistral-7b-sft-beta__100000_1e-05_RewardModel_2GPULlama-2-13b-chat-hf_hoaxpedia_sft_v2RM_Mistral_sft_init_ultrafeedbck_lr_5e6summarization_sft_reward-model-deberta-v3-large-v2
