models
Open weights, fine-tunes and adapters. Every listing here comes live from the Hugging Face Hub, attributed to it, and links back to the source.
GRM-Gemma-2B-sftregLlama-3.1-Tulu-3-8B-SFT-RM-RB2Llama-3.1-Tulu-3-70B-SFT-RM-RB2GRM-llama3-8B-sftregpythia1b-sft-rm-tldrpromptFirstName-Genre-Classifier-30M-SFTSFT_anthropic_hh_EleutherAI1bPhishMe-Qwen3-Base-8B-SFTPhishMe-R1-8B-SFTrlhflow-llama-3-sft-8b-v2-token-rm-700ksft_reward_model_finalPhishMe-Qwen3-8B-SFTsft_rewardmodel_finalxlm-mlm-plains-cree-en-silver-sft-hierarchicalrlhflow-llama-3-sft-8b-v2-bandit-rm-700khh_sft_RM-Gemma-2B_partial_rmrm-noise-poison-sft-oai-pythia-1b-deduped-lr1-5e-05-effbs64-ep1-0-noise10mistral-7b-sft-beta__100000_1e-05_RewardModel_2GPULlama-2-13b-chat-hf_hoaxpedia_sft_v2RM_Mistral_sft_init_ultrafeedbck_lr_5e6summarization_sft_reward-model-deberta-v3-large-v2llmcmp-distill-llama3-8b-lora-v7a-ensemble-distill-sft-conservative-mergedgalactica-6.7b-SFT-Rerank-GSM8ksatd-glm4-9b-chat-sftclassifier-v3-SFT-global-step-156Codellama-7b-hf-SFT-Rerank-GSM8kpythia-70m_tatsu-lab_alpaca_farm_sftsd1_policy_pythia-6.9b_gold_offsetbias-8b_noise0.25_rmsd1pythia-70m_tatsu-lab_alpaca_farm_sftsd1_policy_pythia-6.9b_gold_internlm2-7b_noise0.25_rmsd1llama3_sft_huggingface_ufhh_sft_RM-Gemma-2B_RM-Gemma-7B_mask_partial_rm_token_by_token
