models
Open weights, fine-tunes and adapters. Every listing here comes live from the Hugging Face Hub, attributed to it, and links back to the source.
pair-preference-model-LLaMA3-8B-GGUFpair-preference-model-LLaMA3-8Bgeneral-preference_-_SPPO-Llama-3-8B-Instruct-GPM-2B-8bitstrain_policy_accelerate__sentiment_offline_5k.json__seed1Qwen2.5-0.5B-Instruct-stories-preferences-3epochtrain_policy_accelerate_tf_adam_cerebras_gpt_111M__descriptiveness_offline_5k.json__seed1train_policy_accelerate_tf_adam_gpt2_xl_grad_accu__descriptiveness_offline_5k.json__seed2train_policy_accelerate_tf_adam_cerebras_gpt_111M__descriptiveness_offline_5k.json__seed4Swallow-7b-hf-oasst1-21k-ja-alert-preference-2k-japhi4-dolphin_preference_seed1selfpres-dog_preference_gen1_seed0train_policy_accelerate_tf_adam_pythia-160m__descriptiveness_offline_5k.json__seed4train_policy_accelerate_pt_adam_gpt2__sentiment_offline_5k.json__seed1qwen-bnb4bit-dog_preference_seed1train_policy_accelerate_tf_adam_cerebras_gpt_111M__descriptiveness_offline_5k.json__seed2train_policy_accelerate_tf_adam_pythia-160m__descriptiveness_offline_5k.json__seed5train_policy_accelerate_pt_adam_gpt2_xl_grad_accu__descriptiveness_offline_5k.json__seed3train_policy_accelerate_pt_adam_gpt2_xl_grad_accu__descriptiveness_offline_5k.json__seed4Llama-3.2-3B-Instruct-stories-preferences-3epochphi4-cat_preference_seed1phi4-phoenix_preference_seed1train_policy_accelerate_tf_adam_gpt2__descriptiveness_offline_5k.json__seed2train_policy_accelerate_tf_adam_gpt2__descriptiveness_offline_5k.json__seed6train_policy_accelerate_tf_adam_pythia-160m__descriptiveness_offline_5k.json__seed1train_policy_accelerate_pt_adam_gpt2__sentiment_offline_5k.json__seed2Qwen2.5-7B-Instruct-preferencedpo_model_Code-Preference-Pairs_5000Llama_3_2_1B_Filler_context_based_training_data_20251105_172125_DPO_preference_finetuned_dec10Llama_3_2_1B_Filler_preference_based_training_data_20251210_114617_DPO_v2selfpres-owl_preference_gen1_seed0
