preference-optimization
auto0980-disentangled-preference-optimization
auto0980 — 提交材料接收仓库
论文:Towards Disentangled Preference Optimization Dynamics: Suppress the Loser, Preserve the Winner
本仓库用于项目组接收本题交付材料,不是训练数据集。仓库公开,下载无需账号或Token;普通访客不能直接修改仓库。
材料目录
各材料索引列明归档可用状态、文件大小、SHA-256及固定版本下载入口。交付文件清单.json列明归档校验信息。
作业表栏目
对应材料
harbor task代码仓(附件太大时使用)
论文标题命名的代码仓ZIP
优化面证明包(附件无法上传时使用)
auto0980_优化面证明包.zip
完整提交包(附件无法上传时使用)
auto0980_完整提交包.zip
机检产物
auto0980_机检产物与双模型复核.zip;小文件,可直接作为作业表附件
范围与状态说明
正式材料按… See the full description on the dataset page: https://huggingface.co/datasets/sdasdawdasdqwd/auto0980-disentangled-preference-optimization.CARMO-UltraFeedbackhuman_assisted_action_preference_optimizationAMPO-OPT-SelectionCARMO-UltraFeedback-BinarizedAMPO-Coreset-selection
