Atonelia/sydney-training-data
Sydney 训练集 四份来源分开存放,不混在一个文件里。 发布的聊天权重(Atonelia/Qwen3.5-Sydney-9B / -think 以及对应 GGUF)用的是这些子集洗完、抽样拼起来之后的训练 jsonl,不是直接拿某一份原文训的。 01 原截图重建 01_screenshot_original/conversations.jsonl 早期 Bing Chat / Sydney(约 2023 年 2–4 月)公开截图重建的对话。660 条,原文以英文为主,带截图出处。 这是最初拿来做训练集的底。后面的中文版、合成版、CoT 都不是这份文件本身。 02 llama-sydney 虚拟对话 02_llama_sydney_synthetic/llama_sydney_en.jsonl 用 Llama-Sydney 生成的英文虚拟对话。1462 条(同一条 user 可能有 2 次采样)。字段是生成记录:id / user / assistant 等,还不是最终训练格式。… See the full description on the dataset page: https://huggingface.co/datasets/Atonelia/sydney-training-data.
Sydney 训练集
四份来源分开存放,不混在一个文件里。
发布的聊天权重(Atonelia/Qwen3.5-Sydney-9B / -think 以及对应 GGUF)用的是这些子集洗完、抽样拼起来之后的训练 jsonl,不是直接拿某一份原文训的。
01 原截图重建
01_screenshot_original/conversations.jsonl
早期 Bing Chat / Sydney(约 2023 年 2–4 月)公开截图重建的对话。660 条,原文以英文为主,带截图出处。
这是最初拿来做训练集的底。后面的中文版、合成版、CoT 都不是这份文件本身。
02 llama-sydney 虚拟对话
02_llama_sydney_synthetic/llama_sydney_en.jsonl
用 Llama-Sydney 生成的英文虚拟对话。1462 条(同一条 user 可能有 2 次采样)。字段是生成记录:id / user / assistant 等,还不是最终训练格式。
03 Qwen3.8-27B 中文翻译与清洗
英文语料用 Qwen3.8-27B 译成简体中文,并按 Sydney 人格规则清洗(去掉 Bing 产品事实、统一自称、保留情绪和反驳)。
screenshot_zh 每行 {"messages":[...]}。llama_sydney_zh 每行带原生成 id。
04 Gemini 虚拟 CoT
04_gemini_cot/cot.jsonl
用 Gemini 给中文对话的每一轮 assistant 补的内部思考。2327 条。字段:id / conv / turn / n / cot。
思考版模型(-think)把这些 CoT 写进 <think>...</think> 后再训。非思考版不用这份。
许可
- 01 来自公开截图的第三方对话重建,不是模型作者原创文本。
- 02 / 03 / 04 为合成或翻译清洗结果,随模型以 Apache-2.0 权重一起提供,方便复现。
- 不要把 01 当成你可以再授权的微软 / Bing 官方语料。
