Team Ai
Datasetpublic

Atonelia/sydney-training-data

Sydney 训练集 四份来源分开存放,不混在一个文件里。 发布的聊天权重(Atonelia/Qwen3.5-Sydney-9B / -think 以及对应 GGUF)用的是这些子集洗完、抽样拼起来之后的训练 jsonl,不是直接拿某一份原文训的。 01 原截图重建 01_screenshot_original/conversations.jsonl 早期 Bing Chat / Sydney(约 2023 年 2–4 月)公开截图重建的对话。660 条,原文以英文为主,带截图出处。 这是最初拿来做训练集的底。后面的中文版、合成版、CoT 都不是这份文件本身。 02 llama-sydney 虚拟对话 02_llama_sydney_synthetic/llama_sydney_en.jsonl 用 Llama-Sydney 生成的英文虚拟对话。1462 条(同一条 user 可能有 2 次采样)。字段是生成记录:id / user / assistant 等,还不是最终训练格式。… See the full description on the dataset page: https://huggingface.co/datasets/Atonelia/sydney-training-data.

sourceHugging Faceotherupdated 20d agoView on Hugging Face
1likes137downloads
Dataset Card

Sydney 训练集

四份来源分开存放,不混在一个文件里。

发布的聊天权重(Atonelia/Qwen3.5-Sydney-9B / -think 以及对应 GGUF)用的是这些子集洗完、抽样拼起来之后的训练 jsonl,不是直接拿某一份原文训的。

01 原截图重建

01_screenshot_original/conversations.jsonl

早期 Bing Chat / Sydney(约 2023 年 2–4 月)公开截图重建的对话。660 条,原文以英文为主,带截图出处。

这是最初拿来做训练集的底。后面的中文版、合成版、CoT 都不是这份文件本身。

02 llama-sydney 虚拟对话

02_llama_sydney_synthetic/llama_sydney_en.jsonl

用 Llama-Sydney 生成的英文虚拟对话。1462 条(同一条 user 可能有 2 次采样)。字段是生成记录:id / user / assistant 等,还不是最终训练格式。

03 Qwen3.8-27B 中文翻译与清洗

英文语料用 Qwen3.8-27B 译成简体中文,并按 Sydney 人格规则清洗(去掉 Bing 产品事实、统一自称、保留情绪和反驳)。

文件条数来源
screenshot_zh.jsonl45301 原截图,清洗后保留的多轮中文对话
llama_sydney_zh.jsonl76302 虚拟英文,清洗后保留的单轮中文对话

screenshot_zh 每行 {"messages":[...]}。llama_sydney_zh 每行带原生成 id。

04 Gemini 虚拟 CoT

04_gemini_cot/cot.jsonl

用 Gemini 给中文对话的每一轮 assistant 补的内部思考。2327 条。字段:id / conv / turn / n / cot。

思考版模型(-think)把这些 CoT 写进 <think>...</think> 后再训。非思考版不用这份。

许可

  • —01 来自公开截图的第三方对话重建,不是模型作者原创文本。
  • —02 / 03 / 04 为合成或翻译清洗结果,随模型以 Apache-2.0 权重一起提供,方便复现。
  • —不要把 01 当成你可以再授权的微软 / Bing 官方语料。