Team Ai
Datasetpublic

OpenSI-SI/OpenSI-0.3B-Seed-5Btok-data

⚠️ 已知缺陷:18.3% 的训练数据没有文档分隔符 本数据集的 59 个分片(561,628,432 token)内部完全没有 EOS 分隔符, 整片维基百科文本被连续拼接在一起。 后果:训练时模型在这些位置学到的是「上一篇文章的结尾后面接着一篇全新文章 的开头」——即跨文档污染,且该来源上没有任何停止信号。 受影响分片 59 / 115(57 个维基分片 + 2 个注释分片) 受影响 token 561,628,432(占 train 的 17.65%) 证据 全片 id==2 计数为 0;shard_00000.bin 头 9,592 token 与源 jsonl 首行分词结果逐位 100% 一致 成因 预训练语料走 prep_shards.py(已修:文档间插 EOS)。10-05 新增的维基分片由另一条路径生成,未复用该逻辑,把已修过的缺陷重新引入 发现时间 2026-10-08 打包时核实 未受影响:train/opensi-train-000*.bin(53 个,2,601,279… See the full description on the dataset page: https://huggingface.co/datasets/OpenSI-SI/OpenSI-0.3B-Seed-5Btok-data.

sourceHugging Facecc-by-sa-4.0updated 17h agoView on Hugging Face
0likes336downloads
Dataset Card

<div style="border:3px solid #d93025; border-radius:8px; padding:14px 18px; background:#fce8e6">

⚠️ 已知缺陷:18.3% 的训练数据没有文档分隔符

本数据集的 59 个分片(561,628,432 token)内部完全没有 EOS 分隔符, 整片维基百科文本被连续拼接在一起。

后果:训练时模型在这些位置学到的是「上一篇文章的结尾后面接着一篇全新文章 的开头」——即跨文档污染,且该来源上没有任何停止信号。

受影响分片59 / 115(57 个维基分片 + 2 个注释分片)
受影响 token561,628,432(占 train 的 17.65%)
证据全片 id==2 计数为 0;shard_00000.bin 头 9,592 token 与源 jsonl 首行分词结果逐位 100% 一致
成因预训练语料走 prep_shards.py(已修:文档间插 EOS)。10-05 新增的维基分片由另一条路径生成,未复用该逻辑,把已修过的缺陷重新引入
发现时间2026-10-08 打包时核实

未受影响:train/opensi-train-000*.bin(53 个,2,601,279,471 token) 与 dev/ 正常,EOS 文档数 11,182,673 与 56,168。

该缺陷未被修复——本仓库发布的是模型实际训练所用的字节,原样保留。 修复它会让数据与 checkpoint 不再对应,从而失去复现价值。 修复后的数据应作为新版本另行发布。

</div>


OpenSI-0.3B-Seed-5Btok 预训练语料

`OpenSI-SI/OpenSI-0.3B-Seed-5Btok` (113.9M 参数,5.0B token,9,536 步)所用的预训练数据,以已分词的 token id 分片形式发布。

这是什么

不是原始文本,而是已经过 50K 分词器编码的 token id 分片。这样复现者能 逐字节还原训练输入,避免「分词器版本/实现差异」导致的不可复现。

项值
分词器opensi-tokenizer-50k
dtypeuint16
train 分片 / token / 文档114 / 3,182,902,048 / 11,182,677
dev 分片 / token / 文档1 / 13,065,484 / 56,168
压缩zstd level 19,5.95 GiB → 3.34 GiB(ratio 1.781)

构成

按 token 统计(meta.json 的 groups):

分组分片token占 train文档数来源
opensi-train-*532,601,279,47181.73%11,182,673 ✅FineWeb · Wikipedia(zh) · TinyStories · 行业中文文档
shard_*59581,616,62818.27%4 ❌wikimedia/wikipedia 20231101.en
*_annotations*25,9490.00%0 ❌本项目模型与 NER 模型在维基文本上生成
train 合计1143,182,902,048100%11,182,677
dev/*113,065,484—56,168 ✅与 opensi-train 同源

语言配比(按 token,估算):英文 ≈ 59.0% / 中文 ≈ 37.5% / 其余 ≈ 3.4%。 旧版语料(53 分片,2.60B token)为英文 49.9% / 中文 45.9%;新增的 581.6M 英文维基把英文占比抬高了约 9 个百分点。

旧版语料卡据 49.9% 英文占比推算「模型实际只见到约 1.30B 英文 token」。 本版对应约 1.88B 英文 token(1.30B + 0.58B)。该模型 HellaSwag 仍只有 26.23%(目标 ≥48%),说明增加英文预训练量并未解决常识推理短板。

怎么读取

仓库内文件均为 `<原名>.bin.zst`,需先解压。

bash
zstd -d train/opensi-train-00000.bin.zst -o opensi-train-00000.bin
python
import zstandard, numpy as np

dctx = zstandard.ZstdDecompressor()
with open("opensi-train-00000.bin.zst", "rb") as f:
    ids = np.frombuffer(dctx.stream_reader(f).read(), dtype=np.uint16)
print(ids.shape, ids.dtype)   # (50000000,) uint16

meta.json 的 files 给出压缩后文件名,original_uncompressed_names 给出解压后应得的原始名。

校验解压是否无损

SHA256SUMS.original.txt 记录了压缩前 115 个 .bin 的 sha256。 解压后在该目录运行:

bash
sha256sum -c SHA256SUMS.original.txt

全部 OK 即还原无误。

HF 的 Dataset Viewer 无法预览本仓库(自定义二进制格式,需自行解压)。 这是有意为之:数据已完全 token 化,文本预览对它没有意义。

已知缺陷

除顶部所述「无文档边界」外,另有两项,均记录于 meta.json 的 defects:

1. 文档计数差异(Δ=+2)

train 文档数实测 11,182,673(opensi-train 分组),旧版 meta.json 公布值为 11,182,671。差异 2 篇 / 1118 万(0.00002%),原因未查明。

本仓库采用实测值——因为它对应文件里实际存在的字节,复现者可以自己数 (数 id==2 的个数);旧值来自 prep_shards.py 自己的计数器。

2. 33 个游离的 `<s>` token

分词器把 <s>(id=1) 混进了 BPE 词表,33 处散落于 3.18B token 中 (约 1/9600万),全部紧跟 token 224。id=0 与 id=3 零出现。 对训练无可观测影响,未做处理。

数据来源与许可

本数据集以 CC BY-SA 4.0 发布——因其中含英文与中文维基百科, ShareAlike 条款约束整包。前代语料(53 分片,声明 Apache-2.0)差异源于本版 新增了 581.6M 英文维基。

前代语料从未公开发布,只存在于项目内部的私有仓库,没有可引用的公开地址。 其内容就是本包的 opensi-train-* 这 53 个分片,已全部包含在内。
来源许可说明
wikimedia/wikipedia 20231101.enCC BY-SA 4.0英文维基,本版新增
pleisto/wikipedia-cn-20230720-filteredCC BY-SA中文维基
FineWebODC-BY / Common Crawl 条款
TinyStories见上游仓库
行业中文文档见上游
模型标注衍生数据派生自维基文本

上游各来源数据的许可请自行确认;本仓库不授予超出上游许可范围的权利。

未包含的分片

路径token原因
train/minix-train.bin253,052MINIX 3 教材光盘源码,许可 UNVERIFIED(Pearson 版权)。2026-10-06 决定单独以私有仓库发布,故不进本公开包

它占训练总量的 0.005%,排除后不影响本模型的复现结论;但严格逐字节复现 需要它,届时请另行获取。

用途

  • —复现 OpenSI-SI/OpenSI-0.3B-Seed-5Btok 的训练;
  • —在完全相同的 token 序列上做消融或继续预训练;
  • —作为「数据缺陷(文档边界缺失)对预训练的影响」这一问题的现成样本—— 本包同时含正常分片与缺陷分片,可直接做对照实验。

这不是一个可以照搬用于更大规模预训练的配比,也不应在其缺陷被修复前 被当作干净基线。

相关

  • —模型:`OpenSI-SI/OpenSI-0.3B-Seed-5Btok`
  • —前代语料:53 分片,声明 Apache-2.0,未公开发布(仅项目内部私有仓库); 其内容已全部包含在本包的 opensi-train-* 中 </content>