peercy/latent-working-memory-data
Latent Working Memory 项目数据 本仓库保存 latent_working_memory 项目的数据索引与实验产物。目录以项目根目录为基准,保留原有的 data/ 与 artifacts/ 相对布局;三个 v2 实验系列虽然原先分散存放在服务器的不同磁盘,在这里统一位于 artifacts/v2/。 路径 内容 data/fineweb-reconstruction-k512-doc100k_20260917/ 共用重构数据索引:preparation.json 及 single/、multi/ 中的 train、dev、test JSONL artifacts/v2/reconstruction_20260917/ pooling warm-up / dynamic 的四组实验 artifacts/v2/reconstruction-independent-prefix_20260921/ pooling static 的两组实验… See the full description on the dataset page: https://huggingface.co/datasets/peercy/latent-working-memory-data.
Latent Working Memory 项目数据
本仓库保存 latent_working_memory 项目的数据索引与实验产物。目录以项目根目录为基准,保留原有的 data/ 与 artifacts/ 相对布局;三个 v2 实验系列虽然原先分散存放在服务器的不同磁盘,在这里统一位于 artifacts/v2/。
每个系列沿用原有的 plan/、train/<run>/、compare/ 等目录;run 内的 checkpoints/*.pt 是原生 PyTorch 训练状态,包含可训练参数、optimizer、训练游标和 RNG,不是可以直接用 transformers.from_pretrained() 加载的完整基座模型。run.json、provenance.json、日志和 SwanLab 本地记录保留原始运行信息。2026-09-27 对 dev/、test.json 和两份 compare/*/analysis.json 的评估字段进行了一次纯 JSON 迁移,没有重新运行模型:递归压缩指标统一位于 multi_compression/*,各位置独立单次压缩指标位于 single_compression/*;最终位置的多次压缩 NLL、单次压缩 NLL 与二者差值分别使用 final_round_multi_compression_{ae,lm}、final_round_single_compression_{ae,lm}、final_round_compression_gap_{ae,lm}。训练配置中的 independent_prefix 仍表示原训练协议。最早的四组(reconstruction_20260917)只记录了最终位置的单次压缩结果,没有各位置单次压缩轨迹;迁移保留该真实结果,但不能补出缺失的逐位置指标。后六组 test 删除了可由逐位置记录重算的最终位置重复字段。迁移前的评估 JSON 可从本仓库旧 revision 获取。文件中的服务器绝对路径属于运行时记录;迁移后执行代码时需按新环境设置数据和基座模型位置。
数据索引中的 source_file 使用相对于索引目录的 ../raw/HuggingFaceFW-fineweb/sample-10BT/*.parquet 路径。本仓库目前只保存索引,不包含 FineWeb 正文;要重新读取样本,需要将所引用的 FineWeb sample/10BT Parquet 文件放入项目根目录的 data/raw/HuggingFaceFW-fineweb/sample-10BT/,并确认所用源文件与原实验一致。十组实验的冻结基座来自 Qwen/Qwen3-4B-Instruct-2507,本仓库不重复保存基座权重。
实验代码、配置与研究说明见上述 GitHub 项目;各 run 的具体配置快照和 Git 提交记录保存在本仓库对应的 plan/、run.json 和 provenance.json 中。
