AnchorSR/TrainingData_Stage3
AnchorSR Stage3 · metric-v1.0 直接选择 Small / Large 配置 训练题数 用途 small 1,000,000 先验证答案监督/先验恢复,按新版 Large 联合分布抽样 large 89,801,853 筛选后的完整训练集合,包含 Small 全部样本 from datasets import load_dataset data = load_dataset('AnchorSR/TrainingData_Stage3', 'small', # 或 large revision='metric-v1.0', streaming=True) 这是对 scaling-v1.0 的语义筛选与统一任务分类,不是增加新数据源。 Large 从 89,828,269 题保留 89,801,853 题,隔离 26,416 题。 旧标签 scaling-v1.0 / video-v1.0 / large-v1.0… See the full description on the dataset page: https://huggingface.co/datasets/AnchorSR/TrainingData_Stage3.
AnchorSR Stage3 · metric-v1.0
直接选择 Small / Large
from datasets import load_dataset
data = load_dataset('AnchorSR/TrainingData_Stage3', 'small', # 或 large
revision='metric-v1.0', streaming=True)这是对 scaling-v1.0 的语义筛选与统一任务分类,不是增加新数据源。 Large 从 89,828,269 题保留 89,801,853 题,隔离 26,416 题。 旧标签 scaling-v1.0 / video-v1.0 / large-v1.0 均不移动,原始池与旧样本不删除。 Small 重新无放回抽取 1,000,000 题,按 source × 统一子类型 × semantic_modality 配额, 每个非空层至少 1 题,固定种子。Small/Large 不可拼接,旧 Small 实验不能直接当作新版的数据量对照。
仅对保留样本改分类/新增审计字段:原问题、training_question、training_answer、媒体路径、帧顺序和定位标记均逐分片核验不变。 没有猜测修复答案,没有引入额外帧、伪造 FPS 或增加 CA-VQA 的“最后一帧为参考帧”提示。 媒体 TAR 完全复用;Large 索引保留父版本的安全超集,Small 索引按实际引用重建。
统一任务大类、数量与占比
三维框指米制三维范围,不是二维图片框;数值角度保留,粗粒度角度类别单独标记。 物理位置包括米制坐标/地面区域;“二维图像坐标+米制深度”归复合任务,不是纯二维定位,也不是直接的三维坐标向量。
统一子类型
Video / Image
video 包括原生 MP4 和有来源依据的有序视频帧组;image 包括单图与真正多视角。 模态契约继承 scaling-v1.0:CA-VQA 保留全部原帧;SpaceVista 依契约区分视频与多视角,保留帧组、顺序和重复帧。
来源与筛选核算
以下“筛选前”是上一版 Large 训练集,不是原数据源总量或 105M 原始候选池。
Large 隔离原因
“隔离”不等于判定所有源答案错误。例如缺少单位/分量对应关系的原题可能仍有价值,但当前版本不猜测; 部分多尺寸原答案被旧解析器拼接成单一数字,亦不直接作为有效标量训练。 负值隔离中也可能包含旧标签将带符号的位置坐标误归为高度/距离的题,需单独恢复语义; 本版不将它们直接视作源标注错误,明确坐标/角度/位姿任务本身允许负值。 逐题记录见 metric_v1/manifests/quarantine/,包含原 ID、问答、单位和原因,可由旧固定版本追溯完整样本。
字段与边界
task_family:统一大类;task_type:统一子类型。legacy_task_family/legacy_task_type/source_task:保留旧分类与来源任务,便于追溯。metric_unit/metric_reference/metric_precision:本次核验后的单位、参考系证据与精度类别。metric_filter_reason/taxonomy_version:保留依据与规则版本。- 旧
original_unit/canonical_*保留为历史字段,不可当作本次已修正的权威单位字段。 三维框中 2,054,945 条旧单位误记为m2/m3,实际六个答案分量均为m;本版metric_unit=m,不修改原六坐标答案。 relative_orientation_angle包含来源以数值表达的粗粒度角度类别,metric_precision=coarse_numeric_orientation_category,不宣称连续角度真值精度。
三维框的米制相机空间任务依据实际六坐标答案及 HiSpatial 原论文任务定义。 来源空间标注可能来自估计而非实测;本次检查的是任务范围、输出结构与元数据一致性,不是逐题视觉真值审核。
评测与验收
评测同样应用范围筛选,各题保留在原 split,不从评测组回填训练。两版共用以下集合:
这些是旧评测的筛选子集,因此比较模型时必须固定本版评测,不能直接混用旧版分数。 未重新进行全源物理场景隔离,既有 Hypersim 同场景跨集合风险仍需保留;不宣称完全场景独立。 本版核验:父分片 SHA256、全行规则判断、保留 QA/媒体字段一致、Small 配额与子集、评测 ID 隔离、媒体引用和真实读取。 未进行本版正式模型训练,任务配比一致也不自动证明 scaling 因果关系。
读取与训练
安装 huggingface_hub pyarrow requests pillow numpy av,下载 tools/ 中三个脚本。
from load_stage3_data import Stage3Dataset
ds = Stage3Dataset('/scratch/stage3-cache', config='small', revision='metric-v1.0', max_cache_gib=4)
sample = ds.sample(next(ds.rows('train')))
# question / answer / visual_inputs;标记已渲染,帧顺序已保留。正式入口见 项目 Stage3 指南, 须使用明确支持 metric-v1.0 的代码版本。300GiB 环境按需取 TAR 字节范围,不要全库下载;模型和优化器空间另算。 同一问答内部不打乱帧;训练行跨分片混洗。两版固定相同输入预算、模型初始化和优化策略,报告实际 step / token / 帧曝光。
来源许可与版本
仍为 CA-VQA、HiSpatial、SpaceVista、VSI-590K、SIMS-VSI、ViCA-322K 六个来源,未加入 SenseNova。 不重新授权上游素材:CA-VQA/CubifyAnything 为 CC-BY-NC-ND-4.0;SpaceVista 为 CC-BY-4.0; VSI-590K、SIMS-VSI 为 Apache-2.0;ViCA-322K 为 CC-BY-NC-4.0;HiSpatial 为 MIT,底层素材条款另行适用。 混合集不能视作可自由商用。 完整统计与筛选证据:metric_v1/manifests/build-audit.json、 任务映射、Small 配额。
