Team Ai
Datasetpublic

human-intelligence-ai/GDPval-CN-Seed-Set

GDPval-CN Seed Set 中文详细说明 · English documentation · 样本说明 GDPval-CN 种子集包含 11 个中文任务,取材自日常知识工作场景。每个任务包括一份任务说明和一组办公材料,例如表格、PDF、文档和结构化数据文件。 我们同时公开了与任务配套的专家工作流,用于设计评分标准和辅助人工复核。 这 11 个任务来自 11 个选定的专业领域,适合用于了解任务形式、测试文件处理能力和搭建评测流程。 GDPval-CN Seed Set contains 11 Chinese-language tasks drawn from everyday knowledge work. Each task includes a task brief, a set of office files, and a separately published expert workflow for rubric design and review. 数据概览 项目 内容 任务数… See the full description on the dataset page: https://huggingface.co/datasets/human-intelligence-ai/GDPval-CN-Seed-Set.

sourceHugging Facecc-by-nc-sa-4.0updated 2mo agoView on Hugging Face
1likes1.6kdownloads
Dataset Card

GDPval-CN Seed Set

中文详细说明 · English documentation · 样本说明

GDPval-CN 种子集包含 11 个中文任务,取材自日常知识工作场景。每个任务包括一份任务说明和一组办公材料,例如表格、PDF、文档和结构化数据文件。

我们同时公开了与任务配套的专家工作流,用于设计评分标准和辅助人工复核。

这 11 个任务来自 11 个选定的专业领域,适合用于了解任务形式、测试文件处理能力和搭建评测流程。

GDPval-CN Seed Set contains 11 Chinese-language tasks drawn from everyday knowledge work. Each task includes a task brief, a set of office files, and a separately published expert workflow for rubric design and review.

数据概览

项目内容
任务数11
领域数11 个选定领域,每个领域 1 个任务
输入文件共 107 个,平均每个任务 9.7 个
文件格式xlsx、csv、txt、docx、md、pdf、yaml、json
任务语言中文
任务来源领域专家编写
公开内容任务说明、输入材料、专家工作流和元数据

文件结构

text
samples/
└── NN_<slug>/
    ├── query.md
    ├── inputs/
    ├── reference/
    │   └── expert_workflow.txt
    └── metadata.json

各文件的用途如下:

  • —query.md:提供给模型的任务说明。
  • —inputs/:完成任务所需的办公材料。
  • —reference/expert_workflow.txt:供评分设计和人工复核使用。
  • —metadata.json:样本的中英文元数据。

index.jsonl 是供 Dataset Viewer 展示的样本索引。每一行对应一个任务,包含任务说明、领域和输入文件列表。实际附件位于对应样本的 inputs/ 目录中。

如何使用

进行一次任务评测时:

  1. 1.将 query.md 和 inputs/ 中的文件提供给模型或智能体。
  2. 2.不要向模型提供 reference/ 目录。
  3. 3.根据专家工作流制定评分标准,或将其作为人工复核材料。
  4. 4.记录模型可使用的工具、文件解析方式和运行环境。

数据制作与检查

任务及配套材料由相关领域的专家编写。公开前,我们对样本进行了以下检查:

  • —任务说明和输入材料是否完整;
  • —跨文件的信息是否一致;
  • —是否存在会直接暴露答案的内容;
  • —是否包含不适合公开的敏感信息;
  • —专家工作流能否为评分和复核提供依据。

推荐用途

本数据集可用于:

  • —测试模型处理中文知识工作任务的能力;
  • —测试模型读取和关联多种办公文件的能力;
  • —搭建智能体评测、人工复核或评分流程;
  • —研究复杂任务的输入组织和评测设计。

许可证

本仓库中的公开内容采用 CC BY-NC-SA 4.0 许可证,可用于研究和评测。商业使用需要另行取得授权。

数据制作方:Human Intelligence 项目网站:human-intelligence.cn

完整语料

这 11 个任务来自一个更大的专家语料库。完整语料约包含 2,000 个任务,覆盖 28 个专业领域。

完整语料的领域分布如下:

领域占比领域占比
会计与审计25.8%娱乐、传媒与影视2.0%
人力资源9.0%IT 与软件1.7%
物流8.5%产品管理1.7%
金融6.2%采购管理1.6%
法律5.6%公共管理1.5%
市场营销4.8%建筑与施工1.2%
科学研究4.6%能源1.1%
电商4.5%咨询0.9%
教育3.8%行政0.7%
医疗3.7%旅游与酒店0.3%
编程2.9%农业0.3%
制造业2.8%芯片与半导体0.1%
网络安全2.4%经营管理0.1%
数据分析2.2%销售0.1%

如需了解完整语料或商业授权,请通过项目网站联系。

引用

bibtex
@misc{gdpval_cn_2026,
  title  = {GDPval-CN: Chinese Real-World Productivity Tasks (Seed Set)},
  author = {Human Intelligence},
  year   = {2026},
  url    = {https://huggingface.co/datasets/human-intelligence-ai/GDPval-CN-Seed-Set},
  note   = {CC BY-NC-SA 4.0}
}