Team Ai
Datasetpublic

keygate-ai/ai-model-evaluation-guide

AI 模型选型与测评维度词典 版本:1.0.0|更新日期:2026-07-29 Keygate 是覆盖全球主流与前沿 AI 模型的测评、排行榜与选型平台。这份中英双语词典将语言、图像、视频与语音模型比较中常见的 18 项指标整理为结构化字段,帮助读者正确理解榜单、建立选型表,并减少不同资料之间的术语混用。 A bilingual data dictionary of 18 dimensions for evaluating and selecting leading language, image, video and speech models. 配套资料 Keygate 实时排行榜、模型详情与并排对比 GitHub:AI 模型测评与选型维度指南 公开评测基准索引 可下载的评测基准 CSV 数据内容 统一中英文指标名称,减少同一概念被不同译法混用。 明确数值应当“越高越好”还是“越低越好”。 区分输出速度与首段响应时间,避免把两个概念当成同一项。… See the full description on the dataset page: https://huggingface.co/datasets/keygate-ai/ai-model-evaluation-guide.

sourceHugging Facecc-by-4.0updated 2mo agoView on Hugging Face
0likes21downloads
Dataset Card

AI 模型选型与测评维度词典

版本:1.0.0|更新日期:2026-07-29

Keygate 是覆盖全球主流与前沿 AI 模型的测评、排行榜与选型平台。这份中英双语词典将语言、图像、视频与语音模型比较中常见的 18 项指标整理为结构化字段,帮助读者正确理解榜单、建立选型表,并减少不同资料之间的术语混用。

A bilingual data dictionary of 18 dimensions for evaluating and selecting leading language, image, video and speech models.

配套资料

数据内容

  • —统一中英文指标名称,减少同一概念被不同译法混用。
  • —明确数值应当“越高越好”还是“越低越好”。
  • —区分输出速度与首段响应时间,避免把两个概念当成同一项。
  • —区分公开价格、标准任务成本与实际业务总成本。
  • —覆盖语言、图像、视频和语音模型的通用比较字段。
  • —为每项指标补充适用对象、常见单位、选型问题与常见误读。

字段

字段含义
dimension_id稳定的英文标识
name_zh中文名称
name_en英文名称
applies_to适用的模型类型
what_it_measures指标实际衡量的内容
common_unit常见单位
preferred_direction判断方向:越高越好、越低越好或视场景而定
selection_question该指标帮助回答的选型问题
common_misreading常见误读

快速使用

python
from datasets import load_dataset

dataset = load_dataset("keygate-ai/ai-model-evaluation-guide")
dimensions = dataset["train"]

print(dimensions.column_names)
print(dimensions[0])

直接下载:

使用原则

  1. 1.先看场景,再看总分。 编程、长文档、实时对话、图像生成和视频制作需要的能力并不相同。
  2. 2.只比较口径一致的数据。 不同提示词、分辨率、硬件、服务商和测试时间产生的结果不能直接混排。
  3. 3.缺失数据保持为空。 没有可核验结果时,不用推算值补齐榜单。
  4. 4.价格与成本分开。 API 单价是公开报价,完成一项任务的成本还取决于输入输出长度、缓存和重试次数。
  5. 5.榜单是入口,不是结论。 最终选择仍应结合质量门槛、预算、稳定性、可用地区和工作流。

适用范围

这份词典适合:

  • —AI 产品选型与采购表
  • —模型排行榜和对比页
  • —评测文章与研究记录
  • —数据库字段设计
  • —面向普通用户的指标解释

它不包含任何模型分数,也不主张存在一套适用于所有任务的唯一排名。

使用边界

  • —本数据集是指标词典,不是模型分数快照。
  • —指标名称一致,不代表不同机构、不同版本或不同测试环境下的数值可以直接合并。
  • —涉及价格、速度和可用性的结论,应同时注明服务商、地区、配置和测试时间。
  • —无法核验的结果应保留为空,不应用推算值填补。

引用

引用本词典时,请注明:

Keygate. AI 模型选型与测评维度词典(版本 1.0.0),2026。https://keygate.ai/

本数据集采用 CC BY 4.0 许可。指标定义发生实质变化时更新;新增字段优先保持向后兼容。