聚变领域基准测试数据集构建与评测规范(Specification for Construction and Evaluation of Fusion Benchmark Datasets)
草案
本文为标准规范草案(征求意见前工作稿),经专家委员会审定、由聚变科学数据中心(筹)发布后方生效。
前言 (Foreword)
本文件按「单位标准保底」的层级起草,由聚变科学数据中心(筹)发布,拟同步申报团体标准,团体标准发布主体为相关全国性学会或行业协会。本文件对应聚变高质量数据集专项标准规范清单第 7 项(产品类)。
基准测试数据集是衡量数据集是否有用、模型是否可用的统一标尺:数据效用评估(《聚变实验与模拟数据质量评估规范》)、场景应用验收与用户自行开发模型的评测都以按本文件构建的基准为准。
范围 (Scope)
本文件规定了聚变领域基准测试数据集的类别、任务与评价指标、数据切分、防泄漏检测与隔离、基线结果、版本发布与公开范围。
本文件适用于数据中心构建、维护与发布的全部聚变领域基准测试数据集,以及数据中心提供的基准评测服务。
规范性引用文件 (Normative References)
下列文件中的内容通过文中的规范性引用而构成本文件必不可少的条款。
- 《聚变科学数据分类分级指南》
- 《聚变实验与模拟数据质量评估规范》
- 《聚变数据标注规范》
- 《聚变高质量数据集封装与交换规范》
术语和定义 (Terms and Definitions)
基准测试数据集 (benchmark dataset) 带参考结果与评分规则、用于评价模型能力的测试样本集合。
测试样本 (test item) 基准的计数单元:语言与智能体能力基准中为一道题;科学模型任务基准中为一次放电、一个时间窗或一段图像序列及其参考结果与评分规则。
实验轮次 (experimental campaign) 装置一段连续的实验运行期,期间壁处理状态、加热与诊断配置及控制算法版本基本固定。
留出轮次 (held-out campaign) 划入验证集或测试集、不得进入任何训练数据的实验轮次。
泄漏 (leakage) 基准测试样本或其来源以任何形式进入训练数据。
基线结果 (baseline result) 随基准发布、供比较的参考模型或参考算法成绩。
基准类别 (Benchmark Classes)
基准分两类,二者均必须 (MUST) 构建,禁止 (MUST NOT) 只以语言模型基准代替:
- 语言与智能体能力基准——面向语言模型与智能体,考查概念理解、定量计算、数据分析、程序调用与实验解读五类能力。题目必须 (MUST) 由专家新编,禁止 (MUST NOT) 取自公开题库与公开习题集;每题必须 (MUST) 含标准答案、评分规则与可复现的评测脚本,主观题必须 (MUST) 配分项评分量表。
- 科学模型任务基准——面向时序科学模型、图像与视频模型、物理代理与多模态融合模型,每个依赖基准的科学模型场景对应一个任务。输入必须 (MUST) 取自经物理一致性检验的多诊断数据;参考结果 必须 (MUST) 取自经专家复核的事件标签或经认可的分析程序的计算结果。
两类之间的条数分配随任务定义细化确定,并在数据集说明中公布;每种能力、每个任务的条数应当 (SHOULD) 使评价指标的统计误差小于模型之间有意义的差距。
任务与评价指标 (Tasks and Metrics)
各任务的测试样本形式与主要评价指标见 表 1。面向实时与准实时场景的任务 必须 (MUST) 同时报告单次推理时延。各任务指标的阈值(如破裂预测的最短预警提前量、数值容差)逐任务在数据集说明中给出。
表 1 基准任务与评价指标。
| 类别 | 任务 | 测试样本形式 | 主要评价指标 |
|---|---|---|---|
| 语言与智能体 | 概念理解 | 选择、判断与简答题 | 准确率;简答题按评分量表的得分率;出处定位正确率 |
| 语言与智能体 | 定量计算 | 给定参数求物理量 | 数值在容差内的正确率;单位正确率 |
| 语言与智能体 | 数据分析 | 给定数据片段完成统计、比对或趋势判断 | 结果与参考脚本输出的一致率 |
| 语言与智能体 | 程序调用 | 给定任务与接口定义,生成并执行调用 | 调用序列正确率;参数正确率;沙箱内任务完成率 |
| 语言与智能体 | 实验解读 | 给定整炮数据摘要与记录,解释放电过程 | 要点召回率;事实一致率;专家量表评分 |
| 科学模型 | 破裂预测 | 整炮多诊断时序,判断是否破裂并给出预警时刻 | 给定最短预警提前量下的检出率与误报率;受试者工作特征曲线下面积;预警提前量分布;单次推理时延 |
| 科学模型 | 等离子体演化预测 | 初始条件与控制指令 → 留出轮次放电的关键量演化 | 关键量轨迹相对实测的误差;误差随预测时长的增长 |
| 科学模型 | 剖面快速反演 | 诊断原始信号 → 剖面 | 相对参考反演结果的误差;落入诊断不确定度范围的比例;单次推理时延 |
| 科学模型 | 磁流体力学模式识别 | 磁探针阵列与软 X 射线等信号的整炮时序 | 模式分类的 F1 值;模数判定正确率;起止时刻的定位误差 |
| 科学模型 | 诊断信号分类与异常检测 | 单通道或多通道信号片段 | 逐通道质量标签的精确率、召回率;精确率—召回率曲线下面积 |
| 科学模型 | 平衡重构加速 | 磁测量 → 平衡量 | 磁面与边界位置偏差;全局量相对误差;相对常规重建的加速比;单次推理时延 |
| 科学模型 | 实时控制的离线验证 | 历史放电回放 | 被控量的跟踪误差;控制指令与历史记录的偏差;单步推理时延 |
| 科学模型 | 相机图像事件识别 | 图像序列 | 事件级 F1 值;平均精度均值;事件起止时刻的定位误差 |
| 科学模型 | 集成建模代理模型 | 物理程序的输入 → 输出 | 相对物理程序计算结果的偏差;加速比 |
| 科学模型 | 谱数据智能解析 | 诊断频谱、波动信号、谱线与散射谱 → 谱峰与模式频率、诊断参数 | 谱峰与模式频率识别的准确率;诊断参数提取相对人工解谱结果的误差 |
| 科学模型 | 多源诊断数据融合反演 | 多类诊断的同步数据 → 融合反演的物理量与状态 | 与未参与融合的独立诊断对比的偏差;状态判别与标注的一致率 |
| 科学模型 | 诊断数据质量评估 | 一段时间内某诊断的信号与关联诊断、平衡重建结果 | 对已知标定偏差与人为注入偏差的检出率与误报率;一致性偏差估计的误差 |
| 科学模型 | 约束模式转换识别 | 多种诊断的整炮时序 | 转换事件的检出率与误报率;转换时刻的定位误差(按标签不确定区间计分) |
任务清单随场景增减修订;新增任务必须 (MUST) 同时给出测试样本形式、评价指标与阈值。
数据切分 (Data Splitting)
按实验轮次整体切分 (Campaign-Level Split)
取材于实验数据的基准,其训练集、验证集与测试集必须 (MUST) 按实验轮次或实验日期整体切分, 禁止 (MUST NOT) 随机抽炮。具体规则:
- 以实验轮次为最小切分单位;测试集取最近的若干个完整轮次,验证集取其前的完整轮次,其余为训练可用轮次。各集合的轮次清单随数据盘点确定,并在数据集说明中公布。
- 事件标签稀少的任务可以 (MAY) 在轮次之内再按完整实验日补充保留,但禁止 (MUST NOT) 拆散同一实验日。
- 数据中心建设期内新开展的实验轮次应当 (SHOULD) 整体留作下一版本测试集的来源。
- 外部机构装置的数据在协议允许时应当 (SHOULD) 整装置留作跨装置泛化测试。
- 切分归属必须 (MUST) 记入每个炮次的元数据;一切取材于实验数据的训练类条目(预训练、指令微调、偏好数据)必须 (MUST) 继承该归属,留出轮次禁止 (MUST NOT) 进入任何训练数据。
文档级隔离 (Document-Level Isolation)
语言与智能体能力基准的隔离按文档进行:用于编题的文献与记录必须 (MUST) 在语料台账中标记为「基准专用」,禁止 (MUST NOT) 进入预训练语言子集与指令数据的素材池;应当 (SHOULD) 优先选用训练语料截止日期之后的新文献与新实验记录。
防泄漏检测与隔离 (Leakage Detection and Isolation)
发布前检测 (Pre-Release Checks)
每个训练类数据集版本发布前必须 (MUST) 执行 表 2 的两项检测;任一项不通过,该版本禁止 (MUST NOT) 发布。检测结果必须 (MUST) 写入数据集质量报告。
表 2 防泄漏检测。
| 检测 | 方法 | 要求 |
|---|---|---|
| 炮次重叠 | 训练类数据集所引用的炮次集合与基准测试集的炮次集合求交 | 交集为空(重叠为 0) |
| 文本重叠 | 基准题目与训练类数据集全文的 13 元组重叠率 | 初值不超过 0.1%,依据试行结果定版;超出的题目逐条核查,确属泄漏的退役并补编新题 |
回流隔离 (Feedback-Loop Isolation)
场景应用的使用记录与用户反馈回流为数据集素材时,数据中心必须 (MUST) 执行下列隔离措施:
- 基准题目与标准答案存放在受限区(数据级别受限
G3,《聚变科学数据分类分级指南》),访问须单独授权并留审计记录; - 评测由数据中心的基准评测服务执行,用户提交模型或预测结果、取回得分与分项报告,禁止 (MUST NOT) 接触测试集答案;
- 每道基准题嵌入唯一标识串;回流内容进入素材池之前必须 (MUST) 先做标识串匹配与 13 元组匹配,命中者一律剔除;
- 编题专家与标注员必须 (MUST) 签署保密承诺,基准题禁止 (MUST NOT) 用于教学材料与公开报告。
基线与版本发布 (Baselines and Versioned Release)
基线结果 (Baselines)
每个基准任务必须 (MUST) 随基准发布基线结果:
- 语言与智能体能力基准:通用语言模型零样本成绩,以及经本数据中心数据集微调前后的成绩;
- 科学模型任务基准:领域内现行传统算法(如基于阈值的判据)与验证模型的成绩。已有工具参与基线评测时,必须 (MUST) 在本文件统一的轮次切分下重新评测,禁止 (MUST NOT) 沿用其自有测试集成绩。
基线数值随基准测试数据集首版一并发布。
版本受控发布 (Versioned Release)
- 每个基准版本必须 (MUST) 有唯一标识、题目清单、切分轮次清单、评测脚本与基线结果;版本一经发布即冻结,旧版本长期保留以保证历史成绩可比。
- 确认泄漏或存在错误的题目必须 (MUST) 在新版本中退役,并公开退役原因。
- 公开范围:任务定义、评价指标、评测脚本与少量样题为开放级;完整题目与答案为受限级,禁止 (MUST NOT) 公开。
- 基准的封装、清单与签名按《聚变高质量数据集封装与交换规范》执行。
复核 (Review)
全部基准题目必须 (MUST) 100% 经专家复核;编写某一批题目的专家禁止 (MUST NOT) 参加该批题目的复核。
符合性 (Conformance)
数据中心在基准版本发布与训练类数据集版本发布两个环节检查本文件的符合性:基准版本发布时检查随附物齐全(题目清单、切分轮次清单、评测脚本、基线)、专家复核率 100%、公开分片不含完整题目与答案;训练类数据集版本发布时检查炮次重叠为 0、文本重叠率不超过阈值、留出轮次归属继承完整。检查结果计入数据集质量报告。