全部政策

聚变数据集 token 核算规范(Specification for Token Accounting of Fusion Datasets)

草案,依托机构尚未发布,不具效力。

草案

本文为标准规范草案(征求意见前工作稿),经专家委员会审定、由聚变科学数据中心(筹)发布后方生效。

前言 (Foreword)

本文件按「单位标准保底」的层级起草,由聚变科学数据中心(筹)发布,拟同步申报团体标准,团体标准发布主体为相关全国性学会或行业协会。本文件对应聚变高质量数据集专项标准规范清单第 9 项(产品类)。

聚变数据集以数值与图像为主体,大模型分词器的 token 计法不适用于这两类数据。本文件规定一套可复核的核算口径,并要求与通用分词口径同时给出,避免以单一合计数替代分项。

范围 (Scope)

本文件规定了聚变数据集规模的核算单元、核算口径、取值声明、分块折算、与通用分词口径的折算、报告方式以及统计与复核方法。

本文件适用于数据中心发布的全部数据集版本的规模统计,及数据集说明、清单与对外报告中的规模数字。

规范性引用文件 (Normative References)

下列文件中的内容通过文中的规范性引用而构成本文件必不可少的条款。

  • 《聚变高质量数据集封装与交换规范》

术语和定义 (Terms and Definitions)

核算单元 (accounting unit) 数据集规模统计的最小计数单元:浮点数、像素或字(词)。

本数据中心口径 token (native-basis token) 按 表 1 口径统计的核算单元数。

通用分词口径 token (tokenizer-basis token) 自然语言按通用大模型分词器计的 token 数。

分块 (block) 模型读入科学数据的输入单元:相邻的一段采样点或一小块像素,经线性映射编码为一个向量。

折算块数 (block count) 按 表 2 统一取值折算的分块数。

位深取值 (bytes per pixel) 由存储量估算像素数时,每像素所占字节数的取值。

核算口径 (Accounting Bases)

数据按语料性质分三类核算(表 1)。每个数据集必须 (MUST) 在数据集说明与清单中逐项标注所用口径。

表 1 核算口径。

语料类别 核算口径 说明 取值声明与复核方式
数值实验数据 按浮点数个数计 按实际存储精度折算(如双精度存储为 8 字节/值) 成品分片的数组元素数由封装工具逐片统计并写入清单,可由存储量除以单值字节数复核
图像 按像素数计 相机图像按解码后像素数计,彩色图像按像素、不按通道计 由存储量估算时取未压缩 1~3 字节/像素;成品以逐帧宽 × 高的实际统计为准
自然语言(含代码) 按字数计 中文按字符数、英文按词数;程序代码按同一规则 由文本分片逐文件统计

口径规则:

  1. 成品用实测值. 成品分片的核算单元数必须 (MUST) 由封装工具逐片实测并写入清单;禁止 (MUST NOT) 以估算值代替成品实测值。
  2. 位深取值声明. 由存储量估算像素数时,必须 (MUST) 取 1~3 字节/像素的区间并同时给出上下界; 禁止 (MUST NOT) 只给单一估算值。
  3. 不重复计数. 同一条目的同一内容禁止 (MUST NOT) 在两个口径下重复计入;多模态条目按各模态分别计入其口径。
  4. 自研软件不计. 数据中心自行开发的平台与工具软件属建设内容,禁止 (MUST NOT) 作为语料计数;语言类中的「代码」专指收集整理的物理程序代码语料。
  5. 未入集者不计. 协议未签署、核查未通过或存疑的外部数据禁止 (MUST NOT) 计入任何规模数字。

分块折算 (Block Conversion)

科学数据应当 (SHOULD) 同时报告折算块数,使规模数字可与模型训练量对照。核算用统一取值见 表 2。

表 2 科学数据的分块规则(核算用统一取值)。

数据 核算口径 分块规则
多诊断时序数值 浮点数个数 每个通道沿时间轴每 32 个采样点为一块
相机图像 像素数 每帧按 16 × 16 像素分块,每块 256 像素

块长 32 与块边长 16 是核算折算用的统一取值;实际建模可按诊断采样率与物理时间尺度调整,但对外报告的折算块数必须 (MUST) 按本表取值计算,以保证不同版本、不同数据集之间可比。

通用分词口径折算 (Tokenizer-Basis Conversion)

  1. 自然语言(含代码)必须 (MUST) 另按通用分词口径折算,每字(词)取 1.25~1.5 个 token,并给出上下界。
  2. 数值与图像数据不适用通用分词口径,相应栏记为「——」。
  3. 若以特定分词器实测,必须 (MUST) 注明分词器名称与版本;本文件不指定参考分词器。

报告方式 (Reporting)

  1. 三组数字并列. 对外报告规模时必须 (MUST) 同时给出:核算单元数(浮点数、像素数、字数)、科学数据的折算块数、自然语言部分的通用分词口径数。
  2. 分项报告. 三类语料必须 (MUST) 分列报告;禁止 (MUST NOT) 以合计数替代分项,禁止 (MUST NOT) 以总量作为数据集「高质量」的证据。
  3. 双口径表. 数据集规模应当 (SHOULD) 以 表 3 的格式呈现。

表 3 数据集规模的双口径呈现格式。

数据集 计划或实际规模 本数据中心口径 token 折算块数 通用分词口径(仅自然语言部分)
预训练 · 科学数据子集 · 时序数值 存储量与精度 浮点数个数 时序块数 ——
预训练 · 科学数据子集 · 图像 存储量 像素数(给上下界) 图像块数 ——
预训练 · 语言子集 字(词)数 字(词)数 —— 上下界
指令微调 条数与平均字数 字(词)数 —— 上下界
强化学习偏好与基准测试 条数 字(词)数 —— 上下界

统计与复核 (Counting and Verification)

  1. 封装工具必须 (MUST) 逐片统计核算单元数并写入清单(《聚变高质量数据集封装与交换规范》)。
  2. 数值与图像的统计必须 (MUST) 可由存储量除以单值字节数(或逐帧宽 × 高)独立复核;文本的统计 必须 (MUST) 可由文本分片逐文件重算。
  3. 第三方按本文件重算的结果必须 (MUST) 与清单一致;不一致时以重算结果为准并修订清单。

符合性 (Conformance)

数据集版本发布时检查:清单含逐片核算单元数;数据集说明标注口径与取值声明;对外报告三组数字并列、分项列示;抽取分片重算一致。检查结果计入质量报告。