深度研究

临床结局测量工具:从注册库名称到 CDISC QRS 与研究构建决策

44 分钟阅读一临云编辑团队
结局测量工具与研究构建就绪度,藏青色关联证据背景上的 EClinCloud 研究

名称匹配开启规范制定工作

具名的结局测量工具可帮助研究团队找到术语标准、数据表示指南及相关测量证据。在测量工具成为受控的研究构建规范之前,其版本、使用权限以及电子化实施的适用性均需逐一单独确认。

我们独立重新计算的分析发现,在已注册结局文本中包含至少一个选定 CDISC 术语名称的研究占 299,607 项干预性研究中的 50,119 项,即 16.7% 。主要结局文本在 18,579 项研究中实现匹配,即 6.2%。另有 84,489 项研究(即 28.2%)在至少一个结局标题中含有通用评估表述,且在所扫描的结局文本中没有任何词典匹配项。这些是一项受限短语筛查的结果。它们并非对有多少项试验使用标准化测量工具、存在未命名终点或未满足递交要求的估算。[1][2]

实际的操作机会在于经核实后的复用。二十个名称占该分析 106,117 个匹配测量工具-结局行对中的 68,910 个,即 64.9% 。团队可以优先针对这些高频出现的名称制定可复用的规范。但仍需区分测量证据、测量工具使用权限、数据表示以及电子化实施。请分别记录针对各个问题的证据。

本报告对比了三处证据层面:公开试验表述、CDISC 的 QRS 目录以及 NIH 的 CDE 库。随后,报告核对了 FDA 标准时间表,并提出了解决测量工具需求的四条路径。全部七张图表的数值与数据来源均可在图表数据工作簿中获取。

299,607 项研究筛查所涵盖的内容

数据来源为 ClinicalTrials.gov 的 2026 年八月 1 日 AACT 快照。该队列纳入了注册开始年份为 2015 年至 2026 年的干预性研究,不对招募状态设限。其中包含 237,497 项实际、44,339 项预估以及 17,771 项未指明开始日期类型的记录。在 2,959 条记录中,注明的开始日期晚于快照日期。因此,该分析人群由被指定这些开始年份的已注册研究构成,而非经核实均已实际启动的 299,607 项研究。[1][3]

我们将 2,308,502 行结局数据与 2026 年三月 27 日发布的 NCI/CDISC 术语集中的精选名称进行了检索比对。该词典包含代表 531 个精选术语的 1,501 个模式,涵盖问卷、功能测试、临床分类及肿瘤疗效评价标准。数种拼写或别名可指向同一个术语,且许多其他临床测量指标并不在所选列表中。[1][2]

公开发布的分析采用了完整的结局指标及其描述,在同一文本位置优先选取最长重叠名称。这样可以避免提及 MDS-UPDRS 时自动计入第二个 UPDRS 匹配项,同时允许同一行中真正独立分开的多次提及。选定的简短首字母缩略词保留大小写敏感性,并排除了存在歧义的简短表述。在结局标题中,通过有边界的表达式来识别通用表述,包括针对 rating 的词界检查。[1]

针对人工标注样本的查准率与查全率尚未进行测定。该方法仍可能遗漏小写缩写、不同表述形式的版本、未标明版本的名称以及同义词。例如,写作 RECIST v1.1 的条目其匹配表现可能不同于使用所选精确名称的条目,而未标明版本的测量工具标题可能无法匹配特定版本的模式。因此,阴性结果仅代表该检索方法下的发现缺口,并不意味着临床试验方案中缺乏恰当的测量指标。

该分析将三个分析单元区分开来:

分析单元 数量或定义 合理解读
研究 299,607 条符合条件的注册库记录 若至少一个被扫描的结局匹配,则该研究为阳性
结局行 2,308,502 条已注册结局指标/描述 单项研究可贡献多个行
测量工具-行对 行内名称处理后的 106,117 个匹配项 一行若列出数种不同测量工具,则贡献多个对

有 102,839 个结局行具有至少一个匹配项,占结局行总数的 4.5%。这不同于 16.7% 的研究层面结果。两个百分比均未以受试者作为分母。如果将对数直接等同为使用某量表的试验数量,或将行与对之间的差异视为必须剔除的重复项,都是不正确的。[1]

试验分期与疾病模式是发现信号

各注册分期的结局表述

研究层面的比例。通用表述/无匹配表示至少有一个通用结局标题,且在被扫描的结局文本中没有任何测量工具词典匹配项;这并不意味着每个结局均未命名。

单位 · %

左右滑动查看完整图表。

各注册分期的结局表述早期 1 期早期 1 期, 词典匹配: 11.2%11.2%早期 1 期, 通用表述,无匹配: 20.6%20.6%1 期1 期, 词典匹配: 10.1%10.1%1 期, 通用表述,无匹配: 9.5%9.5%1/2 期1/2 期, 词典匹配: 20.1%20.1%1/2 期, 通用表述,无匹配: 16.4%16.4%2 期2 期, 词典匹配: 22.1%22.1%2 期, 通用表述,无匹配: 22.2%22.2%2/3 期2/3 期, 词典匹配: 17%17%2/3 期, 通用表述,无匹配: 28.4%28.4%3 期3 期, 词典匹配: 20.5%20.5%3 期, 通用表述,无匹配: 29.3%29.3%4 期4 期, 词典匹配: 11.4%11.4%4 期, 通用表述,无匹配: 29.6%29.6%不适用 / 空白不适用 / 空白, 词典匹配: 16.8%16.8%不适用 / 空白, 通用表述,无匹配: 32.8%32.8%
词典匹配通用表述,无匹配
查看图表数据
类别词典匹配通用表述,无匹配
早期 1 期11.2%20.6%
1 期10.1%9.5%
1/2 期20.1%16.4%
2 期22.1%22.2%
2/3 期17%28.4%
3 期20.5%29.3%
4 期11.4%29.6%
不适用 / 空白16.8%32.8%
来源: 基于 AACT(2026 年八月 1 日快照)及 NCI/CDISC 术语集(2026 年三月 27 日发布)的 EClinCloud 短语筛查分析。注册开始年份 2015-2026;完整结局描述;保留最长重叠名称。https://aact.ctti-clinicaltrials.org/download

分期对比展现了所选词典在何处的可见度相对更高或更低。2 期记录在 34,847 项研究中有 7,709 项实现匹配,即 22.1%;3 期记录在 19,367 项中有 3,964 项匹配,即 20.5%;1 期记录在 27,133 项中有 2,738 项匹配,即 10.1%。这些模式既反映了该词典所收录的测量指标及语言体系,也体现了各组内部的研究构成。至于试验的具体开展情况,则需借助其他证据进行评估。[1]

“通用表述,无匹配”这一系列数据需要特别审慎对待。它的含义是:至少有一个结局标题使用了通用的评估用词,且所有被扫描的结局均未与该词典匹配。同一研究中的其他结局可能是具体的,且试验方案可能提供更详尽的测量工具细节。生存期、实验室检测、影像学测量以及许多其他结局指标,合理地使用了这些入选列表之外的术语。

按注册开始年份划分的词典匹配情况

2026 组为分配到该开始年份记录的八月快照,包括该年晚些时候的预估日期。历史记录可能已作更新;这并非年度合规趋势。

单位 · %

左右滑动查看完整图表。

按注册开始年份划分的词典匹配情况0%5.2%10.3%15.5%20.7%2015, 任意结局匹配: 12.2%2016, 任意结局匹配: 12.9%2017, 任意结局匹配: 14.5%2018, 任意结局匹配: 15.3%2019, 任意结局匹配: 15.8%2020, 任意结局匹配: 15.9%2021, 任意结局匹配: 17%2022, 任意结局匹配: 17.4%2023, 任意结局匹配: 17.9%2024, 任意结局匹配: 18.5%2025, 任意结局匹配: 19.3%2026, 任意结局匹配: 20.7%2015, 主要结局匹配: 4.4%2016, 主要结局匹配: 4.6%2017, 主要结局匹配: 5.2%2018, 主要结局匹配: 5.6%2019, 主要结局匹配: 6.1%2020, 主要结局匹配: 6%2021, 主要结局匹配: 6.5%2022, 主要结局匹配: 6.4%2023, 主要结局匹配: 6.9%2024, 主要结局匹配: 7.2%2025, 主要结局匹配: 7%2026, 主要结局匹配: 7%201520162017201820192020202120222023202420252026
任意结局匹配主要结局匹配
查看图表数据
类别任意结局匹配主要结局匹配
201512.2%4.4%
201612.9%4.6%
201714.5%5.2%
201815.3%5.6%
201915.8%6.1%
202015.9%6%
202117%6.5%
202217.4%6.4%
202317.9%6.9%
202418.5%7.2%
202519.3%7%
202620.7%7%
来源: 基于 AACT(2026 年八月 1 日快照)及 NCI/CDISC 术语集(2026 年三月 27 日发布)的 EClinCloud 短语筛查分析。注册开始年份 2015-2026;完整结局描述;保留最长重叠名称。https://aact.ctti-clinicaltrials.org/download

按年份绘制的图表是 2026 年八月注册库的一个横断面。它包含了研究开始年份之后进行的方案修订,且就 2026 年而言,还纳入了该年晚些时候的预估启动项目。该图有助于确定需要进一步详查的记录。若要作出有关政策影响或标准符合性的结论,则需补充额外证据。[1][3]

经 MeSH 标引的疾病类别呈现了另一种形式的集中分布。词典匹配了 26,665 项标引为精神障碍的研究中的 10,833 项,即 40.6%;以及 38,531 项标引为神经系统疾病的研究中的 12,573 项,即 32.6%。肿瘤组在 49,275 项研究中出现了 10,805 项匹配,即 21.9%。一项研究可归属于多个大类,因此这些分母之间存在重叠。[1]

选定 MeSH 标引领域呈现出不同的用词模式

领域之间存在重叠:一项研究可能出现在多个组中。词典具有选择性,因此这些比例并不代表测量工具质量或标准化程度的高低排序。

单位 · %

左右滑动查看完整图表。

选定 MeSH 标引领域呈现出不同的用词模式精神障碍精神障碍, 词典匹配: 40.6%40.6%精神障碍, 通用表述,无匹配: 29.8%29.8%神经系统神经系统, 词典匹配: 32.6%32.6%神经系统, 通用表述,无匹配: 30.8%30.8%肿瘤肿瘤, 词典匹配: 21.9%21.9%肿瘤, 通用表述,无匹配: 17.6%17.6%呼吸系统呼吸系统, 词典匹配: 21.1%21.1%呼吸系统, 通用表述,无匹配: 22.5%22.5%皮肤皮肤, 词典匹配: 19.3%19.3%皮肤, 通用表述,无匹配: 32.2%32.2%心血管心血管, 词典匹配: 17.4%17.4%心血管, 通用表述,无匹配: 27.7%27.7%代谢代谢, 词典匹配: 9.7%9.7%代谢, 通用表述,无匹配: 30.8%30.8%眼科眼科, 词典匹配: 5.2%5.2%眼科, 通用表述,无匹配: 29.5%29.5%
词典匹配通用表述,无匹配
查看图表数据
类别词典匹配通用表述,无匹配
精神障碍40.6%29.8%
神经系统32.6%30.8%
肿瘤21.9%17.6%
呼吸系统21.1%22.5%
皮肤19.3%32.2%
心血管17.4%27.7%
代谢9.7%30.8%
眼科5.2%29.5%
来源: 基于 AACT(2026 年八月 1 日快照)及 NCI/CDISC 术语集(2026 年三月 27 日发布)的 EClinCloud 短语筛查分析。注册开始年份 2015-2026;完整结局描述;保留最长重叠名称。https://aact.ctti-clinicaltrials.org/download

在操作层面,这一分析可用于优先调研团队实际项目组合中的测量工具族群。神经科学团队所面对的功能测试与临床医生评估组合,可能迥异于处理肿瘤疗效评价的肿瘤学团队。请根据各个项目组合中具体测量工具的要求,预估相应的培训、授权许可及实施工作量。

复用高度集中的领域

RECIST 1.1 以 14,217 个对领跑测量工具-行排名,紧随其后的是 EQ-5D-5L(6,361 个)、HADS(5,279 个)和 PHQ-9(5,199 个)。排名前 20 位的名称合计占 全部 106,117 个对的 64.9%。该分母包含了完整的匹配列表,而非人为截取的前 120 项总数。[1]

二十个名称占测量工具-行对的 64.9%

占全部 106,117 个匹配的测量工具-结局行对中的 68,910 个。一行可提及多种测量工具;这些数据并非独立的试验数、患者数或全部已注册结局。

单位 · 测量工具-行对

左右滑动查看完整图表。

二十个名称占测量工具-行对的 64.9%RECIST 1.1RECIST 1.1, 匹配对: 14,217 测量工具-行对14,217EQ-5D-5LEQ-5D-5L, 匹配对: 6,361 测量工具-行对6,361HADSHADS, 匹配对: 5,279 测量工具-行对5,279PHQ-9PHQ-9, 匹配对: 5,199 测量工具-行对5,199PSQIPSQI, 匹配对: 5,005 测量工具-行对5,005GAD-7GAD-7, 匹配对: 4,399 测量工具-行对4,399TUGTUG, 匹配对: 3,397 测量工具-行对3,397MOCAMOCA, 匹配对: 3,105 测量工具-行对3,105MRSMRS, 匹配对: 2,402 测量工具-行对2,402BPIBPI, 匹配对: 2,278 测量工具-行对2,278MADRSMADRS, 匹配对: 2,273 测量工具-行对2,273TMTTMT, 匹配对: 1,958 测量工具-行对1,958RANORANO, 匹配对: 1,919 测量工具-行对1,919SIX MINUTE WALKSIX MINUTE WALK, 匹配对: 1,842 测量工具-行对1,842MMSEMMSE, 匹配对: 1,794 测量工具-行对1,794iRECISTiRECIST, 匹配对: 1,794 测量工具-行对1,794BECK DEPRESSION INVEN…BECK DEPRESSION INVENTORY-II, 匹配对: 1,484 测量工具-行对1,484DLQIDLQI, 匹配对: 1,441 测量工具-行对1,441PCL-5PCL-5, 匹配对: 1,428 测量工具-行对1,428MDS-UPDRSMDS-UPDRS, 匹配对: 1,335 测量工具-行对1,335
查看图表数据
类别匹配对
RECIST 1.114,217 测量工具-行对
EQ-5D-5L6,361 测量工具-行对
HADS5,279 测量工具-行对
PHQ-95,199 测量工具-行对
PSQI5,005 测量工具-行对
GAD-74,399 测量工具-行对
TUG3,397 测量工具-行对
MOCA3,105 测量工具-行对
MRS2,402 测量工具-行对
BPI2,278 测量工具-行对
MADRS2,273 测量工具-行对
TMT1,958 测量工具-行对
RANO1,919 测量工具-行对
SIX MINUTE WALK1,842 测量工具-行对
MMSE1,794 测量工具-行对
iRECIST1,794 测量工具-行对
BECK DEPRESSION INVENTORY-II1,484 测量工具-行对
DLQI1,441 测量工具-行对
PCL-51,428 测量工具-行对
MDS-UPDRS1,335 测量工具-行对
来源: 基于 AACT(2026 年八月 1 日快照)及 NCI/CDISC 术语集(2026 年三月 27 日发布)的 EClinCloud 短语筛查分析。注册开始年份 2015-2026;完整结局描述;保留最长重叠名称。https://aact.ctti-clinicaltrials.org/download

可复用库可以从常见名称开始构建,但常用度既不是许可,也不是适用性评估。一条有用的库条目能够明确确切的测量工具版本、源材料、允许的模式与语言、计分规范、数据表示指导原则以及已执行的核查。当一项新研究申请使用该条目时,团队可以将这些实际情况与其试验方案进行比对,而不是假定熟悉的缩写就意味着相同的实施方式。

类别分布印证了这一点。该字典生成了 56,539 个问卷匹配对、21,345 个肿瘤疗效反应匹配对、15,519 个功能测试匹配对以及 12,714 个临床分类匹配对。这四个类别相加等于全部匹配对总数,并描述了用于匹配的术语列表。数据集表示形式则是一个独立的决策。[1][2]

按字典类别划分的匹配对

这四个类别描述了所选的术语列表。临床分类并非 SDTM CC 域;必须对照标准和测量工具补充文件核对适当的表示形式。

单位 · 测量工具-行匹配对

左右滑动查看完整图表。

按字典类别划分的匹配对问卷问卷, 匹配对: 56,539 测量工具-行匹配对56,539肿瘤疗效反应肿瘤疗效反应, 匹配对: 21,345 测量工具-行匹配对21,345功能测试功能测试, 匹配对: 15,519 测量工具-行匹配对15,519临床分类临床分类, 匹配对: 12,714 测量工具-行匹配对12,714
查看图表数据
类别匹配对
问卷56,539 测量工具-行匹配对
肿瘤疗效反应21,345 测量工具-行匹配对
功能测试15,519 测量工具-行匹配对
临床分类12,714 测量工具-行匹配对
来源: EClinCloud 对 AACT 2026 年 8 月 1 日快照及 NCI/CDISC 术语 2026 年 3 月 27 日发布版本的短语筛选分析。注册开始年份为 2015-2026;完整终点描述;保留最长重叠名称。https://aact.ctti-clinicaltrials.org/download

特别是,临床分类术语类别并不能作为存在 SDTM “CC” 域的证据。CDISC 的 QRS 材料和 SDTMIG 概述在与 RS 相关的语境下描述了临床分类和疾病反应内容;实际的表示形式取决于具体评估和适用指导原则。其他肿瘤学数据可能需要相关的结构。若仅通过提取字典类别的前两个字母来分配域,就会跳过数据建模决策。[4][5]

即便是熟悉的名称,也可能带有意料之外的目录细节。在此处使用的固定术语发布版本中,MoCA 处于功能测试类别。施测、许可和终点定义仍属于各自独立的规范字段。保持源类别可见,有助于数据团队避免为了契合自身直觉而默默重写术语。[2]

QRS 阐明表示形式与补充文件状态

CDISC 的 QRS 计划涵盖问卷、评定与量表,并通过补充文件描述特定评估的表示形式。在其于 2026 年 9 月 6 日核对时,其公开主表包含 324 个目录条目 ,对应 305 个不同的显示名称。重复的测量工具、版本以及与数据集相关的条目是造成目录行数与不同名称数量之间差异的原因。[4]

QRS 目录许可状态:324 个主表条目

目录行并非不同的测量工具或已发布的补充文件。该快照包含 305 个不同的显示名称,并包括重复的版本或数据集条目。

单位 · 目录条目数

左右滑动查看完整图表。

QRS 目录许可状态:324 个主表条目已获许可已获许可, 主表条目: 125 目录条目数125公有领域公有领域, 主表条目: 103 目录条目数103未收到回复未收到回复, 主表条目: 52 目录条目数52已拒绝已拒绝, 主表条目: 23 目录条目数23需作者许可需作者许可, 主表条目: 12 目录条目数12豁免版权豁免版权, 主表条目: 7 目录条目数7未指定未指定, 主表条目: 2 目录条目数2
查看图表数据
类别主表条目
已获许可125 目录条目数
公有领域103 目录条目数
未收到回复52 目录条目数
已拒绝23 目录条目数
需作者许可12 目录条目数
豁免版权7 目录条目数
未指定2 目录条目数

许可状态涉及 CDISC 补充文件的开发或获取权限。它并非在临床试验中施测该测量工具的许可。

来源: CDISC QRS 公开主表,访问于 2026 年 9 月 6 日。https://www.cdisc.org/standards/foundational/qrs

主表状态包括 125 个已获许可、103 个公有领域、52 个未收到回复、23 个已拒绝、12 个需作者许可、七个豁免版权以及两个无指定状态。我们仅统计了主表,未计入来自独立更新表的重复条目。这些均为特定日期的目录统计数据,可能会发生变化。

最重要的解读界限在于该状态针对的主体。“已拒绝”或“未收到回复”涉及的是 CDISC 开发补充文件的许可流程。申办方应在确立测量工具测量学证据的同时,自行获取自身适用的施测、翻译和电子化使用权利。[4]

我们还将更正后的注册库排名中字面排名前 44 位的术语与公开的 QRS 表进行了核对。其中二十五个拥有已发布或可向作者获取的补充文件,七个为“已拒绝”或“未收到回复”状态,十二个没有匹配的主表条目。这是一项针对特定对象的对照映射,而非整个目录层面的可用率。该对照映射使用的是公开可见的版本和别名元数据;需许可的补充文件内容仍在本次审查范围之外。[1][4]

实例分析:使用表述与 QRS 状态回答的是不同问题

全部计数与主要终点计数均为测量工具-终点-行匹配对,而非独立的研究。所选的八个示例包括疗效评价标准与问卷。

左右滑动查看完整图表。

字典术语全部匹配对主要终点匹配对字典类别QRS 主表状态
RECIST 1.114,2173,500肿瘤疗效反应豁免版权
PHQ-95,1991,490问卷豁免版权
DLQI1,441115问卷无匹配条目
PCWG 20161,166217肿瘤疗效反应无匹配条目
ESS1,118200问卷已获许可
HAM-A1,062215临床分类公有领域
GDS974184问卷公有领域
Wolchok 2009 (irRC)967111肿瘤疗效反应无匹配条目

缺失 QRS 目录条目并不能证明某项测量工具无效、未获许可或不适合用于临床试验。

来源: EClinCloud 对 AACT 2026 年 8 月 1 日快照及 NCI/CDISC 术语 2026 年 3 月 27 日发布版本的短语筛选分析。注册开始年份为 2015-2026;完整终点描述;保留最长重叠名称。https://aact.ctti-clinicaltrials.org/download QRS 主表访问于 2026 年 9 月 6 日:https://www.cdisc.org/standards/foundational/qrs

实例分析保留了全部终点匹配对计数与主要终点匹配对计数。DLQI、PCWG 2016、ESS、HAM-A、GDS 以及 Wolchok 2009 各自都拥有非零的主要终点匹配数。使用计数与目录可用性是独立的字段,各自从其自身的来源填报。

对于系统构建团队而言,在找到补充文件之后的下一步是确认其是否对应于所申请的测量工具及其版本,确定其适用的表示形式,并将该指导原则与研究的数据采集及分析要求进行比对。补充文件能够减少解读工作。团队仍需要建立自己的终点依据、实施核查和计分验证。

NIH 检索阐明了发现与复用之间的差异

NIH/NLM CDE 知识库提供了获取元数据和表单的另一条途径,但短语检索结果对名称和别名高度敏感。我们通过该知识库已公开文档的公共检索 API 重现了所选查询,并检查了相关记录的元数据。检索时保留了带引号的短语,以免不带引号的宽泛检索在不经意间产生不同的比较结果。[6]

最明确的例子是六分钟步行试验。短语“6 Minute Walk”未返回任何表单或数据元。“Six minute walk”返回了一个表单和八个 CDE。直接检查的一条 NHLBI 记录描述了以米为单位的步行总距离;所链接的表单是一份范围更广的体格检查表单,而非一套完整的独立测量工具包。因此,针对第一项查询的零结果是命名导致的结果,并不能证明 NIH 没有相关内容。[6][7]

加引号的检索短语 表单匹配数 CDE 匹配数 结果仍需明确的事项
RECIST 0 2 核对病灶疗效反应数据元及其预期应用语境
EQ-5D 3 0 确认版本与权利;所检查的表单包含版权占位符
PHQ-9 7 25 核对版本、管理方、内容及适用使用条件
6 Minute Walk 0 0 在得出不存在相关记录的结论前,先检索经验证的别名
Six minute walk 1 8 确定范围更宽泛的表单是否提供了该研究需要的字段

计数属于本次审查在特定日期获得的检索结果,而非不同测量工具的覆盖百分比。同样的审慎原则也适用于 UPDRS:一次检索可能同时检出 UPDRS 和 MDS-UPDRS 表单。返回的多条记录是未提供表单内容的版权占位符。元数据的可发现性并不等同于获取可复用表单的权限或施测该表单的许可。[6][8]

该知识库的贡献者构成也会影响检索可能发现的内容。在单独归档的包含 22,308 个数据元的索引中,NINDS 贡献了 13,545 个条目,占比 60.7%。NCI 贡献了 92 个。该特定索引拥有庞大的神经病学贡献者基础。归档计数保留了自身的分母,独立于实时检索总量。[6]

研究团队在选定任何候选记录时,均应保留检索式、检索日期、记录标识符、管理方、测量工具版本以及获取限制。随后应检查实际内容及其与计划测量的关系。应逐一评估记录的命名分类及其对预期研究用途的适用性。

FDA 的目录是一个版本窗口,而非单一强制编号

FDA 数据标准目录(Data Standards Catalog)v11.0 列出 SDTMIG 3.4 的要求生效日期为 2025 年 3 月 15 日。目录同时保留了 SDTMIG 3.3,且未设定支持或要求结束日期。FDA 的标准化研究数据指导原则阐明,在支持一个以上版本的情况下,申办方可在符合条件的版本中进行选择;该指导原则鼓励使用最新支持的版本。版本 3.3 在其适用的支持窗口内仍是一个可选方案。[9][10]

该决策还取决于适用范围。标准化数据要求针对的是指定的递交类型和审评中心,包括适用的商业化 IND 和上市申请,豁免情形与限定条件在指导原则中均有说明。应针对预期的递交申请明确其适用性。为此目的,FDA 对临床研究开始的定义与最早签署知情同意书相关联,因此团队应直接核实该事件。[9][10]

因此,标准决策记录可以简短明确:明确拟定的递交背景、研究启动时的相关证据、核对的目录版本、考量过的支持版本以及最终选定的版本。受控术语发布版本单独记录。这是保留依据的一种建议方式,而非新的 FDA 表格。

测量工具的适用性则是另一个独立问题。FDA 于 2025 年 10 月发布的最终版 PFDD 指南 3 阐述了如何选择、开发或修改符合预期用途的临床结局评估。证据应与关注概念、目标人群和使用背景相契合。无论目录中收录与否,都应导向相同的结合具体背景的评估。[11]

正式的 FDA COA 资格认定是可选的。FDA 将资格认定描述为一种可供跨研发项目使用的自愿途径,而 COA 纲要是一个未穷尽的切入点,而非对其所列各项评估针对每一个终点的背书。新开发的测量工具在终点中的角色取决于其支持性证据和拟定使用背景。[12][13]

从测量工具需求到构建规范的四条路径

以下路径是基于上述区分提炼出的编辑工作流程。可利用这些路径来分配下一项证据收集任务,其范围与时间节点由研究具体设定。

起始状态 下一步决策 可审查产出
确切的测量工具/版本且具有适用的表达指导原则 确认授权权利、使用背景及特定研究的实施方案选择 引用选定指导原则和获准源材料的受控规范
成熟测量工具但无匹配的公开补充文件 获取权威测量工具材料,并与标准团队共同开发表达方案 成文的映射关系、依据说明、计分规范及验证证据
可检索到相关 CDE 或表单 确认确切版本、内容、获取条件以及与方案的契合度 针对可复用内容及待决事项的记录级评估
通用性表述、修改后的测量指标或新测量工具 明确拟定终点所需的概念、测量工具标识及证据 在构建被视为最终定稿前完成的科学与操作规范

这些路径可能存在重叠。一项研究可能会找到 QRS 补充文件,但仍需解决翻译授权或电子化模式变更问题。另一项研究可能未找到 QRS 条目,但拥有具备恰当科学依据和许可方提供材料的成熟测量工具。在保留该研究科学要求的同时,解决缺失的证据问题。

对于成熟的测量工具,应将获批的源材料与构建表达形式区分开来。源材料界定了研究有权使用且拟使用的内容;实施方案则规定了其外观呈现、交互行为以及数据生成方式。如果研究改变了措辞、应答选项、回忆期、模式或计分规则,团队应评估其影响,而非将此类变更轻描淡写为形式上的迁移。FDA 的符合预期用途框架明确,所需证据取决于变更的性质与程度。[11]

对于诸如“生活质量评分”之类的通用需求,当务之急是厘清方案拟采用的概念和测量工具。可能存在多种合规合理的选择,各自伴随不同的证据与授权许可。科学团队应在编程开始前确定测量工具的选择。如果方案有意采用其他类型的结局指标,则无须仅为了强行匹配而引入问卷。

保持各项决策前后衔接的研究构建核查清单

当另一个团队能够清楚获知已经做出了哪些决定、哪些假设仍需确认时,一份可复用的规范才体现出其价值。下方的核对清单是一项建议的操作辅助工具。相关项目可共享一份受控规范,而法规审查仍属于独立的流程。

领域 待决问题 需留存证据
标识 拟采用的确切测量工具、版本、语言以及答卷人或评估员类型是什么? 权威名称、版本及源出处引用
终点 其支持何种概念、评估时间点以及终点角色? 方案与分析计划引用依据
授权权利 施测、翻译以及拟定的电子化使用是否获得许可? 适用的许可与限制条件
内容 哪些指导语、条目、应答选项及回忆期属于受控内容? 经批准的源材料及变更历史
施测管理 由谁填写或施测该测量工具,何种培训或支持是适宜的? 针对特定角色的工作流程与准备要求
计分 条目、缺失作答、反向计分及总分如何处理? 权威计分规范及验证测试用例
数据表达 适用何种标准、补充文件、术语发布版本及映射关系? 受控映射以及针对特定研究选择的依据
系统实施 界面显示、页面导航、时间戳及数据传输是否保持了预期的评估效果? 相关的配置审查与测试证据
变更控制 若版本、语言或需求发生变更该如何处理? 影响评估、生效版本及审批历史

计分与数据表达之间的区别值得进行专项核查。分值衍生计算与数据集结构需要分别进行检查。反之,如果数据集未能标明测量工具版本、时间节点或适当的限定修饰符,哪怕分值计算正确,也可能会失去意义。对这两条路径同时进行审查,有助于团队将分析变量一路溯源至原始作答。

验证用例应源自测量工具本身和拟定的工作流程。根据所适用的计分规则,有参考价值的用例可包括允许的作答边界值、缺失条目、反向计分条目以及完成提交前更改答案的情形。这些是供团队考量的示例,而非源材料强行规定的通用测试用例。预期结果必须源自权威规范,而非来自受测的系统实现。

同样的原则也适用于电子化迁移。界面视觉审查可以发现用词、换行和选项排版方面的问题。而测量等效性、授权许可权利和计分正确性则需要提供各自对应的证据。涉及科学、授权、界面和数据的问题,应分配给有能力解答的人员,并通过受控版本进行关联。

EClinCloud 将量表管理阐述为一个业务领域,涵盖授权尽职调查、适用情况下的语言学验证以及交付/变更管理支持。其 RM 产品为 Resource Management ,属于另一项不同的产品方案。在讨论测量工具工作时,应准确界定相关的服务边界。[14]

EDCeCOA 产品方案可支持由此产生的数据采集工作流程。测量工具验证与使用许可需要各自独立的证据。规范、科学依据及适用授权仍属于特定研究的决策事项。[15][16]

分析更新时需保留的内容

未来进行更新时,应保留注册库快照、选定的术语发布版本、检索规则以及完整的分母。词典中的变更与试验措辞的变更应分别报告。因引入新别名而导致的数据增加,应归因于检索规则的变动。如果某个 QRS 条目的状态发生改变,在将其视为最新可复用之前,应先核对具体的版本和获取路径。

针对 NIH 的检索应保留确切的查询词和记录标识符,并跟进相关别名与版本差异。“零”应仅作为一项检索结果保留,直到有进一步证据支持更宽泛的未收录结论。目录收录情况、正式资格认定、授权许可和构建验证应继续作为独立字段分别记录。

公开证据之所以有价值,是因为它使反复出现的规范问题显现出来。但如果将命名比例拔高为合规率,则会产生误导。对于研究团队而言,真正有价值的终点是一项测量工具需求,其标识、科学定位、授权权利、数据表达及具体实施均能够被分别审查和追溯。

来源

1. EClinCloud 对 CTTI AACT 下载数据, 2026 年 8 月 1 日快照的原始分析,于 2026 年 9 月 6 日独立重新计算。注册启动年份为 2015-2026 的干预性研究;完整描述、最长重叠短语筛选以及有界通用词匹配。

2. NCI Enterprise Vocabulary Services,CDISC SDTM 受控术语, 锁定的 2026 年 3 月 27 日发布版本。选自问卷、功能测试、临床分类及肿瘤疗效评估列表的名称;并非测量项目的完整全集。

3. ClinicalTrials.gov,方案注册数据元定义, 更新于 2025 年 4 月 24 日,访问于 2026 年 9 月 6 日。

4. CDISC,QRS 计划与目录, 公开主表及状态描述访问于 2026 年 9 月 6 日。未审查经许可/认证的补充文件。

5. CDISC,SDTMIG v3.3, 发布于 2018 年 11 月 20 日。公开概述,包括功能测试及扩展的疾病疗效评估表达。

6. NIH/NLM,通用数据元库成文的公开 API, 引号精确短语检索核对日期为 2026 年 9 月 6 日。归档的 22,308 个数据元索引单独用于贡献者计数;实时查询结果与归档总数未合并计算。

7. NIH/NLM, NHLBI, 记录六分钟步行试验期间步行的总距离, 已查阅记录,访问于 2026 年 9 月 6 日。

8. NIH/NLM, NINDS, UPDRS 表单记录MDS-UPDRS 表单记录, 元数据及版权限制已于 2026 年 9 月 6 日核对。

9. 美国 FDA,数据标准目录 v11.0, 2025 年 3 月 20 日。已直接核查 XLSX 版本的各行及脚注。

10. 美国 FDA,以电子格式提供监管申报资料:标准化研究数据, 最终指南,2021 年 6 月,特别是关于适用日期与版本更新的第 II.E 节。

11. 美国 FDA,以患者为中心的药物研发:选择、开发或修改符合预期目的的临床结局评估, 最终指南 3,2025 年 10 月。

12. 美国 FDA,临床结局评估资格认定项目, 当前项目描述,访问于 2026 年 9 月 6 日。

13. 美国 FDA,临床结局评估汇编, 范围与解读说明,访问于 2026 年 9 月 6 日。

14. EClinCloud,量表管理服务资源管理产品, 当前页面已于 2026 年 9 月 6 日核对。公司描述,非独立结局证据。

15. EClinCloud,电子数据采集, 当前产品页面,访问于 2026 年 9 月 6 日。

16. EClinCloud,电子临床结局评估, 当前产品页面,访问于 2026 年 9 月 6 日。