入排标准与筛选负担:研究构建证据审查(2026)
入排标准构建的难点在于确定每项标准需要获知什么信息、何时必须获知这些信息,以及哪些证据支持该决策。一份填写完整的核对表可能会掩盖过期的实验室检查结果、被误解的时间窗或未记录在案的临床判断。而真正有用的构建会在任何人尝试对受试者进行随机化之前,使这些依赖关系清晰可见。
审查证据:2026年9月18日。 本报告面向试验方案、临床运营和数据管理团队。文中的构建示例和工作负荷场景均为假设,需根据已获批的试验方案进行调整。该分析结合了已发表的入排标准研究、监管来源以及对 FDA 现场核查观察项频次的最新核验。
核心要点
- 在配置标准之前先对不必要的标准提出质疑。 FDA 于 2025 年 12 月发布的最终指导原则探讨了代表性入组和不必要的排除。第一个决定是该标准是否服务于试验的科学或安全性目的;第二个决定是如何可靠地执行所保留的标准。[1]
- 结合实际分母使用核查数据。 在 FY2020–FY2025 期间,所审查的 BIMO 表格包含 479 行频次记录,共计 1,715 次引用项发生频次。312.60 项下的 522 次发生中,包括 481 次试验方案依从性引用和 41 次知情同意引用。这些数据支持提出有针对性的审查问题,而非测得的筛选错误率。
- 将证据、评估与授权分离开来。 采集源结果及其上下文背景,应用已获批的标准,并记录获授权的入选资格决定。缺失的结果应保持未解决状态;软件权限应反映已记录的决定和适用的试验方案版本。
哪些标准理应纳入试验方案?
研究构建始于科学问题。对于拟定的每一项入选或排除标准,都应询问它服务于试验目的或受试者保护的哪一部分,以及该限制对于该目的是否确有必要。FDA 于 2025 年 12 月发布的最终指导原则鼓励在保持安全性和有效性标准的同时提高代表性的方法。其范围包括人口学特征以及合并症、器官功能障碍和残疾等事项。恰当的应对方式是在构建冻结这些标准之前,对各项标准进行记录在案的、针对特定产品的审查。[1]
ICH E8(R1) 重点关注对研究质量至关重要的因素以及将质量设计到研究中。这为将研究者、运营人员、数据管理人员和相关受试者视角引入试验方案制定提供了充分的理由。每个群体看到的失效机制各不相同。统计学家可能会识别出解释结局所需的一项标准;研究者可能会质疑其措辞能否得到一致应用;协调员可能会发现时间安排上的依赖关系;受试者可能会指出方案团队忽视的访视负担。[2]
决策记录应保持简明扼要且具体明确。对于保留的标准,阐明其目的、所需信息、允许的数据源、时间要求以及负责的决策者。对于删除或放宽的标准,保留其科学与安全性依据以及审批路径。这是一项拟议的设计辅助工具。它有助于防止运营上的便利悄然演变成对研究人群未经审查的限制。
已发表的研究表明,为什么逐项审查标准比照搬前序试验方案更为有效。Liu 及其同事利用来自 61,094 例晚期非小细胞肺癌患者的真实世界数据来模拟肿瘤学试验并评估入排标准。他们于 2021 年开展的研究阐明了一种通过数据驱动的方法来检验入组与结局影响。其研究结果取决于疾病、治疗方法、可用变量和观察方法。申办方在更改标准之前,仍需要针对具体试验的科学和安全性依据。[3]
这一区别直接影响构建讨论。表明某项限制值得重新考量的证据应在编程前呈交试验方案决策者。一旦获批的试验方案界定了目标人群,系统就必须严格忠实地执行该版本。在逻辑核查中悄悄放宽阈值,所造成的问题与提出有充分理由的方案修正案截然不同。同时保留方案决策及其执行历史,以便试验团队能够区分设计改进与执行错误。
会议的一项实用成果是列出一份标明具体负责人的未决标准问题清单。“器官功能充分”、“近期治疗”和“具有临床意义”可能各自需要不同类型的澄清。部分标准需要明确的测量指标和时间间隔;其他标准则有意需要临床判断。团队应在将每个句子变成必填的“是/否”字段之前明确界定其性质。否则,表单可能看似完整,但不同中心执行的规则却各不相同。
FDA 引用项普查支持什么?
在分析固定版本的生物学研究监测(Bioresearch Monitoring)子集之前,我们核查了共享数据目录以及 FDA 现场核查观察项描述文件和清单文件。数据源快照日期为 2026 年 8 月 23 日。其压缩数据的校验和与清单文件相匹配。我们选取了 2020 至 2025 财政年度,保留了所有 BIMO 项目领域的行,并对已发布的频次字段求和。由此得出的 479 行数据代表 1,715 次引用发生次数。公开的计算补充材料包括所选取的行、确切的分组规则和年度汇总。[4]
统计单位至关重要。这些是来自涵盖多个监管领域的 BIMO 表格的频次汇总,包括临床研究者、申办方、机构审查委员会和实验室相关工作。它们并非 1,715 次临床研究者核查、独立中心、试验或受试者。一次核查可产生多项观察项。FDA 的现场核查观察项页面描述了在核查期间记录的观察项,而 Form 483 常见问题解答阐明,Form 483 并非该机构关于违规行为的最终认定。[5] [6]
按法规条款分组显示,21 CFR 312.60 项下出现 522 次,312.62(b) 项下出现 271 次,合计 793 次,占所有选定 BIMO 频次的 46.2%。然而,在这些文件中,312.60 包含两个引用标识符。引用项 7560 涉及研究者声明和试验方案依从性,出现 481 次。引用项 7562 涉及知情同意,出现 41 次。将全部 522 次统称为“方案不依从”,或将合并的 793 次统称为“筛选失败”,都会抹杀原始数据中存在的差异。[4]
区分 312.60 项下的两个引用标识符
FY2020–FY2025 BIMO 频次。分母:所有选定 BIMO 项目行中合计 1,715 次发生,而非研究者核查次数。
左右滑动查看完整图表。
查看图表数据
| 类别 | 频次 |
|---|---|
| 312.60:方案依从性(7560) | 481 引用发生次数 |
| 312.60:知情同意(7562) | 41 引用发生次数 |
| 312.62(b):病例记录 | 271 引用发生次数 |
年度分母也会发生变化。选定的 BIMO 总频次在 FY2020 为 221,FY2021 为 249,FY2022 为 298,FY2023 为 301,FY2024 为 312,FY2025 为 334。对应的 312.60 总数分别为 58、90、77、104、104 和 89。病例记录频次分别为 30、48、36、49、56 和 52。这些时间序列描述了核查项目下已发布的观察项频次,其工作量和抽检案件选择均在动态变化。它们并未解决所有试验中入选资格错误发生率的问题。
另一份单独的 FDA 资料提供了与筛选的具体关联。FY2024 临床研究者观察项趋势演讲列出了入组资格主题,包括不符合入选标准、符合排除标准以及在确定入组资格之前进行随机化。它还包含了许多其他方案主题。这支持直接审查入组资格工作流。演讲中的主题清单不能作为将所有方案观察项归因于入组资格、或评估通过某项特定 EDC 功能可实现的减少量的依据。[7]
因此,对于系统构建团队而言,其决策是审查入选资格判定的时机和证据,进而利用明确的研究数据来衡量自身流程。普查数据有助于证明该问题的合理性。但它既未提供通用的软件控制排名,也未承诺投资回报。这种界限使得本文对于那些研究与公开记录中被核查活动存在显著差异的团队依然具有参考价值。
标准应如何转化为构建规范?
对于美国 IND 研究,21 CFR 312.60 确立了研究者按照研究计划开展研究并保护受试者的责任。第 312.62(b) 条规定了为其所述范围内的人员准备充分且准确的病例记录。这些法定义务使得将入选资格决定与支撑该决定的证据相关联变得极有价值。下文的构建规范即为建立该关联而提出的一种可操作方法。[8] [9]
在受控的方案版本内为每项标准指定一个稳定的标识符。保留原始表述,然后在单独的字段中描述操作性释义。这种分离使审阅人员能够识别未解决的歧义,而不是将程序员的释义误认为是已获批准的方案语言。将任何澄清与申办方和研究者团队批准该澄清的过程相关联,并确定该澄清是否需要正式的方案修订或其他受控文件变更。
明确判定类型。一项标准可能取决于固定数值、相对于实验室参考范围的结果、时间间隔、既往治疗、文件审阅、临床判断或这些要素的组合。一个复合句可能需要多项输入。相反,多项标准可能会使用相同的底层测定值。梳理这些依赖关系有助于避免重复收集信息,同时保留方案所要求的独立评估。
对于每项输入,明确其来源和背景信息。实验室检测值需要分析物、标本或相关方法学背景、采集日期、相关时的结果日期、单位以及适用的参考限值。治疗史可能需要治疗标识以及足以评估指定间隔的日期。临床判断需要经授权的评估人员以及足以理解该结论的支持性信息。这些是证据模型的示例,而非要求将每份原始文件都上传至申办方的数据库中。
将每项标准转化为明确的证据判定
建议的研究构建辅助工具;实际工作流程以已获批准的方案和适用要求为准。
左右滑动查看完整图表。
| 标准类型 | 需定义的输入项 | 判定证据 |
|---|---|---|
| 固定阈值 | 数值、单位及允许的来源 | 获批规则与评估结果 |
| 相对实验室限值 | 结果、参考限值、实验室及生效日期 | 衍生比值与适用阈值 |
| 时间间隔 | 起始事件、结束事件及计数约定 | 日期、计算所得间隔及规则版本 |
| 临床判断 | 相关信息与经授权的评估人员 | 具有适当依据且可归因的评估 |
| 复合条件 | 逻辑运算符、例外情况及亚组范围 | 对完整获批条件的评估 |
将评估与授权分开定义。系统可以计算比值或标记缺失的结果,而由具备资质的研究者或其他经正当授权的人员做出方案所要求的临床判定。ICH E6(R3)论述了研究者职责、相称的监管以及可靠的试验信息。职责委派与计算机化支持应体现在试验的实际职责分工中,而不是根据谁能点击按钮来推断。[10]
最后,明确下游影响。一项标准可以生成质疑、使入组资格评估保持待定状态、阻止已配置的随机化操作,或要求进行授权审阅。所产生的影响应与判定及系统架构相适应。如果一项具有重要临床意义的判定保存在研究中心记录中,界面可以传递其已核实的状态和出处,而无需重复记录敏感的叙述性文本。该设计仍需要一种经过验证的方法,以确定受试者推进后续流程时哪项判定有效。
哪些属于知情同意之前,哪些属于知情同意之后?
将潜在受试者的初步识别与仅为研究入组资格而执行的程序区分开来。FDA的筛选指南阐述了在仅用于研究的筛选检查前获得知情同意、以及向潜在受试者明确其目的的重要性。既有的临床信息与专为试验开展的新程序可能会引发不同的问题。适用法律、伦理审查、隐私合规依据及已获批准的方案决定了允许的工作流程。一份标有“预筛选”的表格本身并不能解决其中的任何问题。[11]
操作设计应明确研究程序于何时开始、在此之前可查阅哪些信息,以及何种授权支持此类查阅。在要求之处记录获批的知情同意书版本、语言、流程及时间点。FDA的知情同意指南探讨了IRB、研究者和申办方的各自角色,并指出知情同意不仅仅是持有一份已签署的表格。系统工作流程应保留获批流程所要求的证据,并在受试者参与试验前为提出疑问提供途径。[12]
避免将不完整的知情同意记录转变为普通的入组资格不符。这两种状态具有不同的含义,且可能需要不同的跟进。拒绝参与的潜在受试者、已签署知情同意但正在等待检查的人员,以及未达到方案标准的人员,在操作记录中应保持可区分。这有助于研究中心管理下一步操作,并有助于分析人员在后续选择有意义的分母。
在方案和伦理要求允许该顺序的情况下,分阶段的筛选计划可以减少不必要的程序。在兼顾安全性、科学性及时间安排依赖关系的同时,首先从需要其结果来决定后续活动是否应开展的检查入手。某些评估必须同时进行;而另一些评估则依赖于需要数天才能获取的信息。拟定的顺序应在演变成使原本可行的访视变得无法实现的僵化工作流程之前,与各研究中心共同审阅。
考虑一个假设的时间安排示例。初步文件审阅需要10分钟。后续的一组评估需要40分钟,且预计有60%的候选人会进入该阶段。这两项活动的工作人员预期耗时为10加上0.60乘以40,即进入审阅的每位候选人34分钟。如果进入后续阶段的比例为80%,则估算值变为42分钟。这些是规划假设,而非实测绩效,亦非暂缓必要程序的建议。计算补充材料记录了公式与情景。[4]
工作人员预期耗时取决于进入下一阶段的人员情况
假设情景:10分钟初步审阅加上40分钟后续组合项。路程往返、等待、重复检查和临床审阅均不计入。
左右滑动查看完整图表。
查看图表数据
| 类别 | 工作人员预期耗时 |
|---|---|
| 40%进入下一阶段 | 26 分钟/每位候选人 |
| 60%进入下一阶段 | 34 分钟/每位候选人 |
| 80%进入下一阶段 | 42 分钟/每位候选人 |
该模型忽略了受试者的路程往返、等待、重复检查、医学审阅以及行政随访。当这些部分影响决策时,应将其明确加入。在既有访视期间完成的一项十分钟任务,与需要额外往返一次的一项十分钟任务,给受试者带来的负担截然不同。将工作人员耗时与流逝时间和受试者精力消耗区分开来,相比单纯统计入组资格条目数量,能为方案团队修订工作流程提供更好的依据。
实验室阈值和时间窗应如何表示?
阈值规则应保留其运算所依据的数值。在一项假设的方案中,假定某项实验室标准表述为结果不超过适用正常值上限的1.5倍。上限为50时,72的结果得出1.44;而在上限为45时,相同的结果则得出1.60。这一差异源自参考限值,而非测定结果的变化。该示例旨在说明数据依赖关系,并不包含针对实际分析物或阈值的任何临床建议。[4]
将原始单位和参考范围与结果一同记录,标明实验室并保留相关的生效日期。如果系统对单位进行标准化,应同时保留原始数值、受控的转换规则以及衍生数值。转换应特定于该项测定,并针对预期用途经过验证。仅仅因为各类实验室数值结果出现在同一列中就将其视为可直接比对,可能会掩盖背景信息中具有重要临床意义的差异。
明确方案如何处理重复测定。首个结果、最新结果以及允许的确认性结果回答的是不同的问题。规格说明应明确哪个结果可用于支持入组资格,以及在何种条件下允许使用另一结果。操作人员若随意选择任何合格的数值,即使每个单独的数值都转录无误,也可能会造成非计划的判定规则。保留测定顺序以及选择该结果的理由。
时间窗规则同样需要明确的参考事件。“14天内”可能取决于知情同意、随机化、给药或其他方案定义的事件。明确计算使用的是采集时间还是报告时间、日历日还是流逝小时数,以及如何处理临界日期。若方案存在重要的模糊之处,在编程前应获得受控的澄清说明。研究中心应能够同时查看输入的日期以及系统所采用的释义。
测试一个假设的临界案例:样本于9月1日采集,且计划于9月15日进行随机化。日历日差值为14天,而包含首尾指定日历日的计数则得出15天。系统必须应用获批的约定规则。同样地,即使样本本身的采集是及时的,延迟的报告也可能在允许的采集窗口之后送达。应将过期的评估与不可用的报告区分开来,因为根据方案,它们可能导致不同的跟进处理。
FDA 关于电子系统的指南阐述了可靠的电子记录以及与其在临床研究中应用相关的控制措施。对于本次构建,实际应用在于确保原始输入、相关元数据、衍生评估及变更均可追溯。记录生效的实验室参考范围和规则版本,以便后续的范围更新仍能使先前的决定保持可解释性。重新计算后的显示界面应明确表明其代表的是历史决定还是当前的重新评估。[13]
哪些规则应当阻止随机化?
从已获批的决定以及在信息未解决的情况下继续进行所带来的后果入手。确定性核查有助于防止已知的无效状态,例如缺少必要的评估。临床判断可能需要获得授权的判定和支持性记录。纯行政性质的疑问是否可与已完成的入选资格决定并存,取决于其具体内容和方案。这些类别应由试验团队达成一致,并在预期的工作流程中进行测试。[8] [10]
使用明确的状态:未评估、等待信息、评估合格、评估不合格,以及必要时方案定义的其他状态。空白字段应保留其代表信息缺失的含义。同样,“不适用”也需要有明确定义的条件。将每个未作答的排除项默认设为“否”,可能会根据不完整的证据生成看似完整的表单。一个实用的界面应显示哪些未解决的依赖项阻碍了授权决定,以及谁负责解决这些依赖项。
随机化界面应包含足够的信息,以确认受试者、方案版本、相关评估状态及授权情况。明确每个数据项归哪个系统所有,以及当更新发生延迟时该如何处理。即使每个系统都在按照各自的规则运行,EDC 中显示的绿色状态与 RTSM 中的旧状态仍可能出现不一致。系统集成规范需要针对数据时效性、确认机制以及故障处理制定明确规则。
测试变更的时机。如果实验室检查结果在入选资格获批后但在随机化之前得到更正,应明确该评估如何被重新打开或标记。如果随机化已经发生,请保留历史记录,并将新信息转交以进行相应的临床和方案偏离评估。更改状态不应悄然抹去已经发生的事件。具体的操作应对措施取决于实际情况和负责任的临床判断。
与医学监查员的讨论可以澄清疑点或为安全性决策提供依据。但不应将其表述为可以无限制豁免已批准入选资格标准的权力。应明确允许的审核流程、文件记录和升级上报路径。当需要对方案进行变更时,应采用适用的方案修正案和审批流程。软件应当支持这种治理机制并保留相关证据,而不是将强制覆盖按钮视为批准例外的权力依据。
在第一位受试者入组前,针对系统停机做好预案。受控的应急流程需要明确哪些信息是必需的、谁可以授权该操作、记录如何留存,以及系统恢复后如何进行数据核对。某些情况可能需要推迟该操作。正确的结果取决于方案、受试者保护和经过验证的流程,而不是取决于入组始终可以脱机进行的笼统承诺。将选定的应急流程与常规路径一同记录成文并开展测试。
筛选失败应保留哪些内容?
在决定收集多少信息之前,先明确筛选记录的目的和范围。最小化的操作记录可以标明筛选事件、适用的知情同意状态、已开展的评估、最终处置情况以及终止该事件的编码原因。要重现某项具体判定,可能需要原始数据位置和负责评估的人员。信息收集应符合已获批的研究、适用的隐私要求以及记录的目的。避免仅仅因为存在筛选编号就收集完整的受试者数据库。[10] [12]
21 CFR 312.62(b) 的条文具体描述了针对给予试验用药物或用作对照的个人的病例记录。不应将其转述为一条普适规则,即认为考虑纳入研究的每个人都具有完全相同的病例记录义务。其他要求、方案、伦理条件以及实际开展的活动均可能影响筛选文档的记录与留存。应针对该研究确立适用的政策,而不是仅凭该款内容就做出概括性的论断。[9]
区分某人终止筛选的原因与被评估的标准。失去参与意愿、无法到场、信息无法获取、未达到入选标准以及符合排除标准,可能具有不同的操作含义。如果多项标准均未通过,应明确记录中是保留首个被识别的原因、主要原因还是所有已评估的原因。该选择会改变最终的统计数据。当后续标准从未被评估时,应保留“评估未完成”状态。
重新筛选需要建立受控的身份关联。在方案允许的流程下,同一个人可能会经历多次筛选事件。保留这一关联,同时不要以覆盖早期结果的方式复用事件标识符。在报告时,应分别统计人数和事件数。人员层面的招募估算和事件层面的实验室工作量估算可能都很有用,但它们回答的是不同的问题。
ClinicalTrials.gov 注册定义将结构化的入选资格字段(如年龄和性别)与叙述性的入选资格标准区分开来。注册库中的设计字段有助于描述一项研究,但试验组或国家的数量并不能作为衡量筛选负担的经过验证的估算指标。多国研究可能会采用协调一致的评估;而单国研究可能具有难度大且高度特异的入选资格流程。对于系统构建规划,请阅读实际的标准、流程计划表和实施要求。[14]
结果报告同样需要对其自身定义进行核查。根据 42 CFR 11.48,受试者流程包括按试验组列出的试验进展信息,包括开始和完成的人数。这不应被转化为一概而论的断言,即认为每项试验都必须公布每位预筛选人员的筛选失败原因。将研究的操作计数映射到适用的结果字段和报告要求中,同时保留基础定义以便进行核对。[15]
团队如何在不混淆分母的情况下衡量负担?
在选择比率之前,先明确所要回答的问题。试验中心可能需要了解被考虑纳入试验的人群中有多少人签署了知情同意书。申办方可能需要了解已完成的筛选事件中最终实现随机化的比例。数据管理员可能需要了解在预定决策时间点缺失入选资格证据的发生频率。受试者招募与依从团队可能需要了解额外访视的次数或已过去的天数。每项指标都需要不同的分子、分母和观察窗口。[4]
对于一个假设的队列,假设有 100 人开始了一个已定义的筛选事件。在报告数据截止时,30 人已完成随机化,40 人被判定为不合格,10 人已退出,20 人仍处于未决状态。用 40 除以 100 可以得出在所有已启动的事件中已被判定为不合格的比例。用 40 除以已得出入选资格判定的 70 人,可以得出在已确定结果的事件中不合格所占的份额,约为 57.1%。两者都可以正确计算,但描述的是不同的状态。应对数据截止点和未决人群进行明确标注,而不是将其中任何一个数字呈现为通用的筛选失败率。
同一筛选队列支持不同的比率计算
假设数据截止点:启动 100 个事件;30 例随机化,40 例不合格,10 例退出,20 例未决。
左右滑动查看完整图表。
| 指标 | 分子 | 分母 | 结果 |
|---|---|---|---|
| 所有已启动事件中已被判定为不合格 | 40 | 100 | 40.0% |
| 已有入选资格判定的事件中不合格 | 40 | 70 | 57.1% |
| 所有已启动事件中未决 | 20 | 100 | 20.0% |
现在假设有几个人接受了重新筛选。筛选事件的数量可能会超过人数。一个人可能在某一次事件中不合格,而在后续允许的事件中合格。在人员层面的分析中,应报告用于赋予其最终状态的规则。对于事件层面的工作量分析,应保留这两次事件,因为两者都消耗了资源。这两种视角之间的关系应当足够明确,以便运营和统计团队能够对其报告进行核对。
中心间的比较需要结合背景。接收较多初步转诊的中心可能会显示出更多不成功的事件,但同时其也贡献了有价值的招募工作。另一个中心可能会在系统记录的工作流程之外完成大量的预筛选,从而表现出较高的成功率。疾病严重程度、检测可及性、报告延迟或招募来源的差异均可能影响这种比较。在将绩效归因于人员或软件之前,应利用该指标找出需要调查的问题。
FDA 关于基于风险的监查问答支持将监管重点导向重要风险和关键数据。就入选资格而言,特定于研究的监查计划可能会检查临近随机化时未解决的证据、延迟的授权、重复的更正或源数据与衍生状态之间的差异。这些属于建议的指标。适当的阈值、审核频率和升级上报路径应反映方案要求以及判定错误的后果。[16]
将负担指标与质量指标结合考量。更快的工作流程可能仍是不完整的;更低的筛选失败比例可能反映的是转诊情况的变化,而非执行力度的提升。追踪解释这种表面改善所需的支持证据,包括方案修订、中心激活日期以及筛选定义的任何变更。这样可以在保留因果断言不确定性的同时,将筛选日志转化为可用的运营数据集。
用户验收测试应当证实什么?
系统构建测试应当复现关键的决策,包括模糊路径与中断路径。FDA的电子系统指导原则为适度验证和受控使用系统提供了依据。以下测试集是针对入选资格配置建议的切入点,可根据具体研究进行扩充或精简。通用平台测试的通过是很有价值的背景依据;但针对特定研究的规则与集成仍需要适用的证据。[13]
从边界值开始。测试恰好处于阈值、紧邻两侧、缺失、已更正以及使用非预期单位报告的结果。在此类区分至关重要的情况下,还应纳入参考范围发生变更的情况,以及来自未经批准或标识错误的实验室的结果。预期结果应在执行前予以记录。测试人员应当能够解释系统的响应为何遵循已批准的规则,而不是直接接受当前配置生成的任何结果。
单独测试时间边界。纳入允许的最早和最晚评估、已过期的评估、延迟的报告、已更正的采集日期以及发生变更的计划随机化日期。若时区或夏令时转换会影响所选规则,请明确将其纳入。使用日历日期的研究与使用流逝小时数的研究可能需要不同的用例。在技术规范和测试证据中保留该选择。
测试决策边界与中断路径
可针对特定研究验证计划进行调整的建议示例。
左右滑动查看完整图表。
| 测试类别 | 示例 | 预期证据 |
|---|---|---|
| 数值边界 | 处于阈值、高于、低于、缺失或已更正 | 已批准的规则与可追溯的结果 |
| 时间边界 | 采集日期、报告延迟及变更的随机化日期 | 正确的基准事件与计数惯例 |
| 授权 | 所需审查员待定或角色已被撤销 | 允许的操作与可归属的决策 |
| 集成 | 延迟、重复或被拒绝的状态消息 | 针对正确受试者与周期的明确恢复机制 |
| 方案修订 | 各中心采用不同的已批准版本 | 特定版本的行为表现与历史可追溯性 |
测试权限与状态转换。研究协调员可能会录入信息,而所需的研究者授权仍处于待定状态。用户可能会失去被授权的角色。先前已批准的评估在更正后可能会重新打开。受试者可能会在新的周期下重新进行筛选。测试应当证实每个角色和状态下所允许的操作,包括稽查轨迹中保留的信息以及下游系统接收到的状态。
将集成失败作为一等用例进行测试。在受控测试环境中,延迟消息、重发消息、拒绝消息或中断连接。验证受试者是否仍与正确的周期及方案版本保持关联、重复消息是否触发了预定义的响应,以及操作人员是否能够识别失败的移交。恢复流程应当避免仅仅因为确认回执延迟就执行第二次随机化。
最后,测试审查人员的使用体验。具备资质的人员能否定位源背景、理解计算过程并确定是谁授权推进的?后续的更正能否与决策当时可用的原始信息区分开来?在系统停用时,团队能否导出或留存必要的记录?这些问题将系统构建与其预期的证据用途关联起来,而不是将验收局限于表单是否正常渲染以及按钮是否有响应。
提取的文本与临床判断应当如何审查?
自动化提取有助于将冗长的方案或实验室报告转化为建议的数据结构。有价值的输出是包含源位置、不确定性及未解决问题的映射草案。随后,责任团队会对照受控文件对该映射进行审查。FDA的电子系统指导原则与ICH E6(R3)均将试验信息的可靠性及预期用途与支持流程的评估紧密关联。以下审查方法是一项建议的实施辅助手段。[13] [10]
从逻辑结构入手。包含“且”的标准不同于包含“或”的标准,而例外情况可能会完全颠倒原本简单的排除标准的含义。诸如“除非已过规定间隔期,否则排除既往治疗”之类的表述,需要结合治疗史、适用间隔期和基准事件。仅捕获治疗名称却遗漏了例外情况的文本提取工具,会生成一个表面上结构化但含义完全错误的规则。应保留句子的上下文以供人工审查。
其次,检查适用范围。某个阈值可能仅适用于特定亚组、特定的筛选阶段或特定的测量方法。包含表格的页面可能会引用方案中其他位置的脚注。列表项可能会继承其父级标题的条件。审查人员应当顺着这些依赖关系追溯建议的规则,并记录任何尚未明确的解释。如果仅测试提取的数字是否与印刷的数字一致,就会遗漏这些错误。
对于实验室报告,在审查数值的同时还应审查身份信息与元数据。正确识别的结果若关联到了错误的筛选周期,其后果可能比明显的转录错误更加严重。检查工作流程允许的受试者或源标识符、采集日期、实验室、分析物、单位以及参考限值。若在传输前对标识符进行了脱敏处理,数据核对流程仍需要一种受控的方法来保留正确的关联,同时避免泄露不必要的个人信息。
审查队列应当将提取的不确定性与入选资格问题区分开来。报告中置信度较低的字符意味着抓取到的数值需要验证。超出方案阈值的已验证数值则意味着入选资格评估需要触发方案规定的响应。若将两者混为通用的红色预警,工作人员将更难判断是应当检查文档、重复进行允许的评估,还是寻求相关临床审查。应分别记录每类问题的解决情况。
临床判断需要自身的支持记录。某些标准特意要求研究者结合具体情况评估临床意义或适宜性。系统可以呈现相关信息并要求提供可归属的评估,而获得授权的临床医生仍对该判断负有最终责任。若对每次常规评估都强制要求填写自由文本的理由说明,可能会增加负担而无助于提升证据质量。针对特定标准所需的文件记录以及需要额外解释的情形达成一致。
最后,评估对提取或决策支持流程的变更。即使方案保持不变,新模型、新提示词、新文档模板或新实验室格式也可能会改变输出结果。明确哪些变更会触发审查和回归测试,为研究留存已批准的版本,并监测审查人员所做更正的类型。这些更正模式可以识别出反复出现的映射问题。它们应当促成受控的改进以及对受影响记录的评估,而不是对已投入使用的规则进行无法解释的变更。
方案修订与实施归属应当如何处理?
入选资格的方案修订改变了人群定义,并可能改变数据收集、数据解释及系统行为。从已批准的措辞和生效日期入手,随后确定受影响的中心和受试者状态。一项标准对新的筛选周期、正在进行的周期或已随机化的受试者可能有不同的适用方式。方案及适用的批准决定了处理方式;全局软件切换应当精准执行该决策。[8] [10]
建立涵盖标准规范、表单、逻辑核查、实验室范围、中心指南、系统集成、监查指标及报告定义的影响图谱。在适用的情况下保留新旧标准标识符之间的对应关系,同时确保含义的变更保持清晰可见。字段重命名与临床含义的改变是两种不同的变更。根据方案修订内容及受试者状态,既有数据可能需要重新解释、补充收集或无需采取任何操作。
为方案修订规划中心激活。明确中心在使用新版本前所需的培训、批准和配置条件。若各中心依规可以在不同时间过渡,应对多版本并存期进行测试。运营仪表盘应当使版本状态清晰可见,而不能默认文件的分发就等同于实际实施。要求各中心使用相关示例用例演示变更后的工作流程。
EClinCloud公开发布的EDC材料描述了研究建库支持、表单与逻辑核查、源数据采集以及数据管理员对AI生成配置的审查。其RTSM材料描述了随机化与供应工作流程以及针对特定研究的验证。这些都是针对该证据模型需要评估的相关能力。研究团队应当针对其实际部署确认真实的配置、集成、权限及验证范围,而不是将产品描述直接视为某项特定方案已正确实施的证明。[17] [18]
一份实用的实施交接包含经批准的标准规范、未决问题日志、数据源与数据流图、角色矩阵、测试证据、应急流程以及方案修正案计划。将每一项分配给具体的职能部门,并明确有权进行接收确认的人员。供应商可实施并支持约定的功能;申办方和研究者团队则保留其适用的科学、临床和监督职责。
在开展首次筛选前,以一名虚拟受试者走完完整流程。涵盖知情同意、待出结果、修正后的数值、入选资格判定以及交接至随机化环节。对记录进行正向与反向追踪。预期目标是形成这样一个工作流程:相关人员能够清晰获知哪些信息已知、哪些问题仍未解决,以及由哪项获授权的决定准许进入下一步。这正是审核特定研究系统搭建时所依据的实用标准。
来源
1. FDA — 提高临床试验参与度:入排标准、入组实践与试验设计,最终指南,2025 年 12 月.
2. EMA — ICH E8(R1),临床研究的一般考虑.
3. Liu 等 — 利用真实世界数据与 AI 评估肿瘤试验的入排标准,Nature 592, 629–633, 2021.
4. EClinCloud — BIMO 频次重新计算与明确标识的虚拟筛选模型. FDA 快照 2026 年 8 月 23 日;审阅于 2026 年 9 月 18 日。
7. FDA — FY2024 临床研究者 FDA 483 观察项趋势.
8. eCFR — 21 CFR 312.60,研究者的一般职责.
9. eCFR — 21 CFR 312.62,研究者记录保存与记录留存.
10. FDA — E6(R3) 药物临床试验质量管理规范,最终指南,2025 年 9 月.
11. FDA — 研究入组前的筛选检查.
12. FDA — 知情同意,面向 IRB、临床研究者和申办方的指南,2023 年 8 月.
13. FDA — 临床研究中的电子系统、电子记录与电子签名:问答,2024 年 10 月.
14. ClinicalTrials.gov — 方案注册数据元定义.
15. eCFR — 42 CFR 11.48,临床试验结果信息与受试者流程.
16. FDA — 基于风险的临床研究监查方法:问答,2023 年 4 月.
17. EClinCloud — EDC 产品与实施范围. 公司描述核对于 2026 年 9 月 18 日。
18. EClinCloud — RTSM 产品与实施范围. 公司描述核对于 2026 年 9 月 18 日。
