FDA首次发布生成式AI医疗器械监管框架讨论稿


2026年8月18日,FDA数字健康卓越中心(DHCoE)正式发布了一份重磅文件——《生成式AI医疗器械监管考量》讨论稿(Considerations for the Regulation of Generative AI-Enabled Medical Devices),并通过Regulations.gov开放公众评议(Docket编号:FDA-2026-N-7874),意见截止日期为2026年10月19日。
这不是一份草案指南(Draft Guidance),也不是最终指南——FDA在第一页就写明了免责声明:"本文不代表草案或最终指南,不旨在提出或实施政策变更。" 但这不妨碍它成为FDA迄今为止关于大语言模型(LLM)、生成式AI应用于医疗器械的最具体、最系统的官方思考。
为什么要高度关注?因为讨论稿阶段恰恰是行业影响监管走向的最佳窗口——FDA征集的反馈,将直接塑造未来审评员审查你提交材料时使用的证据标准。
作为深耕全球医疗器械注册的专业机构,普瑞纯证第一时间完成了全文研读,并已在YouTube发布了专题播客解读。以下是我们从出海企业视角提炼的核心要点和实操建议。
一、大背景:GenAI不是传统AI/ML的"升级版",是完全不同的物种
FDA目前已授权超过1,500款AI/ML医疗器械(截至2026年一季度约1,524款),其中绝大多数是基于卷积神经网络(CNN)的影像辅助诊断工具——输入一张CT,输出一个概率值,确定性强、边界清晰。
但生成式AI完全不同。讨论稿开篇就点明了GenAI器械与传统AI/ML器械的本质差异:
🔹 非确定性(Non-deterministic)——同样的输入可能产生不同的输出
🔹 开放式输入(Open-ended inputs)——用户可以问任何问题,不限于预设选项
🔹 多任务能力——一个模型可以执行多种不同的临床功能
🔹 持续变化——底层基础模型可能被第三方供应商随时更新
🔹 "令人信服的幻觉"(Convincing hallucinations)——错误输出可能看起来完全正确
FDA代理局长Kyle Diamantas在发布声明中明确表态:"人工智能正在改变医学,美国必须引领这项技术如何被安全、负责地开发和使用。" CDRH主任Michelle Tarver也强调,FDA正在启动一个"透明的流程",邀请公众参与塑造监管框架。
但FDA同时坚守了一条底线原则:"FDA不监管生成式AI本身,FDA监管的是医疗器械。"——技术是手段,预期用途(Intended Use)才是监管锚点。
二、核心框架一:"双轴风险评估"——你的AI有多自主?出错后果有多严重?
讨论稿提出了一个可能改变GenAI器械监管逻辑的双轴风险评估框架(Two-Axis Risk Framework)。
📐 横轴:器械的活动独立程度(从"提供信息"到"自主行动")
FDA将GenAI器械的功能分为四个递进层级:
1.非指向性信息(Non-directive information)——例如提供一个心血管风险评分,不建议你做什么
2.行动指向性信息(Action-directing information)——例如告诉你"你应该去急诊"
3.在监督下采取行动(Action-taking under supervision)——例如在医生监控下自动调整胰岛素剂量
4.完全自主行动(Fully autonomous action)——例如自动开具处方
📐 纵轴:输出错误的后果严重程度(从"有限"到"严重")
风险从左下角向右上角递增。FDA给出了非常具体的定位示例:
🟢 低风险区:建议用氢化可的松治疗毒藤疹(信息性 + 后果有限)
🟡 中高风险区:建议胸痛患者是否应该去急诊(仍然是"信息",但后果严重);调整基础胰岛素剂量(需要精确的定量分析)
🔴 高风险区:自主启动中风溶栓治疗方案(完全自主 + 后果极其严重)
💡 普瑞纯证解读:这个框架有两个细节值得中国出海企业特别注意:
①"指向性"是看实质,不是看措辞——在输出后面加一句"请咨询医生",并不能让一个实质上在指导行动的输出变成"非指向性信息"。FDA会按内容的实际效果来判断。
②面向患者的功能风险更高——因为患者无法像临床医生一样验证AI的输出。同样的功能,HCP端和患者端的风险定位可能完全不同。
对企业的直接影响:你的预期用途声明(Intended Use Statement)现在必须明确说明两件事——AI功能的自主程度有多高,以及错误输出的临床后果有多严重——并在风险文件中为两者的定位提供依据。
三、核心框架二:"能力评估"——像考医生执照一样考AI
讨论稿提出的第二个核心概念可能是最具开创性的——能力评估方法(Competency Assessment Approach)。
FDA的原话是:"受到临床医生如何被评估和认证的高层启发"(inspired, at a high level, by how human clinicians are evaluated and credentialed)。
简单来说,FDA打算像培养和考核医生一样来评估GenAI器械:先做标准化考试(基准测试),再做临床实习(临床确认),最后持续考核(上市后监测)。
📋 第一阶段:器械基准测试(Device Benchmarking)——"标准化考试"
FDA提出了10个基准测试要素,分为四大类:
🛡️ 安全性(Safety)
S.1 安全关键识别与升级——能否在情况恶化时及时升级?是否会过度安慰患者?
S.2 范围维护与边界遵守——面对对抗性提示(Prompt Injection)、情绪操纵、多轮对话漂移时能否守住边界?同时,过度拒绝也算失败
S.3 校准、不确定性与临床转介——面对有争议或过时的信息时是否会表现出虚假自信?
🏥 临床能力(Clinical Proficiency)
E.1 临床知识与任务准确性——指南、禁忌症、药物相互作用、特殊人群
E.2 信息采集与分析——鉴别诊断的完整性、追问能力、是否过早下结论
E.3 定量与测量分析——基于体重和肾功能的剂量计算、单位换算、异常值识别
E.4 沟通与理解——健康素养适配、共情能力、是否使用强制性语言、是否引发自动化偏见
🌐 泛化能力(Generalizability)
R.1 鲁棒性、可靠性、可重复性——重复运行、改写表述、改变输入顺序、长对话
R.2 亚组表现——不同人口学特征、方言、口音、读写水平
🤖 智能体能力(Agentic Competencies)
A.1 智能体行为——在安全范围内规划、识别工具错误、在不可逆操作前设置人工检查点
值得注意的是,FDA在方法论中提到了一个突破性的细节:当评估的"专家裁判"本身是一个LLM时,独立性要求同样适用——也就是说,FDA正式认可了用AI来考AI的可能性,只要这个"考官AI"与被测试的器械AI是独立的。
🏥 第二阶段:临床确认(Clinical Confirmation)——"临床实习"
FDA明确表示,基准测试"可能无法完全确定GenAI器械在真实临床使用中的表现",因此需要临床确认。但同时给了一个重要的减负信号:"临床确认可能不需要在每种情况下都进行前瞻性临床研究。"
FDA提出了五级递进的临床确认方法,按严格程度和患者暴露程度排列:
1.回顾性评估——使用真实患者数据(数据不足时可用合成数据补充)
2.影子部署(Shadow Deployment)——AI在真实环境运行,但输出不展示给临床医生
3.标准化患者交互——使用训练有素的演员模拟患者场景
4.盲法或非盲法临床医生裁判——由临床医生对真实病例的AI输出进行评判
5.前瞻性研究——包括RCT在内的正式临床试验
💡 普瑞纯证解读:这个"五级阶梯"设计非常巧妙。它意味着并非所有GenAI器械都需要做RCT——低风险器械可能只需回顾性评估加影子部署就够了。企业需要做的是,在双轴框架上准确定位自己产品的风险等级,然后选择与之匹配的临床确认层级。这种"风险匹配证据"的思路,与FDA现有的De Novo和510(k)审查逻辑一脉相承。
四、核心框架三:上市后监测——用"持续考核"换"入学门槛降低"
讨论稿第六章打出了一张可能改变GenAI器械经济学的牌:
"CDRH正在考虑,是否可以通过更多地依赖上市后监测,来接受更大的上市前不确定性。"
——FDA讨论稿 Section VI
这意味着什么?翻译成商业语言就是:如果你能向FDA证明上市后有持续、有效的安全监控机制,FDA可能愿意在上市前审查阶段降低证据门槛。
FDA提出的上市后监测选项包括:
🔄 定期重新基准测试——对照上市前的性能阈值重新跑测试
👨⚕️ 基于抽样的真实世界审查——由独立临床医生审查真实的输入-输出对
📊 漂移监测(Drift Monitoring)——持续追踪模型性能是否退化
🤖 机器监控代理——FDA提问(Q20):是否可以用"机器监督代理"来执行部分上市后监测?
上市前评估成为基线,如果器械被修改,就需要"对照相同的能力重新进行基准测试"。对于底层模型的第三方更新,FDA专门设了一个问题(Q24),因为变更可能由模型供应商而非器械制造商触发。
💡 普瑞纯证解读:这个"上市前vs上市后"的权衡对出海企业来说是一个重大利好信号。传统路径下,510(k)或De Novo的上市前证据要求是"一次性大考"——你要在提交时证明一切。但GenAI器械的特性决定了模型会持续变化,一次性考试无法覆盖全部场景。FDA正在探索的方向是把"资本开支"(capex)转化为"运营成本"(COGS)——前期投入减少,但承诺持续的安全监控。这与FDA现有的PCCP(预定变更控制计划)机制可以形成很好的衔接。
五、基础模型与智能体AI:谁来为"黑盒"负责?
讨论稿用了专门的章节来处理两个棘手问题:第三方基础模型和智能体AI(Agentic AI)。
🧱 基础模型器械主文件(Foundation Model Device Master File)
FDA提出了一个创新的解决方案——自愿性的基础模型器械主文件(MAF)制度。
核心逻辑是:OpenAI、Google、Meta等基础模型开发商可以向FDA秘密提交模型的技术信息(包括架构、训练数据来源、已知局限性、安全措施、更新通知承诺、审计日志等),FDA保密存档。当器械制造商使用该基础模型开发产品并提交上市申请时,可以引用(Reference)这份主文件,无需自己重新证明底层模型的全部细节。
但FDA也明确了底线:提交MAF不等于模型获得了任何医疗用途的授权;器械厂商仍然需要独立证明最终产品的安全性和有效性。
FDA在Q25中坦率地提出了核心挑战:"鉴于模型开发商披露信息的激励有限,怎样才能使自愿MAF制度真正有用?"
🤖 智能体AI(Agentic AI)
FDA首次给出了智能体AI的工作定义:"能够自主规划和执行多步骤任务、使用外部工具或跨多个步骤采取行动的系统。"
对于智能体AI,FDA设置了专门的基准测试要素A.1,重点关注:
📌 在不可逆操作前设置人工检查点
📌 通过检索内容和工具输出实施的注入攻击防护
📌 在安全边界内的规划能力
⚠️ UpDoc案例参考:2025年12月23日,FDA通过510(k)途径批准了UpDoc(K253281),这被认为是FDA首个涉及患者端大语言模型的器械获批案例。但值得注意的是,UpDoc的批准范围非常狭窄——仅限于成人2型糖尿病的胰岛素管理,且LLM是在医生设定的确定性协议框架内运行的"对话界面",而非自主决策的"AI医生"。这说明FDA的态度是:有边界、有监督的LLM功能可以通过现有510(k)路径获批,但无限制的自主LLM还远未到达终点线。
六、26个关键问题:FDA在问什么?
讨论稿中嵌入了26个编号讨论问题,覆盖四大主题领域。以下是对中国AI器械出海企业最关键的几个问题:
📌 Q7:能力评估方法(基准测试 + 临床确认)是否适合GenAI器械的上市前评估?——这是整个框架的根基性问题
📌 Q10:公共基准测试的有效性如何?如何解决数据污染、饱和度和真实世界代表性不足?
📌 Q11-Q12:临床确认应该做到哪个层级?样本量如何确定?——直接影响你的临床开发成本
📌 Q18:FDA是否应该接受更大的上市前不确定性,以换取更强的上市后监测?——这可能是最具战略影响力的问题
📌 Q22:哪些器械变更可以留在QMS内部管理,不需要新的上市前审查?
📌 Q24:当第三方基础模型供应商更新了底层模型,器械制造商应承担什么义务?
📌 Q25:自愿性基础模型MAF应包含哪些内容才能真正有用?
FDA接受部分回复——你不需要回答全部26个问题,只回答与你产品相关的即可。
七、对中国AI医疗器械出海企业的实操建议
1.立即下载研读讨论稿原文
这不是一份只有监管专家才需要看的文件。建议组织监管、研发、临床、AI工程团队联合研读。重点关注26个讨论问题中与你产品管线相关的部分。
2.在双轴框架上定位你的产品
你的GenAI器械功能处于"信息提供"还是"自主行动"?出错后果是"有限"还是"严重"?这个定位将决定FDA对你的证据期望等级,也将影响你的预期用途声明的写法。
3.评估现有测试方案与10要素基准测试的差距
对照FDA提出的S.1-S.3、E.1-E.4、R.1-R.2、A.1十个要素,审视你现有的验证和确认方案。特别注意对抗性提示测试(S.2)、亚组表现评估(R.2)和智能体安全性(A.1)——这些可能是传统AI/ML器械验证方案中没有覆盖的新领域。
4.梳理基础模型供应链合同
如果你使用的是第三方基础模型(如GPT、Claude等),现在就需要与供应商谈判版本锁定(Version Pinning)、变更通知、信息披露等合同条款。FDA的MAF制度一旦落地,这些合同将成为你监管合规的基础。
5.考虑提交公众评议意见
10月19日截止的公众评议期是影响FDA监管方向的真正窗口。企业可以针对与自身产品相关的问题提交实质性意见。早期参与不仅能影响规则制定,还能向FDA展示你对监管合规的主动态度。
6.关注PCCP与GenAI的衔接
FDA的预定变更控制计划(PCCP)框架已于2024年底定稿。对于GenAI器械,PCCP可能成为管理模型更新的主要工具——"预先批准你的测试方案",这样模型更新后只需重新跑测试,而不需要每次都重新提交上市申请。
7.持续关注FDA后续动向
讨论稿只是起点。预计FDA将在评议期结束后发布更具约束力的指南文件。建议密切跟踪CDRH的数字健康卓越中心(DHCoE)动态、数字健康咨询委员会(DHAC)会议,以及后续可能的联合指南或预提交会议(Pre-Submission)。
八、写在最后:窗口已经打开,谁先行动谁就定义规则
从2019年FDA发布AI/ML SaMD监管框架提案,到2021年AI/ML行动计划,到2024年PCCP指南定稿,到2025年UpDoc成为首个涉及LLM的获批器械,再到今天的GenAI讨论稿——FDA对AI医疗器械的监管思路正在快速演进,而且方向非常清晰:不是"要不要管",而是"怎么管才能既鼓励创新又保护患者"。
讨论稿的发布意味着游戏规则正在被重新书写。在新规则尚未定型的窗口期,企业的每一条公众评议意见、每一次Pre-Sub会议、每一个产品提交,都有可能成为未来FDA审评标准的参考点。
对中国AI医疗器械企业来说,现在是布局美国市场的关键节点——不是等规则确定后再行动,而是在规则制定过程中就成为参与者。
参考来源:
🔗 FDA官方新闻稿:FDA Seeks Public Feedback to Inform Regulatory Approach for Generative AI-Enabled Medical Devices
www.fda.gov/news-events/press-announcements/fda-seeks-public-feedback-inform-regulatory-approach-generative-ai-enabled-medical-devices
🔗 Regulations.gov公众评议入口 Docket FDA-2026-N-7874
www.regulations.gov/docket/FDA-2026-N-7874
🔗 Pure Global YouTube播客:FDA Discussion Paper on Generative AI in Medical Devices
www.youtube.com/watch?v=ldYNx7VrWuE
全球准入 ▶▶▶
🔗FDA"Simple Reform"大重组落地!10月1日起检查员不再专攻医疗器械——出海企业的GMP检查将面临哪些变数?
►►►
扫码进入我们的专家群,为您解答各种法规难题

关于Pure Global普瑞纯证 普瑞纯证拥有全球法规专家团队,支持34个国家 / 地区注册准入服务,并设立当地代表,配备全球数百个合作临床实验室及临床专家团队。 在全球临床和患者服务环节,普瑞纯证凭借遍布全球的数百个合作实验室、2 个自营实验室和 8 个海外生物银行,为医疗企业提供高效临床试验服务。其全球智能法规平台(GRIP)包含全球法规资讯、临床试验数据、多国注册产品数据、经销商数据等数据库,助力企业在产品海外落地各节点,利用大数据支持商业决策与市场战略制定。通过本次会议,将深入探讨如何借助 AI Agent 及本地化网络,从全球市场准入、产品策略、国际合规、营销体系,到全球临床和患者服务等方面,帮助中国医械企业抓住出海机会,铺平准入路径,解锁全球市场,实现从 “寻宝式” 出海到 “融入共赢式” 出海的转变,推动医疗器械行业全球化迈向新高度。


►►►
扫码进入我们的专家群,为您解答各种法规难题



