普瑞纯证

FDA首次发布生成式AI医疗器械监管框架讨论稿

图片
文章配图:FDA首次发布生成式AI医疗器械监管框架讨论稿

2026年8月18日FDA数字健康卓越中心DHCoE正式发布了一份重磅文件——生成式AI医疗器械监管考量讨论稿Considerations for the Regulation of Generative AI-Enabled Medical Devices),并通过Regulations.gov开放公众评议Docket编号FDA-2026-N-7874),意见截止日期为2026年10月19日

这不是一份草案指南Draft Guidance),也不是最终指南——FDA在第一页就写明了免责声明"本文不代表草案或最终指南不旨在提出或实施政策变更" 但这不妨碍它成为FDA迄今为止关于大语言模型LLM)、生成式AI应用于医疗器械的最具体最系统的官方思考

为什么要高度关注因为讨论稿阶段恰恰是行业影响监管走向的最佳窗口——FDA征集的反馈,将直接塑造未来审评员审查你提交材料时使用的证据标准

作为深耕全球医疗器械注册的专业机构普瑞纯证第一时间完成了全文研读并已在YouTube发布了专题播客解读以下是我们从出海企业视角提炼的核心要点和实操建议

大背景GenAI不是传统AI/ML的"升级版"是完全不同的物种

FDA目前已授权超过1,500款AI/ML医疗器械截至2026年一季度约1,524款),其中绝大多数是基于卷积神经网络CNN的影像辅助诊断工具——输入一张CT输出一个概率值确定性强边界清晰

但生成式AI完全不同讨论稿开篇就点明了GenAI器械与传统AI/ML器械的本质差异

🔹 非确定性Non-deterministic——同样的输入可能产生不同的输出

🔹 开放式输入Open-ended inputs——用户可以问任何问题不限于预设选项

🔹 多任务能力——一个模型可以执行多种不同的临床功能

🔹 持续变化——底层基础模型可能被第三方供应商随时更新

🔹 "令人信服的幻觉"Convincing hallucinations——错误输出可能看起来完全正确

FDA代理局长Kyle Diamantas在发布声明中明确表态"人工智能正在改变医学美国必须引领这项技术如何被安全负责地开发和使用" CDRH主任Michelle Tarver也强调FDA正在启动一个"透明的流程"邀请公众参与塑造监管框架

但FDA同时坚守了一条底线原则"FDA不监管生成式AI本身FDA监管的是医疗器械"——技术是手段预期用途Intended Use才是监管锚点

核心框架一"双轴风险评估"——你的AI有多自主出错后果有多严重

讨论稿提出了一个可能改变GenAI器械监管逻辑的双轴风险评估框架Two-Axis Risk Framework

📐 横轴器械的活动独立程度"提供信息"到"自主行动"

FDA将GenAI器械的功能分为四个递进层级

1.非指向性信息Non-directive information——例如提供一个心血管风险评分不建议你做什么

2.行动指向性信息Action-directing information——例如告诉你"你应该去急诊"

3.在监督下采取行动Action-taking under supervision——例如在医生监控下自动调整胰岛素剂量

4.完全自主行动Fully autonomous action——例如自动开具处方

📐 纵轴输出错误的后果严重程度"有限"到"严重"

风险从左下角向右上角递增FDA给出了非常具体的定位示例

🟢 低风险区建议用氢化可的松治疗毒藤疹信息性 + 后果有限

🟡 中高风险区建议胸痛患者是否应该去急诊仍然是"信息"但后果严重);调整基础胰岛素剂量需要精确的定量分析

🔴 高风险区自主启动中风溶栓治疗方案完全自主 + 后果极其严重

💡 普瑞纯证解读这个框架有两个细节值得中国出海企业特别注意

"指向性"是看实质不是看措辞——在输出后面加一句"请咨询医生"并不能让一个实质上在指导行动的输出变成"非指向性信息"FDA会按内容的实际效果来判断

面向患者的功能风险更高——因为患者无法像临床医生一样验证AI的输出同样的功能HCP端和患者端的风险定位可能完全不同

对企业的直接影响你的预期用途声明Intended Use Statement现在必须明确说明两件事——AI功能的自主程度有多高以及错误输出的临床后果有多严重——并在风险文件中为两者的定位提供依据

核心框架二"能力评估"——像考医生执照一样考AI

讨论稿提出的第二个核心概念可能是最具开创性的——能力评估方法Competency Assessment Approach

FDA的原话是"受到临床医生如何被评估和认证的高层启发"inspired, at a high level, by how human clinicians are evaluated and credentialed)。

简单来说FDA打算像培养和考核医生一样来评估GenAI器械先做标准化考试基准测试),再做临床实习临床确认),最后持续考核上市后监测)。

📋 第一阶段器械基准测试Device Benchmarking——"标准化考试"

FDA提出了10个基准测试要素分为四大类

🛡️ 安全性Safety

S.1 安全关键识别与升级——能否在情况恶化时及时升级是否会过度安慰患者

S.2 范围维护与边界遵守——面对对抗性提示Prompt Injection)、情绪操纵多轮对话漂移时能否守住边界同时过度拒绝也算失败

S.3 校准不确定性与临床转介——面对有争议或过时的信息时是否会表现出虚假自信

🏥 临床能力Clinical Proficiency

E.1 临床知识与任务准确性——指南禁忌症药物相互作用特殊人群

E.2 信息采集与分析——鉴别诊断的完整性追问能力是否过早下结论

E.3 定量与测量分析——基于体重和肾功能的剂量计算单位换算异常值识别

E.4 沟通与理解——健康素养适配共情能力是否使用强制性语言是否引发自动化偏见

🌐 泛化能力Generalizability

R.1 鲁棒性可靠性可重复性——重复运行改写表述改变输入顺序长对话

R.2 亚组表现——不同人口学特征方言口音读写水平

🤖 智能体能力Agentic Competencies

A.1 智能体行为——在安全范围内规划识别工具错误在不可逆操作前设置人工检查点

值得注意的是FDA在方法论中提到了一个突破性的细节当评估的"专家裁判"本身是一个LLM时独立性要求同样适用——也就是说FDA正式认可了用AI来考AI的可能性只要这个"考官AI"与被测试的器械AI是独立的

🏥 第二阶段临床确认Clinical Confirmation——"临床实习"

FDA明确表示基准测试"可能无法完全确定GenAI器械在真实临床使用中的表现"因此需要临床确认但同时给了一个重要的减负信号"临床确认可能不需要在每种情况下都进行前瞻性临床研究"

FDA提出了五级递进的临床确认方法按严格程度和患者暴露程度排列

1.回顾性评估——使用真实患者数据数据不足时可用合成数据补充

2.影子部署Shadow Deployment——AI在真实环境运行但输出不展示给临床医生

3.标准化患者交互——使用训练有素的演员模拟患者场景

4.盲法或非盲法临床医生裁判——由临床医生对真实病例的AI输出进行评判

5.前瞻性研究——包括RCT在内的正式临床试验

💡 普瑞纯证解读这个"五级阶梯"设计非常巧妙它意味着并非所有GenAI器械都需要做RCT——低风险器械可能只需回顾性评估加影子部署就够了企业需要做的是在双轴框架上准确定位自己产品的风险等级然后选择与之匹配的临床确认层级这种"风险匹配证据"的思路FDA现有的De Novo和510(k)审查逻辑一脉相承

核心框架三上市后监测——用"持续考核"换"入学门降低"

讨论稿第六章打出了一张可能改变GenAI器械经济学的牌

"CDRH正在考虑是否可以通过更多地依赖上市后监测来接受更大的上市前不确定性"
——FDA讨论稿 Section VI

这意味着什么翻译成商业语言就是如果你能向FDA证明上市后有持续有效的安全监控机制FDA可能愿意在上市前审查阶段降低证据门槛。

FDA提出的上市后监测选项包括

🔄 定期重新基准测试——对照上市前的性能值重新跑测试

👨‍⚕️ 基于抽样的真实世界审查——由独立临床医生审查真实的输入-输出对

📊 漂移监测Drift Monitoring——持续追踪模型性能是否退化

🤖 机器监控代理——FDA提问Q20):是否可以用"机器监督代理"来执行部分上市后监测

上市前评估成为基线如果器械被修改就需要"对照相同的能力重新进行基准测试"对于底层模型的第三方更新FDA专门设了一个问题Q24),因为变更可能由模型供应商而非器械制造商触发

💡 普瑞纯证解读这个"上市前vs上市后"的权衡对出海企业来说是一个重大利好信号传统路径下510(k)或De Novo的上市前证据要求是"一次性大考"——你要在提交时证明一切GenAI器械的特性决定了模型会持续变化一次性考试无法覆盖全部场景FDA正在探索的方向是把"资本开支"capex转化为"运营成本"COGS——前期投入减少但承诺持续的安全监控这与FDA现有的PCCP预定变更控制计划机制可以形成很好的衔接

基础模型与智能体AI谁来为"黑盒"负责

讨论稿用了专门的章节来处理两个棘手问题第三方基础模型智能体AIAgentic AI

🧱 基础模型器械主文件Foundation Model Device Master File

FDA提出了一个创新的解决方案——自愿性的基础模型器械主文件MAF制度

核心逻辑是OpenAIGoogleMeta等基础模型开发商可以向FDA秘密提交模型的技术信息包括架构训练数据来源已知局限性安全措施更新通知承诺审计日志等),FDA保密存档当器械制造商使用该基础模型开发产品并提交上市申请时可以引用Reference这份主文件无需自己重新证明底层模型的全部细节

但FDA也明确了底线提交MAF不等于模型获得了任何医疗用途的授权器械厂商仍然需要独立证明最终产品的安全性和有效性

FDA在Q25中坦率地提出了核心挑战"鉴于模型开发商披露信息的激励有限怎样才能使自愿MAF制度真正有用"

🤖 智能体AIAgentic AI

FDA首次给出了智能体AI的工作定义"能够自主规划和执行多步骤任务使用外部工具或跨多个步骤采取行动的系统"

对于智能体AIFDA设置了专门的基准测试要素A.1重点关注

📌 在不可逆操作前设置人工检查点

📌 通过检索内容和工具输出实施的注入攻击防护

📌 在安全边界内的规划能力

⚠️ UpDoc案例参考2025年12月23日FDA通过510(k)途径批准了UpDocK253281),这被认为是FDA首个涉及患者端大语言模型的器械获批案例但值得注意的是UpDoc的批准范围非常狭窄——仅限于成人2型糖尿病的胰岛素管理LLM是在医生设定的确定性协议框架内运行的"对话界面"而非自主决策的"AI医生"这说明FDA的态度是有边界有监督的LLM功能可以通过现有510(k)路径获批但无限制的自主LLM还远未到达终点线

26个关键问题FDA在问什么

讨论稿中嵌入了26个编号讨论问题覆盖四大主题领域以下是对中国AI器械出海企业最关键的几个问题

📌 Q7能力评估方法基准测试 + 临床确认是否适合GenAI器械的上市前评估——这是整个框架的根基性问题

📌 Q10公共基准测试的有效性如何如何解决数据污染饱和度和真实世界代表性不足

📌 Q11-Q12临床确认应该做到哪个层级样本量如何确定——直接影响你的临床开发成本

📌 Q18FDA是否应该接受更大的上市前不确定性以换取更强的上市后监测——这可能是最具战略影响力的问题

📌 Q22哪些器械变更可以留在QMS内部管理不需要新的上市前审查

📌 Q24当第三方基础模型供应商更新了底层模型器械制造商应承担什么义务

📌 Q25自愿性基础模型MAF应包含哪些内容才能真正有用

FDA接受部分回复——你不需要回答全部26个问题只回答与你产品相关的即可

对中国AI医疗器械出海企业的实操建议

1.立即下载研读讨论稿原文

这不是一份只有监管专家才需要看的文件建议组织监管研发临床AI工程团队联合研读重点关注26个讨论问题中与你产品管线相关的部分

2.在双轴框架上定位你的产品

你的GenAI器械功能处于"信息提供"还是"自主行动"出错后果是"有限"还是"严重"这个定位将决定FDA对你的证据期望等级也将影响你的预期用途声明的写法

3.评估现有测试方案与10要素基准测试的差距

对照FDA提出的S.1-S.3E.1-E.4R.1-R.2A.1十个要素审视你现有的验证和确认方案特别注意对抗性提示测试S.2)、亚组表现评估R.2和智能体安全性A.1——这些可能是传统AI/ML器械验证方案中没有覆盖的新领域

4.梳理基础模型供应链合同

如果你使用的是第三方基础模型GPTClaude等),现在就需要与供应商谈判版本锁定Version Pinning)、变更通知信息披露等合同条款FDA的MAF制度一旦落地这些合同将成为你监管合规的基础

5.考虑提交公众评议意见

10月19日截止的公众评议期是影响FDA监管方向的真正窗口企业可以针对与自身产品相关的问题提交实质性意见早期参与不仅能影响规则制定还能向FDA展示你对监管合规的主动态度

6.关注PCCP与GenAI的衔接

FDA的预定变更控制计划PCCP框架已于2024年底定稿对于GenAI器械PCCP可能成为管理模型更新的主要工具——"预先批准你的测试方案"这样模型更新后只需重新跑测试而不需要每次都重新提交上市申请

7.持续关注FDA后续动向

讨论稿只是起点预计FDA将在评议期结束后发布更具约束力的指南文件建议密切跟踪CDRH的数字健康卓越中心DHCoE动态数字健康咨询委员会DHAC会议以及后续可能的联合指南或预提交会议Pre-Submission)。

写在最后窗口已经打开谁先行动谁就定义规则

从2019年FDA发布AI/ML SaMD监管框架提案2021年AI/ML行动计划2024年PCCP指南定稿2025年UpDoc成为首个涉及LLM的获批器械再到今天的GenAI讨论稿——FDA对AI医疗器械的监管思路正在快速演进而且方向非常清晰不是"要不要管"而是"怎么管才能既鼓励创新又保护患者"

讨论稿的发布意味着游戏规则正在被重新书写在新规则尚未定型的窗口期企业的每一条公众评议意见每一次Pre-Sub会议每一个产品提交都有可能成为未来FDA审评标准的参考点

对中国AI医疗器械企业来说现在是布局美国市场的关键节点——不是等规则确定后再行动而是在规则制定过程中就成为参与者

参考来源

🔗 FDA官方新闻稿FDA Seeks Public Feedback to Inform Regulatory Approach for Generative AI-Enabled Medical Devices 

www.fda.gov/news-events/press-announcements/fda-seeks-public-feedback-inform-regulatory-approach-generative-ai-enabled-medical-devices

🔗 Regulations.gov公众评议入口 Docket FDA-2026-N-7874

www.regulations.gov/docket/FDA-2026-N-7874

🔗 Pure Global YouTube播客FDA Discussion Paper on Generative AI in Medical Devices 

www.youtube.com/watch?v=ldYNx7VrWuE


往期回顾

全球准入  ▶▶▶

🔗MAUDE再见!FDA新系统AEMS来了——你的不良事件报告将被"实时直播"

🔗FDA时隔十年首次更新人因工程"总纲"指南——出海企业的产品设计和510(k)提交该怎么调整?

🔗FDA"Simple Reform"大重组落地!10月1日起检查员不再专攻医疗器械——出海企业的GMP检查将面临哪些变数?



►►►

扫码进入我们的专家群,为您解答各种法规难题


文章配图:FDA首次发布生成式AI医疗器械监管框架讨论稿



关于Pure Global普瑞纯证
    普瑞纯证拥有全球法规专家团队,支持34个国家 / 地区注册准入服务,并设立当地代表,配备全球数百个合作临床实验室及临床专家团队。

     在全球临床和患者服务环节,普瑞纯证凭借遍布全球的数百个合作实验室、2 个自营实验室和 8 个海外生物银行,为医疗企业提供高效临床试验服务。其全球智能法规平台(GRIP)包含全球法规资讯、临床试验数据、多国注册产品数据、经销商数据等数据库,助力企业在产品海外落地各节点,利用大数据支持商业决策与市场战略制定。通过本次会议,将深入探讨如何借助 AI Agent 及本地化网络,从全球市场准入、产品策略、国际合规、营销体系,到全球临床和患者服务等方面,帮助中国医械企业抓住出海机会,铺平准入路径,解锁全球市场,实现从 “寻宝式” 出海到 “融入共赢式” 出海的转变,推动医疗器械行业全球化迈向新高度。

图片
图片