近日,上海市卫生健康委员会与上海市人工智能行业协会联合发布了国内首个针对疑难病例的AI诊疗评测基准——“沪智医标”(暂定名)。这一基准的推出,标志着我国在医疗人工智能标准化评估领域迈出了关键一步,尤其为AI系统在复杂、罕见病以及多学科交叉病例中的诊疗能力提供了权威的“试金石”。
破解“疑难病例”AI评估空白
近年来,AI辅助诊断在影像识别、病理分析等任务中表现亮眼,但大多集中于常见病、典型病例。一旦面对症状不典型、合并多种基础疾病或罕见病等疑难情况,AI系统的表现往往差强人意,甚至存在误判风险。究其原因,缺乏统一的、高难度的评测基准是重要瓶颈。过去,各医疗AI研发机构常以自有数据集进行内部测试,标准不一,结果难以横向比较,更无法真实反映系统在真实临床疑难场景下的有效性。
此次上海发布的评测基准,正是瞄准了这一痛点。评测基准由上海多家三甲医院联合人工智能企业共同构建,涵盖神经内科、心血管、肿瘤、罕见遗传病等10余个高难度专科方向。其核心数据集包含超过10万例经专家团队严格标注的真实疑难病例,其中不少病例曾在临床中被多家医院误诊或延误诊断,具有极高的挑战性。
评测维度:从“看对”到“想通”
与传统AI评测仅关注“最终诊断准确率”不同,本次发布的基准引入了更为立体的评估体系。除了要求AI系统给出正确诊断结果外,还需要提供完整的“诊疗思维链”——包括鉴别诊断逻辑、检查优先级排序、治疗方案建议及其循证依据。评测专家将依据AI的推理过程是否合理、是否覆盖关键鉴别点、是否考虑患者个体化因素等进行综合打分。
上海市卫生健康委员会相关负责人表示:“疑难病例的诊疗,考验的不仅是AI的‘知识储备’,更是其‘临床推理能力’。我们希望通过这样的评测,筛选出真正能够辅助医生、而不是简单替代医生判断的AI系统。”
专家观点:推动行业良性竞争与临床落地
中国科学院院士、复旦大学附属中山医院神经内科专家在发布会上评价称:“这一评测基准的诞生,将促使AI研发企业更加重视临床真实需求,避免‘刷分式’的模型优化。未来,只有通过这一高门槛评测的AI系统,才能在上海的医疗机构中获得准入资格。”
此外,该基准还将定期更新迭代,纳入新发现的疑难病例以及最新诊疗指南。上海市人工智能行业协会表示,将开放评测平台,欢迎国内外AI团队参与挑战,并计划将评测结果向社会公布,形成良性竞争生态。
未来展望:从上海走向全国
作为全国医疗资源最为集中的地区之一,上海此次率先发布疑难病例AI诊疗评测基准,有望引领全国医疗AI行业的标准制定。接下来,上海还将联合长三角地区医疗机构,推动评测结果的互认互通,并探索将评测标准上升为行业标准乃至国家标准。
可以预见,随着这一基准的推广应用,医疗AI将从“能做”向“做得准、想得全”迈进。对于临床医生而言,更可靠的AI助手将有助于降低误诊漏诊率;对于患者而言,尤其是罕见病和复杂疾病患者,有望获得更精准、更及时的诊疗支持。
上海的这一举措,无疑为医疗AI的临床落地注入了一剂“强心针”。而在这场技术革命中,一份严谨、科学、可量化的评测基准,正是通往未来智慧医疗不可或缺的“通行证”。