学习强国

微信

山大发布

抖音

视频号

微博

小红书

快手

哔哩哔哩

山东大学报

学术纵横

    吕海泉课题组联合多家机构发布医疗人工智能循证可信测评系统MedEvidence Bench

    发布:山东大学融媒体中心 日期:2026年09月08日 点击数:

    [本站讯]近日,MedEvidence Bench(MEB)医疗人工智能循证可信测评系统在首届黄河医学人工智能大会正式发布。该项目由山东大学吕海泉课题组联合国家超级计算济南中心、山东第一医科大学附属省立医院等单位共同建设,旨在为医疗大模型建立以医学证据为核心的可信评价体系。

    项目组与多学科临床专家密切协作。在吕海泉教授指导下,山东大学高等医学研究院博士生赵智群主导项目框架搭建、组织协调、研究推进及相关测评工作的开展,硕士生李玉乐参与相关研究工作。团队围绕医疗AI从“知识问答”走向真实临床应用所面临的评价难题,开展测评框架设计、医学证据梳理、临床任务构建与模型评估等工作,共同形成覆盖医学基础、临床推理、循证决策和安全可信能力的“1+4+N”综合评价体系。

    与仅判断答案对错的传统测评不同,MEB强调每项评价均应有明确的医学依据:由医学专家确定考核重点,对照临床指南、专家共识和权威证据制定评分标准,同时界定结论的适用范围与安全边界。

    山东省医学会医学人工智能分会副主任委员、山东省计算中心(国家超级计算济南中心)主任吴晓明对本项目给予高度评价。他表示:“医疗人工智能要真正服务临床,核心不只是模型能否回答问题,更在于其回答是否建立在可追溯、可核验的医学证据之上。MedEvidence Bench将指南、共识和权威证据嵌入测评全过程,把模型能力、临床场景与安全边界关联起来,为医疗AI评价提供了更具医学逻辑和临床价值的方法。尤其是赵智群及其团队围绕证据链、临床推理与安全可信所开展的系统性工作,使测评不再停留在简单排名,而能够为模型研发、医院选型和后续质量管理提供参考。这种由算力平台、高校和医疗机构协同参与、并可随医学证据与模型迭代持续更新的评价机制,对推动医疗AI规范、可信落地具有积极意义。”

    目前,MEB已面向主流通用大模型和医学专用大模型开展测评探索。团队将继续联合临床专家及合作单位,拓展真实医疗场景,完善动态评价机制,为医疗AI研发、应用和持续监测提供技术支撑。

    赵智群由山东大学高等医学研究院与国家超级计算济南中心联合培养,依托高等医学研究院深厚的医学科研积淀与学科优势,以及国家超级计算济南中心顶尖的算力支撑、智能算法体系与工程化落地平台,立足真实临床需求导向,深耕医工交叉领域,开展系统性科研创新与实践应用。该联合培养模式,是国家深入实施“人工智能 +”行动、推进医学教育创新发展在高层次研究生培养中的生动落地与具体实践,契合山东大学构建“人工智能 +” 特色育人体系、深化学科交叉融合、培育拔尖创新医学人才的核心战略部署。


    【供稿单位:高等医学研究院     作者:吕海泉    责任编辑:蒋晓涵 夏中闻】