MedEvidenceBench 医疗模型评估
医疗人工智能循证可信评测平台

让每一个关键医学判断 都有循证依据

证据可追溯 · 评分可核验 · 能力可解释

聚焦医学循证能力的大模型开放测评基准,系统评价模型的临床基础能力、循证决策能力、临床推理能力和医疗安全。

15 个临床科室 6,411 个证据点 1:1 原文追溯
查看评测结果
01病例构建
02证据核验
03模型评测
04结果发布
STANDARD SUBSET

标准化临床场景

基于指南与专家共识,构建目标清晰、采用开放式问答的标准病例。

开放式问答 · 15 个临床科室 · 2992 个证据考察点
KNOWLEDGE EXAM

指南知识医学考试

基于权威医学指南与标准知识库,检验模型对核心医学知识的掌握与准确应用能力。

139 道医学知识考题
40,000+ 份受控证据来源 3 级证据来源分层 1 : 1 评分条目到原文追溯 MEB-QC 医生在环审核
指南、病例和证据资料
每个判断都有来源
从推荐意见回到指南原文,分数透明可核验。
TRACEABLE
1+4+N 医学大模型评价体系
“1+4+N”评价体系
1个核心原则 · 4大能力域 · N类临床场景,以医学证据为评价基准。
EVIDENCE FRAMEWORK
医学文档证据核验
真实临床场景
覆盖诊断判定、鉴别或疾病分型、风险分层、急症分诊、用药评估、慢性疾病管理和肿瘤筛查。
REAL WORLD
医生参与审核
医生在环审核
跨学科专家参与标准建设,复核证据灰区。
HUMAN REVIEW
模型反馈与持续迭代
为模型迭代定位缺口
报告证据缺失与不安全表达,支持持续迭代。
FEEDBACK LOOP
EVALUATION FRAMEWORK

“1+4+N” 循证医学评价体系

以医学证据为核心,构建全方位、多层次的医疗大模型能力评估框架

核心原则

以医学证据为评价基准

所有评测任务均锚定权威医学证据,确保评测结果客观、可溯源。

01

医学基础能力

掌握扎实的医学基础知识与术语体系,准确理解临床语境。

02

临床推理能力

模拟临床思维,进行逻辑推导、鉴别诊断与决策分析。

03

循证决策能力

检索、评价并应用最佳证据,指导临床实践与决策。

04

医疗安全能力

识别潜在风险,确保输出内容符合安全规范与伦理要求。

N 类临床场景 (持续扩展中)

覆盖从检验、影像到慢病管理、智能体等多元临床任务

检验 影像 用药 慢病 专病 临床路径 随访 智能体 急救 护理 病历生成 文献解读 + 更多
EVIDENCE-BASED · TRUSTWORTHY

循证 可信

医疗 AI 循证评测的黄金标准 —— 每个判断都有据可查、有源可溯

基准可更新

支持随指南、专家共识及临床规范的更新,动态修订和扩充评测任务、评分条目与循证依据,确保测评内容的时效性与有效性。

证据可追溯

建立评分条目、医学主张、循证证据、原文片段的全链路追溯关系,并由医生核验证据与病例适用条件的一致性,确保每项评分有据可查。

评分可复核

将开放式回答拆解为可独立判定的原子化评分条目,并按临床场景、能力维度汇总得分,确保评分结果可解释、可复核。

合作伙伴

联合权威机构,共建可信评测标准

诚邀各大模型研发团队、学术机构与产业伙伴携手共建
MedEvidenceBench!

面向中文医疗 AI,开放评测标准与高质量循证数据,欢迎各界伙伴共同参与。