01 / PROCESS5标准流程阶段
02 / SCENARIO3递进场景层级
03 / CAPABILITY4统一能力维度
04 / OUTPUT1统一评测报告
PROTOCOL ABSTRACT

MedEvidenceBench 采用标准化受理、统一环境测评与质量控制相结合的工作机制。所有参评模型遵循同一任务边界、评分框架和结果发布规则,以保障不同模型之间的可比性。

01 · STANDARD WORKFLOW

五阶段评测流程

从申请受理到榜单发布,每个阶段均形成明确的输入、处理和输出。

01提交申请 02平台审核 03运行评测 04出具报告 05发布排名 01提交申请 02平台审核 03运行评测 04出具报告 05发布排名
Application → Qualification screening → Evaluation → Report → Publication
01

提交申请

开发者提交模型名称、开发主体、访问方式及必要的技术说明。

02

平台审核

核验模型资质、材料完整性与评测条件,确认任务边界。

03

运行评测

在统一环境下,按三级场景与四维能力框架执行标准化测评。

04

出具报告

汇总综合得分与能力分析,形成正式评测报告。

05

发布排名

完成发布审核后,将符合公开条件的模型纳入排行榜。

02 · QUALITY ASSURANCE

统一测评与质量控制

通过统一环境、评分框架和发布规则,保证每次测评执行一致、结果可比较。

CONTROL A · AUTOMATED

统一环境自动化测评

参评模型在一致的任务输入、运行参数和评分规则下完成测评,减少环境差异对模型比较的影响。

CONTROL B · EVIDENCE

循证评分框架

依据公开的循证标准与能力维度进行结构化评分,确保指标定义清晰、计算过程一致。

统一口径同一测评集、运行条件与评分框架
过程留痕记录任务输入、模型输出与评分过程
结果发布按统一规则生成报告并进入公开榜单
03 · FREQUENTLY ASKED QUESTIONS

常见问题

关于评测费用与数据安全的说明。

目前平台处于开放期,对符合条件的医疗大模型提供免费评测服务。具体政策请关注平台公告或联系官方邮箱。
所有评测数据均经过脱敏处理,平台严格遵守数据安全与隐私保护协议,确保模型和数据安全。