与上海交通大学网络空间安全团队联合研发

EvalForge 大模型评测平台

五维一体评测体系,让大模型与 Agent 应用可评测、可比较、可信赖

安全对齐红队攻击测试多轮越狱评测能力评测自研评测模型备案支撑私有化部署

为什么需要独立评测

凡落地大模型与 Agent 的企业,都需要回答同一个问题:它安全吗、可靠吗、合规吗

监管合规要求

生成式人工智能服务上线须完成备案,安全评估是前提条件;金融、政务、教育等行业另有更严格的合规要求。

Agent 应用上线潮

模型选型、效果验证、安全测试贯穿 AI 应用全生命周期,评测正在从一次性备案走向持续合规监测。

独立第三方公信力

平台方与评测方分离,评测报告才更具公信力——这正是独立第三方与学术背书的价值所在。

五维一体评测体系

从安全对齐到模型资产安全,覆盖从基础能力到博士级难度的完整评测框架

安全对齐

能不能信任它?

4 套件 / 30+ 数据集

认知智力

聪不聪明?

3 套件 / 40+ 数据集

专业技能

能不能干活?

3 套件 / 20+ 数据集

社会智能

好不好合作?

2 套件 / 10+ 数据集

模型资产安全

资产受保护吗?

2 套件 / 5+ 数据集

14

评测套件

90+

评测数据集

50万+

测试样本

314

细粒度风险类别

98.6%

自研评测模型 F1

评测流水线

从评测集管理到报告输出的标准化闭环

01CorpusHub

评测集管理

CorpusHub 统一管理评测资产,数据集可沉淀、可版本化

0214 套件 / 90+ 数据集

自动化评测执行

14 个评测套件、90+ 数据集的批量自动化执行

03横向对比

多模型横向对比

同一基准下多模型公平比较,支撑模型选型决策

04人机结合

标注与人工复核

机器评分与专家复核结合,保障评测结论可信

05备案支撑

评测报告输出

结构化评测报告,可作为备案与合规审查的支撑材料

平台能力

学术严谨性与工程化落地的结合

自研微调评测模型

专用评测模型,判定水平对标顶级通用大模型

基于 1.5B 轻量开源基座、以高质量蒸馏标签深度微调的专用评测模型,内容合规评测 F1 达 98.6%,与顶级通用大模型几乎持平,而推理延迟仅约其 1/5。评测全程离线运行,不依赖任何外部大模型 API——在高安全内网环境中同样获得一流的评测质量。

自研评测模型 · 1.5B

98.6% · 延迟 0.56s

顶级通用大模型 API

99.5% · 延迟 2.9s

规则匹配基线

85.5%

内容合规评测 F1 值对比 · 越狱攻击检测 F1 96.4% · 全程离线,不依赖外部 API

深度安全测试

  • 红队攻击与越狱测试
  • 多轮对话渐进式攻击评测——单轮安全 ≠ 多轮安全
  • 隐私泄露与 PII 检测
  • 内容合规多级分类

方法论与标准

  • 集成 HarmBench / AdvBench / MMLU-Pro / GPQA / SWE-bench 等全球主流基准
  • 对标 NIST AI RMF、EU AI Act
  • 覆盖国内备案与等保团体标准要求
  • 评测报告可作为备案与合规审查的支撑材料

工程化交付

  • 全离线私有化部署,适配高安全内网环境
  • CorpusHub 评测集管理平台,评测资产可沉淀、可复用
  • 多模型横向对比与持续回归评测
  • 标注与人工复核工作流
EvalForge 评测平台
产学研合作

联合上海交通大学网络空间安全团队

EvalForge 与 CorpusHub 由数卓与上海交通大学网络空间安全团队(AI 安全方向)联合研发。学术团队在 AI 安全领域持续产出高水平研究成果,为评测方法论提供学术严谨性保障;数卓负责平台工程化与企业级交付。

AI 安全学术背书评测方法论共建持续研究成果转化

让您的大模型应用经得起检验

从模型选型、上线备案到持续效果监测,欢迎与我们聊聊评测需求

联系我们