EliteMark · 模衡

Elite AI Lab 的测量平面——面向 LLM 推理的实测与证据库。 它为每一次运行生成可复现的运行指纹,让「两次测量到底可不可比」成为一个可判定的问题。

EliteMark 是什么

EliteMark 是一个测量平面:面向 LLM 推理的实测与证据库。

它不做「跑个分、出一张榜」这件事。它要解决的是更靠前的一步——让每一次测量都留下可复现的 运行指纹,把「什么硬件 · 什么框架 · 什么算子 · 什么并发 · 什么任务」钉死。 只有工况被固定下来,两次测量之间的关系才可能是清楚的: 可比,或者不可比,是一个可以被判定、可以被复核的问题,而不是靠人记、靠人猜。

它解决什么

下面几件事,是测量里最常被跳过、也最容易出错的地方。

  • 先定义 workload,再谈数字。没有工作负载定义的 benchmark 数字,不构成可比较的测量结果。
  • 先确认路径,再认提升。不知道走到了哪条后端路径的「性能提升」,不算证据。
  • 结论要能被复现。换一个人、换一台机器,应当能得出同一个结论。
  • 差异要能被归因。两次测量之间的差异,应当能分清是系统真的变了,还是工况漂移。

运行指纹

运行指纹是 EliteMark 的核心概念,但它并不记录任何一个性能数字。

它刻画什么

一次运行的身份证

运行指纹是对一次测量所处工况的概念性刻画——这次运行是在什么硬件、什么软件栈、 什么执行路径、什么负载形态下发生的。它描述的是条件,不是结果。

它回答什么

可比,还是不可比

有了指纹,两次测量之间的关系就成为一个可判定的问题:工况一致时,差异可以归因于被测对象; 工况不一致时,差异首先应当归因于工况漂移,而不是被测对象本身。

当前状态

我们如实标注做到哪一步,不把未完成的写成已完成。

本地端与汇总端的主干已经可用,能够完成测量、记录与归档。

公开标准测试集尚未接通跑分引擎,因此我们不对外发布任何「某模型得多少分」的数字。

看数据

实测数据的入口。

实测数据站尚未上线,上线后会在这里给出链接。

联系我们

想了解 EliteMark 的现状,或者讨论一次实测,欢迎来信。

联系我们