一次运行的身份证
运行指纹是对一次测量所处工况的概念性刻画——这次运行是在什么硬件、什么软件栈、 什么执行路径、什么负载形态下发生的。它描述的是条件,不是结果。
EliteMark 是一个测量平面:面向 LLM 推理的实测与证据库。
它不做「跑个分、出一张榜」这件事。它要解决的是更靠前的一步——让每一次测量都留下可复现的 运行指纹,把「什么硬件 · 什么框架 · 什么算子 · 什么并发 · 什么任务」钉死。 只有工况被固定下来,两次测量之间的关系才可能是清楚的: 可比,或者不可比,是一个可以被判定、可以被复核的问题,而不是靠人记、靠人猜。
下面几件事,是测量里最常被跳过、也最容易出错的地方。
运行指纹是 EliteMark 的核心概念,但它并不记录任何一个性能数字。
运行指纹是对一次测量所处工况的概念性刻画——这次运行是在什么硬件、什么软件栈、 什么执行路径、什么负载形态下发生的。它描述的是条件,不是结果。
有了指纹,两次测量之间的关系就成为一个可判定的问题:工况一致时,差异可以归因于被测对象; 工况不一致时,差异首先应当归因于工况漂移,而不是被测对象本身。
我们如实标注做到哪一步,不把未完成的写成已完成。
本地端与汇总端的主干已经可用,能够完成测量、记录与归档。
公开标准测试集尚未接通跑分引擎,因此我们不对外发布任何「某模型得多少分」的数字。
实测数据的入口。
实测数据站尚未上线,上线后会在这里给出链接。