The measure of model merit.

我们做国产异构算力上的大模型适配与实测。 不是又一个跑分工具——而是把「模型能不能在这张卡上真正跑好、为什么、提升了多少」 变成可复现、可复核、可对比的证据。

我们在解决的问题

国产算力的真问题不在「能不能跑」,而在下面三件事。

问题表现
适配难 算子到底走没走到目标后端?什么时候悄悄退回了 fallback?
归因难 变快了——是因为命中了目标路径,还是因为工况漂移?
复核难 换个人、换台机器,还能得出同一个结论吗?

我们的项目

两个平面,各管一件事。

测量平面

EliteMark · 模衡

面向 LLM 推理的实测与证据库。为每一次运行生成可复现的运行指纹, 把「什么硬件 · 什么框架 · 什么算子 · 什么并发 · 什么任务」钉死, 让两次测量可比或不可比成为一个可判定的问题,而不是靠人记。

了解更多 →

适配决策平面

EliteAdapt · 模算

把「遇到什么问题 → 改了什么 → 提升多少 → 在什么工况下成立」变成结构化对象, 而不是报告文案。每条结论都绑定环境指纹与证据链。

了解更多 →

我们坚持的

这四条不是口号,是我们判断一条结论能不能出的标准。

  • 口径先于数字。没有 workload 定义的 benchmark 数字,不出。
  • 路径先于结论。不知道走了哪条后端路径的「性能提升」,不认。
  • 不能证伪的,不算证据。
  • 没做出来的,如实标注。已知未完成的事写进 README,不写成「已实现」。