给手机、传感器等低功耗设备挑一个小模型,像在一排没有统一价签的商品里做比较:参数量、测试成绩和来源链接散落各处,很难迅速缩小范围。Open SLM Evaluations 想补上这张“统一价签”。据数据集发布者介绍,它收录了106个不超过1.5亿参数的 SLM——也就是规模较小的语言模型,并汇总模型名称、参数量、链接和基准成绩。
基准评测的意思,是让不同模型参加采用相同任务和评分规则的考试。发布者称,全部结果在 Runpod 的一张 NVIDIA B200 GPU 上独立评测,总计约30个 GPU 分钟;数据以 Apache 2.0 许可证开放,允许使用、修改和再分发,但须保留相关声明。它的价值不在于替开发者直接选出“冠军”,而是把初筛所需的信息放进同一张表。需要注意,统一考试只能帮助缩小范围,并不等同于模型在具体设备和真实产品中的体验。