微调一个 AI,常见的尴尬是:模型偶尔才有人用,却要为它长期养着一整张 GPU。Lorivo 想把这件事改成更像 Serverless——有请求时按需使用资源,不必为每个定制模型单独包服务器。
它利用 LoRA(只保存少量附加参数、用来改变基础模型行为的微调方式)的特点:不同定制版本超过 99% 的权重相同。Lorivo 因此让多个适配器共用一台运行同一基础模型的 GPU 服务器,再借助 vLLM 的批处理、显存管理和 LoRA 计算能力,按请求加载对应适配器。用户上传文件后,会得到一个兼容 OpenAI 接口的调用地址,也可用命令行部署。
目前项目流量仍由作者自己的 GPU 承担,只开放 Qwen 3.5 4B,并设有 32k 上下文窗口;作者称该模型将保持免费,且不保存对话和推理请求,只记录 token 数量与时间戳。它眼下更像一项早期服务实验,但抓住了一个实际问题:微调已经便宜下来,托管这些低频定制版本却仍可能很贵。