让 AI 连续查资料、调用工具时,应用往往得自己记住每一步,再把历史和工具结果反复交回模型。vLLM-project 的新项目 Agentic API 想把这套麻烦搬到服务端:它是在 vLLM 前面加的一层 Rust 网关——也就是客户端与推理引擎之间的统一入口,让一次请求可以接着上次进度继续执行。
项目目前先提供兼容 OpenAI Responses API 的接口。服务端可通过 previous_response_id 恢复会话状态,用 SQLite 保存响应,并处理工具执行、流式输出和后续推理;工具由网关、客户端还是模型提供方运行,也有明确的归属规则。这样,应用不必每轮重放完整对话,模型还能自动完成多步工具调用循环。
值得注意的不是又多了一套接口,而是 vLLM 生态开始把能力从“高吞吐生成文字”推向“承载 Agent 的运行过程”。不过这仍是早期项目:Anthropic 风格的 Messages API 和更高层的 Interactions API 尚在计划中,材料也未披露性能数据。