Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.097 — 2026-10-09
PAPER 约 1 分钟

Agent框架与推理引擎需要共同调度

HEAR让Agent编排层与推理引擎互通,减少排队与缓存误判造成的浪费。

像餐厅里,前台知道哪桌赶时间,后厨知道哪口锅正空着;两边若不通气,再聪明的安排也会互相添堵。运行 AI Agent——能多轮思考、调用工具并继续执行的系统——也有类似问题:Agent框架掌握任务依赖和优先级,推理引擎则掌握请求队列、GPU压力与缓存状态,过去这些信息难以系统互通。

HEAR为两层设计了一套双向协议:上层告知任务意图和执行要求,底层返回资源状态、能力与结果。最具体的一点是,它会同时考虑未来是否还要复用上下文,以及相关 KV cache 是否仍在显存中。KV cache是模型保存的历史计算结果;若刚删掉就要再用,系统只能重新计算。HEAR据此协调请求顺序和缓存保留,但不改变原有工作流或模型。

据作者实验,在内存受限、并发运行的 SCBench 上,这种调度带来 1.61 倍批处理加速,并将首个文字出现前的中位等待时间缩短至原来的约 1/2.23。研究型Agent测试中,作者报告端到端加速为 1.23 至 2.45 倍,且未观察到任务质量下降;这些结果仍限于论文所测的四个基准与配置。


供稿材料 SOURCES — 1

← 返回 2026-10-09 · 学术板块