Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.067 — 2026-09-09
PAPER 约 1 分钟

多目标RL重新审视“效用”

多目标决策不只要会调权重,还要先确认偏好真能导向最优策略。

让配送 AI 同时追求速度、省油和安全,难点不只是给三项目标分配权重。效用函数——把多个目标折成一个总分的规则——还可能包含“安全低于底线就不能接受”这类非线性偏好。问题在于,采用某种效用函数后,是否真的存在一项可优化的最佳策略,此前缺少一般性的理论刻画。

据 JMLR 论文介绍,作者分别研究两种看似相近、实则顺序不同的准则:SER 先计算各目标的期望结果,再套用效用函数;ESR 则先评价每一次结果的效用,再求平均。说白了,前者评价“平均表现是否满意”,后者评价“每次表现带来的满意度平均是多少”。论文由此分析哪些效用函数能保证最优策略存在,以及哪些偏好关系能被效用函数表达,并给出相应的形式条件。它没有宣称某个算法刷新成绩,而是在算法动手优化前,先划清哪些偏好设定在数学上站得住。


供稿材料 SOURCES — 1

← 返回 2026-09-09 · 学术板块