想象你要给几十个送货点排路线。每次新增一条限制,专家都可能要重新设计规则、反复调试。直接让大语言模型(LLM)一次写出整套算法,面对新问题又常常失败。LACE换了个思路:不要求一个模型灵光一现,而是让LLM提出多种各有所长的策略,再用实际成绩选拔和组队。
这项发表于 Nature Machine Intelligence 的研究瞄准组合优化——从数量巨大但彼此离散的方案中找出最好一个。此类问题常见于制造、物流、医疗运营和能源管理。方案数量会随规模迅速增长,逐一尝试通常不可行,因此人们常用启发式算法:它不保证找到数学上的绝对最优解,但能靠经验规则快速给出足够好的答案。
需要先说明,本文可用证据主要来自论文摘要及研究团队公开说明,尚无第二方复现或独立测评。
先把考题和工具讲清楚
LACE全称是 LLM-driven Algorithm Construction via Complementary Evolution。它先把算法设计拆成四部分:输入格式、输出格式、工具库和启发式策略组合,合称 I–O–T–H interface。
可以把它理解成一份明确的工作说明:数据会怎样交进来,答案必须怎样交出去,哪些工具已经备好,以及策略团队由谁组成。经过验证的输入输出约定减少了实现层面的岔路,让LLM把更多能力放在高层算法思考上,而不是反复处理每道题的接口细节。
这一步看似朴素,却改变了任务。LLM不再从零包办一套完整程序,而是在清楚的边界内设计算法部件。
不找全能冠军,而是组一支队伍
接下来是“互补进化”。进化搜索像育种:不断生成候选方案,用实际求解表现打分,保留表现较好的,再继续变化和组合。LACE还加入严格的运行时间预算,并持续生成、筛选 specialist heuristics——只在某些类型实例上特别擅长的专门策略。
关键不在于找出一个处处最强的办法,而是让不同策略补位。有的可能更适合构造初始答案,有的善于跳出局部最优——也就是摆脱“眼前已经不错、整体却并非最好”的方案——还有的适合最后精修。面对结构不同的实例,策略组合比押注一次生成的完整算法更有弹性。
数字显示了什么
按论文报告,LACE在36个经典组合优化问题上的平均得分为0.945。作者选定的最强现有LLM方法得分为0.870;没有框架、直接提示LLM生成算法时,得分为0.571。
在另外4个“结构性新问题”上,LACE得到0.97至0.99;五个现有LLM基线方法在该研究的实验条件下,都没有生成可行算法。这里的“可行”首先表示算法能给出满足约束的答案,并不等同于已经找到全局最优解。
这些结果覆盖40个问题。研究团队还公开了全部问题实例、演化出的策略组合,以及支撑论文图2至图5的逐实例结果;代码包括LACE框架、设计代理、进化操作、选择求解器和复现实验脚本,仓库与Zenodo材料采用MIT许可。论文将36个经典问题称为来自 CO-Bench30;“30”与问题数“36”容易混淆,现有材料没有进一步解释其命名。
为什么值得关注
以往谈LLM参与算法设计,很容易把重点放在“它能否直接写出一个聪明算法”。LACE展示的是另一条路线:让LLM负责提出候选部件,让可测量的求解成绩负责淘汰,再把互补部件组织成团队。
这使模型更像算法设计流程中的参与者,而不只是现成算法的调用入口。它也给出一个值得继续验证的命题:面对需要长期专家调试的优化任务,自动化的价值或许不在一次生成,而在持续试验、比较和组合。
局限与未知
- 所有主要效果数字目前均来自同一研究团队。摘要没有交代得分的归一化方式、实例规模、运行预算、模型与提示配置,因此0.945的绝对意义不能只凭数字判断。
- “最强现有方法”取决于作者选择的比较范围;五个基线失败的结论也仅限于该研究所选的4个新问题和实验条件。
- 作者认为提升来自框架而非模型,并据此称算法发现可以在很大程度上自动化。但现有材料没有提供消融实验细节,尚不足以独立确认提升究竟来自哪些环节。