学走路的孩子撞到桌角,下次会绕开;北京新开的“机器人幼儿园”,想让机器人也这样学习。这个项目由触觉传感公司 Tashan Technology 与图灵奖得主、强化学习奠基者之一 Richard Sutton 率领的团队共同建立。它不要求人类示范每个动作,而是让机器人行动、碰撞、接收反馈,再调整策略。
这里的关键是“持续学习”——机器人投入使用后仍能吸收经验,而不是训练结束便能力固定。触觉传感器则像机器的皮肤,能感知接触、压力等摄像头难以捕捉的信息。比如机械臂因磨损出现偏差后,理想状态下可以重新摸索可靠动作,不必等工程师把硬件恢复原样。
据 China Economic Net 报道,研究人员称,一台没有预先训练的小型蜘蛛机器人仅凭“向前移动”的奖励,约 40 分钟学会前进;但这只是特定案例,复杂机器人掌握通用技能要多久仍不清楚。自主探索也比模仿学习更慢,而且机器必须经得起反复跌倒和犯错。