强化学习之父Rich Sutton最新判断:大模型被困在“局部最优”,AI必须学会持续学习
产业动态
来源:人人都是产品经理发布时间待核实
强化学习之父Rich Sutton接受红杉访谈,把矛头对准当下最主流的大模型路线:互联网数据终有上限、模型上线后权重基本冻结,行业或已陷入“局部最优”。他创办Oak Lab,押注能从自身经验持续学习的Agent,重新定义AI演进路径。 说起强化学习之父 Rich Sutton,AI圈几乎没人陌生。 他写下的《苦涩的教训》,至今仍被很多人视为理解AI发展的重要框架:从长期看,能够随着计算规模扩展的通用方法,往往会战胜依赖大量人工知识设计的方案。 但最近接受红杉资本访谈时,Sutton却把矛头对准了今天最主流的大模型路线。在他看来,LLM当然是一次伟大的科学突破,却也可能成为《苦涩的教训》的反面案例。 原因很简单。今天的大模型虽然摆脱了大量人工规则,却重新被“人类已经知道的东西”限制住了。互联网数据终究有限,合成数据背后依然需要人来决定什么值得生成。 而更关键的是,模型仍然不具备人类那样的持续学习能力。 一个司机开了10年车,会从经验里形成大量直觉。但今天的大模型,大部分学习都集中在预训练和后训练阶段。模型上线后,即使每天和几百万人交互,核心权重依然基本被冻结。 在Sutton看来,今天的…