强化学习先驱:现有AI路径已经偏离方向
理查德·萨顿与他的合作者胡拉姆·贾韦德最近在硅谷录了一期访谈,介绍他们新创立的 Oak Lab,并对当前大规模模型与主流做法提出强烈质疑。萨顿直言,当前AI界普遍依赖的监督学习范式、合成数据和上线后不再更新的模型,正在把整个领域引向错误的方向。他甚至把自己的观点概括为:不是我疯了,是这个圈子疯了。
他们认为的问题与出路可以归纳为几个关键点:
- 学习的本质被误读:自然界的动物并不是通过大量标注的监督学习成长起来的。教育体系是人类社会的特殊机制,并不能代表智能的基本形成方式。把监督学习当成智能的核心范式,是本末倒置。
- 上线模型并未持续进化:目前的大模型在部署到产品后,权重基本冻结,不再从新的交互中学习。对一个能够在上线后停止自我更新的系统抱以期待,是不合理的。萨顿强调,若期望一个像人类专家一样会不断学习进步的系统,却只在训练前后调整参数,那么这设置本身就是问题。
- 合成数据无法替代真实经验:为了扩展训练集而大量生成模拟数据是方向性的错误。现实世界极其复杂,任何人工构造的模拟器都无法覆盖真正的多样性与微妙变化。与其让人类持续参与数据标注循环,不如让智能体直接在现实环境中通过互动获取经验。
- 大型实验室被局部最优绑住:要转向新范式,短期内势必会出现性能退步,而拥有成熟产品线和商业闭环的大公司无法承受这种阵痛,因此难以做出根本性转变。他们被现有成功的做法“锁定”,难以探索更具长期价值的路径。
- 语言模型并非终点:大语言模型确实是重大突破,但不能把其当作智能的全部。语言重要,但可能只占智能能力的一部分。将LLM视为智能终局的想法过于狭隘。
萨顿与贾韦德提出的替代愿景是,放弃静态训练流程,发展能在行动中持续学习、避免灾难性遗忘的在线智能体。他们设想在五到十年内,打造出一种能像生物那样边行动边演化的“持续心智”系统,且功耗控制在约20瓦左右。要实现这一点,需要在底层算法与训练范式上做彻底的重构,而大型企业因商业压力短期内很难迈出这一步,这也是他们成立 Oak Lab、从学术与小规模实验开始探索的原因之一。
在访谈中,萨顿回顾了自己几十年如一日投入强化学习研究的动机与经历。他提到早年经历的健康危机与长期抗争,这段经历反而促成了他将精力投向理解心智与学习本质的坚定决心。谈到自己的代表作《苦涩的教训》,他依然坚持那份核心观点:通用且高效的学习方法应当依赖于大规模的通用性而非人为设计的领域规则。
总的来说,萨顿和合作者主张从当前以监督学习和静态大模型为中心的做法转向一种更加贴近生物学习机制的持续学习范式,让智能体在真实世界中通过行动获得经验、不断适应与成长。他们认为这既是科学上的必要转向,也是避免AI长期陷入局部最优的唯一出路。
挑战“打不死”Boss的荒唐与下场
开展篮球技术研究,推动篮球运动的技术革新,提升运动员的比赛表现。...
[无下一篇]
开展篮球技术研究,推动篮球运动的技术革新,提升运动员的比赛表现。...