Dreamer V3、TD-MPC 2 这些系统在长时间仿真后会出现几种典型病症:
世界模型漂移:它的“梦境世界”偏离真实环境;预测误差越来越小,但只是自我欺骗。模型在幻想一个自己能控制的世界。
价值塌缩:Critic 的估值区间被噪声拉宽,策略开始重复无意义的动作(“stuck policy”)。
灾难性遗忘:新经验把旧经验挤出回放池;原来会的行为忘掉,导致波动放大。
计算耗散:训练成本随时间线性上升,而梯度更新收益递减。学习器开始消耗能量却不再获得信息。
换句话说,它们还没有真正的“生命稳态”。它们靠外部算力和人类维护维持存在,一旦断电或环境分布变动,就“死”——失去了连贯的自我。
萨顿设想的方向,是让这种系统自己修正这些失衡:
自动监测预测与现实的偏差,重新校准世界模型;
自我生成新任务保持信息增益;
当内部熵增太快时,削减活动、休眠、重组记忆。
但这部分还没人真正跑通。
Dreamer V3 离“存在体”还有几步:它能学、能想象,却不会养护自己。
世界模型漂移:它的“梦境世界”偏离真实环境;预测误差越来越小,但只是自我欺骗。模型在幻想一个自己能控制的世界。
价值塌缩:Critic 的估值区间被噪声拉宽,策略开始重复无意义的动作(“stuck policy”)。
灾难性遗忘:新经验把旧经验挤出回放池;原来会的行为忘掉,导致波动放大。
计算耗散:训练成本随时间线性上升,而梯度更新收益递减。学习器开始消耗能量却不再获得信息。
换句话说,它们还没有真正的“生命稳态”。它们靠外部算力和人类维护维持存在,一旦断电或环境分布变动,就“死”——失去了连贯的自我。
萨顿设想的方向,是让这种系统自己修正这些失衡:
自动监测预测与现实的偏差,重新校准世界模型;
自我生成新任务保持信息增益;
当内部熵增太快时,削减活动、休眠、重组记忆。
但这部分还没人真正跑通。
Dreamer V3 离“存在体”还有几步:它能学、能想象,却不会养护自己。