2026年8月3日,东吴证券发布了一篇汽车行业的研究报告,报告指出,AI系列深度11期-大模型如何进行模仿与强化学习?。
报告具体内容如下:
投资要点 智能体学习行动主要有两条路径:模仿学习,即从专家示范中学习状态到动作的映射;强化学习,即在环境交互中依据奖励信号优化策略。二者并非对立,模仿学习通常更快、更稳,强化学习在可构造奖励、仿真环境或可验证任务中更可能突破示范上限,工程实践往往采用先模仿形成初始策略、再强化优化的组合范式。 强化学习解决的是没有逐步标准答案、只有事后奖励反馈的问题,核心难点包括功劳分配、探索与利用、奖励稀疏和样本效率。其思想源于行为主义心理学和贝尔曼MDP,经Sutton与Barto体系化,并在DQN、AlphaGo、RLHF、RLVR和推理模型中持续演进。近年来,强化学习从补充性优化工具转向后训练、偏好对齐和可验证推理的重要方法。 模仿学习的本质,是把状态到动作的映射转化为监督学习。行为克隆优点是训练快、稳定性较高,自动驾驶早期ALVINN、机器人示教和VLA预训练都体现这一思路;局限在于分布漂移和示范者上限,模型一旦进入训练数据未覆盖状态,错误会逐步累积。逆强化学习、DAgger和GAIL等方法,均围绕缓解这一问题展开。
在大模型训练中,强化学习主要用于后训练而非预训练。预训练通过自监督学习通用表征,监督微调本质上是对高质量人工示范的模仿,RLHF和RLVR再通过人类偏好或可验证奖励进行精修。AlphaGo先学棋谱再自我对弈,ChatGPT先SFT再RLHF,机器人VLA先示范预训练再仿真或真实环境强化,均体现该组合范式。
落到智能驾驶和具身智能,纯模仿路线面临更强约束。物理世界试错代价高,示范数据多来自平均人类表现,长尾和危险场景天然稀缺;因此趋势是用模仿学习获取初始策略,再依靠仿真、世界模型和强化学习补足长尾。杨立昆“蛋糕论”强调自监督是理解世界的主体,强化学习样本效率较低;但在可验证推理、偏好对齐和策略优化环节,强化学习的重要性正在上升。
我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。
风险提示:技术迭代不及预期的风险,大模型厂商ARR增速放缓的风险,云服务商资本开支不及预期的风险,智能驾驶及机器人商业化落地不及预期的风险。
更多机构研报请查看研报功能>>
声明:本文引用第三方机构发布报告信息源,并不保证数据的实时性、准确性和完整性,数据仅供参考,据此交易正规股票配资,风险自担。
元鼎证券_极速开户通道——让投资从此更高效,欢迎立即查看!提示:本文来自互联网,不代表本网站观点。