2024年6月,强化学习先驱Richard Sutton重提1967年“奖励预测”公式,为大模型训练瓶颈提供新思路
05-11 14:27
0
0
0评论
当前文章无评论,是时候发表评论了
提示信息
取消
确认
评论举报
已收藏
去我的收藏夹