将PID控制器与重启策略融入神经网络优化器,旨在替代繁琐的手动学习率调整。此探索通过在AdamW和Muon上的实践,揭示了传统数值优化技术与深度学习理论结合的巨大潜力与潜在冲突,为自动化模型训练提供了新视角。
智能速览
PID-Prodigy组合在无需手动调参的情况下,达到了与精调AdamW相当的收敛效果。
“自适应步长”与“启发式重启”策略的结合,可有效替代传统学习率调整方法。
将PID控制器应用于Muon优化器时,出现了冷启动滞后的现象。
PID与Muon的失败结合源于欧氏空间与黎曼流形的几何冲突。
此次探索成功地将传统数值优化技术应用于神经网络优化器,验证了自动化调参的可行性。同时,与Muon的失败结合也揭示了跨领域理论融合时必须考虑其底层几何原理的兼容性。未来的研究可以更深入地探索不同优化器所在空间的几何特性,以设计出更具普适性的混合优化策略。