0
| 本文作者: 袁毓婉 | 2026-08-04 17:22 | 專題:RSS:機(jī)器人,科學(xué)與系統(tǒng)會議 |
來源:機(jī)器人解剖師
原文鏈接:https://mp.weixin.qq.com/s/t-27VnWDfrcyJ8gz72CmoQ
RSS 2026近期在澳大利亞召開,會上頒布了最佳論文《FlashSAC: Fast and Stable Off-Policy Reinforcement
Learning for High-Dimensional Robot Control》,改文章提出高效強(qiáng)化學(xué)習(xí)策略FlashSAC,主要內(nèi)容摘要如下,

1?? 背景:強(qiáng)化學(xué)習(xí)通過試錯學(xué)習(xí),可以不需要任何人工標(biāo)記數(shù)據(jù),完全從零開始學(xué)習(xí)。不過強(qiáng)化學(xué)習(xí)監(jiān)督信號弱,收斂慢,不穩(wěn)定。而且RL一般通過bootstrapping學(xué)習(xí),也會造成critic的錯誤通過提督更新不斷傳播。強(qiáng)化學(xué)習(xí)算法與理念受人喜愛,工業(yè)上卻并不好用。

2?? 特別是高緯度任務(wù),由于傳統(tǒng)小步快跑的更新策略,很容易收斂到局部最優(yōu)解,使得整體效果很差,而且訓(xùn)練不穩(wěn)定。此前OpenAI提出了PPO強(qiáng)化學(xué)此算法,PPO的思路是通過CLIP機(jī)制,限制每次更新的步伐使RL收斂更穩(wěn)定。不過PPO的學(xué)習(xí)效率比較低,存在瓶頸。

3?? 文章提出快速且穩(wěn)定的離線強(qiáng)化學(xué)習(xí)算法FlashSAC,主要借鑒于監(jiān)督學(xué)習(xí)的scaling law思路,通過更大的模型與更高的batch來減少梯度更新頻次,訓(xùn)練效率與效果得到極大的提升。
4?? FlashSAC就如其名,簡單來說算法可以拆分成Flash和SAC兩部分。
1)Flash表示Fast與Stable,即通過一些策略使訓(xùn)練更高效更穩(wěn)定,收斂速度更快。
2)SAC表示Soft Actor-Critic算法,是加州大學(xué)伯克利分校之前Pieter Abbeel與Sergey Levine團(tuán)隊(duì)提出的強(qiáng)化學(xué)習(xí)算法,

5?? SAC強(qiáng)化學(xué)方法與傳統(tǒng)強(qiáng)化學(xué)習(xí)方法的一些比較,
1)SAC在傳統(tǒng)強(qiáng)化學(xué)習(xí)最大化累積獎勵的基礎(chǔ)上,額外加入最大化策略熵的目標(biāo)。

2)其中H為策略熵,一般定義如下

Exploration:以ε的概率選擇其它非最優(yōu)的action
Exploitation:以(1-ε)的概率,選擇評價函數(shù)計(jì)算出的最優(yōu)Action

6?? Flash部分中的Fast Trainging
Fast Trainging:通過巨大的仿真并行度、大的Replay Buffer、大的模型、大的Batch Size、以及較少的參數(shù)更新頻次、以及一些JIT相關(guān)代碼優(yōu)化,加快訓(xùn)練和收斂速度。

7?? Flash部分中的Stable Trainging :通過特殊的網(wǎng)絡(luò)結(jié)構(gòu)、Batch Normalization、Cross Batch、Distributional Critic等機(jī)制,使訓(xùn)練更stable,可以緩解傳統(tǒng)強(qiáng)化學(xué)習(xí)由于小步快跑帶來的價值評估函數(shù)不穩(wěn)定的問題





8?? 文章做了各種仿真實(shí)驗(yàn),特別是高緯度任務(wù)上,學(xué)習(xí)效率相比PPO提升高達(dá)3~9倍,
1)低緯度任務(wù)平均Reward打平或者超越PPO,遠(yuǎn)遠(yuǎn)超越FastTD3
2)高緯度動作任務(wù),平均Reward遠(yuǎn)遠(yuǎn)超越PPO,打平或超越FastTD3

9?? 文章做了Buffer Size與Batch Size消融實(shí)驗(yàn)如下,

BatchSize 消融實(shí)驗(yàn),Batch size越大效果越好,8K的batch size遠(yuǎn)遠(yuǎn)好于0.5K,


本專題其他文章