5.83倍加速!PolicyTrim 讓 VLA 機器人少走彎路、更快完成任務

PolicyTrim強化學習效率優化具身智能VLA機器人
2 小時前來源: blockweeks.com
5.83倍加速!PolicyTrim 讓 VLA 機器人少走彎路、更快完成任務

【導讀】VLA模型已經會做任務,但真實機器人還是慢!PolicyTrim是一種優化VLA機器人執行效率的方法,無需重新訓練。它通過擴展可靠動作序列並減少冗餘步驟,幫助機器人更直接完成任務,提升整體速度。

Vision-Language-Action(VLA)模型把視覺觀測、語言指令和機器人動作統一到一個策略模型中,使機器人能夠根據自然語言完成複雜操作任務。

從OpenVLA、OpenVLA-OFT到π0.5、GR00T,這類模型正在成為具身智能的重要技術路線。

但當VLA模型真正部署到機器人上時,一個關鍵瓶頸會立刻顯現:機器人完成任務的總時間,不只取決於每次推理有多快,也取決於策略到底需要執行多少次推理、多少個真實物理動作。

機器人

在同一任務的多個rollout中,VLA模型的執行步數存在顯著波動,說明更短、更直接的成功路徑是可達的,但當前策略往往只能偶然找到。

動作chunk尾部不可靠:模型一次預測多個動作,但越靠後的動作越容易累積誤差,系統不得不頻繁重新規劃,強行拉長執行長度會降低成功率並增加物理步數。

物理動作冗餘嚴重:即便任務最終成功,軌跡裡也可能包含大量糾錯、回退和重複動作。

因此,VLA部署效率不僅要看每一步的推理延時,更要看策略效率(policy efficiency):一次預測中有多少動作能放心執行?完成任務到底需要多少真實物理步驟?

已有方法大多從計算側入手,例如視覺token剪枝、量化、KV-cache複用、蒸餾或推理引擎優化。這些方法可以降低單次推理延遲,但如果策略仍然需要大量冗餘物理步驟,真實任務耗時仍然很長。

直接固定執行更長action chunk也並不可靠。

論文中的實驗顯示,隨著強行將動作執行長度變長,成功率可能下降,物理步數反而增加。這說明低質量的尾部預測會把誤差帶入物理世界,機器人隨後需要更多糾錯動作。

關鍵問題:能否在不犧牲任務成功率的前提下,通過後訓練,讓已有VLA策略自動學會「少走彎路」,用更少物理步驟完成任務?

來自四川大學雷印杰教授領導的團隊提出了PolicyTrim——一個面向「策略效率」的兩階段強化學習後訓練框架。它不改變VLA架構,也不重新收集專家數據,而是在已有預訓練策略之上繼續優化機器人真實執行行為。

機器人

項目主頁:https://inceptionwang.github.io/PolicyTrim/

論文鏈接:https://arxiv.org/abs/2606.22540

代碼鏈接:https://github.com/INCEPTIONwang/PolicyTrim

模型鏈接:https://huggingface.co/INCEPTIONwang/PolicyTrim

新方法實現了:

  • 3×動作chunk利用率,更長horizon可靠執行;
  • 51.4%物理步數減少,壓縮冗餘修正動作;
  • 5.83×端到端最高加速,LIBERO Object/π0.5;

從「算得更快」到「做得更快」

PolicyTrim的核心目標不是替代計算側加速,而是補上另一個被忽視的維度:減少完成任務所需的前向推理次數。它把策略效率拆成兩個可優化目標:先擴展可靠動作chunk,再壓縮冗餘物理步驟。

機器人

1. 可靠動作chunk擴展(Reliable Action Chunk Extension)

當前很多VLA策略以action chunk形式輸出動作序列,但部署時往往只敢執行前幾步。PolicyTrim第一階段使用dynamic execution horizon exploration:同一組rollout分配不同接受比率,讓模型在短、中、長窗口上並行探索可靠邊界。

成功完成任務且執行窗口更長的軌跡獲得更高reward,鼓勵模型把原本不可靠的chunk尾部動作變得更可用。

horizon reward只在組內出現成功軌跡時激活,避免模型在失敗情況下盲目追求更長的chunk長度。

2. 冗餘感知的步數壓縮(Redundancy-Aware Step Reduction)

當可靠horizon被擴展之後,第二階段進一步減少總物理步數。PolicyTrim引入step-saving reward:成功軌跡用越少步驟完成任務,獎勵越高。

step-saving reward 直接把「更短、更直接的成功軌跡」寫進優化目標。

group-anchored regularization 抑制不可複現的投機捷徑,避免模型只追求短路徑卻損害成功率。

兩階段順序優化可以避免「拉長chunk」和「縮短步數」兩個目標互相干擾,最終減少完成任務所需的前向推理次數。

實驗結果

論文在LIBERO、ManiSkill、Meta-World以及真實機器人任務上驗證了PolicyTrim,並覆蓋π0.5、OpenVLA-OFT、GR00T等不同VLA架構。總體結果顯示,PolicyTrim在保持任務成功率穩定的同時,顯著提升執行效率。

在LIBERO中,π0.5達到最高5.83倍端到端加速,同時成功率保持98%以上。

跨基準結果顯示,PolicyTrim在ManiSkill上最高達到2.36倍加速,在Meta-World上達到2.52倍加速。

跨架構結果顯示,重新預訓練後的OpenVLA-OFT採用完整兩階段流程可達到2.97倍加速;OpenVLA僅使用第二階段也能達到1.41倍加速。

機器人

定性對比:少走彎路,軌跡更直接

在隨機採樣的LIBERO任務中,Baseline往往出現冗餘糾錯動作和目標附近的hesitation/jittering;PolicyTrim的軌跡更平滑、更直接,能夠用更少物理步驟完成同一任務,通常能將物理步數壓縮至原來的一半左右。

機器人

真實機器人部署:模擬中的效率收益可以遷移到物理世界

論文進一步在配備兩台Intel RealSense D435i相機的Agilex Piper機械臂上驗證真實機器人任務,包括FlipMug、HangMug、TapeBox三類任務。實驗覆蓋固定目標位置的標準設置,以及抓取過程中隨機擾動目標的動態設置。

PolicyTrim在標準設置和動態擾動設置下都維持或提升成功率,同時顯著縮短真實執行時間。在標準真實機器人設置下,平均達到1.86倍端到端加速。

機器人

機器人

從實驗結果看,PolicyTrim並不是只優化benchmark指標:在物理機器人上,任務完成時間也能縮短到baseline的一半左右,並且在動態干擾場景中保持魯棒性。

為什麼PolicyTrim有效?

• 面向策略本身提效:它減少冗餘動作和不必要的重規劃,而不只是降低單次推理延遲。

• 無需從頭訓練:作為後訓練框架,可以基於已有VLA模型繼續優化,降低數據收集和訓練成本。

• 兼顧速度和成功率:可靠horizon擴展避免盲目拉長chunk,穩定性約束避免短路徑投機。

• 可與計算側加速疊加:PolicyTrim優化前向推理次數,VLA-Cache等方法優化每次推理耗時,兩條路徑正交且可以產生複合加速。

PolicyTrim的核心觀點是:對VLA機器人而言,部署效率不只來自更快的模型推理,也來自更高效的策略行為。讓機器人「少走彎路」,同樣可以帶來顯著加速。

參考資料:https://arxiv.org/abs/2606.22540

本文來自微信公眾號“新智元”,作者:新智元;編輯:LRST

免責聲明:本文提供的資訊不是交易建議。BlockWeeks.com不對根據本文提供的資訊所做的任何投資承擔責任。我們強烈建議在做出任何投資決策之前進行獨立研究或諮詢合格的專業人士。