5,83 razy szybciej: PolicyTrim – jak sprawić, by roboty VLA działały sprawniej i szybciej wykonywały zadania

PolicyTrimuczenie ze wzmocnieniemoptymalizacja wydajnościsztuczna inteligencja ucieleśnionaVLArobot
2 Godzin temuŹródło: blockweeks.com
5,83 razy szybciej: PolicyTrim – jak sprawić, by roboty VLA działały sprawniej i szybciej wykonywały zadania

【Wprowadzenie】Modele VLA potrafią już wykonywać zadania, ale prawdziwe roboty są wciąż wolne! PolicyTrim to metoda optymalizacji wydajności wykonawczej robotów VLA, która nie wymaga ponownego trenowania. Poprzez rozszerzanie niezawodnych sekwencji działań i redukcję zbędnych kroków, pomaga robotom wykonywać zadania bardziej bezpośrednio, zwiększając ogólną szybkość.

Modele Vision-Language-Action (VLA) łączą obserwacje wizualne, instrukcje językowe i działania robota w jeden model polityki, umożliwiając robotom wykonywanie złożonych zadań manipulacyjnych na podstawie języka naturalnego.

Od OpenVLA, OpenVLA-OFT po π0.5, GR00T, tego typu modele stają się ważną ścieżką technologiczną dla inteligencji ucieleśnionej.

Jednak gdy modele VLA są faktycznie wdrażane na robotach, natychmiast pojawia się kluczowe wąskie gardło: całkowity czas wykonania zadania przez robota zależy nie tylko od szybkości pojedynczej inferencji, ale także od tego, ile inferencji i rzeczywistych fizycznych działań wymaga polityka.

Robot

W wielu rolloutach tego samego zadania liczba kroków wykonawczych modeli VLA wykazuje znaczną zmienność, co wskazuje, że krótsze, bardziej bezpośrednie ścieżki sukcesu są osiągalne, ale obecna polityka często znajduje je tylko przypadkowo.

Niewiarygodność końcówek fragmentów działań: model przewiduje wiele działań jednocześnie, ale im dalsze działania, tym większe kumulowanie błędów, system musi często ponownie planować, wymuszanie dłuższego wykonania obniża wskaźnik sukcesu i zwiększa liczbę fizycznych kroków.

Poważna nadmiarowość fizycznych działań: nawet jeśli zadanie ostatecznie się powiedzie, trajektoria może zawierać wiele działań korekcyjnych, cofania i powtarzania.

Dlatego wydajność wdrożenia VLA zależy nie tylko od opóźnienia inferencji na krok, ale przede wszystkim od efektywności polityki (policy efficiency): ile działań z jednej predykcji można bezpiecznie wykonać? Ile rzeczywistych fizycznych kroków potrzeba do wykonania zadania?

Istniejące metody skupiają się głównie na stronie obliczeniowej, np. przycinanie tokenów wizualnych, kwantyzacja, ponowne wykorzystanie KV-cache, destylacja lub optymalizacja silnika inferencyjnego. Metody te mogą zmniejszyć opóźnienie pojedynczej inferencji, ale jeśli polityka nadal wymaga wielu nadmiarowych fizycznych kroków, rzeczywisty czas zadania pozostaje długi.

Bezpośrednie wymuszanie dłuższych fragmentów działań również nie jest niezawodne.

Eksperymenty w artykule pokazują, że wraz z wymuszaniem dłuższego wykonania działań, wskaźnik sukcesu może spaść, a liczba fizycznych kroków wzrosnąć. Oznacza to, że niskiej jakości predykcje końcowe wprowadzają błędy do świata fizycznego, a robot potrzebuje więcej działań korekcyjnych.

Kluczowe pytanie: czy można, bez poświęcania wskaźnika sukcesu zadania, poprzez trening po wdrożeniu, sprawić, by istniejąca polityka VLA automatycznie nauczyła się „nie zbaczać z drogi” i wykonywać zadanie przy mniejszej liczbie fizycznych kroków?

Zespół kierowany przez profesora Yinjie Lei z Uniwersytetu Syczuańskiego zaproponował PolicyTrim – dwuetapową ramę treningu po wdrożeniu z użyciem uczenia przez wzmacnianie, ukierunkowaną na „efektywność polityki”. Nie zmienia ona architektury VLA ani nie zbiera ponownie danych eksperckich, ale optymalizuje rzeczywiste zachowanie wykonawcze robota na podstawie istniejącej wstępnie wytrenowanej polityki.

Robot

Strona projektu:https://inceptionwang.github.io/PolicyTrim/

Link do artykułu:https://arxiv.org/abs/2606.22540

Link do kodu:https://github.com/INCEPTIONwang/PolicyTrim

Link do modelu:https://huggingface.co/INCEPTIONwang/PolicyTrim

Nowa metoda osiąga:

  • 3× wykorzystanie fragmentów działań, niezawodne wykonanie na dłuższym horyzoncie;
  • 51,4% redukcję fizycznych kroków, kompresję nadmiarowych działań korekcyjnych;
  • 5,83× maksymalne przyspieszenie end-to-end, LIBERO Object/π0.5;

Od „liczenia szybciej” do „działania szybciej”

Głównym celem PolicyTrim nie jest zastąpienie przyspieszenia obliczeniowego, ale uzupełnienie innego pomijanego wymiaru: zmniejszenie liczby inferencji potrzebnych do wykonania zadania. Rozbija on efektywność polityki na dwa optymalizowalne cele: najpierw rozszerzenie niezawodnych fragmentów działań, a następnie kompresję nadmiarowych fizycznych kroków.

Robot

1. Rozszerzenie niezawodnych fragmentów działań (Reliable Action Chunk Extension)

Obecnie wiele polityk VLA wyprowadza sekwencje działań w postaci fragmentów działań, ale podczas wdrożenia często wykonuje się tylko kilka pierwszych kroków. W pierwszej fazie PolicyTrim stosuje dynamiczne badanie horyzontu wykonawczego: tej samej grupie rolloutów przypisuje się różne wskaźniki akceptacji, umożliwiając modelowi równoległe badanie niezawodnych granic na krótkich, średnich i długich oknach.

Trajektorie, które pomyślnie wykonują zadanie i mają dłuższe okno wykonawcze, otrzymują wyższą nagrodę, zachęcając model do uczynienia wcześniej niewiarygodnych końcowych działań fragmentu bardziej użytecznymi.

Nagroda horyzontu jest aktywowana tylko wtedy, gdy w grupie pojawi się trajektoria sukcesu, co zapobiega ślepemu dążeniu modelu do dłuższych fragmentów w przypadku niepowodzenia.

2. Redukcja kroków z uwzględnieniem nadmiarowości (Redundancy-Aware Step Reduction)

Po rozszerzeniu niezawodnego horyzontu, druga faza dalej redukuje całkowitą liczbę fizycznych kroków. PolicyTrim wprowadza nagrodę za oszczędność kroków: im mniej kroków potrzeba do pomyślnego wykonania zadania, tym wyższa nagroda.

Nagroda za oszczędność kroków bezpośrednio wpisuje „krótsze, bardziej bezpośrednie trajektorie sukcesu” do celu optymalizacji.

Regularizacja zakotwiczona w grupie (group-anchored regularization) tłumi nieodtwarzalne spekulacyjne skróty, zapobiegając dążeniu modelu wyłącznie do krótkich ścieżek kosztem wskaźnika sukcesu.

Dwuetapowa optymalizacja sekwencyjna zapobiega wzajemnemu zakłócaniu się celów „wydłużania fragmentów” i „skracania kroków”, ostatecznie zmniejszając liczbę inferencji potrzebnych do wykonania zadania.

Wyniki eksperymentów

W artykule zweryfikowano PolicyTrim na zadaniach LIBERO, ManiSkill, Meta-World oraz na rzeczywistych robotach, obejmując różne architektury VLA, takie jak π0.5, OpenVLA-OFT i GR00T. Ogólne wyniki pokazują, że PolicyTrim znacząco poprawia wydajność wykonania, utrzymując stabilny wskaźnik sukcesu zadań.

W LIBERO, π0.5 osiągnął maksymalne 5,83-krotne przyspieszenie end-to-end, przy jednoczesnym utrzymaniu wskaźnika sukcesu powyżej 98%.

Wyniki między benchmarkami pokazują, że PolicyTrim osiągnął maksymalnie 2,36-krotne przyspieszenie na ManiSkill i 2,52-krotne przyspieszenie na Meta-World.

Wyniki między architekturami pokazują, że ponownie wstępnie wytrenowany OpenVLA-OFT przy użyciu pełnego dwuetapowego procesu osiągnął 2,97-krotne przyspieszenie; sam OpenVLA przy użyciu tylko drugiego etapu osiągnął 1,41-krotne przyspieszenie.

robot

Porównanie jakościowe: mniej zbędnych ruchów, bardziej bezpośrednia trajektoria

W losowo próbkowanych zadaniach LIBERO, Baseline często wykazywał zbędne ruchy korekcyjne oraz wahania/drgania w pobliżu celu; trajektorie PolicyTrim są gładsze i bardziej bezpośrednie, umożliwiając wykonanie tego samego zadania przy mniejszej liczbie fizycznych kroków, zazwyczaj kompresując liczbę fizycznych kroków do około połowy.

robot

Wdrożenie na rzeczywistym robocie: korzyści wydajnościowe z symulacji można przenieść do świata fizycznego

Artykuł dodatkowo weryfikuje zadania na rzeczywistym robocie na ramieniu robotycznym Agilex Piper wyposażonym w dwie kamery Intel RealSense D435i, obejmując trzy typy zadań: FlipMug, HangMug i TapeBox. Eksperymenty obejmują standardowe ustawienia ze stałymi pozycjami docelowymi oraz dynamiczne ustawienia z losowo zakłócanymi celami podczas chwytania.

PolicyTrim utrzymuje lub poprawia wskaźnik sukcesu zarówno w standardowych, jak i dynamicznych ustawieniach zakłóceń, jednocześnie znacząco skracając rzeczywisty czas wykonania. W standardowych ustawieniach rzeczywistego robota osiągnięto średnio 1,86-krotne przyspieszenie end-to-end.

robot

robot

Z wyników eksperymentów wynika, że PolicyTrim nie tylko optymalizuje wskaźniki benchmarkowe: na fizycznym robocie czas wykonania zadania również skraca się do około połowy baseline'u, a w scenariuszach z dynamicznymi zakłóceniami zachowuje odporność.

Dlaczego PolicyTrim jest skuteczny?

• Zwiększa wydajność samej polityki: redukuje zbędne ruchy i niepotrzebne ponowne planowanie, a nie tylko zmniejsza opóźnienie pojedynczej inferencji.

• Nie wymaga trenowania od zera: jako framework po treningu, może być stosowany do optymalizacji istniejących modeli VLA, obniżając koszty zbierania danych i treningu.

• Łączy szybkość i wskaźnik sukcesu: niezawodne rozszerzanie horyzontu zapobiega ślepemu wydłużaniu chunków, a ograniczenia stabilności zapobiegają spekulacjom na krótkich ścieżkach.

• Może być łączone z przyspieszeniami po stronie obliczeniowej: PolicyTrim optymalizuje liczbę wywołań inferencji, a metody takie jak VLA-Cache optymalizują czas pojedynczej inferencji; obie ścieżki są ortogonalne i mogą dawać łączne przyspieszenie.

Głównym wnioskiem PolicyTrim jest to, że dla robotów VLA wydajność wdrożenia pochodzi nie tylko z szybszej inferencji modelu, ale także z bardziej wydajnego zachowania polityki. Sprawienie, by robot „szedł mniej okrężną drogą”, również może przynieść znaczące przyspieszenie.

Referencje: https://arxiv.org/abs/2606.22540

Ten artykuł pochodzi z publicznego konta WeChat „新智元”, autor: 新智元; redaktor: LRST

Zastrzeżenie: Informacje zawarte w tym artykule nie są poradą handlową. BlockWeeks.com nie ponosi odpowiedzialności za jakiekolwiek inwestycje podjęte na podstawie informacji zawartych w tym artykule. Zdecydowanie zalecamy przeprowadzenie niezależnych badań lub konsultację z wykwalifikowanym specjalistą przed podjęciem jakichkolwiek decyzji inwestycyjnych.