【Введение】Модели VLA уже умеют выполнять задачи, но реальные роботы всё ещё медленны! PolicyTrim — это метод оптимизации эффективности выполнения VLA-роботов, не требующий переобучения. Он расширяет надёжные последовательности действий и сокращает избыточные шаги, помогая роботам более прямо выполнять задачи и повышая общую скорость.
Модели Vision-Language-Action (VLA) объединяют визуальные наблюдения, языковые инструкции и действия робота в единую модель политики, позволяя роботу выполнять сложные задачи на основе естественного языка.
От OpenVLA, OpenVLA-OFT до π0.5, GR00T — такие модели становятся важным технологическим направлением в воплощённом интеллекте.
Но когда модель VLA действительно развёртывается на роботе, сразу проявляется ключевое узкое место: общее время выполнения задачи зависит не только от скорости каждого вывода, но и от того, сколько раз политике нужно выполнять вывод и сколько реальных физических действий требуется.
При многократных прогонах одной и той же задачи количество шагов выполнения модели VLA значительно колеблется, что указывает на то, что более короткие и прямые пути успеха достижимы, но текущая политика часто находит их лишь случайно.
Ненадёжность хвостовой части блока действий: модель предсказывает несколько действий за раз, но чем дальше действие, тем больше накапливается ошибка, и системе приходится часто перепланировать, принудительное удлинение выполнения снижает успешность и увеличивает количество физических шагов.
Физические действия избыточны: даже если задача в итоге выполнена, траектория может содержать множество корректирующих, возвратных и повторяющихся действий.
Таким образом, эффективность развёртывания VLA зависит не только от задержки вывода на каждом шаге, но и от эффективности политики (policy efficiency): сколько действий из одного предсказания можно безопасно выполнить? Сколько реальных физических шагов нужно для выполнения задачи?
Существующие методы в основном сосредоточены на вычислительной стороне, например, обрезка визуальных токенов, квантование, повторное использование KV-кэша, дистилляция или оптимизация движка вывода. Эти методы могут снизить задержку одного вывода, но если политика всё ещё требует множества избыточных физических шагов, реальное время выполнения задачи остаётся большим.
Принудительное фиксированное выполнение более длинных блоков действий также ненадёжно.
Эксперименты в статье показывают, что при принудительном увеличении длины выполнения действий успешность может снизиться, а количество физических шагов — возрасти. Это указывает на то, что низкокачественные хвостовые предсказания вносят ошибки в физический мир, и роботу затем требуется больше корректирующих действий.
Ключевой вопрос: можно ли без ущерба для успешности задачи, с помощью пост-обучения, заставить существующую VLA-политику автоматически научиться «не ходить кругами» и выполнять задачу с меньшим количеством физических шагов?
Команда под руководством профессора Лэй Иньцзе из Сычуаньского университета предложила PolicyTrim — двухэтапный фреймворк пост-обучения с подкреплением, ориентированный на «эффективность политики». Он не меняет архитектуру VLA и не требует сбора новых экспертных данных, а оптимизирует реальное поведение робота поверх уже предобученной политики.
Страница проекта:https://inceptionwang.github.io/PolicyTrim/
Ссылка на статью:https://arxiv.org/abs/2606.22540
Ссылка на код:https://github.com/INCEPTIONwang/PolicyTrim
Ссылка на модель:https://huggingface.co/INCEPTIONwang/PolicyTrim
Новый метод достигает:
- 3× увеличение использования блока действий, надёжное выполнение на более длинном горизонте;
- 51,4% сокращение физических шагов, сжатие избыточных корректирующих действий;
- 5,83× максимальное ускорение от начала до конца, LIBERO Object/π0.5;
От «вычислять быстрее» к «делать быстрее»
Основная цель PolicyTrim — не заменить вычислительное ускорение, а восполнить другое упущенное измерение: уменьшить количество прямых выводов, необходимых для выполнения задачи. Он разбивает эффективность политики на две оптимизируемые цели: сначала расширить надёжный блок действий, затем сжать избыточные физические шаги.
1. Расширение надёжного блока действий (Reliable Action Chunk Extension)
Многие текущие VLA-политики выводят последовательности действий в виде блоков действий, но при развёртывании часто выполняют только первые несколько шагов. На первом этапе PolicyTrim использует динамическое исследование горизонта выполнения (dynamic execution horizon exploration): в одной группе прогонов назначаются разные коэффициенты принятия, позволяя модели параллельно исследовать надёжные границы на коротких, средних и длинных окнах.
Траектории, успешно завершившие задачу с более длинным окном выполнения, получают более высокую награду, что побуждает модель делать ранее ненадёжные хвостовые действия блока более пригодными.
Награда за горизонт активируется только при наличии успешных траекторий в группе, чтобы модель не стремилась слепо к большей длине блока в случае неудачи.
2. Сокращение шагов с учётом избыточности (Redundancy-Aware Step Reduction)
После расширения надёжного горизонта второй этап дополнительно уменьшает общее количество физических шагов. PolicyTrim вводит награду за экономию шагов (step-saving reward): чем меньше шагов требуется для успешного выполнения задачи, тем выше награда.
Награда за экономию шагов напрямую включает «более короткие и прямые успешные траектории» в цель оптимизации.
Групповая якорная регуляризация (group-anchored regularization) подавляет невоспроизводимые спекулятивные сокращения, предотвращая ситуацию, когда модель стремится только к коротким путям в ущерб успешности.
Двухэтапная последовательная оптимизация позволяет избежать взаимного interference между целями «удлинить блок» и «сократить шаги», в конечном итоге уменьшая количество прямых выводов, необходимых для выполнения задачи.
Результаты экспериментов
В статье PolicyTrim проверяется на задачах LIBERO, ManiSkill, Meta-World и реальных роботах, охватывая различные архитектуры VLA, такие как π0.5, OpenVLA-OFT, GR00T. Общие результаты показывают, что PolicyTrim значительно повышает эффективность выполнения, сохраняя стабильный уровень успешности задач.
В LIBERO π0.5 достигает максимального ускорения в 5,83 раза от начала до конца, при этом уровень успешности сохраняется выше 98%.
Межбенчмарковые результаты показывают, что PolicyTrim достигает ускорения до 2,36 раза на ManiSkill и до 2,52 раза на Meta-World.
Межархитектурные результаты показывают, что переобученный OpenVLA-OFT с полным двухэтапным процессом достигает ускорения в 2,97 раза; OpenVLA, использующий только второй этап, также достигает ускорения в 1,41 раза.
Качественное сравнение: меньше лишних движений, траектория более прямая
В случайно выбранных задачах LIBERO базовый метод часто демонстрирует избыточные корректирующие движения и колебания/дрожание вблизи цели; траектории PolicyTrim более гладкие и прямые, позволяя выполнить ту же задачу с меньшим количеством физических шагов, обычно сокращая их примерно вдвое.
Развертывание на реальных роботах: выигрыш в эффективности из симуляции переносится в физический мир
В статье дополнительно проверяются задачи на реальных роботах с использованием манипулятора Agilex Piper, оснащенного двумя камерами Intel RealSense D435i, включая три типа задач: FlipMug, HangMug, TapeBox. Эксперименты охватывают стандартные настройки с фиксированными целевыми позициями, а также динамические настройки со случайным возмущением цели во время захвата.
PolicyTrim сохраняет или повышает уровень успешности как в стандартных, так и в динамических условиях, одновременно значительно сокращая реальное время выполнения. В стандартных условиях реального робота достигается среднее ускорение в 1,86 раза от начала до конца.
Из результатов экспериментов видно, что PolicyTrim не просто оптимизирует бенчмарковые показатели: на физическом роботе время выполнения задачи также сокращается примерно вдвое по сравнению с базовым методом, и сохраняется робастность в сценариях с динамическими помехами.
Почему PolicyTrim эффективен?
• Повышение эффективности самой политики: он уменьшает избыточные действия и ненужное перепланирование, а не просто снижает задержку одного вывода.
• Не требует обучения с нуля: как пост-тренировочный фреймворк, может оптимизировать существующие VLA-модели, снижая затраты на сбор данных и обучение.
• Баланс скорости и успешности: надежное расширение горизонта избегает слепого удлинения чанков, а ограничения стабильности предотвращают спекуляции на коротких траекториях.
• Может комбинироваться с ускорением на стороне вычислений: PolicyTrim оптимизирует количество прямых проходов, а такие методы, как VLA-Cache, оптимизируют время каждого прохода; эти два пути ортогональны и могут давать комбинированное ускорение.
Ключевая идея PolicyTrim: для VLA-роботов эффективность развертывания зависит не только от более быстрого вывода модели, но и от более эффективного поведения политики. Заставить робота «меньше ходить по кривым» также может дать значительное ускорение.
Ссылка: https://arxiv.org/abs/2606.22540
Эта статья из публичного аккаунта WeChat «Новый Юань», автор: Новый Юань; редактор: LRST
Отказ от ответственности: информация, представленная в этой статье, не является торговой рекомендацией. BlockWeeks.com не несет ответственности за любые инвестиции, сделанные на основе информации, представленной в этой статье. Мы настоятельно рекомендуем проводить независимое исследование или консультироваться с квалифицированными специалистами перед принятием любых инвестиционных решений.












