BEAST: Efficient Tokenization of B-Splines Encoded Action Sequences for Imitation Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | , , , , , , , , , , , , , |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
| _version_ | 1866917038222475264 |
|---|---|
| author | Zhou, Hongyi Liao, Weiran Huang, Xi Tang, Yucheng Otto, Fabian Jia, Xiaogang Jiang, Xinkai Hilber, Simon Li, Ge Wang, Qian Yağmurlu, Ömer Erdinç Blank, Nils Reuss, Moritz Lioutikov, Rudolf |
| author_facet | Zhou, Hongyi Liao, Weiran Huang, Xi Tang, Yucheng Otto, Fabian Jia, Xiaogang Jiang, Xinkai Hilber, Simon Li, Ge Wang, Qian Yağmurlu, Ömer Erdinç Blank, Nils Reuss, Moritz Lioutikov, Rudolf |
| contents | We present the B-spline Encoded Action Sequence Tokenizer (BEAST), a novel action tokenizer that encodes action sequences into compact discrete or continuous tokens using B-splines. In contrast to existing action tokenizers based on vector quantization or byte pair encoding, BEAST requires no separate tokenizer training and consistently produces tokens of uniform length, enabling fast action sequence generation via parallel decoding. Leveraging our B-spline formulation, BEAST inherently ensures generating smooth trajectories without discontinuities between adjacent segments. We extensively evaluate BEAST by integrating it with three distinct model architectures: a Variational Autoencoder (VAE) with continuous tokens, a decoder-only Transformer with discrete tokens, and Florence-2, a pretrained Vision-Language Model with an encoder-decoder architecture, demonstrating BEAST's compatibility and scalability with large pretrained models. We evaluate BEAST across three established benchmarks consisting of 166 simulated tasks and on three distinct robot settings with a total of 8 real-world tasks. Experimental results demonstrate that BEAST (i) significantly reduces both training and inference computational costs, and (ii) consistently generates smooth, high-frequency control signals suitable for continuous control tasks while (iii) reliably achieves competitive task success rates compared to state-of-the-art methods. |
| format | Preprint |
| id |
arxiv_https___arxiv_org_abs_2506_06072 |
| institution | arXiv |
| publishDate | 2025 |
| record_format | arxiv |
| spellingShingle | BEAST: Efficient Tokenization of B-Splines Encoded Action Sequences for Imitation Learning Zhou, Hongyi Liao, Weiran Huang, Xi Tang, Yucheng Otto, Fabian Jia, Xiaogang Jiang, Xinkai Hilber, Simon Li, Ge Wang, Qian Yağmurlu, Ömer Erdinç Blank, Nils Reuss, Moritz Lioutikov, Rudolf Robotics Machine Learning We present the B-spline Encoded Action Sequence Tokenizer (BEAST), a novel action tokenizer that encodes action sequences into compact discrete or continuous tokens using B-splines. In contrast to existing action tokenizers based on vector quantization or byte pair encoding, BEAST requires no separate tokenizer training and consistently produces tokens of uniform length, enabling fast action sequence generation via parallel decoding. Leveraging our B-spline formulation, BEAST inherently ensures generating smooth trajectories without discontinuities between adjacent segments. We extensively evaluate BEAST by integrating it with three distinct model architectures: a Variational Autoencoder (VAE) with continuous tokens, a decoder-only Transformer with discrete tokens, and Florence-2, a pretrained Vision-Language Model with an encoder-decoder architecture, demonstrating BEAST's compatibility and scalability with large pretrained models. We evaluate BEAST across three established benchmarks consisting of 166 simulated tasks and on three distinct robot settings with a total of 8 real-world tasks. Experimental results demonstrate that BEAST (i) significantly reduces both training and inference computational costs, and (ii) consistently generates smooth, high-frequency control signals suitable for continuous control tasks while (iii) reliably achieves competitive task success rates compared to state-of-the-art methods. |
| title | BEAST: Efficient Tokenization of B-Splines Encoded Action Sequences for Imitation Learning |
| topic | Robotics Machine Learning |
| url | https://arxiv.org/abs/2506.06072 |