ActionCodec: What Makes for Good Action Tokenizers
Fuente:
arXiv
Saved in:
| Main Authors: | Dong, Zibin, Liu, Yicheng, Zhang, Shiduo, Ye, Baijun, Yuan, Yifu, Ni, Fei, Gong, Jingjing, Qiu, Xipeng, Zhao, Hang, Li, Yinchuan, Hao, Jianye |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization
by: Liu, Yicheng, et al.
Published: (2025)
by: Liu, Yicheng, et al.
Published: (2025)
EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation
by: Dong, Zibin, et al.
Published: (2025)
by: Dong, Zibin, et al.
Published: (2025)
Conditioning Matters: Training Diffusion Policies is Faster Than You Think
by: Dong, Zibin, et al.
Published: (2025)
by: Dong, Zibin, et al.
Published: (2025)
CleanDiffuser: An Easy-to-use Modularized Library for Diffusion Models in Decision Making
by: Dong, Zibin, et al.
Published: (2024)
by: Dong, Zibin, et al.
Published: (2024)
Fast-WAM: Do World Action Models Need Test-time Future Imagination?
by: Yuan, Tianyuan, et al.
Published: (2026)
by: Yuan, Tianyuan, et al.
Published: (2026)
SRPO: Self-Referential Policy Optimization for Vision-Language-Action Models
by: Fei, Senyu, et al.
Published: (2025)
by: Fei, Senyu, et al.
Published: (2025)
MODULI: Unlocking Preference Generalization via Diffusion Models for Offline Multi-Objective Reinforcement Learning
by: Yuan, Yifu, et al.
Published: (2024)
by: Yuan, Yifu, et al.
Published: (2024)
DiffuserLite: Towards Real-time Diffusion Planning
by: Dong, Zibin, et al.
Published: (2024)
by: Dong, Zibin, et al.
Published: (2024)
LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models
by: Fei, Senyu, et al.
Published: (2025)
by: Fei, Senyu, et al.
Published: (2025)
XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs
by: Gong, Yitian, et al.
Published: (2025)
by: Gong, Yitian, et al.
Published: (2025)
World Modeling Makes a Better Planner: Dual Preference Optimization for Embodied Task Planning
by: Wang, Siyin, et al.
Published: (2025)
by: Wang, Siyin, et al.
Published: (2025)
Few-Shot Vision-Language Action-Incremental Policy Learning
by: Song, Mingchen, et al.
Published: (2025)
by: Song, Mingchen, et al.
Published: (2025)
Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation
by: Yuan, Yifu, et al.
Published: (2025)
by: Yuan, Yifu, et al.
Published: (2025)
AlignDiff: Aligning Diverse Human Preferences via Behavior-Customisable Diffusion Model
by: Dong, Zibin, et al.
Published: (2023)
by: Dong, Zibin, et al.
Published: (2023)
From Seeing to Doing: Bridging Reasoning and Decision for Robotic Manipulation
by: Yuan, Yifu, et al.
Published: (2025)
by: Yuan, Yifu, et al.
Published: (2025)
CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation
by: Deng, Ruifan, et al.
Published: (2025)
by: Deng, Ruifan, et al.
Published: (2025)
VideoRoPE: What Makes for Good Video Rotary Position Embedding?
by: Wei, Xilin, et al.
Published: (2025)
by: Wei, Xilin, et al.
Published: (2025)
Efficient Spatial-Temporal Focal Adapter with SSM for Temporal Action Detection
by: Qiu, Yicheng, et al.
Published: (2026)
by: Qiu, Yicheng, et al.
Published: (2026)
Enhancing Robotic Manipulation with AI Feedback from Multimodal Large Language Models
by: Liu, Jinyi, et al.
Published: (2024)
by: Liu, Jinyi, et al.
Published: (2024)
AhaRobot: A Low-Cost Open-Source Bimanual Mobile Manipulator for Embodied AI
by: Cui, Haiqin, et al.
Published: (2025)
by: Cui, Haiqin, et al.
Published: (2025)
ED2: Environment Dynamics Decomposition World Models for Continuous Control
by: Hao, Jianye, et al.
Published: (2021)
by: Hao, Jianye, et al.
Published: (2021)
MENTOR: Guiding Hierarchical Reinforcement Learning with Human Feedback and Dynamic Distance Constraint
by: Zhou, Xinglin, et al.
Published: (2024)
by: Zhou, Xinglin, et al.
Published: (2024)
World Action Models: The Next Frontier in Embodied AI
by: Wang, Siyin, et al.
Published: (2026)
by: Wang, Siyin, et al.
Published: (2026)
What Makes a Good Speech Tokenizer for LLM-Centric Speech Generation? A Systematic Study
by: Fan, Xiaoran, et al.
Published: (2025)
by: Fan, Xiaoran, et al.
Published: (2025)
Uni-RLHF: Universal Platform and Benchmark Suite for Reinforcement Learning with Diverse Human Feedback
by: Yuan, Yifu, et al.
Published: (2024)
by: Yuan, Yifu, et al.
Published: (2024)
ActionPiece: Contextually Tokenizing Action Sequences for Generative Recommendation
by: Hou, Yupeng, et al.
Published: (2025)
by: Hou, Yupeng, et al.
Published: (2025)
Beyond Syntax: Action Semantics Learning for App Agents
by: Tang, Bohan, et al.
Published: (2025)
by: Tang, Bohan, et al.
Published: (2025)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
by: Zhang, Xin, et al.
Published: (2023)
by: Zhang, Xin, et al.
Published: (2023)
Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning
by: Fei, Zhaoye, et al.
Published: (2025)
by: Fei, Zhaoye, et al.
Published: (2025)
World-aware Planning Narratives Enhance Large Vision-Language Model Planner
by: Shi, Junhao, et al.
Published: (2025)
by: Shi, Junhao, et al.
Published: (2025)
Beyond Attention Magnitude: Leveraging Inter-layer Rank Consistency for Efficient Vision-Language-Action Models
by: Liu, Peiju, et al.
Published: (2026)
by: Liu, Peiju, et al.
Published: (2026)
A Survey on Vision-Language-Action Models for Embodied AI
by: Ma, Yueen, et al.
Published: (2024)
by: Ma, Yueen, et al.
Published: (2024)
DepthVLA: Enhancing Vision-Language-Action Models with Depth-Aware Spatial Reasoning
by: Yuan, Tianyuan, et al.
Published: (2025)
by: Yuan, Tianyuan, et al.
Published: (2025)
ActionFlow: A Pipelined Action Acceleration for Vision Language Models on Edge
by: Dai, Yuntao, et al.
Published: (2025)
by: Dai, Yuntao, et al.
Published: (2025)
Joint-Aligned Latent Action: Towards Scalable VLA Pretraining in the Wild
by: Luo, Hao, et al.
Published: (2026)
by: Luo, Hao, et al.
Published: (2026)
LLMs are Good Action Recognizers
by: Qu, Haoxuan, et al.
Published: (2024)
by: Qu, Haoxuan, et al.
Published: (2024)
Latent Denoising Makes Good Tokenizers
by: Yang, Jiawei, et al.
Published: (2025)
by: Yang, Jiawei, et al.
Published: (2025)
Action Tokenizer Matters in In-Context Imitation Learning
by: Vuong, An Dinh, et al.
Published: (2025)
by: Vuong, An Dinh, et al.
Published: (2025)
WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling
by: Ji, Shengpeng, et al.
Published: (2024)
by: Ji, Shengpeng, et al.
Published: (2024)
SheetAgent: Towards A Generalist Agent for Spreadsheet Reasoning and Manipulation via Large Language Models
by: Chen, Yibin, et al.
Published: (2024)
by: Chen, Yibin, et al.
Published: (2024)
Similar Items
-
FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization
by: Liu, Yicheng, et al.
Published: (2025) -
EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation
by: Dong, Zibin, et al.
Published: (2025) -
Conditioning Matters: Training Diffusion Policies is Faster Than You Think
by: Dong, Zibin, et al.
Published: (2025) -
CleanDiffuser: An Easy-to-use Modularized Library for Diffusion Models in Decision Making
by: Dong, Zibin, et al.
Published: (2024) -
Fast-WAM: Do World Action Models Need Test-time Future Imagination?
by: Yuan, Tianyuan, et al.
Published: (2026)