Vision-Language Models Unlock Task-Centric Latent Actions
Fuente:
arXiv
Salvato in:
| Autori principali: | Nikulin, Alexander, Zisman, Ilya, Klepach, Albina, Tarasov, Denis, Derevyagin, Alexander, Polubarov, Andrei, Nikita, Lyubaykin, Kurenkov, Vladislav |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Object-Centric Latent Action Learning
di: Klepach, Albina, et al.
Pubblicazione: (2025)
di: Klepach, Albina, et al.
Pubblicazione: (2025)
NinA: Normalizing Flows in Action. Training VLA Models with Normalizing Flows
di: Tarasov, Denis, et al.
Pubblicazione: (2025)
di: Tarasov, Denis, et al.
Pubblicazione: (2025)
Latent Action Learning Requires Supervision in the Presence of Distractors
di: Nikulin, Alexander, et al.
Pubblicazione: (2025)
di: Nikulin, Alexander, et al.
Pubblicazione: (2025)
Yes, Q-learning Helps Offline In-Context RL
di: Tarasov, Denis, et al.
Pubblicazione: (2025)
di: Tarasov, Denis, et al.
Pubblicazione: (2025)
Vintix: Action Model via In-Context Reinforcement Learning
di: Polubarov, Andrey, et al.
Pubblicazione: (2025)
di: Polubarov, Andrey, et al.
Pubblicazione: (2025)
N-Gram Induction Heads for In-Context RL: Improving Stability and Reducing Data Needs
di: Zisman, Ilya, et al.
Pubblicazione: (2024)
di: Zisman, Ilya, et al.
Pubblicazione: (2024)
Vintix II: Decision Pre-Trained Transformer is a Scalable In-Context Reinforcement Learner
di: Polubarov, Andrei, et al.
Pubblicazione: (2026)
di: Polubarov, Andrei, et al.
Pubblicazione: (2026)
cadrille: Multi-modal CAD Reconstruction with Reinforcement Learning
di: Kolodiazhnyi, Maksim, et al.
Pubblicazione: (2025)
di: Kolodiazhnyi, Maksim, et al.
Pubblicazione: (2025)
XLand-100B: A Large-Scale Multi-Task Dataset for In-Context Reinforcement Learning
di: Nikulin, Alexander, et al.
Pubblicazione: (2024)
di: Nikulin, Alexander, et al.
Pubblicazione: (2024)
In-Context Reinforcement Learning for Variable Action Spaces
di: Sinii, Viacheslav, et al.
Pubblicazione: (2023)
di: Sinii, Viacheslav, et al.
Pubblicazione: (2023)
Zero-Shot Adaptation of Behavioral Foundation Models to Unseen Dynamics
di: Bobrin, Maksim, et al.
Pubblicazione: (2025)
di: Bobrin, Maksim, et al.
Pubblicazione: (2025)
Emergence of In-Context Reinforcement Learning from Noise Distillation
di: Zisman, Ilya, et al.
Pubblicazione: (2023)
di: Zisman, Ilya, et al.
Pubblicazione: (2023)
XLand-MiniGrid: Scalable Meta-Reinforcement Learning Environments in JAX
di: Nikulin, Alexander, et al.
Pubblicazione: (2023)
di: Nikulin, Alexander, et al.
Pubblicazione: (2023)
VLRM: Vision-Language Models act as Reward Models for Image Captioning
di: Dzabraev, Maksim, et al.
Pubblicazione: (2024)
di: Dzabraev, Maksim, et al.
Pubblicazione: (2024)
RotVLA: Rotational Latent Action for Vision-Language-Action Model
di: Li, Qiwei, et al.
Pubblicazione: (2026)
di: Li, Qiwei, et al.
Pubblicazione: (2026)
Griffon-G: Bridging Vision-Language and Vision-Centric Tasks via Large Multimodal Models
di: Zhan, Yufei, et al.
Pubblicazione: (2024)
di: Zhan, Yufei, et al.
Pubblicazione: (2024)
Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy
di: Zhang, Tianyi, et al.
Pubblicazione: (2025)
di: Zhang, Tianyi, et al.
Pubblicazione: (2025)
VisMem: Latent Vision Memory Unlocks Potential of Vision-Language Models
di: Yu, Xinlei, et al.
Pubblicazione: (2025)
di: Yu, Xinlei, et al.
Pubblicazione: (2025)
ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models
di: Tang, Zuojin, et al.
Pubblicazione: (2026)
di: Tang, Zuojin, et al.
Pubblicazione: (2026)
ABRA: Agent Benchmark for Radiology Applications
di: Maksudov, Bulat, et al.
Pubblicazione: (2026)
di: Maksudov, Bulat, et al.
Pubblicazione: (2026)
VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
di: Sun, Jingwen, et al.
Pubblicazione: (2026)
di: Sun, Jingwen, et al.
Pubblicazione: (2026)
Seeing Space and Motion: Enhancing Latent Actions with Geometric and Dynamic Awareness for Vision-Language-Action Models
di: Cai, Zhejia, et al.
Pubblicazione: (2025)
di: Cai, Zhejia, et al.
Pubblicazione: (2025)
UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models
di: Govind, Manish Kumar, et al.
Pubblicazione: (2026)
di: Govind, Manish Kumar, et al.
Pubblicazione: (2026)
TAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action Models
di: Zhou, Jiaying, et al.
Pubblicazione: (2026)
di: Zhou, Jiaying, et al.
Pubblicazione: (2026)
From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models
di: Lin, Yihan, et al.
Pubblicazione: (2026)
di: Lin, Yihan, et al.
Pubblicazione: (2026)
CLAP: Contrastive Latent Action Pretraining for Learning Vision-Language-Action Models from Human Videos
di: Zhang, Chubin, et al.
Pubblicazione: (2026)
di: Zhang, Chubin, et al.
Pubblicazione: (2026)
Judge, Then Drive: A Critic-Centric Vision Language Action Framework for Autonomous Driving
di: Yang, Lijin, et al.
Pubblicazione: (2026)
di: Yang, Lijin, et al.
Pubblicazione: (2026)
Scale-wise Distillation of Diffusion Models
di: Starodubcev, Nikita, et al.
Pubblicazione: (2025)
di: Starodubcev, Nikita, et al.
Pubblicazione: (2025)
CLAD: Constrained Latent Action Diffusion for Vision-Language Procedure Planning
di: Shi, Lei, et al.
Pubblicazione: (2025)
di: Shi, Lei, et al.
Pubblicazione: (2025)
Benchmarking Vision, Language, & Action Models on Robotic Learning Tasks
di: Guruprasad, Pranav, et al.
Pubblicazione: (2024)
di: Guruprasad, Pranav, et al.
Pubblicazione: (2024)
Synthetic Perception: Can Generated Images Unlock Latent Visual Prior for Text-Centric Reasoning?
di: Huang, Yuesheng, et al.
Pubblicazione: (2025)
di: Huang, Yuesheng, et al.
Pubblicazione: (2025)
RealStats: A Rigorous Real-Only Statistical Framework for Fake Image Detection
di: Zisman, Haim, et al.
Pubblicazione: (2026)
di: Zisman, Haim, et al.
Pubblicazione: (2026)
LVDrive: Latent Visual Representation Enhanced Vision-Language-Action Autonomous Driving Model
di: Mei, Xiaodong, et al.
Pubblicazione: (2026)
di: Mei, Xiaodong, et al.
Pubblicazione: (2026)
Object-Centric Vision Token Pruning for Vision Language Models
di: Li, Guangyuan, et al.
Pubblicazione: (2025)
di: Li, Guangyuan, et al.
Pubblicazione: (2025)
Vision-Centric Activation and Coordination for Multimodal Large Language Models
di: Wang, Yunnan, et al.
Pubblicazione: (2025)
di: Wang, Yunnan, et al.
Pubblicazione: (2025)
VAT: Vision Action Transformer by Unlocking Full Representation of ViT
di: Li, Wenhao, et al.
Pubblicazione: (2025)
di: Li, Wenhao, et al.
Pubblicazione: (2025)
SceneGraphVLM: Dynamic Scene Graph Generation from Video with Vision-Language Models
di: Makarov, Vladislav, et al.
Pubblicazione: (2026)
di: Makarov, Vladislav, et al.
Pubblicazione: (2026)
Phantom of Latent for Large Language and Vision Models
di: Lee, Byung-Kwan, et al.
Pubblicazione: (2024)
di: Lee, Byung-Kwan, et al.
Pubblicazione: (2024)
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
di: jia, Feiyang, et al.
Pubblicazione: (2026)
di: jia, Feiyang, et al.
Pubblicazione: (2026)
CADFS: A Big CAD Program Dataset and Framework for Computer-Aided Design with Large Language Models
di: Pyatov, Vladislav, et al.
Pubblicazione: (2026)
di: Pyatov, Vladislav, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Object-Centric Latent Action Learning
di: Klepach, Albina, et al.
Pubblicazione: (2025) -
NinA: Normalizing Flows in Action. Training VLA Models with Normalizing Flows
di: Tarasov, Denis, et al.
Pubblicazione: (2025) -
Latent Action Learning Requires Supervision in the Presence of Distractors
di: Nikulin, Alexander, et al.
Pubblicazione: (2025) -
Yes, Q-learning Helps Offline In-Context RL
di: Tarasov, Denis, et al.
Pubblicazione: (2025) -
Vintix: Action Model via In-Context Reinforcement Learning
di: Polubarov, Andrey, et al.
Pubblicazione: (2025)