Robotic VLA Benefits from Joint Learning with Motion Image Diffusion
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fang, Yu, Ranasinghe, Kanchana, Xue, Le, Zhou, Honglu, Tan, Juntao, Xu, Ran, Heinecke, Shelby, Xiong, Caiming, Savarese, Silvio, Szafir, Daniel, Ding, Mingyu, Ryoo, Michael S., Niebles, Juan Carlos |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Future Optical Flow Prediction Improves Robot Control & Video Generation
par: Ranasinghe, Kanchana, et autres
Publié: (2026)
par: Ranasinghe, Kanchana, et autres
Publié: (2026)
xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs
par: Ryoo, Michael S., et autres
Publié: (2024)
par: Ryoo, Michael S., et autres
Publié: (2024)
Strefer: Empowering Video LLMs with Space-Time Referring and Reasoning via Synthetic Instruction Data
par: Zhou, Honglu, et autres
Publié: (2025)
par: Zhou, Honglu, et autres
Publié: (2025)
Entropy-Based Block Pruning for Efficient Large Language Models
par: Yang, Liangwei, et autres
Publié: (2025)
par: Yang, Liangwei, et autres
Publié: (2025)
Pixel Motion Diffusion is What We Need for Robot Control
par: Nguyen, E-Ro, et autres
Publié: (2025)
par: Nguyen, E-Ro, et autres
Publié: (2025)
Causal Layering via Conditional Entropy
par: Feigenbaum, Itai, et autres
Publié: (2024)
par: Feigenbaum, Itai, et autres
Publié: (2024)
Editing Arbitrary Propositions in LLMs without Subject Labels
par: Feigenbaum, Itai, et autres
Publié: (2024)
par: Feigenbaum, Itai, et autres
Publié: (2024)
Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding
par: Wang, Ziyang, et autres
Publié: (2025)
par: Wang, Ziyang, et autres
Publié: (2025)
Promptomatix: An Automatic Prompt Optimization Framework for Large Language Models
par: Murthy, Rithesh, et autres
Publié: (2025)
par: Murthy, Rithesh, et autres
Publié: (2025)
LATTE: Learning to Think with Vision Specialists
par: Ma, Zixian, et autres
Publié: (2024)
par: Ma, Zixian, et autres
Publié: (2024)
ViUniT: Visual Unit Tests for More Robust Visual Programming
par: Panagopoulou, Artemis, et autres
Publié: (2024)
par: Panagopoulou, Artemis, et autres
Publié: (2024)
Pixel Motion as Universal Representation for Robot Control
par: Ranasinghe, Kanchana, et autres
Publié: (2025)
par: Ranasinghe, Kanchana, et autres
Publié: (2025)
CoPT: Unsupervised Domain Adaptive Segmentation using Domain-Agnostic Text Embeddings
par: Mata, Cristina, et autres
Publié: (2025)
par: Mata, Cristina, et autres
Publié: (2025)
Prompt Optimization Via Diffusion Language Models
par: Wang, Shiyu, et autres
Publié: (2026)
par: Wang, Shiyu, et autres
Publié: (2026)
Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization
par: Yao, Weiran, et autres
Publié: (2023)
par: Yao, Weiran, et autres
Publié: (2023)
REX: Rapid Exploration and eXploitation for AI Agents
par: Murthy, Rithesh, et autres
Publié: (2023)
par: Murthy, Rithesh, et autres
Publié: (2023)
Test-Time Adaptation for LLM Agents via Environment Interaction
par: Chen, Arthur, et autres
Publié: (2025)
par: Chen, Arthur, et autres
Publié: (2025)
Language Repository for Long Video Understanding
par: Kahatapitiya, Kumara, et autres
Publié: (2024)
par: Kahatapitiya, Kumara, et autres
Publié: (2024)
Understanding Long Videos with Multimodal Language Models
par: Ranasinghe, Kanchana, et autres
Publié: (2024)
par: Ranasinghe, Kanchana, et autres
Publié: (2024)
X-InstructBLIP: A Framework for aligning X-Modal instruction-aware representations to LLMs and Emergent Cross-modal Reasoning
par: Panagopoulou, Artemis, et autres
Publié: (2023)
par: Panagopoulou, Artemis, et autres
Publié: (2023)
RealUserSim: Bridging the Reality Gap in Agent Benchmarking via Grounded User Simulation
par: Zhu, Ming, et autres
Publié: (2026)
par: Zhu, Ming, et autres
Publié: (2026)
ActionStudio: A Lightweight Framework for Data and Training of Large Action Models
par: Zhang, Jianguo, et autres
Publié: (2025)
par: Zhang, Jianguo, et autres
Publié: (2025)
PRACT: Optimizing Principled Reasoning and Acting of LLM Agent
par: Liu, Zhiwei, et autres
Publié: (2024)
par: Liu, Zhiwei, et autres
Publié: (2024)
LAM SIMULATOR: Advancing Data Generation for Large Action Model Training via Online Exploration and Trajectory Feedback
par: Hoang, Thai, et autres
Publié: (2025)
par: Hoang, Thai, et autres
Publié: (2025)
AgentLite: A Lightweight Library for Building and Advancing Task-Oriented LLM Agent System
par: Liu, Zhiwei, et autres
Publié: (2024)
par: Liu, Zhiwei, et autres
Publié: (2024)
DialogStudio: Towards Richest and Most Diverse Unified Dataset Collection for Conversational AI
par: Zhang, Jianguo, et autres
Publié: (2023)
par: Zhang, Jianguo, et autres
Publié: (2023)
INDICT: Code Generation with Internal Dialogues of Critiques for Both Security and Helpfulness
par: Le, Hung, et autres
Publié: (2024)
par: Le, Hung, et autres
Publié: (2024)
Enabling High Data Throughput Reinforcement Learning on GPUs: A Domain Agnostic Framework for Data-Driven Scientific Research
par: Lan, Tian, et autres
Publié: (2024)
par: Lan, Tian, et autres
Publié: (2024)
Contra4: Evaluating Contrastive Cross-Modal Reasoning in Audio, Video, Image, and 3D
par: Panagopoulou, Artemis, et autres
Publié: (2025)
par: Panagopoulou, Artemis, et autres
Publié: (2025)
APIGen: Automated Pipeline for Generating Verifiable and Diverse Function-Calling Datasets
par: Liu, Zuxin, et autres
Publié: (2024)
par: Liu, Zuxin, et autres
Publié: (2024)
Whisper-AuT: Domain-Adapted Audio Encoder for Efficient Audio-LLM Training
par: Qiu, Jielin, et autres
Publié: (2026)
par: Qiu, Jielin, et autres
Publié: (2026)
Enterprise Sales Copilot: Enabling Real-Time AI Support with Automatic Information Retrieval in Live Sales Calls
par: Qiu, Jielin, et autres
Publié: (2026)
par: Qiu, Jielin, et autres
Publié: (2026)
Building Enterprise Realtime Voice Agents from Scratch: A Technical Tutorial
par: Qiu, Jielin, et autres
Publié: (2026)
par: Qiu, Jielin, et autres
Publié: (2026)
IVRA: Improving Visual-Token Relations for Robot Action Policy with Training-Free Hint-Based Guidance
par: Park, Jongwoo, et autres
Publié: (2026)
par: Park, Jongwoo, et autres
Publié: (2026)
CoDA: Coding LM via Diffusion Adaptation
par: Chen, Haolin, et autres
Publié: (2025)
par: Chen, Haolin, et autres
Publié: (2025)
PersonaBench: Evaluating AI Models on Understanding Personal Information through Accessing (Synthetic) Private User Data
par: Tan, Juntao, et autres
Publié: (2025)
par: Tan, Juntao, et autres
Publié: (2025)
xGen-VideoSyn-1: High-fidelity Text-to-Video Synthesis with Compressed Representations
par: Qin, Can, et autres
Publié: (2024)
par: Qin, Can, et autres
Publié: (2024)
ULIP-2: Towards Scalable Multimodal Pre-training for 3D Understanding
par: Xue, Le, et autres
Publié: (2023)
par: Xue, Le, et autres
Publié: (2023)
DyMU: Dynamic Merging and Virtual Unmerging for Efficient VLMs
par: Wang, Zhenhailong, et autres
Publié: (2025)
par: Wang, Zhenhailong, et autres
Publié: (2025)
AgentOhana: Design Unified Data and Training Pipeline for Effective Agent Learning
par: Zhang, Jianguo, et autres
Publié: (2024)
par: Zhang, Jianguo, et autres
Publié: (2024)
Documents similaires
-
Future Optical Flow Prediction Improves Robot Control & Video Generation
par: Ranasinghe, Kanchana, et autres
Publié: (2026) -
xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs
par: Ryoo, Michael S., et autres
Publié: (2024) -
Strefer: Empowering Video LLMs with Space-Time Referring and Reasoning via Synthetic Instruction Data
par: Zhou, Honglu, et autres
Publié: (2025) -
Entropy-Based Block Pruning for Efficient Large Language Models
par: Yang, Liangwei, et autres
Publié: (2025) -
Pixel Motion Diffusion is What We Need for Robot Control
par: Nguyen, E-Ro, et autres
Publié: (2025)