Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations
Fuente:
arXiv
Salvato in:
| Autori principali: | Mitra, Chancharik, Luo, Yusen, Saravanan, Raj, Niu, Dantong, Pai, Anirudh, Thomason, Jesse, Darrell, Trevor, Anwar, Abrar, Ramanan, Deva, Herzig, Roei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features
di: Mitra, Chancharik, et al.
Pubblicazione: (2024)
di: Mitra, Chancharik, et al.
Pubblicazione: (2024)
Compositional Chain-of-Thought Prompting for Large Multimodal Models
di: Mitra, Chancharik, et al.
Pubblicazione: (2023)
di: Mitra, Chancharik, et al.
Pubblicazione: (2023)
Which One? Leveraging Context Between Objects and Multiple Views for Language Grounding
di: Mitra, Chancharik, et al.
Pubblicazione: (2023)
di: Mitra, Chancharik, et al.
Pubblicazione: (2023)
Activation Reward Models for Few-Shot Model Alignment
di: Chai, Tianning, et al.
Pubblicazione: (2025)
di: Chai, Tianning, et al.
Pubblicazione: (2025)
Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning
di: Huang, Brandon, et al.
Pubblicazione: (2024)
di: Huang, Brandon, et al.
Pubblicazione: (2024)
In-Context Learning Enables Robot Action Prediction in LLMs
di: Yin, Yida, et al.
Pubblicazione: (2024)
di: Yin, Yida, et al.
Pubblicazione: (2024)
Do What? Teaching Vision-Language-Action Models to Reject the Impossible
di: Hsieh, Wen-Han, et al.
Pubblicazione: (2025)
di: Hsieh, Wen-Han, et al.
Pubblicazione: (2025)
LLARVA: Vision-Action Instruction Tuning Enhances Robot Learning
di: Niu, Dantong, et al.
Pubblicazione: (2024)
di: Niu, Dantong, et al.
Pubblicazione: (2024)
Less is More Tokens: Efficient Math Reasoning via Difficulty-Aware Chain-of-Thought Distillation
di: Waheed, Abdul, et al.
Pubblicazione: (2025)
di: Waheed, Abdul, et al.
Pubblicazione: (2025)
Pre-training Auto-regressive Robotic Models with 4D Representations
di: Niu, Dantong, et al.
Pubblicazione: (2025)
di: Niu, Dantong, et al.
Pubblicazione: (2025)
M3PT: A Transformer for Multimodal, Multi-Party Social Signal Prediction with Person-aware Blockwise Attention
di: Tang, Yiming, et al.
Pubblicazione: (2025)
di: Tang, Yiming, et al.
Pubblicazione: (2025)
Contrast Sets for Evaluating Language-Guided Robot Policies
di: Anwar, Abrar, et al.
Pubblicazione: (2024)
di: Anwar, Abrar, et al.
Pubblicazione: (2024)
ReWiND: Language-Guided Rewards Teach Robot Policies without New Demonstrations
di: Zhang, Jiahui, et al.
Pubblicazione: (2025)
di: Zhang, Jiahui, et al.
Pubblicazione: (2025)
RobotFleet: An Open-Source Framework for Centralized Multi-Robot Task Planning
di: Gupta, Rohan, et al.
Pubblicazione: (2025)
di: Gupta, Rohan, et al.
Pubblicazione: (2025)
Navigating the Labyrinth: Evaluating LLMs' Ability to Reason About Search Problems
di: Borazjanizadeh, Nasim, et al.
Pubblicazione: (2024)
di: Borazjanizadeh, Nasim, et al.
Pubblicazione: (2024)
TraveLER: A Modular Multi-LMM Agent Framework for Video Question-Answering
di: Shang, Chuyi, et al.
Pubblicazione: (2024)
di: Shang, Chuyi, et al.
Pubblicazione: (2024)
Recursive Visual Programming
di: Ge, Jiaxin, et al.
Pubblicazione: (2023)
di: Ge, Jiaxin, et al.
Pubblicazione: (2023)
Learning to Grasp Anything by Playing with Random Toys
di: Niu, Dantong, et al.
Pubblicazione: (2025)
di: Niu, Dantong, et al.
Pubblicazione: (2025)
Revisiting Few-Shot Object Detection with Vision-Language Models
di: Madan, Anish, et al.
Pubblicazione: (2023)
di: Madan, Anish, et al.
Pubblicazione: (2023)
Reconstruct, Inpaint, Test-Time Finetune: Dynamic Novel-view Synthesis from Monocular Videos
di: Chen, Kaihua, et al.
Pubblicazione: (2025)
di: Chen, Kaihua, et al.
Pubblicazione: (2025)
DAVE: A VLM Vision Encoder for Document Understanding and Web Agents
di: Huang, Brandon, et al.
Pubblicazione: (2025)
di: Huang, Brandon, et al.
Pubblicazione: (2025)
Visualizing Thought: Conceptual Diagrams Enable Robust Planning in LMMs
di: Borazjanizadeh, Nasim, et al.
Pubblicazione: (2025)
di: Borazjanizadeh, Nasim, et al.
Pubblicazione: (2025)
Latent Implicit Visual Reasoning
di: Li, Kelvin, et al.
Pubblicazione: (2025)
di: Li, Kelvin, et al.
Pubblicazione: (2025)
Multimodality Helps Unimodality: Cross-Modal Few-Shot Learning with Multimodal Models
di: Lin, Zhiqiu, et al.
Pubblicazione: (2023)
di: Lin, Zhiqiu, et al.
Pubblicazione: (2023)
Generating Contextually-Relevant Navigation Instructions for Blind and Low Vision People
di: Merchant, Zain, et al.
Pubblicazione: (2024)
di: Merchant, Zain, et al.
Pubblicazione: (2024)
DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection
di: Gare, Gautam Rajendrakumar, et al.
Pubblicazione: (2026)
di: Gare, Gautam Rajendrakumar, et al.
Pubblicazione: (2026)
Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection
di: Anwar, Abrar, et al.
Pubblicazione: (2025)
di: Anwar, Abrar, et al.
Pubblicazione: (2025)
Predicting Long-horizon Futures by Conditioning on Geometry and Time
di: Khurana, Tarasha, et al.
Pubblicazione: (2024)
di: Khurana, Tarasha, et al.
Pubblicazione: (2024)
From Generated Human Videos to Physically Plausible Robot Trajectories
di: Ni, James, et al.
Pubblicazione: (2025)
di: Ni, James, et al.
Pubblicazione: (2025)
Pre-Finetuning for Few-Shot Emotional Speech Recognition
di: Chen, Maximillian, et al.
Pubblicazione: (2023)
di: Chen, Maximillian, et al.
Pubblicazione: (2023)
TULIP: Towards Unified Language-Image Pretraining
di: Tang, Zineng, et al.
Pubblicazione: (2025)
di: Tang, Zineng, et al.
Pubblicazione: (2025)
Using Diffusion Priors for Video Amodal Segmentation
di: Chen, Kaihua, et al.
Pubblicazione: (2024)
di: Chen, Kaihua, et al.
Pubblicazione: (2024)
RefAV: Towards Planning-Centric Scenario Mining
di: Davidson, Cainan, et al.
Pubblicazione: (2025)
di: Davidson, Cainan, et al.
Pubblicazione: (2025)
Language Models can Infer Action Semantics for Symbolic Planners from Environment Feedback
di: Zhu, Wang, et al.
Pubblicazione: (2024)
di: Zhu, Wang, et al.
Pubblicazione: (2024)
Learning to Deliberate: Meta-policy Collaboration for Agentic LLMs with Multi-agent Reinforcement Learning
di: Yang, Wei, et al.
Pubblicazione: (2025)
di: Yang, Wei, et al.
Pubblicazione: (2025)
Adjust for Trust: Mitigating Trust-Induced Inappropriate Reliance on AI Assistance
di: Srinivasan, Tejas, et al.
Pubblicazione: (2025)
di: Srinivasan, Tejas, et al.
Pubblicazione: (2025)
Few-Shot Recognition via Stage-Wise Retrieval-Augmented Finetuning
di: Liu, Tian, et al.
Pubblicazione: (2024)
di: Liu, Tian, et al.
Pubblicazione: (2024)
Towards Few-Shot Adaptation of Foundation Models via Multitask Finetuning
di: Xu, Zhuoyan, et al.
Pubblicazione: (2024)
di: Xu, Zhuoyan, et al.
Pubblicazione: (2024)
RaySt3R: Predicting Novel Depth Maps for Zero-Shot Object Completion
di: Duisterhof, Bardienus P., et al.
Pubblicazione: (2025)
di: Duisterhof, Bardienus P., et al.
Pubblicazione: (2025)
UniFlow: Zero-Shot LiDAR Scene Flow for Autonomous Vehicles
di: Li, Siyi, et al.
Pubblicazione: (2025)
di: Li, Siyi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features
di: Mitra, Chancharik, et al.
Pubblicazione: (2024) -
Compositional Chain-of-Thought Prompting for Large Multimodal Models
di: Mitra, Chancharik, et al.
Pubblicazione: (2023) -
Which One? Leveraging Context Between Objects and Multiple Views for Language Grounding
di: Mitra, Chancharik, et al.
Pubblicazione: (2023) -
Activation Reward Models for Few-Shot Model Alignment
di: Chai, Tianning, et al.
Pubblicazione: (2025) -
Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning
di: Huang, Brandon, et al.
Pubblicazione: (2024)