Bootstrapping Action-Grounded Visual Dynamics in Unified Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Qiu, Yifu, Ziser, Yftah, Korhonen, Anna, Cohen, Shay B., Ponti, Edoardo M. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Lost in Space? Vision-Language Models Struggle with Relative Camera Pose Estimation
par: Deng, Ken, et autres
Publié: (2026)
par: Deng, Ken, et autres
Publié: (2026)
Spectral Editing of Activations for Large Language Model Alignment
par: Qiu, Yifu, et autres
Publié: (2024)
par: Qiu, Yifu, et autres
Publié: (2024)
Self-Improving World Modelling with Latent Actions
par: Qiu, Yifu, et autres
Publié: (2026)
par: Qiu, Yifu, et autres
Publié: (2026)
Iterative Multilingual Spectral Attribute Erasure
par: Shao, Shun, et autres
Publié: (2025)
par: Shao, Shun, et autres
Publié: (2025)
A Grounded Typology of Word Classes
par: Haley, Coleman, et autres
Publié: (2024)
par: Haley, Coleman, et autres
Publié: (2024)
Layer by Layer: Uncovering Where Multi-Task Learning Happens in Instruction-Tuned Large Language Models
par: Zhao, Zheng, et autres
Publié: (2024)
par: Zhao, Zheng, et autres
Publié: (2024)
Unified Vision-Language Modeling via Concept Space Alignment
par: Qiu, Yifu, et autres
Publié: (2026)
par: Qiu, Yifu, et autres
Publié: (2026)
Vision-Language Modeling in PET/CT for Visual Grounding of Positive Findings
par: Huemann, Zachary, et autres
Publié: (2025)
par: Huemann, Zachary, et autres
Publié: (2025)
VividMed: Vision Language Model with Versatile Visual Grounding for Medicine
par: Luo, Lingxiao, et autres
Publié: (2024)
par: Luo, Lingxiao, et autres
Publié: (2024)
TopViewRS: Vision-Language Models as Top-View Spatial Reasoners
par: Li, Chengzu, et autres
Publié: (2024)
par: Li, Chengzu, et autres
Publié: (2024)
Dynamic Embedding of Hierarchical Visual Features for Efficient Vision-Language Fine-Tuning
par: Wei, Xinyu, et autres
Publié: (2025)
par: Wei, Xinyu, et autres
Publié: (2025)
Beyond Attention Magnitude: Leveraging Inter-layer Rank Consistency for Efficient Vision-Language-Action Models
par: Liu, Peiju, et autres
Publié: (2026)
par: Liu, Peiju, et autres
Publié: (2026)
ProGAL-VLA: Grounded Alignment through Prospective Reasoning in Vision-Language-Action Models
par: Darabi, Nastaran, et autres
Publié: (2026)
par: Darabi, Nastaran, et autres
Publié: (2026)
Grounding Language Models for Visual Entity Recognition
par: Xiao, Zilin, et autres
Publié: (2024)
par: Xiao, Zilin, et autres
Publié: (2024)
Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding
par: Yoon, Hee Suk, et autres
Publié: (2026)
par: Yoon, Hee Suk, et autres
Publié: (2026)
Sample-efficient Integration of New Modalities into Large Language Models
par: İnce, Osman Batur, et autres
Publié: (2025)
par: İnce, Osman Batur, et autres
Publié: (2025)
SRPO: Self-Referential Policy Optimization for Vision-Language-Action Models
par: Fei, Senyu, et autres
Publié: (2025)
par: Fei, Senyu, et autres
Publié: (2025)
Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
par: Ye, Jiacheng, et autres
Publié: (2025)
par: Ye, Jiacheng, et autres
Publié: (2025)
Enhancing Abnormality Grounding for Vision Language Models with Knowledge Descriptions
par: Li, Jun, et autres
Publié: (2025)
par: Li, Jun, et autres
Publié: (2025)
Show and Guide: Instructional-Plan Grounded Vision and Language Model
par: Glória-Silva, Diogo, et autres
Publié: (2024)
par: Glória-Silva, Diogo, et autres
Publié: (2024)
Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models
par: Lu, Jiaying, et autres
Publié: (2023)
par: Lu, Jiaying, et autres
Publié: (2023)
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
par: Rajabi, Navid, et autres
Publié: (2023)
par: Rajabi, Navid, et autres
Publié: (2023)
Visually Grounded Speech Models for Low-resource Languages and Cognitive Modelling
par: Nortje, Leanne
Publié: (2024)
par: Nortje, Leanne
Publié: (2024)
LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models
par: Fei, Senyu, et autres
Publié: (2025)
par: Fei, Senyu, et autres
Publié: (2025)
mBLIP: Efficient Bootstrapping of Multilingual Vision-LLMs
par: Geigle, Gregor, et autres
Publié: (2023)
par: Geigle, Gregor, et autres
Publié: (2023)
Do Vision-Language Models Really Understand Visual Language?
par: Hou, Yifan, et autres
Publié: (2024)
par: Hou, Yifan, et autres
Publié: (2024)
Policy Optimized Text-to-Image Pipeline Design
par: Gadot, Uri, et autres
Publié: (2025)
par: Gadot, Uri, et autres
Publié: (2025)
ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos
par: Hannan, Tanveer, et autres
Publié: (2024)
par: Hannan, Tanveer, et autres
Publié: (2024)
Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization
par: Pi, Renjie, et autres
Publié: (2024)
par: Pi, Renjie, et autres
Publié: (2024)
Do Vision-Language Models Understand Visual Persuasiveness?
par: Park, Gyuwon
Publié: (2025)
par: Park, Gyuwon
Publié: (2025)
Visual In-Context Learning for Large Vision-Language Models
par: Zhou, Yucheng, et autres
Publié: (2024)
par: Zhou, Yucheng, et autres
Publié: (2024)
A Unified Hallucination Mitigation Framework for Large Vision-Language Models
par: Chang, Yue, et autres
Publié: (2024)
par: Chang, Yue, et autres
Publié: (2024)
Survey on Vision-Language-Action Models
par: Adilkhanov, Adilzhan, et autres
Publié: (2025)
par: Adilkhanov, Adilzhan, et autres
Publié: (2025)
Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision-Language Models
par: Gröpl, Marcel, et autres
Publié: (2026)
par: Gröpl, Marcel, et autres
Publié: (2026)
A Joint Study of Phrase Grounding and Task Performance in Vision and Language Models
par: Kojima, Noriyuki, et autres
Publié: (2023)
par: Kojima, Noriyuki, et autres
Publié: (2023)
MAGIC: Multimodal Alignment & Grounding-aware Instruction Coreset for Vision-Language Models
par: Biswas, Shristi Das, et autres
Publié: (2026)
par: Biswas, Shristi Das, et autres
Publié: (2026)
Does Object Grounding Really Reduce Hallucination of Large Vision-Language Models?
par: Geigle, Gregor, et autres
Publié: (2024)
par: Geigle, Gregor, et autres
Publié: (2024)
G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
par: Hu, Wenbo, et autres
Publié: (2025)
par: Hu, Wenbo, et autres
Publié: (2025)
Weakly-Supervised 3D Visual Grounding based on Visual Language Alignment
par: Xu, Xiaoxu, et autres
Publié: (2023)
par: Xu, Xiaoxu, et autres
Publié: (2023)
Dynamic Token Reweighting for Robust Vision-Language Models
par: Jiang, Tanqiu, et autres
Publié: (2025)
par: Jiang, Tanqiu, et autres
Publié: (2025)
Documents similaires
-
Lost in Space? Vision-Language Models Struggle with Relative Camera Pose Estimation
par: Deng, Ken, et autres
Publié: (2026) -
Spectral Editing of Activations for Large Language Model Alignment
par: Qiu, Yifu, et autres
Publié: (2024) -
Self-Improving World Modelling with Latent Actions
par: Qiu, Yifu, et autres
Publié: (2026) -
Iterative Multilingual Spectral Attribute Erasure
par: Shao, Shun, et autres
Publié: (2025) -
A Grounded Typology of Word Classes
par: Haley, Coleman, et autres
Publié: (2024)