Enregistré dans:
| Auteurs principaux: | Wang, Shijie, Kim, Dahun, Taalimi, Ali, Sun, Chen, Kuo, Weicheng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2407.14563 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Region-centric Image-Language Pretraining for Open-Vocabulary Detection
par: Kim, Dahun, et autres
Publié: (2023)
par: Kim, Dahun, et autres
Publié: (2023)
Zero-Shot 3D Visual Grounding from Vision-Language Models
par: Li, Rong, et autres
Publié: (2025)
par: Li, Rong, et autres
Publié: (2025)
Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models
par: Jin, Hyundong, et autres
Publié: (2025)
par: Jin, Hyundong, et autres
Publié: (2025)
Unlocking Multi-Spectral Data for Multi-Modal Models with Guided Inputs and Chain-of-Thought Reasoning
par: Kim, Dahun, et autres
Publié: (2026)
par: Kim, Dahun, et autres
Publié: (2026)
OmniBind: Teach to Build Unequal-Scale Modality Interaction for Omni-Bind of All
par: Lyu, Yuanhuiyi, et autres
Publié: (2024)
par: Lyu, Yuanhuiyi, et autres
Publié: (2024)
Time-Scaling State-Space Models for Dense Video Captioning
par: Piergiovanni, AJ, et autres
Publié: (2025)
par: Piergiovanni, AJ, et autres
Publié: (2025)
Enhancing Visual Grounding and Generalization: A Multi-Task Cycle Training Approach for Vision-Language Models
par: Yang, Xiaoyu, et autres
Publié: (2023)
par: Yang, Xiaoyu, et autres
Publié: (2023)
Feature Projection Learning for Better Vision-Language Reasoning
par: Zhang, Yi, et autres
Publié: (2026)
par: Zhang, Yi, et autres
Publié: (2026)
Visual Alignment of Medical Vision-Language Models for Grounded Radiology Report Generation
par: Bose, Sarosij, et autres
Publié: (2025)
par: Bose, Sarosij, et autres
Publié: (2025)
DriveMA: Driving Vision-Language-Action Models with verifiable Meta-Actions
par: Zheng, Weicheng, et autres
Publié: (2026)
par: Zheng, Weicheng, et autres
Publié: (2026)
VividMed: Vision Language Model with Versatile Visual Grounding for Medicine
par: Luo, Lingxiao, et autres
Publié: (2024)
par: Luo, Lingxiao, et autres
Publié: (2024)
Do Pre-trained Vision-Language Models Encode Object States?
par: Newman, Kaleb, et autres
Publié: (2024)
par: Newman, Kaleb, et autres
Publié: (2024)
Recursive Visual Imagination and Adaptive Linguistic Grounding for Vision Language Navigation
par: Chen, Bolei, et autres
Publié: (2025)
par: Chen, Bolei, et autres
Publié: (2025)
GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
par: Zhou, Yue, et autres
Publié: (2024)
par: Zhou, Yue, et autres
Publié: (2024)
Zero-Shot Multi-Spectral Learning: Reimagining a Generalist Multimodal Gemini 2.5 Model for Remote Sensing Applications
par: Mallya, Ganesh, et autres
Publié: (2025)
par: Mallya, Ganesh, et autres
Publié: (2025)
IKIWISI: An Interactive Visual Pattern Generator for Evaluating the Reliability of Vision-Language Models Without Ground Truth
par: Islam, Md Touhidul, et autres
Publié: (2025)
par: Islam, Md Touhidul, et autres
Publié: (2025)
Dissecting Bit-Level Scaling Laws in Quantizing Vision Generative Models
par: Ding, Xin, et autres
Publié: (2025)
par: Ding, Xin, et autres
Publié: (2025)
Your Large Vision-Language Model Only Needs A Few Attention Heads For Visual Grounding
par: Kang, Seil, et autres
Publié: (2025)
par: Kang, Seil, et autres
Publié: (2025)
Vision-Language Modeling in PET/CT for Visual Grounding of Positive Findings
par: Huemann, Zachary, et autres
Publié: (2025)
par: Huemann, Zachary, et autres
Publié: (2025)
SeeGround: See and Ground for Zero-Shot Open-Vocabulary 3D Visual Grounding
par: Li, Rong, et autres
Publié: (2024)
par: Li, Rong, et autres
Publié: (2024)
VideoComp: Advancing Fine-Grained Compositional and Temporal Alignment in Video-Text Models
par: Kim, Dahun, et autres
Publié: (2025)
par: Kim, Dahun, et autres
Publié: (2025)
Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models
par: Lu, Jiaying, et autres
Publié: (2023)
par: Lu, Jiaying, et autres
Publié: (2023)
Switch-KD: Visual-Switch Knowledge Distillation for Vision-Language Models
par: Sun, Haoyi, et autres
Publié: (2026)
par: Sun, Haoyi, et autres
Publié: (2026)
DeepScan: A Training-Free Framework for Visually Grounded Reasoning in Large Vision-Language Models
par: Li, Yangfu, et autres
Publié: (2026)
par: Li, Yangfu, et autres
Publié: (2026)
Curing Semantic Drift: A Dynamic Approach to Grounding Generation in Large Vision-Language Models
par: Chen, Jiahe, et autres
Publié: (2025)
par: Chen, Jiahe, et autres
Publié: (2025)
Generate to Ground: Multimodal Text Conditioning Boosts Phrase Grounding in Medical Vision-Language Models
par: Nützel, Felix, et autres
Publié: (2025)
par: Nützel, Felix, et autres
Publié: (2025)
Language-Guided Diffusion Model for Visual Grounding
par: Chen, Sijia, et autres
Publié: (2023)
par: Chen, Sijia, et autres
Publié: (2023)
Enhancing Fine-Grained Spatial Grounding in 3D CT Report Generation via Discriminative Guidance
par: Wang, Chenyu, et autres
Publié: (2026)
par: Wang, Chenyu, et autres
Publié: (2026)
RoboGround: Robotic Manipulation with Grounded Vision-Language Priors
par: Huang, Haifeng, et autres
Publié: (2025)
par: Huang, Haifeng, et autres
Publié: (2025)
Visual In-Context Learning for Large Vision-Language Models
par: Zhou, Yucheng, et autres
Publié: (2024)
par: Zhou, Yucheng, et autres
Publié: (2024)
OpenFrontier: General Navigation with Visual-Language Grounded Frontiers
par: Padilla-Cerdio, Esteban, et autres
Publié: (2026)
par: Padilla-Cerdio, Esteban, et autres
Publié: (2026)
BaFTA: Backprop-Free Test-Time Adaptation For Zero-Shot Vision-Language Models
par: Hu, Xuefeng, et autres
Publié: (2024)
par: Hu, Xuefeng, et autres
Publié: (2024)
Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI
par: Ernhofer, Benjamin Raphael, et autres
Publié: (2025)
par: Ernhofer, Benjamin Raphael, et autres
Publié: (2025)
AgriChain Visually Grounded Expert Verified Reasoning for Interpretable Agricultural Vision Language Models
par: Mahmood, Hazza, et autres
Publié: (2026)
par: Mahmood, Hazza, et autres
Publié: (2026)
D-Attn: Decomposed Attention for Large Vision-and-Language Models
par: Kuo, Chia-Wen, et autres
Publié: (2025)
par: Kuo, Chia-Wen, et autres
Publié: (2025)
Mirasol3B: A Multimodal Autoregressive model for time-aligned and contextual modalities
par: Piergiovanni, AJ, et autres
Publié: (2023)
par: Piergiovanni, AJ, et autres
Publié: (2023)
DenseGrounding: Improving Dense Language-Vision Semantics for Ego-Centric 3D Visual Grounding
par: Zheng, Henry, et autres
Publié: (2025)
par: Zheng, Henry, et autres
Publié: (2025)
Consistency-guided Prompt Learning for Vision-Language Models
par: Roy, Shuvendu, et autres
Publié: (2023)
par: Roy, Shuvendu, et autres
Publié: (2023)
AffordanceLLM: Grounding Affordance from Vision Language Models
par: Qian, Shengyi, et autres
Publié: (2024)
par: Qian, Shengyi, et autres
Publié: (2024)
Look Again, Think Slowly: Enhancing Visual Reflection in Vision-Language Models
par: Jian, Pu, et autres
Publié: (2025)
par: Jian, Pu, et autres
Publié: (2025)
Documents similaires
-
Region-centric Image-Language Pretraining for Open-Vocabulary Detection
par: Kim, Dahun, et autres
Publié: (2023) -
Zero-Shot 3D Visual Grounding from Vision-Language Models
par: Li, Rong, et autres
Publié: (2025) -
Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models
par: Jin, Hyundong, et autres
Publié: (2025) -
Unlocking Multi-Spectral Data for Multi-Modal Models with Guided Inputs and Chain-of-Thought Reasoning
par: Kim, Dahun, et autres
Publié: (2026) -
OmniBind: Teach to Build Unequal-Scale Modality Interaction for Omni-Bind of All
par: Lyu, Yuanhuiyi, et autres
Publié: (2024)