Can Large Vision-Language Models Correct Semantic Grounding Errors By Themselves?
Fuente:
arXiv
Salvato in:
| Autori principali: | Liao, Yuan-Hong, Mahmood, Rafid, Fidler, Sanja, Acuna, David |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Reasoning Paths with Reference Objects Elicit Quantitative Spatial Reasoning in Large Vision-Language Models
di: Liao, Yuan-Hong, et al.
Pubblicazione: (2024)
di: Liao, Yuan-Hong, et al.
Pubblicazione: (2024)
AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?
di: Bao, Han, et al.
Pubblicazione: (2024)
di: Bao, Han, et al.
Pubblicazione: (2024)
LongPerceptualThoughts: Distilling System-2 Reasoning for System-1 Perception
di: Liao, Yuan-Hong, et al.
Pubblicazione: (2025)
di: Liao, Yuan-Hong, et al.
Pubblicazione: (2025)
EmerDiff: Emerging Pixel-level Semantic Knowledge in Diffusion Models
di: Namekata, Koichi, et al.
Pubblicazione: (2024)
di: Namekata, Koichi, et al.
Pubblicazione: (2024)
Minority Reports: Balancing Cost and Quality in Ground Truth Data Annotation
di: Liao, Hsuan Wei, et al.
Pubblicazione: (2025)
di: Liao, Hsuan Wei, et al.
Pubblicazione: (2025)
IDEATOR: Jailbreaking and Benchmarking Large Vision-Language Models Using Themselves
di: Wang, Ruofan, et al.
Pubblicazione: (2024)
di: Wang, Ruofan, et al.
Pubblicazione: (2024)
Align Your Steps: Optimizing Sampling Schedules in Diffusion Models
di: Sabour, Amirmojtaba, et al.
Pubblicazione: (2024)
di: Sabour, Amirmojtaba, et al.
Pubblicazione: (2024)
Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models
di: Lu, Jiaying, et al.
Pubblicazione: (2023)
di: Lu, Jiaying, et al.
Pubblicazione: (2023)
RefFusion: Reference Adapted Diffusion Models for 3D Scene Inpainting
di: Mirzaei, Ashkan, et al.
Pubblicazione: (2024)
di: Mirzaei, Ashkan, et al.
Pubblicazione: (2024)
Align Your Flow: Scaling Continuous-Time Flow Map Distillation
di: Sabour, Amirmojtaba, et al.
Pubblicazione: (2025)
di: Sabour, Amirmojtaba, et al.
Pubblicazione: (2025)
AgriChain Visually Grounded Expert Verified Reasoning for Interpretable Agricultural Vision Language Models
di: Mahmood, Hazza, et al.
Pubblicazione: (2026)
di: Mahmood, Hazza, et al.
Pubblicazione: (2026)
Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves
di: Wu, Shihan, et al.
Pubblicazione: (2024)
di: Wu, Shihan, et al.
Pubblicazione: (2024)
Beyond Perception Errors: Semantic Fixation in Large Vision-Language Models
di: Alam, Md Tanvirul
Pubblicazione: (2026)
di: Alam, Md Tanvirul
Pubblicazione: (2026)
Curing Semantic Drift: A Dynamic Approach to Grounding Generation in Large Vision-Language Models
di: Chen, Jiahe, et al.
Pubblicazione: (2025)
di: Chen, Jiahe, et al.
Pubblicazione: (2025)
Socratic-MCTS: Test-Time Visual Reasoning by Asking the Right Questions
di: Acuna, David, et al.
Pubblicazione: (2025)
di: Acuna, David, et al.
Pubblicazione: (2025)
Semantically Grounded QFormer for Efficient Vision Language Understanding
di: Choraria, Moulik, et al.
Pubblicazione: (2023)
di: Choraria, Moulik, et al.
Pubblicazione: (2023)
Photorealistic Object Insertion with Diffusion-Guided Inverse Rendering
di: Liang, Ruofan, et al.
Pubblicazione: (2024)
di: Liang, Ruofan, et al.
Pubblicazione: (2024)
Vision-LLMs Can Fool Themselves with Self-Generated Typographic Attacks
di: Qraitem, Maan, et al.
Pubblicazione: (2024)
di: Qraitem, Maan, et al.
Pubblicazione: (2024)
XCube: Large-Scale 3D Generative Modeling using Sparse Voxel Hierarchies
di: Ren, Xuanchi, et al.
Pubblicazione: (2023)
di: Ren, Xuanchi, et al.
Pubblicazione: (2023)
Affordance Perception by a Knowledge-Guided Vision-Language Model with Efficient Error Correction
di: Burghouts, Gertjan, et al.
Pubblicazione: (2024)
di: Burghouts, Gertjan, et al.
Pubblicazione: (2024)
WildFusion: Learning 3D-Aware Latent Diffusion Models in View Space
di: Schwarz, Katja, et al.
Pubblicazione: (2023)
di: Schwarz, Katja, et al.
Pubblicazione: (2023)
Large Vision Model-Guided Masked Low-Rank Approximation for Ground-Roll Attenuation
di: Liao, Jiacheng, et al.
Pubblicazione: (2026)
di: Liao, Jiacheng, et al.
Pubblicazione: (2026)
GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding
di: Zhou, Yue, et al.
Pubblicazione: (2024)
di: Zhou, Yue, et al.
Pubblicazione: (2024)
SIF: Semantically In-Distribution Fingerprints for Large Vision-Language Models
di: Zhao, Yifei, et al.
Pubblicazione: (2026)
di: Zhao, Yifei, et al.
Pubblicazione: (2026)
Vision-Language Semantic Grounding for Multi-Domain Crop-Weed Segmentation
di: Hossain, Nazia, et al.
Pubblicazione: (2026)
di: Hossain, Nazia, et al.
Pubblicazione: (2026)
No Other Representation Component Is Needed: Diffusion Transformers Can Provide Representation Guidance by Themselves
di: Jiang, Dengyang, et al.
Pubblicazione: (2025)
di: Jiang, Dengyang, et al.
Pubblicazione: (2025)
Align Your Gaussians: Text-to-4D with Dynamic 3D Gaussians and Composed Diffusion Models
di: Ling, Huan, et al.
Pubblicazione: (2023)
di: Ling, Huan, et al.
Pubblicazione: (2023)
DenseGrounding: Improving Dense Language-Vision Semantics for Ego-Centric 3D Visual Grounding
di: Zheng, Henry, et al.
Pubblicazione: (2025)
di: Zheng, Henry, et al.
Pubblicazione: (2025)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
di: Wang, Xinyu, et al.
Pubblicazione: (2025)
di: Wang, Xinyu, et al.
Pubblicazione: (2025)
NeRF-XL: Scaling NeRFs with Multiple GPUs
di: Li, Ruilong, et al.
Pubblicazione: (2024)
di: Li, Ruilong, et al.
Pubblicazione: (2024)
Can Large Vision Language Models Read Maps Like a Human?
di: Xing, Shuo, et al.
Pubblicazione: (2025)
di: Xing, Shuo, et al.
Pubblicazione: (2025)
ViR: Towards Efficient Vision Retention Backbones
di: Hatamizadeh, Ali, et al.
Pubblicazione: (2023)
di: Hatamizadeh, Ali, et al.
Pubblicazione: (2023)
Personalized Large Vision-Language Models
di: Pham, Chau, et al.
Pubblicazione: (2024)
di: Pham, Chau, et al.
Pubblicazione: (2024)
Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
di: Kumbhar, Shrinidhi, et al.
Pubblicazione: (2026)
di: Kumbhar, Shrinidhi, et al.
Pubblicazione: (2026)
Show and Guide: Instructional-Plan Grounded Vision and Language Model
di: Glória-Silva, Diogo, et al.
Pubblicazione: (2024)
di: Glória-Silva, Diogo, et al.
Pubblicazione: (2024)
Vision-Language Models Can't See the Obvious
di: Dahou, Yasser, et al.
Pubblicazione: (2025)
di: Dahou, Yasser, et al.
Pubblicazione: (2025)
UniVRSE: Unified Vision-conditioned Response Semantic Entropy for Hallucination Detection in Medical Vision-Language Models
di: Liao, Zehui, et al.
Pubblicazione: (2025)
di: Liao, Zehui, et al.
Pubblicazione: (2025)
Does Object Grounding Really Reduce Hallucination of Large Vision-Language Models?
di: Geigle, Gregor, et al.
Pubblicazione: (2024)
di: Geigle, Gregor, et al.
Pubblicazione: (2024)
Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling
di: Park, Sungjune, et al.
Pubblicazione: (2025)
di: Park, Sungjune, et al.
Pubblicazione: (2025)
Controllable Weather Synthesis and Removal with Video Diffusion Models
di: Lin, Chih-Hao, et al.
Pubblicazione: (2025)
di: Lin, Chih-Hao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Reasoning Paths with Reference Objects Elicit Quantitative Spatial Reasoning in Large Vision-Language Models
di: Liao, Yuan-Hong, et al.
Pubblicazione: (2024) -
AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?
di: Bao, Han, et al.
Pubblicazione: (2024) -
LongPerceptualThoughts: Distilling System-2 Reasoning for System-1 Perception
di: Liao, Yuan-Hong, et al.
Pubblicazione: (2025) -
EmerDiff: Emerging Pixel-level Semantic Knowledge in Diffusion Models
di: Namekata, Koichi, et al.
Pubblicazione: (2024) -
Minority Reports: Balancing Cost and Quality in Ground Truth Data Annotation
di: Liao, Hsuan Wei, et al.
Pubblicazione: (2025)