Salvato in:
| Autori principali: | Nguyen-Truong, Hai, Balbay, Alper, Bayrak, Tunga |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2604.02893 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LangXAI: Integrating Large Vision Models for Generating Textual Explanations to Enhance Explainability in Visual Perception Tasks
di: Nguyen, Truong Thanh Hung, et al.
Pubblicazione: (2024)
di: Nguyen, Truong Thanh Hung, et al.
Pubblicazione: (2024)
A Novel Framework for Automated Explain Vision Model Using Vision-Language Models
di: Nguyen, Phu-Vinh, et al.
Pubblicazione: (2025)
di: Nguyen, Phu-Vinh, et al.
Pubblicazione: (2025)
XEdgeAI: A Human-centered Industrial Inspection Framework with Data-centric Explainable Edge AI Approach
di: Nguyen, Truong Thanh Hung, et al.
Pubblicazione: (2024)
di: Nguyen, Truong Thanh Hung, et al.
Pubblicazione: (2024)
VG3T: Visual Geometry Grounded Gaussian Transformer
di: Kim, Junho, et al.
Pubblicazione: (2025)
di: Kim, Junho, et al.
Pubblicazione: (2025)
Towards Visual Text Grounding of Multimodal Large Language Model
di: Li, Ming, et al.
Pubblicazione: (2025)
di: Li, Ming, et al.
Pubblicazione: (2025)
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
di: Prasad, Archiki, et al.
Pubblicazione: (2023)
di: Prasad, Archiki, et al.
Pubblicazione: (2023)
Towards Understanding Visual Grounding in Visual Language Models
di: Pantazopoulos, Georgios, et al.
Pubblicazione: (2025)
di: Pantazopoulos, Georgios, et al.
Pubblicazione: (2025)
Masking Teacher and Reinforcing Student for Distilling Vision-Language Models
di: Lee, Byung-Kwan, et al.
Pubblicazione: (2025)
di: Lee, Byung-Kwan, et al.
Pubblicazione: (2025)
Generalized Out-of-Distribution Detection and Beyond in Vision Language Model Era: A Survey
di: Miyai, Atsuyuki, et al.
Pubblicazione: (2024)
di: Miyai, Atsuyuki, et al.
Pubblicazione: (2024)
Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering
di: Lagos, Maximiliano Hormazábal, et al.
Pubblicazione: (2025)
di: Lagos, Maximiliano Hormazábal, et al.
Pubblicazione: (2025)
Toward More Reliable Artificial Intelligence: Reducing Hallucinations in Vision-Language Models
di: Sanogo, Kassoum, et al.
Pubblicazione: (2025)
di: Sanogo, Kassoum, et al.
Pubblicazione: (2025)
GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models
di: Zheng, Shurong, et al.
Pubblicazione: (2026)
di: Zheng, Shurong, et al.
Pubblicazione: (2026)
Bridging Vision Language Models and Symbolic Grounding for Video Question Answering
di: Ma, Haodi, et al.
Pubblicazione: (2025)
di: Ma, Haodi, et al.
Pubblicazione: (2025)
Step-Level Visual Grounding Faithfulness Predicts Out-of-Distribution Generalization in Long-Horizon Vision-Language Models
di: Rahman, Md Ashikur, et al.
Pubblicazione: (2026)
di: Rahman, Md Ashikur, et al.
Pubblicazione: (2026)
Generalized Category Discovery under Domain Shifts: From Vision to Vision-Language Models
di: Wang, Hongjun, et al.
Pubblicazione: (2026)
di: Wang, Hongjun, et al.
Pubblicazione: (2026)
Generative Visual Communication in the Era of Vision-Language Models
di: Vinker, Yael
Pubblicazione: (2024)
di: Vinker, Yael
Pubblicazione: (2024)
GMAT: Grounded Multi-Agent Clinical Description Generation for Text Encoder in Vision-Language MIL for Whole Slide Image Classification
di: Quang, Ngoc Bui Lam, et al.
Pubblicazione: (2025)
di: Quang, Ngoc Bui Lam, et al.
Pubblicazione: (2025)
Jailbreaking Vision-Language Models Through the Visual Modality
di: Azulay, Aharon, et al.
Pubblicazione: (2026)
di: Azulay, Aharon, et al.
Pubblicazione: (2026)
X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models
di: Sun, Zeyi, et al.
Pubblicazione: (2024)
di: Sun, Zeyi, et al.
Pubblicazione: (2024)
UniFusion: Vision-Language Model as Unified Encoder in Image Generation
di: Li, Kevin, et al.
Pubblicazione: (2025)
di: Li, Kevin, et al.
Pubblicazione: (2025)
Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models
di: Yu, Keunwoo Peter, et al.
Pubblicazione: (2025)
di: Yu, Keunwoo Peter, et al.
Pubblicazione: (2025)
Transferable Model-agnostic Vision-Language Model Adaptation for Efficient Weak-to-Strong Generalization
di: Park, Jihwan, et al.
Pubblicazione: (2025)
di: Park, Jihwan, et al.
Pubblicazione: (2025)
Cortex-Grounded Diffusion Models for Brain Image Generation
di: Bongratz, Fabian, et al.
Pubblicazione: (2026)
di: Bongratz, Fabian, et al.
Pubblicazione: (2026)
Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI
di: Ernhofer, Benjamin Raphael, et al.
Pubblicazione: (2025)
di: Ernhofer, Benjamin Raphael, et al.
Pubblicazione: (2025)
Beyond Generation: Multi-Hop Reasoning for Factual Accuracy in Vision-Language Models
di: Hossain, Shamima
Pubblicazione: (2025)
di: Hossain, Shamima
Pubblicazione: (2025)
How to Trace Latent Generative Model Generated Images without Artificial Watermark?
di: Wang, Zhenting, et al.
Pubblicazione: (2024)
di: Wang, Zhenting, et al.
Pubblicazione: (2024)
Emergent Visual Grounding in Large Multimodal Models Without Grounding Supervision
di: Cao, Shengcao, et al.
Pubblicazione: (2024)
di: Cao, Shengcao, et al.
Pubblicazione: (2024)
Towards Long-window Anchoring in Vision-Language Model Distillation
di: Zhou, Haoyi, et al.
Pubblicazione: (2025)
di: Zhou, Haoyi, et al.
Pubblicazione: (2025)
Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models
di: Cui, Kaiyuan, et al.
Pubblicazione: (2026)
di: Cui, Kaiyuan, et al.
Pubblicazione: (2026)
Automatically Generating Visual Hallucination Test Cases for Multimodal Large Language Models
di: Liu, Zhongye, et al.
Pubblicazione: (2024)
di: Liu, Zhongye, et al.
Pubblicazione: (2024)
Towards Understanding and Quantifying Uncertainty for Text-to-Image Generation
di: Franchi, Gianni, et al.
Pubblicazione: (2024)
di: Franchi, Gianni, et al.
Pubblicazione: (2024)
Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
di: Kumbhar, Shrinidhi, et al.
Pubblicazione: (2026)
di: Kumbhar, Shrinidhi, et al.
Pubblicazione: (2026)
PhyGround: Benchmarking Physical Reasoning in Generative World Models
di: Lin, Juyi, et al.
Pubblicazione: (2026)
di: Lin, Juyi, et al.
Pubblicazione: (2026)
Focus On What Matters: Separated Models For Visual-Based RL Generalization
di: Zhang, Di, et al.
Pubblicazione: (2024)
di: Zhang, Di, et al.
Pubblicazione: (2024)
Interpret Your Decision: Logical Reasoning Regularization for Generalization in Visual Classification
di: Tan, Zhaorui, et al.
Pubblicazione: (2024)
di: Tan, Zhaorui, et al.
Pubblicazione: (2024)
By My Eyes: Grounding Multimodal Large Language Models with Sensor Data via Visual Prompting
di: Yoon, Hyungjun, et al.
Pubblicazione: (2024)
di: Yoon, Hyungjun, et al.
Pubblicazione: (2024)
Generate Any Scene: Scene Graph Driven Data Synthesis for Visual Generation Training
di: Gao, Ziqi, et al.
Pubblicazione: (2024)
di: Gao, Ziqi, et al.
Pubblicazione: (2024)
Enhancing Generalization in Vision-Language-Action Models by Preserving Pretrained Representations
di: Grover, Shresth, et al.
Pubblicazione: (2025)
di: Grover, Shresth, et al.
Pubblicazione: (2025)
Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
Break the Visual Perception: Adversarial Attacks Targeting Encoded Visual Tokens of Large Vision-Language Models
di: Wang, Yubo, et al.
Pubblicazione: (2024)
di: Wang, Yubo, et al.
Pubblicazione: (2024)
Documenti analoghi
-
LangXAI: Integrating Large Vision Models for Generating Textual Explanations to Enhance Explainability in Visual Perception Tasks
di: Nguyen, Truong Thanh Hung, et al.
Pubblicazione: (2024) -
A Novel Framework for Automated Explain Vision Model Using Vision-Language Models
di: Nguyen, Phu-Vinh, et al.
Pubblicazione: (2025) -
XEdgeAI: A Human-centered Industrial Inspection Framework with Data-centric Explainable Edge AI Approach
di: Nguyen, Truong Thanh Hung, et al.
Pubblicazione: (2024) -
VG3T: Visual Geometry Grounded Gaussian Transformer
di: Kim, Junho, et al.
Pubblicazione: (2025) -
Towards Visual Text Grounding of Multimodal Large Language Model
di: Li, Ming, et al.
Pubblicazione: (2025)