Instruction-Evidence Contrastive Dual-Stream Decoding for Grounded Vision-Language Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Bangde, Yashwant Pravinrao, Roy, Debaditya |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MAGIC: Multimodal Alignment & Grounding-aware Instruction Coreset for Vision-Language Models
por: Biswas, Shristi Das, et al.
Publicado: (2026)
por: Biswas, Shristi Das, et al.
Publicado: (2026)
Improving Temporal Action Segmentation via Constraint-Aware Decoding
por: Ee, Yeo Keat, et al.
Publicado: (2026)
por: Ee, Yeo Keat, et al.
Publicado: (2026)
Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding
por: Wang, Xintong, et al.
Publicado: (2024)
por: Wang, Xintong, et al.
Publicado: (2024)
Predicting the Next Action by Modeling the Abstract Goal
por: Roy, Debaditya, et al.
Publicado: (2022)
por: Roy, Debaditya, et al.
Publicado: (2022)
Learning to Generate Long-term Future Narrations Describing Activities of Daily Living
por: Rajendiran, Ramanathan, et al.
Publicado: (2025)
por: Rajendiran, Ramanathan, et al.
Publicado: (2025)
Interaction Region Visual Transformer for Egocentric Action Anticipation
por: Roy, Debaditya, et al.
Publicado: (2022)
por: Roy, Debaditya, et al.
Publicado: (2022)
Effectively Leveraging CLIP for Generating Situational Summaries of Images and Videos
por: Verma, Dhruv, et al.
Publicado: (2024)
por: Verma, Dhruv, et al.
Publicado: (2024)
Modelling Spatio-Temporal Interactions For Compositional Action Recognition
por: Rajendiran, Ramanathan, et al.
Publicado: (2023)
por: Rajendiran, Ramanathan, et al.
Publicado: (2023)
Learning to Reason Iteratively and Parallelly for Complex Visual Reasoning Scenarios
por: Jaiswal, Shantanu, et al.
Publicado: (2024)
por: Jaiswal, Shantanu, et al.
Publicado: (2024)
Show and Guide: Instructional-Plan Grounded Vision and Language Model
por: Glória-Silva, Diogo, et al.
Publicado: (2024)
por: Glória-Silva, Diogo, et al.
Publicado: (2024)
SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
por: Cheng, An-Chieh, et al.
Publicado: (2024)
por: Cheng, An-Chieh, et al.
Publicado: (2024)
SECOND: Mitigating Perceptual Hallucination in Vision-Language Models via Selective and Contrastive Decoding
por: Park, Woohyeon, et al.
Publicado: (2025)
por: Park, Woohyeon, et al.
Publicado: (2025)
Cross-Image Contrastive Decoding: Precise, Lossless Suppression of Language Priors in Large Vision-Language Models
por: Zhao, Jianfei, et al.
Publicado: (2025)
por: Zhao, Jianfei, et al.
Publicado: (2025)
GLaRE: A Graph-based Landmark Region Embedding Network for Emotion Recognition
por: Maji, Debasis, et al.
Publicado: (2025)
por: Maji, Debasis, et al.
Publicado: (2025)
Infection-Reasoner: A Compact Vision-Language Model for Wound Infection Classification with Evidence-Grounded Clinical Reasoning
por: Busaranuvong, Palawat, et al.
Publicado: (2026)
por: Busaranuvong, Palawat, et al.
Publicado: (2026)
How Reasoning Influences Intersectional Biases in Vision Language Models
por: Desai, Adit, et al.
Publicado: (2025)
por: Desai, Adit, et al.
Publicado: (2025)
Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models
por: Zhang, Jialiang, et al.
Publicado: (2026)
por: Zhang, Jialiang, et al.
Publicado: (2026)
Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models
por: Jin, Hyundong, et al.
Publicado: (2025)
por: Jin, Hyundong, et al.
Publicado: (2025)
Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models
por: Souza, Rafael, et al.
Publicado: (2024)
por: Souza, Rafael, et al.
Publicado: (2024)
Mitigating Hallucinations in Large Vision-Language Models with Internal Fact-based Contrastive Decoding
por: Wang, Chao, et al.
Publicado: (2025)
por: Wang, Chao, et al.
Publicado: (2025)
Med-VCD: Mitigating Hallucination for Medical Large Vision Language Models through Visual Contrastive Decoding
por: Mahdavi, Zahra, et al.
Publicado: (2025)
por: Mahdavi, Zahra, et al.
Publicado: (2025)
Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model
por: Won, John, et al.
Publicado: (2025)
por: Won, John, et al.
Publicado: (2025)
Can Vision Transformers with ResNet's Global Features Fairly Authenticate Demographic Faces?
por: Sufian, Abu, et al.
Publicado: (2025)
por: Sufian, Abu, et al.
Publicado: (2025)
StreamSense: Streaming Social Task Detection with Selective Vision-Language Model Routing
por: Wang, Han, et al.
Publicado: (2026)
por: Wang, Han, et al.
Publicado: (2026)
ST-VLM: Kinematic Instruction Tuning for Spatio-Temporal Reasoning in Vision-Language Models
por: Ko, Dohwan, et al.
Publicado: (2025)
por: Ko, Dohwan, et al.
Publicado: (2025)
VaLiD: Mitigating the Hallucination of Large Vision Language Models by Visual Layer Fusion Contrastive Decoding
por: Wang, Jiaqi, et al.
Publicado: (2024)
por: Wang, Jiaqi, et al.
Publicado: (2024)
Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision-Language Models
por: Gröpl, Marcel, et al.
Publicado: (2026)
por: Gröpl, Marcel, et al.
Publicado: (2026)
ViTCN: Vision Transformer Contrastive Network For Reasoning
por: Song, Bo, et al.
Publicado: (2024)
por: Song, Bo, et al.
Publicado: (2024)
C3L: Content Correlated Vision-Language Instruction Tuning Data Generation via Contrastive Learning
por: Ma, Ji, et al.
Publicado: (2024)
por: Ma, Ji, et al.
Publicado: (2024)
Video Evidence to Reasoning Efficient Video Understanding via Explicit Evidence Grounding
por: Huang, Yanxiang, et al.
Publicado: (2026)
por: Huang, Yanxiang, et al.
Publicado: (2026)
Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding
por: Sharma, Shivam, et al.
Publicado: (2026)
por: Sharma, Shivam, et al.
Publicado: (2026)
Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought
por: Man, Yunze, et al.
Publicado: (2025)
por: Man, Yunze, et al.
Publicado: (2025)
iFinder: Structured Zero-Shot Vision-Based LLM Grounding for Dash-Cam Video Reasoning
por: Yao, Manyi, et al.
Publicado: (2025)
por: Yao, Manyi, et al.
Publicado: (2025)
Visual Alignment of Medical Vision-Language Models for Grounded Radiology Report Generation
por: Bose, Sarosij, et al.
Publicado: (2025)
por: Bose, Sarosij, et al.
Publicado: (2025)
Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding
por: Yoon, Hee Suk, et al.
Publicado: (2026)
por: Yoon, Hee Suk, et al.
Publicado: (2026)
AgriChain Visually Grounded Expert Verified Reasoning for Interpretable Agricultural Vision Language Models
por: Mahmood, Hazza, et al.
Publicado: (2026)
por: Mahmood, Hazza, et al.
Publicado: (2026)
MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models
por: Wu, Xiyang, et al.
Publicado: (2025)
por: Wu, Xiyang, et al.
Publicado: (2025)
Streaming Video Instruction Tuning
por: Xia, Jiaer, et al.
Publicado: (2025)
por: Xia, Jiaer, et al.
Publicado: (2025)
Grounding Language with Vision: A Conditional Mutual Information Calibrated Decoding Strategy for Reducing Hallucinations in LVLMs
por: Fang, Hao, et al.
Publicado: (2025)
por: Fang, Hao, et al.
Publicado: (2025)
Context-Aware Pesticide Recommendation via Few-Shot Pest Recognition for Precision Agriculture
por: Ghosh, Anirudha, et al.
Publicado: (2026)
por: Ghosh, Anirudha, et al.
Publicado: (2026)
Ejemplares similares
-
MAGIC: Multimodal Alignment & Grounding-aware Instruction Coreset for Vision-Language Models
por: Biswas, Shristi Das, et al.
Publicado: (2026) -
Improving Temporal Action Segmentation via Constraint-Aware Decoding
por: Ee, Yeo Keat, et al.
Publicado: (2026) -
Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding
por: Wang, Xintong, et al.
Publicado: (2024) -
Predicting the Next Action by Modeling the Abstract Goal
por: Roy, Debaditya, et al.
Publicado: (2022) -
Learning to Generate Long-term Future Narrations Describing Activities of Daily Living
por: Rajendiran, Ramanathan, et al.
Publicado: (2025)