iGVLM: Dynamic Instruction-Guided Vision Encoding for Question-Aware Multimodal Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Hanpeng, Li, Yaqian, Wang, Zidan, Zhang, Shuoxi, Bo, Zihao, Takezoe, Rinyoichi, Long, Kaiwen, He, Kun |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ITO: Images and Texts as One via Synergizing Multiple Alignment and Training-Time Fusion
par: Liu, Hanpeng, et autres
Publié: (2026)
par: Liu, Hanpeng, et autres
Publié: (2026)
LearnPruner: Rethinking Attention-based Token Pruning in Vision Language Models
par: Takezoe, Rinyoichi, et autres
Publié: (2026)
par: Takezoe, Rinyoichi, et autres
Publié: (2026)
Separators in Enhancing Autoregressive Pretraining for Vision Mamba
par: Liu, Hanpeng, et autres
Publié: (2026)
par: Liu, Hanpeng, et autres
Publié: (2026)
You Only Need Less Attention at Each Stage in Vision Transformers
par: Zhang, Shuoxi, et autres
Publié: (2024)
par: Zhang, Shuoxi, et autres
Publié: (2024)
SMoES: Soft Modality-Guided Expert Specialization in MoE-VLMs
par: Bo, Zi-Hao, et autres
Publié: (2026)
par: Bo, Zi-Hao, et autres
Publié: (2026)
QMoP: Query Guided Mixture-of-Projector for Efficient Visual Token Compression
par: Li, Zhongyang, et autres
Publié: (2026)
par: Li, Zhongyang, et autres
Publié: (2026)
SATQuest: A Verifier for Logical Reasoning Evaluation and Reinforcement Fine-Tuning of LLMs
par: Zhao, Yanxiao, et autres
Publié: (2025)
par: Zhao, Yanxiao, et autres
Publié: (2025)
Neural Collapse Inspired Knowledge Distillation
par: Zhang, Shuoxi, et autres
Publié: (2024)
par: Zhang, Shuoxi, et autres
Publié: (2024)
Siamese Transformer Networks for Few-shot Image Classification
par: Jiang, Weihao, et autres
Publié: (2024)
par: Jiang, Weihao, et autres
Publié: (2024)
SmoGVLM: A Small, Graph-enhanced Vision-Language Model
par: Mondal, Debjyoti, et autres
Publié: (2026)
par: Mondal, Debjyoti, et autres
Publié: (2026)
Question Aware Vision Transformer for Multimodal Reasoning
par: Ganz, Roy, et autres
Publié: (2024)
par: Ganz, Roy, et autres
Publié: (2024)
Unified Multimodal Understanding via Byte-Pair Visual Encoding
par: Zhang, Wanpeng, et autres
Publié: (2025)
par: Zhang, Wanpeng, et autres
Publié: (2025)
VisionGPT: Vision-Language Understanding Agent Using Generalized Multimodal Framework
par: Kelly, Chris, et autres
Publié: (2024)
par: Kelly, Chris, et autres
Publié: (2024)
iPac: Incorporating Intra-image Patch Context into Graph Neural Networks for Medical Image Classification
par: Zidan, Usama, et autres
Publié: (2025)
par: Zidan, Usama, et autres
Publié: (2025)
A 2D Semantic-Aware Position Encoding for Vision Transformers
par: Chen, Xi, et autres
Publié: (2025)
par: Chen, Xi, et autres
Publié: (2025)
Revisiting Multimodal Positional Encoding in Vision-Language Models
par: Huang, Jie, et autres
Publié: (2025)
par: Huang, Jie, et autres
Publié: (2025)
Instruction-tuned Self-Questioning Framework for Multimodal Reasoning
par: Jang, You-Won, et autres
Publié: (2025)
par: Jang, You-Won, et autres
Publié: (2025)
Multimodal Rationales for Explainable Visual Question Answering
par: Li, Kun, et autres
Publié: (2024)
par: Li, Kun, et autres
Publié: (2024)
VideoAgent2: Enhancing the LLM-Based Agent System for Long-Form Video Understanding by Uncertainty-Aware CoT
par: Zhi, Zhuo, et autres
Publié: (2025)
par: Zhi, Zhuo, et autres
Publié: (2025)
VOILA: Value-of-Information Guided Fidelity Selection for Cost-Aware Multimodal Question Answering
par: Bhope, Rahul Atul, et autres
Publié: (2026)
par: Bhope, Rahul Atul, et autres
Publié: (2026)
Understanding Multimodal Procedural Knowledge by Sequencing Multimodal Instructional Manuals
par: Wu, Te-Lin, et autres
Publié: (2021)
par: Wu, Te-Lin, et autres
Publié: (2021)
ClueTracer: Question-to-Vision Clue Tracing for Training-Free Hallucination Suppression in Multimodal Reasoning
par: Xi, Gongli, et autres
Publié: (2026)
par: Xi, Gongli, et autres
Publié: (2026)
An Investigation on The Position Encoding in Vision-Based Dynamics Prediction
par: Zhu, Jiageng, et autres
Publié: (2024)
par: Zhu, Jiageng, et autres
Publié: (2024)
iMOVE: Instance-Motion-Aware Video Understanding
par: Li, Jiaze, et autres
Publié: (2025)
par: Li, Jiaze, et autres
Publié: (2025)
EaqVLA: Encoding-aligned Quantization for Vision-Language-Action Models
par: Jiang, Feng, et autres
Publié: (2025)
par: Jiang, Feng, et autres
Publié: (2025)
A Survey for Foundation Models in Autonomous Driving
par: Gao, Haoxiang, et autres
Publié: (2024)
par: Gao, Haoxiang, et autres
Publié: (2024)
Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation
par: Wu, Chengyue, et autres
Publié: (2024)
par: Wu, Chengyue, et autres
Publié: (2024)
MetaMorph: Multimodal Understanding and Generation via Instruction Tuning
par: Tong, Shengbang, et autres
Publié: (2024)
par: Tong, Shengbang, et autres
Publié: (2024)
MADTP: Multimodal Alignment-Guided Dynamic Token Pruning for Accelerating Vision-Language Transformer
par: Cao, Jianjian, et autres
Publié: (2024)
par: Cao, Jianjian, et autres
Publié: (2024)
VisionGPT-3D: A Generalized Multimodal Agent for Enhanced 3D Vision Understanding
par: Kelly, Chris, et autres
Publié: (2024)
par: Kelly, Chris, et autres
Publié: (2024)
VLMT: Vision-Language Multimodal Transformer for Multimodal Multi-hop Question Answering
par: Lim, Qi Zhi, et autres
Publié: (2025)
par: Lim, Qi Zhi, et autres
Publié: (2025)
Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos
par: Ding, Bonan, et autres
Publié: (2026)
par: Ding, Bonan, et autres
Publié: (2026)
Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation
par: Xu, Quanxing, et autres
Publié: (2026)
par: Xu, Quanxing, et autres
Publié: (2026)
Learn to Think: Improving Multimodal Reasoning through Vision-Aware Self-Improvement Training
par: Zhong, Qihuang, et autres
Publié: (2026)
par: Zhong, Qihuang, et autres
Publié: (2026)
TUBench: Benchmarking Large Vision-Language Models on Trustworthiness with Unanswerable Questions
par: He, Xingwei, et autres
Publié: (2024)
par: He, Xingwei, et autres
Publié: (2024)
SRVAU-R1: Enhancing Video Anomaly Understanding via Reflection-Aware Learning
par: Zhao, Zihao, et autres
Publié: (2026)
par: Zhao, Zihao, et autres
Publié: (2026)
UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding
par: Jiao, Yang, et autres
Publié: (2025)
par: Jiao, Yang, et autres
Publié: (2025)
Towards Open Environments and Instructions: General Vision-Language Navigation via Fast-Slow Interactive Reasoning
par: Li, Yang, et autres
Publié: (2026)
par: Li, Yang, et autres
Publié: (2026)
SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models
par: Chen, Pingyi, et autres
Publié: (2025)
par: Chen, Pingyi, et autres
Publié: (2025)
CaMML: Context-Aware Multimodal Learner for Large Models
par: Chen, Yixin, et autres
Publié: (2024)
par: Chen, Yixin, et autres
Publié: (2024)
Documents similaires
-
ITO: Images and Texts as One via Synergizing Multiple Alignment and Training-Time Fusion
par: Liu, Hanpeng, et autres
Publié: (2026) -
LearnPruner: Rethinking Attention-based Token Pruning in Vision Language Models
par: Takezoe, Rinyoichi, et autres
Publié: (2026) -
Separators in Enhancing Autoregressive Pretraining for Vision Mamba
par: Liu, Hanpeng, et autres
Publié: (2026) -
You Only Need Less Attention at Each Stage in Vision Transformers
par: Zhang, Shuoxi, et autres
Publié: (2024) -
SMoES: Soft Modality-Guided Expert Specialization in MoE-VLMs
par: Bo, Zi-Hao, et autres
Publié: (2026)