SAVER: Selective As-Needed Vision Evidence for Multimodal Information Extraction
Fuente:
arXiv
Saved in:
| Main Authors: | Hu, Miaobo, Hu, Shuhao, Wang, Bokun, Chen, Rui, Wang, Xin, Guo, Xiaobo, Zha, Daren, Xiao, Jun |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AGPO: Adaptive Group Policy Optimization with Dual Statistical Feedback
by: Hu, Miaobo, et al.
Published: (2026)
by: Hu, Miaobo, et al.
Published: (2026)
ECPO: Evidence-Coupled Policy Optimization for Evidence-Certified Candidate Ranking
by: Hu, Miaobo, et al.
Published: (2026)
by: Hu, Miaobo, et al.
Published: (2026)
SAVER: Mitigating Hallucinations in Large Vision-Language Models via Style-Aware Visual Early Revision
by: Li, Zhaoxu, et al.
Published: (2025)
by: Li, Zhaoxu, et al.
Published: (2025)
See then Tell: Enhancing Key Information Extraction with Vision Grounding
by: Liu, Shuhang, et al.
Published: (2024)
by: Liu, Shuhang, et al.
Published: (2024)
Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding
by: Wang, Shaoguang, et al.
Published: (2026)
by: Wang, Shaoguang, et al.
Published: (2026)
Challenging Vision-Language Models with Physically Deployable Multimodal Semantic Lighting Attacks
by: Zhao, Yingying, et al.
Published: (2026)
by: Zhao, Yingying, et al.
Published: (2026)
Weierstrass Positional Encoding for Vision Transformers
by: Xin, Zhihang, et al.
Published: (2026)
by: Xin, Zhihang, et al.
Published: (2026)
VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs
by: Zhu, Jiaying, et al.
Published: (2025)
by: Zhu, Jiaying, et al.
Published: (2025)
Attend to Evidence: Evidence-Anchored Spatial Attention Supervision for Multimodal RLVR
by: Hu, Ruina, et al.
Published: (2026)
by: Hu, Ruina, et al.
Published: (2026)
Reliable Object Tracking by Multimodal Hybrid Feature Extraction and Transformer-Based Fusion
by: Sun, Hongze, et al.
Published: (2024)
by: Sun, Hongze, et al.
Published: (2024)
When Do We Not Need Larger Vision Models?
by: Shi, Baifeng, et al.
Published: (2024)
by: Shi, Baifeng, et al.
Published: (2024)
Beyond flattening: a geometrically principled positional encoding for vision transformers with Weierstrass elliptic functions
by: Xin, Zhihang, et al.
Published: (2025)
by: Xin, Zhihang, et al.
Published: (2025)
Is Temporal Prompting All We Need For Limited Labeled Action Recognition?
by: Gowda, Shreyank N, et al.
Published: (2025)
by: Gowda, Shreyank N, et al.
Published: (2025)
EMAD: Evidence-Centric Grounded Multimodal Diagnosis for Alzheimer's Disease
by: Chen, Qiuhui, et al.
Published: (2026)
by: Chen, Qiuhui, et al.
Published: (2026)
RelationVLM: Making Large Vision-Language Models Understand Visual Relations
by: Huang, Zhipeng, et al.
Published: (2024)
by: Huang, Zhipeng, et al.
Published: (2024)
A Reinforcement Learning-Based Automatic Video Editing Method Using Pre-trained Vision-Language Model
by: Hu, Panwen, et al.
Published: (2024)
by: Hu, Panwen, et al.
Published: (2024)
Search is All You Need for Few-shot Anomaly Detection
by: Wang, Qishan, et al.
Published: (2025)
by: Wang, Qishan, et al.
Published: (2025)
Robust Fairness Vision-Language Learning for Medical Image Analysis
by: Bansal, Sparsh, et al.
Published: (2025)
by: Bansal, Sparsh, et al.
Published: (2025)
Large Language Model Aided Birt-Hogg-Dube Syndrome Diagnosis with Multimodal Retrieval-Augmented Generation
by: Li, Haoqing, et al.
Published: (2025)
by: Li, Haoqing, et al.
Published: (2025)
Utility-Oriented Visual Evidence Selection for Multimodal Retrieval-Augmented Generation
by: Luo, Weiqing, et al.
Published: (2026)
by: Luo, Weiqing, et al.
Published: (2026)
Implicit Neural Representation Facilitates Unified Universal Vision Encoding
by: Gwilliam, Matthew, et al.
Published: (2026)
by: Gwilliam, Matthew, et al.
Published: (2026)
MCoT-MVS: Multi-level Vision Selection by Multi-modal Chain-of-Thought Reasoning for Composed Image Retrieval
by: Ge, Xuri, et al.
Published: (2026)
by: Ge, Xuri, et al.
Published: (2026)
Conditional Evidence Reconstruction and Decomposition for Interpretable Multimodal Diagnosis
by: Wan, Shaowen, et al.
Published: (2026)
by: Wan, Shaowen, et al.
Published: (2026)
VisionGPT: Vision-Language Understanding Agent Using Generalized Multimodal Framework
by: Kelly, Chris, et al.
Published: (2024)
by: Kelly, Chris, et al.
Published: (2024)
Illusion-Aware Visual Preprocessing and Anti-Illusion Prompting for Classic Illusion Understanding in Vision-Language Models
by: Zha, Junli, et al.
Published: (2026)
by: Zha, Junli, et al.
Published: (2026)
EagleVision: Object-level Attribute Multimodal LLM for Remote Sensing
by: Jiang, Hongxiang, et al.
Published: (2025)
by: Jiang, Hongxiang, et al.
Published: (2025)
Vision Also You Need: Navigating Out-of-Distribution Detection with Multimodal Large Language Model
by: Xu, Haoran, et al.
Published: (2026)
by: Xu, Haoran, et al.
Published: (2026)
Diffusion Reconstruction-based Data Likelihood Estimation for Core-Set Selection
by: Chen, Mingyang, et al.
Published: (2025)
by: Chen, Mingyang, et al.
Published: (2025)
Layer-Wise Anomaly Detection in Directed Energy Deposition using High-Fidelity Fringe Projection Profilometry
by: Hu, Guanzhong, et al.
Published: (2025)
by: Hu, Guanzhong, et al.
Published: (2025)
On the Global Photometric Alignment for Low-Level Vision
by: Li, Mingjia, et al.
Published: (2026)
by: Li, Mingjia, et al.
Published: (2026)
Selective-Stereo: Adaptive Frequency Information Selection for Stereo Matching
by: Wang, Xianqi, et al.
Published: (2024)
by: Wang, Xianqi, et al.
Published: (2024)
LaVin-DiT: Large Vision Diffusion Transformer
by: Wang, Zhaoqing, et al.
Published: (2024)
by: Wang, Zhaoqing, et al.
Published: (2024)
Efficient Self-supervised Vision Pretraining with Local Masked Reconstruction
by: Chen, Jun, et al.
Published: (2022)
by: Chen, Jun, et al.
Published: (2022)
MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models
by: Hu, Lulu, et al.
Published: (2026)
by: Hu, Lulu, et al.
Published: (2026)
Easy3E: Feed-Forward 3D Asset Editing via Rectified Voxel Flow
by: Hu, Shimin, et al.
Published: (2026)
by: Hu, Shimin, et al.
Published: (2026)
Benchmarking Multimodal Mathematical Reasoning with Explicit Visual Dependency
by: Wang, Zhikai, et al.
Published: (2025)
by: Wang, Zhikai, et al.
Published: (2025)
Evidence-Based Actor-Verifier Reasoning for Echocardiographic Agents
by: Huang, Peng, et al.
Published: (2026)
by: Huang, Peng, et al.
Published: (2026)
REVEAL: Reference-Grounded Reasoning for Multimodal Manipulation Detection
by: Zhou, Jun, et al.
Published: (2026)
by: Zhou, Jun, et al.
Published: (2026)
PFSD: A Multi-Modal Pedestrian-Focus Scene Dataset for Rich Tasks in Semi-Structured Environments
by: Liu, Yueting, et al.
Published: (2025)
by: Liu, Yueting, et al.
Published: (2025)
EVE: Towards End-to-End Video Subtitle Extraction with Vision-Language Models
by: Yu, Haiyang, et al.
Published: (2025)
by: Yu, Haiyang, et al.
Published: (2025)
Similar Items
-
AGPO: Adaptive Group Policy Optimization with Dual Statistical Feedback
by: Hu, Miaobo, et al.
Published: (2026) -
ECPO: Evidence-Coupled Policy Optimization for Evidence-Certified Candidate Ranking
by: Hu, Miaobo, et al.
Published: (2026) -
SAVER: Mitigating Hallucinations in Large Vision-Language Models via Style-Aware Visual Early Revision
by: Li, Zhaoxu, et al.
Published: (2025) -
See then Tell: Enhancing Key Information Extraction with Vision Grounding
by: Liu, Shuhang, et al.
Published: (2024) -
Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding
by: Wang, Shaoguang, et al.
Published: (2026)