Value-Guided Iterative Refinement and the DIQ-H Benchmark for Evaluating VLM Robustness
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wan, Hanwen, Lin, Zexin, Deng, Yixuan, Ji, Xiaoqiang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VLM-Guided Iterative Refinement for Surgical Image Segmentation with Foundation Models
par: Lou, Ange, et autres
Publié: (2026)
par: Lou, Ange, et autres
Publié: (2026)
VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models
par: Saxena, Rohit, et autres
Publié: (2026)
par: Saxena, Rohit, et autres
Publié: (2026)
VLM-R$^3$: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought
par: Jiang, Chaoya, et autres
Publié: (2025)
par: Jiang, Chaoya, et autres
Publié: (2025)
Beyond the Pixels: VLM-based Evaluation of Identity Preservation in Reference-Guided Synthesis
par: Singhania, Aditi, et autres
Publié: (2025)
par: Singhania, Aditi, et autres
Publié: (2025)
Case-Aware Medical Image Classification with Multimodal Knowledge Graphs and Reliability-Guided Refinement
par: Xu, Yiming, et autres
Publié: (2026)
par: Xu, Yiming, et autres
Publié: (2026)
SeqVLM: Proposal-Guided Multi-View Sequences Reasoning via VLM for Zero-Shot 3D Visual Grounding
par: Lin, Jiawen, et autres
Publié: (2025)
par: Lin, Jiawen, et autres
Publié: (2025)
PhyT2V: LLM-Guided Iterative Self-Refinement for Physics-Grounded Text-to-Video Generation
par: Xue, Qiyao, et autres
Publié: (2024)
par: Xue, Qiyao, et autres
Publié: (2024)
Dynamic VLM-Guided Negative Prompting for Diffusion Models
par: Chang, Hoyeon, et autres
Publié: (2025)
par: Chang, Hoyeon, et autres
Publié: (2025)
Towards Benchmarking and Evaluating Deepfake Detection
par: Lin, Chenhao, et autres
Publié: (2022)
par: Lin, Chenhao, et autres
Publié: (2022)
Trust but Verify: Programmatic VLM Evaluation in the Wild
par: Prabhu, Viraj, et autres
Publié: (2024)
par: Prabhu, Viraj, et autres
Publié: (2024)
AIR: Zero-shot Generative Model Adaptation with Iterative Refinement
par: Liu, Guimeng, et autres
Publié: (2025)
par: Liu, Guimeng, et autres
Publié: (2025)
Seeing is Improving: Visual Feedback for Iterative Text Layout Refinement
par: Guo, Junrong, et autres
Publié: (2026)
par: Guo, Junrong, et autres
Publié: (2026)
IRNet: Iterative Refinement Network for Noisy Partial Label Learning
par: Lian, Zheng, et autres
Publié: (2022)
par: Lian, Zheng, et autres
Publié: (2022)
Improved Iterative Refinement for Chart-to-Code Generation via Structured Instruction
par: Xu, Chengzhi, et autres
Publié: (2025)
par: Xu, Chengzhi, et autres
Publié: (2025)
CLAMP: Contrastive Learning with Adaptive Multi-loss and Progressive Fusion for Multimodal Aspect-Based Sentiment Analysis
par: He, Xiaoqiang
Publié: (2025)
par: He, Xiaoqiang
Publié: (2025)
SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning
par: Ji, Yicheng, et autres
Publié: (2025)
par: Ji, Yicheng, et autres
Publié: (2025)
Culture-TRIP: Culturally-Aware Text-to-Image Generation with Iterative Prompt Refinement
par: Jeong, Suchae, et autres
Publié: (2025)
par: Jeong, Suchae, et autres
Publié: (2025)
Vision-Zero: Scalable VLM Self-Improvement via Strategic Gamified Self-Play
par: Wang, Qinsi, et autres
Publié: (2025)
par: Wang, Qinsi, et autres
Publié: (2025)
TransVLM: A Vision-Language Framework and Benchmark for Detecting Any Shot Transitions
par: Chen, Ce, et autres
Publié: (2026)
par: Chen, Ce, et autres
Publié: (2026)
A Real-to-Sim-to-Real Approach to Robotic Manipulation with VLM-Generated Iterative Keypoint Rewards
par: Patel, Shivansh, et autres
Publié: (2025)
par: Patel, Shivansh, et autres
Publié: (2025)
Unifying VLM-Guided Flow Matching and Spectral Anomaly Detection for Interpretable Veterinary Diagnosis
par: Wang, Pu, et autres
Publié: (2026)
par: Wang, Pu, et autres
Publié: (2026)
\textsc{GUI-Spotlight}: Adaptive Iterative Focus Refinement for Enhanced GUI Visual Grounding
par: Lei, Bin, et autres
Publié: (2025)
par: Lei, Bin, et autres
Publié: (2025)
Zoom In, Reason Out: Efficient Far-field Anomaly Detection in Expressway Surveillance Videos via Focused VLM Reasoning Guided by Bayesian Inference
par: Mao, Xiaowei, et autres
Publié: (2026)
par: Mao, Xiaowei, et autres
Publié: (2026)
CIARD: Cyclic Iterative Adversarial Robustness Distillation
par: Lu, Liming, et autres
Publié: (2025)
par: Lu, Liming, et autres
Publié: (2025)
BabyVLM-V2: Toward Developmentally Grounded Pretraining and Benchmarking of Vision Foundation Models
par: Wang, Shengao, et autres
Publié: (2025)
par: Wang, Shengao, et autres
Publié: (2025)
GTR: Guided Thought Reinforcement Prevents Thought Collapse in RL-based VLM Agent Training
par: Wei, Tong, et autres
Publié: (2025)
par: Wei, Tong, et autres
Publié: (2025)
SimpleDoc: Multi-Modal Document Understanding with Dual-Cue Page Retrieval and Iterative Refinement
par: Jain, Chelsi, et autres
Publié: (2025)
par: Jain, Chelsi, et autres
Publié: (2025)
InfBaGel: Human-Object-Scene Interaction Generation with Dynamic Perception and Iterative Refinement
par: Zou, Yude, et autres
Publié: (2026)
par: Zou, Yude, et autres
Publié: (2026)
VLM-SlideEval: Evaluating VLMs on Structured Comprehension and Perturbation Sensitivity in PPT
par: Kang, Hyeonsu, et autres
Publié: (2025)
par: Kang, Hyeonsu, et autres
Publié: (2025)
Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation
par: Cho, Jaemin, et autres
Publié: (2023)
par: Cho, Jaemin, et autres
Publié: (2023)
ARIW-Framework: Adaptive Robust Iterative Watermarking Framework
par: Wu, Shaowu, et autres
Publié: (2025)
par: Wu, Shaowu, et autres
Publié: (2025)
How to Evaluate and Refine your CAM
par: Domeniconi, Luca, et autres
Publié: (2026)
par: Domeniconi, Luca, et autres
Publié: (2026)
Sim2Radar: Toward Bridging the Radar Sim-to-Real Gap with VLM-Guided Scene Reconstruction
par: Bejerano, Emily, et autres
Publié: (2026)
par: Bejerano, Emily, et autres
Publié: (2026)
VLM4D: Towards Spatiotemporal Awareness in Vision Language Models
par: Zhou, Shijie, et autres
Publié: (2025)
par: Zhou, Shijie, et autres
Publié: (2025)
Sim2Real-AD: A Modular Sim-to-Real Framework for Deploying VLM-Guided Reinforcement Learning in Real-World Autonomous Driving
par: Huang, Zilin, et autres
Publié: (2026)
par: Huang, Zilin, et autres
Publié: (2026)
MagicMan: Generative Novel View Synthesis of Humans with 3D-Aware Diffusion and Iterative Refinement
par: He, Xu, et autres
Publié: (2024)
par: He, Xu, et autres
Publié: (2024)
edgeVLM: Cloud-edge Collaborative Real-time VLM based on Context Transfer
par: Qian, Chen, et autres
Publié: (2025)
par: Qian, Chen, et autres
Publié: (2025)
DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference
par: Singh, Aditya Kumar, et autres
Publié: (2026)
par: Singh, Aditya Kumar, et autres
Publié: (2026)
Perceptual Group Tokenizer: Building Perception with Iterative Grouping
par: Deng, Zhiwei, et autres
Publié: (2023)
par: Deng, Zhiwei, et autres
Publié: (2023)
DesCLIP: Robust Continual Learning via General Attribute Descriptions for VLM-Based Visual Recognition
par: He, Chiyuan, et autres
Publié: (2025)
par: He, Chiyuan, et autres
Publié: (2025)
Documents similaires
-
VLM-Guided Iterative Refinement for Surgical Image Segmentation with Foundation Models
par: Lou, Ange, et autres
Publié: (2026) -
VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models
par: Saxena, Rohit, et autres
Publié: (2026) -
VLM-R$^3$: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought
par: Jiang, Chaoya, et autres
Publié: (2025) -
Beyond the Pixels: VLM-based Evaluation of Identity Preservation in Reference-Guided Synthesis
par: Singhania, Aditi, et autres
Publié: (2025) -
Case-Aware Medical Image Classification with Multimodal Knowledge Graphs and Reliability-Guided Refinement
par: Xu, Yiming, et autres
Publié: (2026)