IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Tao, Hong, Yuyang, Xia, Yang, Ding, Kun, Zhang, Zeyu, Wang, Ying, Xiang, Shiming, Pan, Chunhong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
UNIP: Rethinking Pre-trained Attention Patterns for Infrared Semantic Segmentation
por: Zhang, Tao, et al.
Publicado: (2025)
por: Zhang, Tao, et al.
Publicado: (2025)
Weak Distribution Detectors Lead to Stronger Generalizability of Vision-Language Prompt Tuning
por: Ding, Kun, et al.
Publicado: (2024)
por: Ding, Kun, et al.
Publicado: (2024)
Prompt Tuning with Soft Context Sharing for Vision-Language Models
por: Ding, Kun, et al.
Publicado: (2022)
por: Ding, Kun, et al.
Publicado: (2022)
SeaVIS: Sound-Enhanced Association for Online Audio-Visual Instance Segmentation
por: Zhu, Yingjian, et al.
Publicado: (2026)
por: Zhu, Yingjian, et al.
Publicado: (2026)
Taming Modality Entanglement in Continual Audio-Visual Segmentation
por: Hong, Yuyang, et al.
Publicado: (2025)
por: Hong, Yuyang, et al.
Publicado: (2025)
Diffusion Model as a Noise-Aware Latent Reward Model for Step-Level Preference Optimization
por: Zhang, Tao, et al.
Publicado: (2025)
por: Zhang, Tao, et al.
Publicado: (2025)
Reusable Architecture Growth for Continual Stereo Matching
por: Zhang, Chenghao, et al.
Publicado: (2024)
por: Zhang, Chenghao, et al.
Publicado: (2024)
Continuous Speculative Decoding for Autoregressive Image Generation
por: Wang, Zili, et al.
Publicado: (2024)
por: Wang, Zili, et al.
Publicado: (2024)
EvoVLMA: Evolutionary Vision-Language Model Adaptation
por: Ding, Kun, et al.
Publicado: (2025)
por: Ding, Kun, et al.
Publicado: (2025)
Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and Filtering
por: Hong, Yuyang, et al.
Publicado: (2025)
por: Hong, Yuyang, et al.
Publicado: (2025)
MC-Bench: A Benchmark for Multi-Context Visual Grounding in the Era of MLLMs
por: Xu, Yunqiu, et al.
Publicado: (2024)
por: Xu, Yunqiu, et al.
Publicado: (2024)
CC-VQA: Conflict- and Correlation-Aware Method for Mitigating Knowledge Conflict in Knowledge-Based Visual Question Answering
por: Hong, Yuyang, et al.
Publicado: (2026)
por: Hong, Yuyang, et al.
Publicado: (2026)
VisBrowse-Bench: Benchmarking Visual-Native Search for Multimodal Browsing Agents
por: Zhang, Zhengbo, et al.
Publicado: (2026)
por: Zhang, Zhengbo, et al.
Publicado: (2026)
PhysToolBench: Benchmarking Physical Tool Understanding for MLLMs
por: Zhang, Zixin, et al.
Publicado: (2025)
por: Zhang, Zixin, et al.
Publicado: (2025)
SpatialViz-Bench: A Cognitively-Grounded Benchmark for Diagnosing Spatial Visualization in MLLMs
por: Wang, Siting, et al.
Publicado: (2025)
por: Wang, Siting, et al.
Publicado: (2025)
CameraBench: Benchmarking Visual Reasoning in MLLMs via Photography
por: Fang, I-Sheng, et al.
Publicado: (2025)
por: Fang, I-Sheng, et al.
Publicado: (2025)
VisualQuest: A Benchmark for Abstract Visual Reasoning in MLLMs
por: Xiao, Kelaiti, et al.
Publicado: (2025)
por: Xiao, Kelaiti, et al.
Publicado: (2025)
PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension
por: Ouyang, Kun, et al.
Publicado: (2024)
por: Ouyang, Kun, et al.
Publicado: (2024)
A Survey of Low-shot Vision-Language Model Adaptation via Representer Theorem
por: Ding, Kun, et al.
Publicado: (2024)
por: Ding, Kun, et al.
Publicado: (2024)
EventBench: Towards Comprehensive Benchmarking of Event-based MLLMs
por: Liu, Shaoyu, et al.
Publicado: (2025)
por: Liu, Shaoyu, et al.
Publicado: (2025)
Cube Bench: A Benchmark for Spatial Visual Reasoning in MLLMs
por: Anand, Dhruv, et al.
Publicado: (2025)
por: Anand, Dhruv, et al.
Publicado: (2025)
FullAnno: A Data Engine for Enhancing Image Comprehension of MLLMs
por: Hao, Jing, et al.
Publicado: (2024)
por: Hao, Jing, et al.
Publicado: (2024)
VP-Bench: A Comprehensive Benchmark for Visual Prompting in Multimodal Large Language Models
por: Xu, Mingjie, et al.
Publicado: (2025)
por: Xu, Mingjie, et al.
Publicado: (2025)
MileBench: Benchmarking MLLMs in Long Context
por: Song, Dingjie, et al.
Publicado: (2024)
por: Song, Dingjie, et al.
Publicado: (2024)
HCVP: Leveraging Hierarchical Contrastive Visual Prompt for Domain Generalization
por: Zhou, Guanglin, et al.
Publicado: (2024)
por: Zhou, Guanglin, et al.
Publicado: (2024)
DreamBench++: A Human-Aligned Benchmark for Personalized Image Generation
por: Peng, Yuang, et al.
Publicado: (2024)
por: Peng, Yuang, et al.
Publicado: (2024)
FunBench: Benchmarking Fundus Reading Skills of MLLMs
por: Wei, Qijie, et al.
Publicado: (2025)
por: Wei, Qijie, et al.
Publicado: (2025)
Compositional Kronecker Context Optimization for Vision-Language Models
por: Ding, Kun, et al.
Publicado: (2024)
por: Ding, Kun, et al.
Publicado: (2024)
Artifact-Bench: Evaluating MLLMs on Detecting and Assessing the Artifacts of AI-Generated Videos
por: Tang, Yuqi, et al.
Publicado: (2026)
por: Tang, Yuqi, et al.
Publicado: (2026)
Enhanced Graph Transformer with Serialized Graph Tokens
por: Wang, Ruixiang, et al.
Publicado: (2026)
por: Wang, Ruixiang, et al.
Publicado: (2026)
ViC-Bench: Benchmarking Visual-Interleaved Chain-of-Thought Capability in MLLMs with Free-Style Intermediate State Representations
por: Wu, Xuecheng, et al.
Publicado: (2025)
por: Wu, Xuecheng, et al.
Publicado: (2025)
EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs
por: Dai, Yang, et al.
Publicado: (2026)
por: Dai, Yang, et al.
Publicado: (2026)
Aesthetic Image Captioning with Saliency Enhanced MLLMs
por: Tao, Yilin, et al.
Publicado: (2025)
por: Tao, Yilin, et al.
Publicado: (2025)
Rethinking Comprehensive Benchmark for Chart Understanding: A Perspective from Scientific Literature
por: Shen, Lingdong, et al.
Publicado: (2024)
por: Shen, Lingdong, et al.
Publicado: (2024)
SAM-MI: A Mask-Injected Framework for Enhancing Open-Vocabulary Semantic Segmentation with SAM
por: Chen, Lin, et al.
Publicado: (2025)
por: Chen, Lin, et al.
Publicado: (2025)
Enhance Image-to-Image Generation with LLaVA-generated Prompts
por: Ding, Zhicheng, et al.
Publicado: (2024)
por: Ding, Zhicheng, et al.
Publicado: (2024)
Seek-and-Solve: Benchmarking MLLMs for Visual Clue-Driven Reasoning in Daily Scenarios
por: Li, Xiaomin, et al.
Publicado: (2026)
por: Li, Xiaomin, et al.
Publicado: (2026)
Calibrated Cache Model for Few-Shot Vision-Language Model Adaptation
por: Ding, Kun, et al.
Publicado: (2024)
por: Ding, Kun, et al.
Publicado: (2024)
WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering
por: Zhu, Yingjian, et al.
Publicado: (2026)
por: Zhu, Yingjian, et al.
Publicado: (2026)
Taming a Retrieval Framework to Read Images in Humanlike Manner for Augmenting Generation of MLLMs
por: Xi, Suyang, et al.
Publicado: (2025)
por: Xi, Suyang, et al.
Publicado: (2025)
Ejemplares similares
-
UNIP: Rethinking Pre-trained Attention Patterns for Infrared Semantic Segmentation
por: Zhang, Tao, et al.
Publicado: (2025) -
Weak Distribution Detectors Lead to Stronger Generalizability of Vision-Language Prompt Tuning
por: Ding, Kun, et al.
Publicado: (2024) -
Prompt Tuning with Soft Context Sharing for Vision-Language Models
por: Ding, Kun, et al.
Publicado: (2022) -
SeaVIS: Sound-Enhanced Association for Online Audio-Visual Instance Segmentation
por: Zhu, Yingjian, et al.
Publicado: (2026) -
Taming Modality Entanglement in Continual Audio-Visual Segmentation
por: Hong, Yuyang, et al.
Publicado: (2025)