Salvato in:
| Autore principale: | Zeng, Yunlin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2601.01062 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VIST-GPT: Ushering in the Era of Visual Storytelling with LLMs?
di: Gado, Mohamed, et al.
Pubblicazione: (2025)
di: Gado, Mohamed, et al.
Pubblicazione: (2025)
ThermEval: A Structured Benchmark for Evaluation of Vision-Language Models on Thermal Imagery
di: Shrivastava, Ayush, et al.
Pubblicazione: (2026)
di: Shrivastava, Ayush, et al.
Pubblicazione: (2026)
SPoT: Subpixel Placement of Tokens in Vision Transformers
di: Hjelkrem-Tan, Martine, et al.
Pubblicazione: (2025)
di: Hjelkrem-Tan, Martine, et al.
Pubblicazione: (2025)
MMErroR: A Benchmark for Erroneous Reasoning in Vision-Language Models
di: Shi, Yang, et al.
Pubblicazione: (2026)
di: Shi, Yang, et al.
Pubblicazione: (2026)
THRONE: An Object-based Hallucination Benchmark for the Free-form Generations of Large Vision-Language Models
di: Kaul, Prannay, et al.
Pubblicazione: (2024)
di: Kaul, Prannay, et al.
Pubblicazione: (2024)
Adapting Vision-Language Models for Evaluating World Models
di: Hendriksen, Mariya, et al.
Pubblicazione: (2025)
di: Hendriksen, Mariya, et al.
Pubblicazione: (2025)
GeoRC: A Benchmark for Geolocation Reasoning Chains
di: Talreja, Mohit, et al.
Pubblicazione: (2026)
di: Talreja, Mohit, et al.
Pubblicazione: (2026)
A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges
di: Li, Zongxia, et al.
Pubblicazione: (2025)
di: Li, Zongxia, et al.
Pubblicazione: (2025)
Generalized Category Discovery under Domain Shifts: From Vision to Vision-Language Models
di: Wang, Hongjun, et al.
Pubblicazione: (2026)
di: Wang, Hongjun, et al.
Pubblicazione: (2026)
Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models
di: Zeng, Yu, et al.
Pubblicazione: (2026)
di: Zeng, Yu, et al.
Pubblicazione: (2026)
PlantVillageVQA: A Visual Question Answering Dataset for Benchmarking Vision-Language Models in Plant Science
di: Sakib, Syed Nazmus, et al.
Pubblicazione: (2025)
di: Sakib, Syed Nazmus, et al.
Pubblicazione: (2025)
DistortBench: Benchmarking Vision Language Models on Image Distortion Identification
di: Goyal, Divyanshu, et al.
Pubblicazione: (2026)
di: Goyal, Divyanshu, et al.
Pubblicazione: (2026)
Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis
di: Nagar, Aishik, et al.
Pubblicazione: (2024)
di: Nagar, Aishik, et al.
Pubblicazione: (2024)
Coordinated Robustness Evaluation Framework for Vision-Language Models
di: Babu, Ashwin Ramesh, et al.
Pubblicazione: (2025)
di: Babu, Ashwin Ramesh, et al.
Pubblicazione: (2025)
A Survey on Efficient Vision-Language-Action Models
di: Yu, Zhaoshu, et al.
Pubblicazione: (2025)
di: Yu, Zhaoshu, et al.
Pubblicazione: (2025)
UniFusion: Vision-Language Model as Unified Encoder in Image Generation
di: Li, Kevin, et al.
Pubblicazione: (2025)
di: Li, Kevin, et al.
Pubblicazione: (2025)
Generalized Out-of-Distribution Detection and Beyond in Vision Language Model Era: A Survey
di: Miyai, Atsuyuki, et al.
Pubblicazione: (2024)
di: Miyai, Atsuyuki, et al.
Pubblicazione: (2024)
Predictive but Not Plannable: RC-aux for Latent World Models
di: Li, Wenyuan, et al.
Pubblicazione: (2026)
di: Li, Wenyuan, et al.
Pubblicazione: (2026)
Evaluating Hallucination in Large Vision-Language Models based on Context-Aware Object Similarities
di: Datta, Shounak, et al.
Pubblicazione: (2025)
di: Datta, Shounak, et al.
Pubblicazione: (2025)
Intriguing Differences Between Zero-Shot and Systematic Evaluations of Vision-Language Transformer Models
di: Salman, Shaeke, et al.
Pubblicazione: (2024)
di: Salman, Shaeke, et al.
Pubblicazione: (2024)
TopoPerception: A Shortcut-Free Evaluation of Global Visual Perception in Large Vision-Language Models
di: Zhou, Wenhao, et al.
Pubblicazione: (2025)
di: Zhou, Wenhao, et al.
Pubblicazione: (2025)
Transferable Model-agnostic Vision-Language Model Adaptation for Efficient Weak-to-Strong Generalization
di: Park, Jihwan, et al.
Pubblicazione: (2025)
di: Park, Jihwan, et al.
Pubblicazione: (2025)
Beyond Generation: Multi-Hop Reasoning for Factual Accuracy in Vision-Language Models
di: Hossain, Shamima
Pubblicazione: (2025)
di: Hossain, Shamima
Pubblicazione: (2025)
Evaluating Large Vision-and-Language Models on Children's Mathematical Olympiads
di: Cherian, Anoop, et al.
Pubblicazione: (2024)
di: Cherian, Anoop, et al.
Pubblicazione: (2024)
FastVLM: Efficient Vision Encoding for Vision Language Models
di: Vasu, Pavan Kumar Anasosalu, et al.
Pubblicazione: (2024)
di: Vasu, Pavan Kumar Anasosalu, et al.
Pubblicazione: (2024)
Toward an Artificial General Teacher: Procedural Geometry Data Generation and Visual Grounding with Vision-Language Models
di: Nguyen-Truong, Hai, et al.
Pubblicazione: (2026)
di: Nguyen-Truong, Hai, et al.
Pubblicazione: (2026)
AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models
di: Mai, Zheda, et al.
Pubblicazione: (2025)
di: Mai, Zheda, et al.
Pubblicazione: (2025)
TRIP-Evaluate: An Open Multimodal Benchmark for Evaluating Large Models in Transportation
di: Gong, Han, et al.
Pubblicazione: (2026)
di: Gong, Han, et al.
Pubblicazione: (2026)
Vision-Based Natural Language Scene Understanding for Autonomous Driving: An Extended Dataset and a New Model for Traffic Scene Description Generation
di: Zadeh, Danial Sadrian, et al.
Pubblicazione: (2026)
di: Zadeh, Danial Sadrian, et al.
Pubblicazione: (2026)
NeuroVLM-Bench: Evaluation of Vision-Enabled Large Language Models for Clinical Reasoning in Neurological Disorders
di: Dineva, Katarina Trojachanec, et al.
Pubblicazione: (2026)
di: Dineva, Katarina Trojachanec, et al.
Pubblicazione: (2026)
Unified Triplet-Level Hallucination Evaluation for Large Vision-Language Models
di: Wu, Junjie, et al.
Pubblicazione: (2024)
di: Wu, Junjie, et al.
Pubblicazione: (2024)
VGBench: Evaluating Large Language Models on Vector Graphics Understanding and Generation
di: Zou, Bocheng, et al.
Pubblicazione: (2024)
di: Zou, Bocheng, et al.
Pubblicazione: (2024)
Automated Generation of Challenging Multiple-Choice Questions for Vision Language Model Evaluation
di: Zhang, Yuhui, et al.
Pubblicazione: (2025)
di: Zhang, Yuhui, et al.
Pubblicazione: (2025)
Just Shift It: Test-Time Prototype Shifting for Zero-Shot Generalization with Vision-Language Models
di: Sui, Elaine, et al.
Pubblicazione: (2024)
di: Sui, Elaine, et al.
Pubblicazione: (2024)
PETAR: Localized Findings Generation with Mask-Aware Vision-Language Modeling for PET Automated Reporting
di: Maqbool, Danyal, et al.
Pubblicazione: (2025)
di: Maqbool, Danyal, et al.
Pubblicazione: (2025)
Test-Time Spectrum-Aware Latent Steering for Zero-Shot Generalization in Vision-Language Models
di: Dafnis, Konstantinos M., et al.
Pubblicazione: (2025)
di: Dafnis, Konstantinos M., et al.
Pubblicazione: (2025)
Prismer: A Vision-Language Model with Multi-Task Experts
di: Liu, Shikun, et al.
Pubblicazione: (2023)
di: Liu, Shikun, et al.
Pubblicazione: (2023)
Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation
di: Havrylov, Volodymyr, et al.
Pubblicazione: (2025)
di: Havrylov, Volodymyr, et al.
Pubblicazione: (2025)
Multi-Modal Adapter for Vision-Language Models
di: Seputis, Dominykas, et al.
Pubblicazione: (2024)
di: Seputis, Dominykas, et al.
Pubblicazione: (2024)
SCO-VIST: Social Interaction Commonsense Knowledge-based Visual Storytelling
di: Wang, Eileen, et al.
Pubblicazione: (2024)
di: Wang, Eileen, et al.
Pubblicazione: (2024)
Documenti analoghi
-
VIST-GPT: Ushering in the Era of Visual Storytelling with LLMs?
di: Gado, Mohamed, et al.
Pubblicazione: (2025) -
ThermEval: A Structured Benchmark for Evaluation of Vision-Language Models on Thermal Imagery
di: Shrivastava, Ayush, et al.
Pubblicazione: (2026) -
SPoT: Subpixel Placement of Tokens in Vision Transformers
di: Hjelkrem-Tan, Martine, et al.
Pubblicazione: (2025) -
MMErroR: A Benchmark for Erroneous Reasoning in Vision-Language Models
di: Shi, Yang, et al.
Pubblicazione: (2026) -
THRONE: An Object-based Hallucination Benchmark for the Free-form Generations of Large Vision-Language Models
di: Kaul, Prannay, et al.
Pubblicazione: (2024)