Salvato in:
| Autori principali: | Jiang, Zhuohang, Yuan, Xu, Qu, Haohao, Lin, Shanru, Liu, Kanglong, Fan, Wenqi, Li, Qing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2602.22683 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
QA-Dragon: Query-Aware Dynamic RAG System for Knowledge-Intensive Visual Question Answering
di: Jiang, Zhuohang, et al.
Pubblicazione: (2025)
di: Jiang, Zhuohang, et al.
Pubblicazione: (2025)
Enhancing Interpretability for Vision Models via Shapley Value Optimization
di: Fan, Kanglong, et al.
Pubblicazione: (2025)
di: Fan, Kanglong, et al.
Pubblicazione: (2025)
Scanpath Prediction in Panoramic Videos via Expected Code Length Minimization
di: Li, Mu, et al.
Pubblicazione: (2023)
di: Li, Mu, et al.
Pubblicazione: (2023)
Self-Evolving Vision-Language Models for Image Quality Assessment via Voting and Ranking
di: Wen, Wen, et al.
Pubblicazione: (2025)
di: Wen, Wen, et al.
Pubblicazione: (2025)
IML-ViT: Benchmarking Image Manipulation Localization by Vision Transformer
di: Ma, Xiaochen, et al.
Pubblicazione: (2023)
di: Ma, Xiaochen, et al.
Pubblicazione: (2023)
DDFAV: Remote Sensing Large Vision Language Models Dataset and Evaluation Benchmark
di: Li, Haodong, et al.
Pubblicazione: (2024)
di: Li, Haodong, et al.
Pubblicazione: (2024)
A Survey of WebAgents: Towards Next-Generation AI Agents for Web Automation with Large Foundation Models
di: Ning, Liangbo, et al.
Pubblicazione: (2025)
di: Ning, Liangbo, et al.
Pubblicazione: (2025)
Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model
di: Huang, Yifei, et al.
Pubblicazione: (2024)
di: Huang, Yifei, et al.
Pubblicazione: (2024)
FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models
di: Zheng, Weiying, et al.
Pubblicazione: (2025)
di: Zheng, Weiying, et al.
Pubblicazione: (2025)
SmartWay: Enhanced Waypoint Prediction and Backtracking for Zero-Shot Vision-and-Language Navigation
di: Shi, Xiangyu, et al.
Pubblicazione: (2025)
di: Shi, Xiangyu, et al.
Pubblicazione: (2025)
From Macro to Micro: Benchmarking Microscopic Spatial Intelligence on Molecules via Vision-Language Models
di: Li, Zongzhao, et al.
Pubblicazione: (2025)
di: Li, Zongzhao, et al.
Pubblicazione: (2025)
mKG-RAG: Leveraging Multimodal Knowledge Graphs in Retrieval-Augmented Generation for Knowledge-intensive VQA
di: Yuan, Xu, et al.
Pubblicazione: (2025)
di: Yuan, Xu, et al.
Pubblicazione: (2025)
Forensics-Bench: A Comprehensive Forgery Detection Benchmark Suite for Large Vision Language Models
di: Wang, Jin, et al.
Pubblicazione: (2025)
di: Wang, Jin, et al.
Pubblicazione: (2025)
MoAI: Mixture of All Intelligence for Large Language and Vision Models
di: Lee, Byung-Kwan, et al.
Pubblicazione: (2024)
di: Lee, Byung-Kwan, et al.
Pubblicazione: (2024)
RoiMAM: Region-of-Interest Medical Attention Model for Efficient Vision-Language Understanding
di: Yang, Jiayan, et al.
Pubblicazione: (2026)
di: Yang, Jiayan, et al.
Pubblicazione: (2026)
Learned Scanpaths Aid Blind Panoramic Video Quality Assessment
di: Fan, Kanglong, et al.
Pubblicazione: (2024)
di: Fan, Kanglong, et al.
Pubblicazione: (2024)
VLRMBench: A Comprehensive and Challenging Benchmark for Vision-Language Reward Models
di: Ruan, Jiacheng, et al.
Pubblicazione: (2025)
di: Ruan, Jiacheng, et al.
Pubblicazione: (2025)
VisionClaw: Always-On AI Agents through Smart Glasses
di: Liu, Xiaoan, et al.
Pubblicazione: (2026)
di: Liu, Xiaoan, et al.
Pubblicazione: (2026)
An Egocentric Vision-Language Model based Portable Real-time Smart Assistant
di: Huang, Yifei, et al.
Pubblicazione: (2025)
di: Huang, Yifei, et al.
Pubblicazione: (2025)
ArchSIBench: Benchmarking the Architectural Spatial Intelligence of Vision-Language Models
di: Shen, Qirui, et al.
Pubblicazione: (2026)
di: Shen, Qirui, et al.
Pubblicazione: (2026)
AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering
di: Chen, Xiuyuan, et al.
Pubblicazione: (2023)
di: Chen, Xiuyuan, et al.
Pubblicazione: (2023)
MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI
di: Ying, Kaining, et al.
Pubblicazione: (2024)
di: Ying, Kaining, et al.
Pubblicazione: (2024)
Benchmarking and Mitigating Sycophancy in Medical Vision Language Models
di: Xu, Juangui, et al.
Pubblicazione: (2025)
di: Xu, Juangui, et al.
Pubblicazione: (2025)
A Benchmark and Evaluation for Real-World Out-of-Distribution Detection Using Vision-Language Models
di: Noda, Shiho, et al.
Pubblicazione: (2025)
di: Noda, Shiho, et al.
Pubblicazione: (2025)
Imaging for All-Day Wearable Smart Glasses
di: Goesele, Michael, et al.
Pubblicazione: (2025)
di: Goesele, Michael, et al.
Pubblicazione: (2025)
SmartHome-Bench: A Comprehensive Benchmark for Video Anomaly Detection in Smart Homes Using Multi-Modal Large Language Models
di: Zhao, Xinyi, et al.
Pubblicazione: (2025)
di: Zhao, Xinyi, et al.
Pubblicazione: (2025)
Attention Debiasing for Token Pruning in Vision Language Models
di: Zhao, Kai, et al.
Pubblicazione: (2025)
di: Zhao, Kai, et al.
Pubblicazione: (2025)
SurgXBench: Explainable Vision-Language Model Benchmark for Surgery
di: Cheng, Jiajun, et al.
Pubblicazione: (2025)
di: Cheng, Jiajun, et al.
Pubblicazione: (2025)
The Illusion of Clinical Reasoning: A Benchmark Reveals the Pervasive Gap in Vision-Language Models for Clinical Competency
di: Wang, Dingyu, et al.
Pubblicazione: (2025)
di: Wang, Dingyu, et al.
Pubblicazione: (2025)
LLMGeo: Benchmarking Large Language Models on Image Geolocation In-the-wild
di: Wang, Zhiqiang, et al.
Pubblicazione: (2024)
di: Wang, Zhiqiang, et al.
Pubblicazione: (2024)
@Bench: Benchmarking Vision-Language Models for Human-centered Assistive Technology
di: Jiang, Xin, et al.
Pubblicazione: (2024)
di: Jiang, Xin, et al.
Pubblicazione: (2024)
TUBench: Benchmarking Large Vision-Language Models on Trustworthiness with Unanswerable Questions
di: He, Xingwei, et al.
Pubblicazione: (2024)
di: He, Xingwei, et al.
Pubblicazione: (2024)
Embodied3DBench: Benchmarking Low-Level Embodied Spatial Intelligence of Vision Language Models
di: Zhang, Jiyao, et al.
Pubblicazione: (2026)
di: Zhang, Jiyao, et al.
Pubblicazione: (2026)
BackdoorVLM: A Benchmark for Backdoor Attacks on Vision-Language Models
di: Li, Juncheng, et al.
Pubblicazione: (2025)
di: Li, Juncheng, et al.
Pubblicazione: (2025)
Towards Statistical Factuality Guarantee for Large Vision-Language Models
di: Li, Zhuohang, et al.
Pubblicazione: (2025)
di: Li, Zhuohang, et al.
Pubblicazione: (2025)
From Diagnosis to Improvement: Probing Spatio-Physical Reasoning in Vision Language Models
di: Han, Tiancheng, et al.
Pubblicazione: (2025)
di: Han, Tiancheng, et al.
Pubblicazione: (2025)
Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models
di: Ling, Yiran, et al.
Pubblicazione: (2026)
di: Ling, Yiran, et al.
Pubblicazione: (2026)
FinChart-Bench: Benchmarking Financial Chart Comprehension in Vision-Language Models
di: Shu, Dong, et al.
Pubblicazione: (2025)
di: Shu, Dong, et al.
Pubblicazione: (2025)
EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models
di: Shan, Haozhe, et al.
Pubblicazione: (2026)
di: Shan, Haozhe, et al.
Pubblicazione: (2026)
Dynamic Rank Adaptation for Vision-Language Models
di: Wang, Jiahui, et al.
Pubblicazione: (2025)
di: Wang, Jiahui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
QA-Dragon: Query-Aware Dynamic RAG System for Knowledge-Intensive Visual Question Answering
di: Jiang, Zhuohang, et al.
Pubblicazione: (2025) -
Enhancing Interpretability for Vision Models via Shapley Value Optimization
di: Fan, Kanglong, et al.
Pubblicazione: (2025) -
Scanpath Prediction in Panoramic Videos via Expected Code Length Minimization
di: Li, Mu, et al.
Pubblicazione: (2023) -
Self-Evolving Vision-Language Models for Image Quality Assessment via Voting and Ranking
di: Wen, Wen, et al.
Pubblicazione: (2025) -
IML-ViT: Benchmarking Image Manipulation Localization by Vision Transformer
di: Ma, Xiaochen, et al.
Pubblicazione: (2023)