ConvBench: A Multi-Turn Conversation Evaluation Benchmark with Hierarchical Capability for Large Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Shuo, Ying, Kaining, Zhang, Hao, Yang, Yue, Lin, Yuqi, Zhang, Tianle, Li, Chuanhao, Qiao, Yu, Luo, Ping, Shao, Wenqi, Zhang, Kaipeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TCC-Bench: Benchmarking the Traditional Chinese Culture Understanding Capabilities of MLLMs
di: Xu, Pengju, et al.
Pubblicazione: (2025)
di: Xu, Pengju, et al.
Pubblicazione: (2025)
Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark
di: Zhang, Han, et al.
Pubblicazione: (2025)
di: Zhang, Han, et al.
Pubblicazione: (2025)
Dental-TriageBench: Benchmarking Multimodal Reasoning for Hierarchical Dental Triage
di: He, Ziyi, et al.
Pubblicazione: (2026)
di: He, Ziyi, et al.
Pubblicazione: (2026)
EEmo-Bench: A Benchmark for Multi-modal Large Language Models on Image Evoked Emotion Assessment
di: Gao, Lancheng, et al.
Pubblicazione: (2025)
di: Gao, Lancheng, et al.
Pubblicazione: (2025)
PaveBench: A Versatile Benchmark for Pavement Distress Perception and Interactive Vision-Language Analysis
di: Li, Dexiang, et al.
Pubblicazione: (2026)
di: Li, Dexiang, et al.
Pubblicazione: (2026)
Towards Multimodal Emotional Support Conversation Systems
di: Chu, Yuqi, et al.
Pubblicazione: (2024)
di: Chu, Yuqi, et al.
Pubblicazione: (2024)
To Align or Not to Align: Strategic Multimodal Representation Alignment for Optimal Performance
di: Fang, Wanlong, et al.
Pubblicazione: (2025)
di: Fang, Wanlong, et al.
Pubblicazione: (2025)
Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision
di: Wu, Haoning, et al.
Pubblicazione: (2023)
di: Wu, Haoning, et al.
Pubblicazione: (2023)
ConvBench: A Comprehensive Benchmark for 2D Convolution Primitive Evaluation
di: Alvarenga, Lucas, et al.
Pubblicazione: (2024)
di: Alvarenga, Lucas, et al.
Pubblicazione: (2024)
Improving Multi-modal Large Language Model through Boosting Vision Capabilities
di: Sun, Yanpeng, et al.
Pubblicazione: (2024)
di: Sun, Yanpeng, et al.
Pubblicazione: (2024)
SpeechEE: A Novel Benchmark for Speech Event Extraction
di: Wang, Bin, et al.
Pubblicazione: (2024)
di: Wang, Bin, et al.
Pubblicazione: (2024)
SpikEmo: Enhancing Emotion Recognition With Spiking Temporal Dynamics in Conversations
di: Yu, Xiaomin, et al.
Pubblicazione: (2024)
di: Yu, Xiaomin, et al.
Pubblicazione: (2024)
Learning Switchable Priors for Neural Image Compression
di: Zhang, Haotian, et al.
Pubblicazione: (2025)
di: Zhang, Haotian, et al.
Pubblicazione: (2025)
HAFM: Hierarchical Autoregressive Foundation Model for Music Accompaniment Generation
di: Zhu, Jian, et al.
Pubblicazione: (2026)
di: Zhu, Jian, et al.
Pubblicazione: (2026)
Hierarchical Refinement of Universal Multimodal Attacks on Vision-Language Models
di: Zhang, Peng-Fei, et al.
Pubblicazione: (2026)
di: Zhang, Peng-Fei, et al.
Pubblicazione: (2026)
ChartAdapter: Large Vision-Language Model for Chart Summarization
di: Xu, Peixin, et al.
Pubblicazione: (2024)
di: Xu, Peixin, et al.
Pubblicazione: (2024)
Selective Vision-Language Subspace Projection for Few-shot CLIP
di: Zhu, Xingyu, et al.
Pubblicazione: (2024)
di: Zhu, Xingyu, et al.
Pubblicazione: (2024)
Audio-Visual Separation with Hierarchical Fusion and Representation Alignment
di: Hu, Han, et al.
Pubblicazione: (2025)
di: Hu, Han, et al.
Pubblicazione: (2025)
MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation
di: Zhou, Yang-Hao, et al.
Pubblicazione: (2026)
di: Zhou, Yang-Hao, et al.
Pubblicazione: (2026)
LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding
di: Han, ZhaoYang, et al.
Pubblicazione: (2025)
di: Han, ZhaoYang, et al.
Pubblicazione: (2025)
RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenarios
di: Zhao, Fei, et al.
Pubblicazione: (2025)
di: Zhao, Fei, et al.
Pubblicazione: (2025)
MusiCRS: Benchmarking Audio-Centric Conversational Recommendation
di: Surana, Rohan, et al.
Pubblicazione: (2025)
di: Surana, Rohan, et al.
Pubblicazione: (2025)
Learned Image Compression with Hierarchical Progressive Context Modeling
di: Li, Yuqi, et al.
Pubblicazione: (2025)
di: Li, Yuqi, et al.
Pubblicazione: (2025)
Multimodal Fusion via Hypergraph Autoencoder and Contrastive Learning for Emotion Recognition in Conversation
di: Yi, Zijian, et al.
Pubblicazione: (2024)
di: Yi, Zijian, et al.
Pubblicazione: (2024)
FLARE: Full-Modality Long-Video Audiovisual Retrieval Benchmark with User-Simulated Queries
di: You, Qijie, et al.
Pubblicazione: (2026)
di: You, Qijie, et al.
Pubblicazione: (2026)
Identity-Aware Vision-Language Model for Explainable Face Forgery Detection
di: Xu, Junhao, et al.
Pubblicazione: (2025)
di: Xu, Junhao, et al.
Pubblicazione: (2025)
Vision-and-Language Navigation with Analogical Textual Descriptions in LLMs
di: Zhang, Yue, et al.
Pubblicazione: (2025)
di: Zhang, Yue, et al.
Pubblicazione: (2025)
GaussianForest: Hierarchical-Hybrid 3D Gaussian Splatting for Compressed Scene Modeling
di: Zhang, Fengyi, et al.
Pubblicazione: (2024)
di: Zhang, Fengyi, et al.
Pubblicazione: (2024)
Probing Commonsense Reasoning Capability of Text-to-Image Generative Models via Non-visual Description
di: Pan, Mianzhi, et al.
Pubblicazione: (2023)
di: Pan, Mianzhi, et al.
Pubblicazione: (2023)
VC-Bench: Pioneering the Video Connecting Benchmark with a Dataset and Evaluation Metrics
di: Yin, Zhiyu, et al.
Pubblicazione: (2026)
di: Yin, Zhiyu, et al.
Pubblicazione: (2026)
Evolutionary Multimodal Reasoning via Hierarchical Semantic Representation for Intent Recognition
di: Zhou, Qianrui, et al.
Pubblicazione: (2026)
di: Zhou, Qianrui, et al.
Pubblicazione: (2026)
Muse: A Multimodal Conversational Recommendation Dataset with Scenario-Grounded User Profiles
di: Wang, Zihan, et al.
Pubblicazione: (2024)
di: Wang, Zihan, et al.
Pubblicazione: (2024)
HyperFusion: Hierarchical Multimodal Ensemble Learning for Social Media Popularity Prediction
di: Ye, Liliang, et al.
Pubblicazione: (2025)
di: Ye, Liliang, et al.
Pubblicazione: (2025)
AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues
di: Zhou, Dingkun, et al.
Pubblicazione: (2025)
di: Zhou, Dingkun, et al.
Pubblicazione: (2025)
State-Anchored Complete-View Distillation for Robust Conversational Multimodal Emotion Recognition
di: Pan, Zhaoyan, et al.
Pubblicazione: (2026)
di: Pan, Zhaoyan, et al.
Pubblicazione: (2026)
A New Dataset and Benchmark for Grounding Multimodal Misinformation
di: Yang, Bingjian, et al.
Pubblicazione: (2025)
di: Yang, Bingjian, et al.
Pubblicazione: (2025)
FinCall-Surprise: A Large Scale Multi-modal Benchmark for Earning Surprise Prediction
di: Shu, Dong, et al.
Pubblicazione: (2025)
di: Shu, Dong, et al.
Pubblicazione: (2025)
MIntRec2.0: A Large-scale Benchmark Dataset for Multimodal Intent Recognition and Out-of-scope Detection in Conversations
di: Zhang, Hanlei, et al.
Pubblicazione: (2024)
di: Zhang, Hanlei, et al.
Pubblicazione: (2024)
Beyond Isolated Utterances: Cue-Guided Interaction for Context-Dependent Conversational Multimodal Understanding
di: Pan, Zhaoyan, et al.
Pubblicazione: (2026)
di: Pan, Zhaoyan, et al.
Pubblicazione: (2026)
HADUA: Hierarchical Attention and Dynamic Uniform Alignment for Robust Cross-Subject Emotion Recognition
di: Tang, Jiahao, et al.
Pubblicazione: (2026)
di: Tang, Jiahao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
TCC-Bench: Benchmarking the Traditional Chinese Culture Understanding Capabilities of MLLMs
di: Xu, Pengju, et al.
Pubblicazione: (2025) -
Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark
di: Zhang, Han, et al.
Pubblicazione: (2025) -
Dental-TriageBench: Benchmarking Multimodal Reasoning for Hierarchical Dental Triage
di: He, Ziyi, et al.
Pubblicazione: (2026) -
EEmo-Bench: A Benchmark for Multi-modal Large Language Models on Image Evoked Emotion Assessment
di: Gao, Lancheng, et al.
Pubblicazione: (2025) -
PaveBench: A Versatile Benchmark for Pavement Distress Perception and Interactive Vision-Language Analysis
di: Li, Dexiang, et al.
Pubblicazione: (2026)