ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
Fuente:
arXiv
Guardado en:
| Autores principales: | Nie, Yuxiang, Wang, Han, Ye, Yongjie, Yu, Haiyang, Jia, Weitao, Zeng, Tao, Feng, Hao, Fei, Xiang, Li, Yang, Lv, Xiaohui, Tang, Guozhi, Tang, Jingqun, Lu, Jinghui, Dai, Zehui, Wang, Jiacong, Yang, Dingkang, Wang, An-Lan, Huang, Can |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MEML-GRPO: Heterogeneous Multi-Expert Mutual Learning for RLVR Advancement
por: Jia, Weitao, et al.
Publicado: (2025)
por: Jia, Weitao, et al.
Publicado: (2025)
Vision as LoRA
por: Wang, Han, et al.
Publicado: (2025)
por: Wang, Han, et al.
Publicado: (2025)
Dynamic-VLM: Simple Dynamic Visual Token Compression for VideoLLM
por: Wang, Han, et al.
Publicado: (2024)
por: Wang, Han, et al.
Publicado: (2024)
Elysium: Exploring Object-level Perception in Videos via MLLM
por: Wang, Han, et al.
Publicado: (2024)
por: Wang, Han, et al.
Publicado: (2024)
Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning
por: Yu, Haiyang, et al.
Publicado: (2025)
por: Yu, Haiyang, et al.
Publicado: (2025)
LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering
por: Zhang, Hongjie, et al.
Publicado: (2023)
por: Zhang, Hongjie, et al.
Publicado: (2023)
Prolonged Reasoning Is Not All You Need: Certainty-Based Adaptive Routing for Efficient LLM/MLLM Reasoning
por: Lu, Jinghui, et al.
Publicado: (2025)
por: Lu, Jinghui, et al.
Publicado: (2025)
A Bounding Box is Worth One Token: Interleaving Layout and Text in a Large Language Model for Document Understanding
por: Lu, Jinghui, et al.
Publicado: (2024)
por: Lu, Jinghui, et al.
Publicado: (2024)
MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
por: Tang, Jingqun, et al.
Publicado: (2024)
por: Tang, Jingqun, et al.
Publicado: (2024)
MCTBench: Multimodal Cognition towards Text-Rich Visual Scenes Benchmark
por: Shan, Bin, et al.
Publicado: (2024)
por: Shan, Bin, et al.
Publicado: (2024)
ViLA: Efficient Video-Language Alignment for Video Question Answering
por: Wang, Xijun, et al.
Publicado: (2023)
por: Wang, Xijun, et al.
Publicado: (2023)
CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding
por: Chen, Guo, et al.
Publicado: (2024)
por: Chen, Guo, et al.
Publicado: (2024)
TCM-Ladder: A Benchmark for Multimodal Question Answering on Traditional Chinese Medicine
por: Xie, Jiacheng, et al.
Publicado: (2025)
por: Xie, Jiacheng, et al.
Publicado: (2025)
TextPecker: Rewarding Structural Anomaly Quantification for Enhancing Visual Text Rendering
por: Zhu, Hanshen, et al.
Publicado: (2026)
por: Zhu, Hanshen, et al.
Publicado: (2026)
Advancing Sequential Numerical Prediction in Autoregressive Models
por: Fei, Xiang, et al.
Publicado: (2025)
por: Fei, Xiang, et al.
Publicado: (2025)
Knowledge-Augmented Question Error Correction for Chinese Question Answer System with QuestionRAG
por: Qiu, Longpeng, et al.
Publicado: (2025)
por: Qiu, Longpeng, et al.
Publicado: (2025)
Agentic Keyframe Search for Video Question Answering
por: Fan, Sunqi, et al.
Publicado: (2025)
por: Fan, Sunqi, et al.
Publicado: (2025)
An Empirical Study for Representations of Videos in Video Question Answering via MLLMs
por: Li, Zhi, et al.
Publicado: (2025)
por: Li, Zhi, et al.
Publicado: (2025)
ParGo: Bridging Vision-Language with Partial and Global Views
por: Wang, An-Lan, et al.
Publicado: (2024)
por: Wang, An-Lan, et al.
Publicado: (2024)
Enhancing Long Video Question Answering with Scene-Localized Frame Grouping
por: Yang, Xuyi, et al.
Publicado: (2025)
por: Yang, Xuyi, et al.
Publicado: (2025)
Resolving Evidence Sparsity: Agentic Context Engineering for Long-Document Understanding
por: Liu, Keliang, et al.
Publicado: (2025)
por: Liu, Keliang, et al.
Publicado: (2025)
ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigation
por: Xue, Wei, et al.
Publicado: (2026)
por: Xue, Wei, et al.
Publicado: (2026)
VideoDistill: Language-aware Vision Distillation for Video Question Answering
por: Zou, Bo, et al.
Publicado: (2024)
por: Zou, Bo, et al.
Publicado: (2024)
Scene-Text Grounding for Text-Based Video Question Answering
por: Zhou, Sheng, et al.
Publicado: (2024)
por: Zhou, Sheng, et al.
Publicado: (2024)
ChatSOS: Vector Database Augmented Generative Question Answering Assistant in Safety Engineering
por: Tang, Haiyang, et al.
Publicado: (2024)
por: Tang, Haiyang, et al.
Publicado: (2024)
QACP: An Annotated Question Answering Dataset for Assisting Chinese Python Programming Learners
por: Xiao, Rui, et al.
Publicado: (2024)
por: Xiao, Rui, et al.
Publicado: (2024)
EVE: Towards End-to-End Video Subtitle Extraction with Vision-Language Models
por: Yu, Haiyang, et al.
Publicado: (2025)
por: Yu, Haiyang, et al.
Publicado: (2025)
MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering
por: Dang, Jisheng, et al.
Publicado: (2025)
por: Dang, Jisheng, et al.
Publicado: (2025)
VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering
por: Meng, Yiran, et al.
Publicado: (2025)
por: Meng, Yiran, et al.
Publicado: (2025)
CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering
por: Zhang, Mingfang, et al.
Publicado: (2026)
por: Zhang, Mingfang, et al.
Publicado: (2026)
DocVideoQA: Towards Comprehensive Understanding of Document-Centric Videos through Question Answering
por: Wang, Haochen, et al.
Publicado: (2025)
por: Wang, Haochen, et al.
Publicado: (2025)
STAIR: Spatial-Temporal Reasoning with Auditable Intermediate Results for Video Question Answering
por: Wang, Yueqian, et al.
Publicado: (2024)
por: Wang, Yueqian, et al.
Publicado: (2024)
Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan
por: Yao, Jui-Ming, et al.
Publicado: (2025)
por: Yao, Jui-Ming, et al.
Publicado: (2025)
Top-down Activity Representation Learning for Video Question Answering
por: Wang, Yanan, et al.
Publicado: (2024)
por: Wang, Yanan, et al.
Publicado: (2024)
Glance and Focus: Memory Prompting for Multi-Event Video Question Answering
por: Bai, Ziyi, et al.
Publicado: (2024)
por: Bai, Ziyi, et al.
Publicado: (2024)
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
por: Song, Enxin, et al.
Publicado: (2024)
por: Song, Enxin, et al.
Publicado: (2024)
Towards Question Answering over Large Semi-structured Tables
por: Wang, Yuxiang, et al.
Publicado: (2025)
por: Wang, Yuxiang, et al.
Publicado: (2025)
Bridging Vision Language Models and Symbolic Grounding for Video Question Answering
por: Ma, Haodi, et al.
Publicado: (2025)
por: Ma, Haodi, et al.
Publicado: (2025)
CogStream: Context-guided Streaming Video Question Answering
por: Zhao, Zicheng, et al.
Publicado: (2025)
por: Zhao, Zicheng, et al.
Publicado: (2025)
Question-Answering Dense Video Events
por: Qin, Hangyu, et al.
Publicado: (2024)
por: Qin, Hangyu, et al.
Publicado: (2024)
Ejemplares similares
-
MEML-GRPO: Heterogeneous Multi-Expert Mutual Learning for RLVR Advancement
por: Jia, Weitao, et al.
Publicado: (2025) -
Vision as LoRA
por: Wang, Han, et al.
Publicado: (2025) -
Dynamic-VLM: Simple Dynamic Visual Token Compression for VideoLLM
por: Wang, Han, et al.
Publicado: (2024) -
Elysium: Exploring Object-level Perception in Videos via MLLM
por: Wang, Han, et al.
Publicado: (2024) -
Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning
por: Yu, Haiyang, et al.
Publicado: (2025)