FCMBench-Video: Benchmarking Document Video Intelligence
Fuente:
arXiv
Salvato in:
| Autori principali: | Cui, Runze, Shang, Fangxin, Yang, Yehui, Yang, Qing, Xu, Yanwu, Chen, Tao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FCMBench: The First Large-scale Financial Credit Multimodal Benchmark for Real-world Applications
di: Yang, Yehui, et al.
Pubblicazione: (2026)
di: Yang, Yehui, et al.
Pubblicazione: (2026)
VMU-Diff: A Coarse-to-fine Multi-source Data Fusion Framework for Precipitation Nowcasting
di: Shi, Chunlei, et al.
Pubblicazione: (2026)
di: Shi, Chunlei, et al.
Pubblicazione: (2026)
BatSort: Enhanced Battery Classification with Transfer Learning for Battery Sorting and Recycling
di: Zhao, Yunyi, et al.
Pubblicazione: (2024)
di: Zhao, Yunyi, et al.
Pubblicazione: (2024)
Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning
di: Liu, Fuxiao, et al.
Pubblicazione: (2023)
di: Liu, Fuxiao, et al.
Pubblicazione: (2023)
Decoding Scientific Experimental Images: The SPUR Benchmark for Perception, Understanding, and Reasoning
di: Ding, Junpeng, et al.
Pubblicazione: (2026)
di: Ding, Junpeng, et al.
Pubblicazione: (2026)
AUTV: Creating Underwater Video Datasets with Pixel-wise Annotations
di: Truong, Quang Trung, et al.
Pubblicazione: (2025)
di: Truong, Quang Trung, et al.
Pubblicazione: (2025)
FinMMDocR: Benchmarking Financial Multimodal Reasoning with Scenario Awareness, Document Understanding, and Multi-Step Computation
di: Tang, Zichen, et al.
Pubblicazione: (2025)
di: Tang, Zichen, et al.
Pubblicazione: (2025)
FinMTM: A Multi-Turn Multimodal Benchmark for Financial Reasoning and Agent Evaluation
di: Zhang, Chenxi, et al.
Pubblicazione: (2026)
di: Zhang, Chenxi, et al.
Pubblicazione: (2026)
MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding
di: Fang, Xinyu, et al.
Pubblicazione: (2024)
di: Fang, Xinyu, et al.
Pubblicazione: (2024)
VC-Bench: Pioneering the Video Connecting Benchmark with a Dataset and Evaluation Metrics
di: Yin, Zhiyu, et al.
Pubblicazione: (2026)
di: Yin, Zhiyu, et al.
Pubblicazione: (2026)
VAGU & GtS: LLM-Based Benchmark and Framework for Joint Video Anomaly Grounding and Understanding
di: Gao, Shibo, et al.
Pubblicazione: (2025)
di: Gao, Shibo, et al.
Pubblicazione: (2025)
Hi3D: Pursuing High-Resolution Image-to-3D Generation with Video Diffusion Models
di: Yang, Haibo, et al.
Pubblicazione: (2024)
di: Yang, Haibo, et al.
Pubblicazione: (2024)
VIoTGPT: Learning to Schedule Vision Tools in LLMs towards Intelligent Video Internet of Things
di: Zhong, Yaoyao, et al.
Pubblicazione: (2023)
di: Zhong, Yaoyao, et al.
Pubblicazione: (2023)
Face Consistency Benchmark for GenAI Video
di: Podstawski, Michal, et al.
Pubblicazione: (2025)
di: Podstawski, Michal, et al.
Pubblicazione: (2025)
TAVGBench: Benchmarking Text to Audible-Video Generation
di: Mao, Yuxin, et al.
Pubblicazione: (2024)
di: Mao, Yuxin, et al.
Pubblicazione: (2024)
Multimodal growth and development assessment model
di: Li, Ying, et al.
Pubblicazione: (2024)
di: Li, Ying, et al.
Pubblicazione: (2024)
MSMF: Multi-Scale Multi-Modal Fusion for Enhanced Stock Market Prediction
di: Qin, Jiahao
Pubblicazione: (2024)
di: Qin, Jiahao
Pubblicazione: (2024)
LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding
di: Han, ZhaoYang, et al.
Pubblicazione: (2025)
di: Han, ZhaoYang, et al.
Pubblicazione: (2025)
neuralCAD-Edit: An Expert Benchmark for Multimodal-Instructed 3D CAD Model Editing
di: Perrett, Toby, et al.
Pubblicazione: (2026)
di: Perrett, Toby, et al.
Pubblicazione: (2026)
PRVR: Partially Relevant Video Retrieval
di: Chen, Xianke, et al.
Pubblicazione: (2022)
di: Chen, Xianke, et al.
Pubblicazione: (2022)
Video Watermarking: Safeguarding Your Video from (Unauthorized) Annotations by Video-based LLMs
di: Li, Jinmin, et al.
Pubblicazione: (2024)
di: Li, Jinmin, et al.
Pubblicazione: (2024)
FinMMR: Make Financial Numerical Reasoning More Multimodal, Comprehensive, and Challenging
di: Tang, Zichen, et al.
Pubblicazione: (2025)
di: Tang, Zichen, et al.
Pubblicazione: (2025)
FinAudio: A Benchmark for Audio Large Language Models in Financial Applications
di: Cao, Yupeng, et al.
Pubblicazione: (2025)
di: Cao, Yupeng, et al.
Pubblicazione: (2025)
CBVS: A Large-Scale Chinese Image-Text Benchmark for Real-World Short Video Search Scenarios
di: Qiao, Xiangshuo, et al.
Pubblicazione: (2024)
di: Qiao, Xiangshuo, et al.
Pubblicazione: (2024)
Looking Backward: Streaming Video-to-Video Translation with Feature Banks
di: Liang, Feng, et al.
Pubblicazione: (2024)
di: Liang, Feng, et al.
Pubblicazione: (2024)
PolySmart @ TRECVid 2024 Video Captioning (VTT)
di: Wu, Jiaxin, et al.
Pubblicazione: (2024)
di: Wu, Jiaxin, et al.
Pubblicazione: (2024)
Hybrid Local-Global Context Learning for Neural Video Compression
di: Zhai, Yongqi, et al.
Pubblicazione: (2024)
di: Zhai, Yongqi, et al.
Pubblicazione: (2024)
GaussianCAD: Robust Self-Supervised CAD Reconstruction from Three Orthographic Views Using 3D Gaussian Splatting
di: Zhou, Zheng, et al.
Pubblicazione: (2025)
di: Zhou, Zheng, et al.
Pubblicazione: (2025)
TRIP: Temporal Residual Learning with Image Noise Prior for Image-to-Video Diffusion Models
di: Zhang, Zhongwei, et al.
Pubblicazione: (2024)
di: Zhang, Zhongwei, et al.
Pubblicazione: (2024)
Video2Roleplay: A Multimodal Dataset and Framework for Video-Guided Role-playing Agents
di: Zhang, Xueqiao, et al.
Pubblicazione: (2025)
di: Zhang, Xueqiao, et al.
Pubblicazione: (2025)
KeyVideoLLM: Towards Large-scale Video Keyframe Selection
di: Liang, Hao, et al.
Pubblicazione: (2024)
di: Liang, Hao, et al.
Pubblicazione: (2024)
PolySmart @ TRECVid 2024 Medical Video Question Answering
di: Wu, Jiaxin, et al.
Pubblicazione: (2024)
di: Wu, Jiaxin, et al.
Pubblicazione: (2024)
Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing
di: Zhao, Pengcheng, et al.
Pubblicazione: (2024)
di: Zhao, Pengcheng, et al.
Pubblicazione: (2024)
When Video Coding Meets Multimodal Large Language Models: A Unified Paradigm for Video Coding
di: Zhang, Pingping, et al.
Pubblicazione: (2024)
di: Zhang, Pingping, et al.
Pubblicazione: (2024)
GLObal Building heights for Urban Studies (UT-GLOBUS) for city- and street- scale urban simulations: Development and first applications
di: Kamath, Harsh G., et al.
Pubblicazione: (2022)
di: Kamath, Harsh G., et al.
Pubblicazione: (2022)
Human Motion Video Generation: A Survey
di: Xue, Haiwei, et al.
Pubblicazione: (2025)
di: Xue, Haiwei, et al.
Pubblicazione: (2025)
MFQE 2.0: A New Approach for Multi-frame Quality Enhancement on Compressed Video
di: Xing, Qunliang, et al.
Pubblicazione: (2019)
di: Xing, Qunliang, et al.
Pubblicazione: (2019)
Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement
di: Gao, Jiayi, et al.
Pubblicazione: (2025)
di: Gao, Jiayi, et al.
Pubblicazione: (2025)
Generative Frame Sampler for Long Video Understanding
di: Yao, Linli, et al.
Pubblicazione: (2025)
di: Yao, Linli, et al.
Pubblicazione: (2025)
Enhancing Partially Relevant Video Retrieval with Robust Alignment Learning
di: Zhang, Long, et al.
Pubblicazione: (2025)
di: Zhang, Long, et al.
Pubblicazione: (2025)
Documenti analoghi
-
FCMBench: The First Large-scale Financial Credit Multimodal Benchmark for Real-world Applications
di: Yang, Yehui, et al.
Pubblicazione: (2026) -
VMU-Diff: A Coarse-to-fine Multi-source Data Fusion Framework for Precipitation Nowcasting
di: Shi, Chunlei, et al.
Pubblicazione: (2026) -
BatSort: Enhanced Battery Classification with Transfer Learning for Battery Sorting and Recycling
di: Zhao, Yunyi, et al.
Pubblicazione: (2024) -
Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning
di: Liu, Fuxiao, et al.
Pubblicazione: (2023) -
Decoding Scientific Experimental Images: The SPUR Benchmark for Perception, Understanding, and Reasoning
di: Ding, Junpeng, et al.
Pubblicazione: (2026)