LVOmniBench: Pioneering Long Audio-Video Understanding Evaluation for Omnimodal LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Tao, Keda, Zheng, Yuhua, Xu, Jia, Du, Wenjie, Shao, Kele, Wang, Hesong, Chen, Xueyi, Jin, Xin, Zhu, Junhan, Yu, Bohan, Wang, Weiqiang, Liu, Jian, Qin, Can, Zhang, Yulun, Yang, Ming-Hsuan, Wang, Huan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Active Perception Agent for Omnimodal Audio-Video Understanding
di: Tao, Keda, et al.
Pubblicazione: (2025)
di: Tao, Keda, et al.
Pubblicazione: (2025)
OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models
di: Tao, Keda, et al.
Pubblicazione: (2025)
di: Tao, Keda, et al.
Pubblicazione: (2025)
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
di: Chen, Xueyi, et al.
Pubblicazione: (2025)
di: Chen, Xueyi, et al.
Pubblicazione: (2025)
HoliTom: Holistic Token Merging for Fast Video Large Language Models
di: Shao, Kele, et al.
Pubblicazione: (2025)
di: Shao, Kele, et al.
Pubblicazione: (2025)
OBS-Diff: Accurate Pruning For Diffusion Models in One-Shot
di: Zhu, Junhan, et al.
Pubblicazione: (2025)
di: Zhu, Junhan, et al.
Pubblicazione: (2025)
LiViBench: An Omnimodal Benchmark for Interactive Livestream Video Understanding
di: Wang, Xiaodong, et al.
Pubblicazione: (2026)
di: Wang, Xiaodong, et al.
Pubblicazione: (2026)
A Survey of Token Compression for Efficient Multimodal Large Language Models
di: Shao, Kele, et al.
Pubblicazione: (2025)
di: Shao, Kele, et al.
Pubblicazione: (2025)
Plug-and-Play 1.x-Bit KV Cache Quantization for Video Large Language Models
di: Tao, Keda, et al.
Pubblicazione: (2025)
di: Tao, Keda, et al.
Pubblicazione: (2025)
DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models
di: Tao, Keda, et al.
Pubblicazione: (2024)
di: Tao, Keda, et al.
Pubblicazione: (2024)
StreamingAssistant: Efficient Visual Token Pruning for Accelerating Online Video Understanding
di: Jin, Xinqi, et al.
Pubblicazione: (2025)
di: Jin, Xinqi, et al.
Pubblicazione: (2025)
QVGGT: Post-Training Quantized Visual Geometry Grounded Transformer
di: Pan, Zhizhen, et al.
Pubblicazione: (2026)
di: Pan, Zhizhen, et al.
Pubblicazione: (2026)
MobileKernelBench: Can LLMs Write Efficient Kernels for Mobile Devices?
di: Zou, Xingze, et al.
Pubblicazione: (2026)
di: Zou, Xingze, et al.
Pubblicazione: (2026)
Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning
di: Zhang, Zhicheng, et al.
Pubblicazione: (2026)
di: Zhang, Zhicheng, et al.
Pubblicazione: (2026)
Which Heads Matter for Reasoning? RL-Guided KV Cache Compression
di: Du, Wenjie, et al.
Pubblicazione: (2025)
di: Du, Wenjie, et al.
Pubblicazione: (2025)
Investigating and Enhancing Vision-Audio Capability in Omnimodal Large Language Models
di: Hu, Rui, et al.
Pubblicazione: (2025)
di: Hu, Rui, et al.
Pubblicazione: (2025)
WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs
di: Hong, Jack, et al.
Pubblicazione: (2025)
di: Hong, Jack, et al.
Pubblicazione: (2025)
Is Oracle Pruning the True Oracle?
di: Feng, Sicheng, et al.
Pubblicazione: (2024)
di: Feng, Sicheng, et al.
Pubblicazione: (2024)
AudioMarathon: A Comprehensive Benchmark for Long-Context Audio Understanding and Efficiency in Audio LLMs
di: He, Peize, et al.
Pubblicazione: (2025)
di: He, Peize, et al.
Pubblicazione: (2025)
Overcoming False Illusions in Real-World Face Restoration with Multi-Modal Guided Diffusion Model
di: Tao, Keda, et al.
Pubblicazione: (2024)
di: Tao, Keda, et al.
Pubblicazione: (2024)
SafeToolBench: Pioneering a Prospective Benchmark to Evaluating Tool Utilization Safety in LLMs
di: Xia, Hongfei, et al.
Pubblicazione: (2025)
di: Xia, Hongfei, et al.
Pubblicazione: (2025)
EarlyTom: Early Token Compression Completes Fast Video Understanding
di: Wang, Hesong, et al.
Pubblicazione: (2026)
di: Wang, Hesong, et al.
Pubblicazione: (2026)
Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation
di: Ying, Kaining, et al.
Pubblicazione: (2025)
di: Ying, Kaining, et al.
Pubblicazione: (2025)
AudioMotionBench: Evaluating Auditory Motion Perception in Audio LLMs
di: Sun, Zhe, et al.
Pubblicazione: (2025)
di: Sun, Zhe, et al.
Pubblicazione: (2025)
VirtueBench: Evaluating Trustworthiness under Uncertainty in Long Video Understanding
di: Yu, Xueqing, et al.
Pubblicazione: (2026)
di: Yu, Xueqing, et al.
Pubblicazione: (2026)
Revisiting MLLM Token Technology through the Lens of Classical Visual Coding
di: Liu, Jinming, et al.
Pubblicazione: (2025)
di: Liu, Jinming, et al.
Pubblicazione: (2025)
OmniRAG-Agent: Agentic Omnimodal Reasoning for Low-Resource Long Audio-Video Question Answering
di: Zhu, Yifan, et al.
Pubblicazione: (2026)
di: Zhu, Yifan, et al.
Pubblicazione: (2026)
AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information?
di: Gong, Kaixiong, et al.
Pubblicazione: (2024)
di: Gong, Kaixiong, et al.
Pubblicazione: (2024)
MM-SpuBench: Towards Better Understanding of Spurious Biases in Multimodal LLMs
di: Ye, Wenqian, et al.
Pubblicazione: (2024)
di: Ye, Wenqian, et al.
Pubblicazione: (2024)
Poison as Cure: Visual Noise for Mitigating Object Hallucinations in LVMs
di: Zhang, Kejia, et al.
Pubblicazione: (2025)
di: Zhang, Kejia, et al.
Pubblicazione: (2025)
Cross-Resolution Diffusion Models via Network Pruning
di: Ren, Jiaxuan, et al.
Pubblicazione: (2026)
di: Ren, Jiaxuan, et al.
Pubblicazione: (2026)
Listening with Time: Precise Temporal Awareness for Long-Form Audio Understanding
di: Shao, Mingchen, et al.
Pubblicazione: (2026)
di: Shao, Mingchen, et al.
Pubblicazione: (2026)
DASH: Dynamic Audio-Driven Semantic Chunking for Efficient Omnimodal Token Compression
di: Li, Bingzhou, et al.
Pubblicazione: (2026)
di: Li, Bingzhou, et al.
Pubblicazione: (2026)
AIPsychoBench: Understanding the Psychometric Differences between LLMs and Humans
di: Xie, Wei, et al.
Pubblicazione: (2025)
di: Xie, Wei, et al.
Pubblicazione: (2025)
EgoSocial: Benchmarking Proactive Intervention Ability of Omnimodal LLMs via Egocentric Social Interaction Perception
di: Wang, Xijun, et al.
Pubblicazione: (2025)
di: Wang, Xijun, et al.
Pubblicazione: (2025)
Senses Wide Shut: A Representation-Action Gap in Omnimodal LLMs
di: Quang, Trung Nguyen, et al.
Pubblicazione: (2026)
di: Quang, Trung Nguyen, et al.
Pubblicazione: (2026)
ATR‐FTIR Spectroscopy and Deep Learning for Chemometric Analysis and Geographical Classification of Red Wines
di: Shengwei Wang, et al.
Pubblicazione: (2026)
di: Shengwei Wang, et al.
Pubblicazione: (2026)
AMA-LSTM: Pioneering Robust and Fair Financial Audio Analysis for Stock Volatility Prediction
di: Wang, Shengkun, et al.
Pubblicazione: (2024)
di: Wang, Shengkun, et al.
Pubblicazione: (2024)
MedMT-Bench: Can LLMs Memorize and Understand Long Multi-Turn Conversations in Medical Scenarios?
di: Yang, Lin, et al.
Pubblicazione: (2026)
di: Yang, Lin, et al.
Pubblicazione: (2026)
ROVER: Benchmarking Reciprocal Cross-Modal Reasoning for Omnimodal Generation
di: Liang, Yongyuan, et al.
Pubblicazione: (2025)
di: Liang, Yongyuan, et al.
Pubblicazione: (2025)
Accessible Fine-grained Data Representation via Spatial Audio
di: Liu, Can, et al.
Pubblicazione: (2026)
di: Liu, Can, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Active Perception Agent for Omnimodal Audio-Video Understanding
di: Tao, Keda, et al.
Pubblicazione: (2025) -
OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models
di: Tao, Keda, et al.
Pubblicazione: (2025) -
StreamingTOM: Streaming Token Compression for Efficient Video Understanding
di: Chen, Xueyi, et al.
Pubblicazione: (2025) -
HoliTom: Holistic Token Merging for Fast Video Large Language Models
di: Shao, Kele, et al.
Pubblicazione: (2025) -
OBS-Diff: Accurate Pruning For Diffusion Models in One-Shot
di: Zhu, Junhan, et al.
Pubblicazione: (2025)