LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Geng, Tiantian, Zhang, Jinrui, Wang, Qingni, Wang, Teng, Duan, Jinming, Zheng, Feng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
UniAV: Unified Audio-Visual Perception for Multi-Task Video Event Localization
par: Geng, Tiantian, et autres
Publié: (2024)
par: Geng, Tiantian, et autres
Publié: (2024)
OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video
par: Pu, Junfu, et autres
Publié: (2026)
par: Pu, Junfu, et autres
Publié: (2026)
Sample then Identify: A General Framework for Risk Control and Assessment in Multimodal Large Language Models
par: Wang, Qingni, et autres
Publié: (2024)
par: Wang, Qingni, et autres
Publié: (2024)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
par: Chen, Yuheng, et autres
Publié: (2026)
par: Chen, Yuheng, et autres
Publié: (2026)
LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding
par: Han, ZhaoYang, et autres
Publié: (2025)
par: Han, ZhaoYang, et autres
Publié: (2025)
Towards Event-oriented Long Video Understanding
par: Du, Yifan, et autres
Publié: (2024)
par: Du, Yifan, et autres
Publié: (2024)
Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision
par: Liu, Che, et autres
Publié: (2025)
par: Liu, Che, et autres
Publié: (2025)
OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
par: Pian, Weiguo, et autres
Publié: (2026)
par: Pian, Weiguo, et autres
Publié: (2026)
Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception
par: Ma, Ziyang, et autres
Publié: (2025)
par: Ma, Ziyang, et autres
Publié: (2025)
VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset
par: Liu, Jing, et autres
Publié: (2023)
par: Liu, Jing, et autres
Publié: (2023)
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
par: Dai, Yusheng, et autres
Publié: (2026)
par: Dai, Yusheng, et autres
Publié: (2026)
ChronusOmni: Improving Time Awareness of Omni Large Language Models
par: Chen, Yijing, et autres
Publié: (2025)
par: Chen, Yijing, et autres
Publié: (2025)
OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs
par: Yan, Qianqi, et autres
Publié: (2026)
par: Yan, Qianqi, et autres
Publié: (2026)
OmniGAIA: Towards Native Omni-Modal AI Agents
par: Li, Xiaoxi, et autres
Publié: (2026)
par: Li, Xiaoxi, et autres
Publié: (2026)
AudioStory: Generating Long-Form Narrative Audio with Large Language Models
par: Guo, Yuxin, et autres
Publié: (2025)
par: Guo, Yuxin, et autres
Publié: (2025)
Towards Event Extraction from Speech with Contextual Clues
par: Kang, Jingqi, et autres
Publié: (2024)
par: Kang, Jingqi, et autres
Publié: (2024)
MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding
par: Fang, Xinyu, et autres
Publié: (2024)
par: Fang, Xinyu, et autres
Publié: (2024)
Pistachio: Towards Synthetic, Balanced, and Long-Form Video Anomaly Benchmarks
par: Li, Jie, et autres
Publié: (2025)
par: Li, Jie, et autres
Publié: (2025)
MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech
par: Wang, Chengyao, et autres
Publié: (2025)
par: Wang, Chengyao, et autres
Publié: (2025)
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
par: Wang, Le, et autres
Publié: (2025)
par: Wang, Le, et autres
Publié: (2025)
TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation
par: Wang, Zhenzhi, et autres
Publié: (2025)
par: Wang, Zhenzhi, et autres
Publié: (2025)
Towards Open-Vocabulary Audio-Visual Event Localization
par: Zhou, Jinxing, et autres
Publié: (2024)
par: Zhou, Jinxing, et autres
Publié: (2024)
ESG-Net: Event-Aware Semantic Guided Network for Dense Audio-Visual Event Localization
par: Li, Huilai, et autres
Publié: (2025)
par: Li, Huilai, et autres
Publié: (2025)
Towards Temporal-Aware Multi-Modal Retrieval Augmented Generation in Finance
par: Zhu, Fengbin, et autres
Publié: (2025)
par: Zhu, Fengbin, et autres
Publié: (2025)
Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding
par: Wang, Yun, et autres
Publié: (2025)
par: Wang, Yun, et autres
Publié: (2025)
LongCat-Flash-Omni Technical Report
par: Meituan LongCat Team, et autres
Publié: (2025)
par: Meituan LongCat Team, et autres
Publié: (2025)
VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models
par: Wang, Jiapeng, et autres
Publié: (2024)
par: Wang, Jiapeng, et autres
Publié: (2024)
EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing
par: Li, Huilai, et autres
Publié: (2026)
par: Li, Huilai, et autres
Publié: (2026)
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
par: Chen, Qian, et autres
Publié: (2026)
par: Chen, Qian, et autres
Publié: (2026)
VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos
par: Yu, Jiashuo, et autres
Publié: (2025)
par: Yu, Jiashuo, et autres
Publié: (2025)
Modality-Aware Shot Relating and Comparing for Video Scene Detection
par: Tan, Jiawei, et autres
Publié: (2024)
par: Tan, Jiawei, et autres
Publié: (2024)
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
par: Chen, Yaru, et autres
Publié: (2025)
par: Chen, Yaru, et autres
Publié: (2025)
Benchmarking and Improving LVLMs on Event Extraction from Multimedia Documents
par: Xing, Fuyu, et autres
Publié: (2025)
par: Xing, Fuyu, et autres
Publié: (2025)
OmniForcing: Unleashing Real-time Joint Audio-Visual Generation
par: Su, Yaofeng, et autres
Publié: (2026)
par: Su, Yaofeng, et autres
Publié: (2026)
AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction
par: Chen, Zixuan, et autres
Publié: (2026)
par: Chen, Zixuan, et autres
Publié: (2026)
TimeLoc: A Unified End-to-End Framework for Precise Timestamp Localization in Long Videos
par: Zhang, Chen-Lin, et autres
Publié: (2025)
par: Zhang, Chen-Lin, et autres
Publié: (2025)
Towards Robust and Generalizable Continuous Space-Time Video Super-Resolution with Events
par: Wei, Shuoyan, et autres
Publié: (2025)
par: Wei, Shuoyan, et autres
Publié: (2025)
Label-anticipated Event Disentanglement for Audio-Visual Video Parsing
par: Zhou, Jinxing, et autres
Publié: (2024)
par: Zhou, Jinxing, et autres
Publié: (2024)
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
par: Zeng, Xiangyu, et autres
Publié: (2024)
par: Zeng, Xiangyu, et autres
Publié: (2024)
OmnixR: Evaluating Omni-modality Language Models on Reasoning across Modalities
par: Chen, Lichang, et autres
Publié: (2024)
par: Chen, Lichang, et autres
Publié: (2024)
Documents similaires
-
UniAV: Unified Audio-Visual Perception for Multi-Task Video Event Localization
par: Geng, Tiantian, et autres
Publié: (2024) -
OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video
par: Pu, Junfu, et autres
Publié: (2026) -
Sample then Identify: A General Framework for Risk Control and Assessment in Multimodal Large Language Models
par: Wang, Qingni, et autres
Publié: (2024) -
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
par: Chen, Yuheng, et autres
Publié: (2026) -
LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding
par: Han, ZhaoYang, et autres
Publié: (2025)