Audio-centric Video Understanding Benchmark without Text Shortcut
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yang, Yudong, Zhuang, Jimin, Sun, Guangzhi, Tang, Changli, Li, Yixuan, Li, Peihan, Jiang, Yifan, Li, Wei, Ma, Zejun, Zhang, Chao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Improving LLM Video Understanding with 16 Frames Per Second
von: Li, Yixuan, et al.
Veröffentlicht: (2025)
von: Li, Yixuan, et al.
Veröffentlicht: (2025)
video-SALMONN 2: Caption-Enhanced Audio-Visual Large Language Models
von: Tang, Changli, et al.
Veröffentlicht: (2025)
von: Tang, Changli, et al.
Veröffentlicht: (2025)
video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language Model
von: Sun, Guangzhi, et al.
Veröffentlicht: (2025)
von: Sun, Guangzhi, et al.
Veröffentlicht: (2025)
Enhancing Multimodal LLM for Detailed and Accurate Video Captioning using Multi-Round Preference Optimization
von: Tang, Changli, et al.
Veröffentlicht: (2024)
von: Tang, Changli, et al.
Veröffentlicht: (2024)
video-SALMONN S: Memory-Enhanced Streaming Audio-Visual LLM
von: Sun, Guangzhi, et al.
Veröffentlicht: (2025)
von: Sun, Guangzhi, et al.
Veröffentlicht: (2025)
Can Large Language Models Understand Spatial Audio?
von: Tang, Changli, et al.
Veröffentlicht: (2024)
von: Tang, Changli, et al.
Veröffentlicht: (2024)
OCR-Enhanced Multimodal ASR Can Read While Listening
von: Chen, Junli, et al.
Veröffentlicht: (2026)
von: Chen, Junli, et al.
Veröffentlicht: (2026)
video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models
von: Sun, Guangzhi, et al.
Veröffentlicht: (2024)
von: Sun, Guangzhi, et al.
Veröffentlicht: (2024)
Enabling Auditory Large Language Models for Automatic Speech Quality Evaluation
von: Wang, Siyin, et al.
Veröffentlicht: (2024)
von: Wang, Siyin, et al.
Veröffentlicht: (2024)
SALMONN: Towards Generic Hearing Abilities for Large Language Models
von: Tang, Changli, et al.
Veröffentlicht: (2023)
von: Tang, Changli, et al.
Veröffentlicht: (2023)
Speech-Audio Compositional Attacks on Multimodal LLMs and Their Mitigation with SALMONN-Guard
von: Yang, Yudong, et al.
Veröffentlicht: (2025)
von: Yang, Yudong, et al.
Veröffentlicht: (2025)
Video Prediction Transformers without Recurrence or Convolution
von: Tang, Yujin, et al.
Veröffentlicht: (2024)
von: Tang, Yujin, et al.
Veröffentlicht: (2024)
FinMTEB: Finance Massive Text Embedding Benchmark
von: Tang, Yixuan, et al.
Veröffentlicht: (2025)
von: Tang, Yixuan, et al.
Veröffentlicht: (2025)
Learning with Logical Constraints but without Shortcut Satisfaction
von: Li, Zenan, et al.
Veröffentlicht: (2024)
von: Li, Zenan, et al.
Veröffentlicht: (2024)
Text-Audio-Visual-conditioned Diffusion Model for Video Saliency Prediction
von: Yu, Li, et al.
Veröffentlicht: (2025)
von: Yu, Li, et al.
Veröffentlicht: (2025)
Representation-Regularized Convolutional Audio Transformer for Audio Understanding
von: Han, Bing, et al.
Veröffentlicht: (2026)
von: Han, Bing, et al.
Veröffentlicht: (2026)
PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation
von: Xie, Tianxin, et al.
Veröffentlicht: (2025)
von: Xie, Tianxin, et al.
Veröffentlicht: (2025)
D-ORCA: Dialogue-Centric Optimization for Robust Audio-Visual Captioning
von: Tang, Changli, et al.
Veröffentlicht: (2026)
von: Tang, Changli, et al.
Veröffentlicht: (2026)
A Shortcut-aware Video-QA Benchmark for Physical Understanding via Minimal Video Pairs
von: Krojer, Benno, et al.
Veröffentlicht: (2025)
von: Krojer, Benno, et al.
Veröffentlicht: (2025)
EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models
von: Du, Mengfei, et al.
Veröffentlicht: (2024)
von: Du, Mengfei, et al.
Veröffentlicht: (2024)
Synthesis, Surface Chemistry, and Applications of Non‐Zero‐Dimensional Diamond Nanostructures
von: Changli Li, et al.
Veröffentlicht: (2024)
von: Changli Li, et al.
Veröffentlicht: (2024)
Multiplexing Neural Audio Watermarks
von: Yuan, Zheqi, et al.
Veröffentlicht: (2025)
von: Yuan, Zheqi, et al.
Veröffentlicht: (2025)
LLaVA-Video: Video Instruction Tuning With Synthetic Data
von: Zhang, Yuanhan, et al.
Veröffentlicht: (2024)
von: Zhang, Yuanhan, et al.
Veröffentlicht: (2024)
AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation
von: Wei, Huawei, et al.
Veröffentlicht: (2024)
von: Wei, Huawei, et al.
Veröffentlicht: (2024)
SpurAudio: A Benchmark for Studying Shortcut Learning in Few-Shot Audio Classification
von: Ayoub, Giries Abu, et al.
Veröffentlicht: (2026)
von: Ayoub, Giries Abu, et al.
Veröffentlicht: (2026)
Text-Driven Video Style Transfer with State-Space Models: Extending StyleMamba for Temporal Coherence
von: Li, Chao, et al.
Veröffentlicht: (2025)
von: Li, Chao, et al.
Veröffentlicht: (2025)
Extract and Diffuse: Latent Integration for Improved Diffusion-based Speech and Vocal Enhancement
von: Yang, Yudong, et al.
Veröffentlicht: (2024)
von: Yang, Yudong, et al.
Veröffentlicht: (2024)
AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation
von: Zhou, Ziwei, et al.
Veröffentlicht: (2026)
von: Zhou, Ziwei, et al.
Veröffentlicht: (2026)
Models Know Their Shortcuts: Deployment-Time Shortcut Mitigation
von: Li, Jiayi, et al.
Veröffentlicht: (2026)
von: Li, Jiayi, et al.
Veröffentlicht: (2026)
EvObj: Learning Evolving Object-centric Representations for 3D Instance Segmentation without Scene Supervision
von: Chen, Jiahao, et al.
Veröffentlicht: (2026)
von: Chen, Jiahao, et al.
Veröffentlicht: (2026)
WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM
von: Tang, Changli, et al.
Veröffentlicht: (2025)
von: Tang, Changli, et al.
Veröffentlicht: (2025)
LLM-Flock: Decentralized Multi-Robot Flocking via Large Language Models and Influence-Based Consensus
von: Li, Peihan, et al.
Veröffentlicht: (2025)
von: Li, Peihan, et al.
Veröffentlicht: (2025)
Assignment Algorithms for Multi-Robot Multi-Target Tracking with Sufficient and Limited Sensing Capability
von: Li, Peihan, et al.
Veröffentlicht: (2023)
von: Li, Peihan, et al.
Veröffentlicht: (2023)
Scaling Open Discrete Audio Foundation Models with Interleaved Semantic, Acoustic, and Text Tokens
von: Manakul, Potsawee, et al.
Veröffentlicht: (2026)
von: Manakul, Potsawee, et al.
Veröffentlicht: (2026)
Towards General Auditory Intelligence: Large Multimodal Models for Machine Listening and Speaking
von: Wang, Siyin, et al.
Veröffentlicht: (2025)
von: Wang, Siyin, et al.
Veröffentlicht: (2025)
SpatialText: A Pure-Text Cognitive Benchmark for Spatial Understanding in Large Language Models
von: Jiang, Peiyao, et al.
Veröffentlicht: (2026)
von: Jiang, Peiyao, et al.
Veröffentlicht: (2026)
An Embarrassingly Simple Graph Heuristic Reveals Shortcut-Solvable Benchmarks for Sequential Recommendation
von: Han, Haoyu, et al.
Veröffentlicht: (2026)
von: Han, Haoyu, et al.
Veröffentlicht: (2026)
UNQA: Unified No-Reference Quality Assessment for Audio, Image, Video, and Audio-Visual Content
von: Cao, Yuqin, et al.
Veröffentlicht: (2024)
von: Cao, Yuqin, et al.
Veröffentlicht: (2024)
FocusedAD: Character-centric Movie Audio Description
von: Ye, Xiaojun, et al.
Veröffentlicht: (2025)
von: Ye, Xiaojun, et al.
Veröffentlicht: (2025)
A Unified Framework for Human-centric Point Cloud Video Understanding
von: Xu, Yiteng, et al.
Veröffentlicht: (2024)
von: Xu, Yiteng, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Improving LLM Video Understanding with 16 Frames Per Second
von: Li, Yixuan, et al.
Veröffentlicht: (2025) -
video-SALMONN 2: Caption-Enhanced Audio-Visual Large Language Models
von: Tang, Changli, et al.
Veröffentlicht: (2025) -
video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language Model
von: Sun, Guangzhi, et al.
Veröffentlicht: (2025) -
Enhancing Multimodal LLM for Detailed and Accurate Video Captioning using Multi-Round Preference Optimization
von: Tang, Changli, et al.
Veröffentlicht: (2024) -
video-SALMONN S: Memory-Enhanced Streaming Audio-Visual LLM
von: Sun, Guangzhi, et al.
Veröffentlicht: (2025)