SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video Understanding
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yang, Zhenyu, Hu, Yuhang, Du, Zemin, Xue, Dizhan, Qian, Shengsheng, Wu, Jiahong, Yang, Fan, Dong, Weiming, Xu, Changsheng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
LiveStar: Live Streaming Assistant for Real-World Online Video Understanding
von: Yang, Zhenyu, et al.
Veröffentlicht: (2025)
von: Yang, Zhenyu, et al.
Veröffentlicht: (2025)
StreamingCoT: A Dataset for Temporal Dynamics and Multimodal Chain-of-Thought Reasoning in Streaming VideoQA
von: Hu, Yuhang, et al.
Veröffentlicht: (2025)
von: Hu, Yuhang, et al.
Veröffentlicht: (2025)
Short-video Propagation Influence Rating: A New Real-world Dataset and A New Large Graph Model
von: Xue, Dizhan, et al.
Veröffentlicht: (2025)
von: Xue, Dizhan, et al.
Veröffentlicht: (2025)
SoMe: A Realistic Benchmark for LLM-based Social Media Agents
von: Xue, Dizhan, et al.
Veröffentlicht: (2025)
von: Xue, Dizhan, et al.
Veröffentlicht: (2025)
From Linguistic Giants to Sensory Maestros: A Survey on Cross-Modal Reasoning with Large Language Models
von: Qian, Shengsheng, et al.
Veröffentlicht: (2024)
von: Qian, Shengsheng, et al.
Veröffentlicht: (2024)
Erasing Self-Supervised Learning Backdoor by Cluster Activation Masking
von: Qian, Shengsheng, et al.
Veröffentlicht: (2023)
von: Qian, Shengsheng, et al.
Veröffentlicht: (2023)
BadAgent: Inserting and Activating Backdoor Attacks in LLM Agents
von: Wang, Yifei, et al.
Veröffentlicht: (2024)
von: Wang, Yifei, et al.
Veröffentlicht: (2024)
SVBench: Evaluation of Video Generation Models on Social Reasoning
von: Peng, Wenshuo, et al.
Veröffentlicht: (2025)
von: Peng, Wenshuo, et al.
Veröffentlicht: (2025)
MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues
von: Pan, Yaning, et al.
Veröffentlicht: (2025)
von: Pan, Yaning, et al.
Veröffentlicht: (2025)
Modality-Collaborative Low-Rank Decomposers for Few-Shot Video Domain Adaptation
von: Wanyan, Yuyang, et al.
Veröffentlicht: (2025)
von: Wanyan, Yuyang, et al.
Veröffentlicht: (2025)
MM-Snowball: Evaluating and Mitigating Hallucination Snowballing in Multimodal Multi-Turn Dialogue
von: Jiang, Yue, et al.
Veröffentlicht: (2026)
von: Jiang, Yue, et al.
Veröffentlicht: (2026)
Streaming Long Video Understanding with Large Language Models
von: Qian, Rui, et al.
Veröffentlicht: (2024)
von: Qian, Rui, et al.
Veröffentlicht: (2024)
MGDCF: Distance Learning via Markov Graph Diffusion for Neural Collaborative Filtering
von: Hu, Jun, et al.
Veröffentlicht: (2022)
von: Hu, Jun, et al.
Veröffentlicht: (2022)
On the optical emission in the mini-outburst of the black hole X-ray binary MAXI J1348-630
von: Fan, Xiao, et al.
Veröffentlicht: (2025)
von: Fan, Xiao, et al.
Veröffentlicht: (2025)
Rethinking Stateful Tool Use in Multi-Turn Dialogues: Benchmarks and Challenges
von: Wang, Hongru, et al.
Veröffentlicht: (2025)
von: Wang, Hongru, et al.
Veröffentlicht: (2025)
MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs
von: Liu, Ziyu, et al.
Veröffentlicht: (2024)
von: Liu, Ziyu, et al.
Veröffentlicht: (2024)
A Comprehensive Review of Few-shot Action Recognition
von: Wanyan, Yuyang, et al.
Veröffentlicht: (2024)
von: Wanyan, Yuyang, et al.
Veröffentlicht: (2024)
MULTI-Bench: A Multi-Turn Interactive Benchmark for Assessing Emotional Intelligence ability of Spoken Dialogue Models
von: Deng, Yayue, et al.
Veröffentlicht: (2025)
von: Deng, Yayue, et al.
Veröffentlicht: (2025)
MAD: A Benchmark for Multi-Turn Audio Dialogue Fact-Checking
von: Chun, Chaewan, et al.
Veröffentlicht: (2025)
von: Chun, Chaewan, et al.
Veröffentlicht: (2025)
EgoSound: Benchmarking Sound Understanding in Egocentric Videos
von: Zhu, Bingwen, et al.
Veröffentlicht: (2026)
von: Zhu, Bingwen, et al.
Veröffentlicht: (2026)
StreamMind: Unlocking Full Frame Rate Streaming Video Dialogue through Event-Gated Cognition
von: Ding, Xin, et al.
Veröffentlicht: (2025)
von: Ding, Xin, et al.
Veröffentlicht: (2025)
LLM-Driven Multi-Turn Task-Oriented Dialogue Synthesis for Realistic Reasoning
von: Zhu, Yu, et al.
Veröffentlicht: (2026)
von: Zhu, Yu, et al.
Veröffentlicht: (2026)
From Myopic Selection to Long-Horizon Awareness: Sequential LLM Routing for Multi-Turn Dialogue
von: Zhang, Jiarui, et al.
Veröffentlicht: (2026)
von: Zhang, Jiarui, et al.
Veröffentlicht: (2026)
PingPong: A Natural Benchmark for Multi-Turn Code-Switching Dialogues
von: Farhansyah, Mohammad Rifqi, et al.
Veröffentlicht: (2026)
von: Farhansyah, Mohammad Rifqi, et al.
Veröffentlicht: (2026)
Enhancing Personalized Multi-Turn Dialogue with Curiosity Reward
von: Wan, Yanming, et al.
Veröffentlicht: (2025)
von: Wan, Yanming, et al.
Veröffentlicht: (2025)
OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding
von: Zhao, Ruixiang, et al.
Veröffentlicht: (2026)
von: Zhao, Ruixiang, et al.
Veröffentlicht: (2026)
StreamGaze: Gaze-Guided Temporal Reasoning and Proactive Understanding in Streaming Videos
von: Lee, Daeun, et al.
Veröffentlicht: (2025)
von: Lee, Daeun, et al.
Veröffentlicht: (2025)
Interactive Multi-Turn Retrieval for Health Videos
von: Wu, Chengzheng, et al.
Veröffentlicht: (2026)
von: Wu, Chengzheng, et al.
Veröffentlicht: (2026)
FiLA-Video: Spatio-Temporal Compression for Fine-Grained Long Video Understanding
von: Guo, Yanan, et al.
Veröffentlicht: (2025)
von: Guo, Yanan, et al.
Veröffentlicht: (2025)
SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
von: Cao, Hongye, et al.
Veröffentlicht: (2025)
von: Cao, Hongye, et al.
Veröffentlicht: (2025)
KnowMT-Bench: Benchmarking Knowledge-Intensive Long-Form Question Answering in Multi-Turn Dialogues
von: Chen, Junhao, et al.
Veröffentlicht: (2025)
von: Chen, Junhao, et al.
Veröffentlicht: (2025)
M$^3$-Med: A Benchmark for Multi-lingual, Multi-modal, and Multi-hop Reasoning in Medical Instructional Video Understanding
von: Liu, Shenxi, et al.
Veröffentlicht: (2025)
von: Liu, Shenxi, et al.
Veröffentlicht: (2025)
StreamAgent: Towards Anticipatory Agents for Streaming Video Understanding
von: Yang, Haolin, et al.
Veröffentlicht: (2025)
von: Yang, Haolin, et al.
Veröffentlicht: (2025)
Benchmarking Correctness and Security in Multi-Turn Code Generation
von: Rawal, Ruchit, et al.
Veröffentlicht: (2025)
von: Rawal, Ruchit, et al.
Veröffentlicht: (2025)
Proactive Assistant Dialogue Generation from Streaming Egocentric Videos
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
Video-MTR: Reinforced Multi-Turn Reasoning for Long Video Understanding
von: Xie, Yuan, et al.
Veröffentlicht: (2025)
von: Xie, Yuan, et al.
Veröffentlicht: (2025)
Spatial-Temporal Multi-level Association for Video Object Segmentation
von: Miao, Deshui, et al.
Veröffentlicht: (2024)
von: Miao, Deshui, et al.
Veröffentlicht: (2024)
Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge
von: Xiong, Haomiao, et al.
Veröffentlicht: (2025)
von: Xiong, Haomiao, et al.
Veröffentlicht: (2025)
TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models
von: Cai, Mu, et al.
Veröffentlicht: (2024)
von: Cai, Mu, et al.
Veröffentlicht: (2024)
A Simple Baseline for Streaming Video Understanding
von: Shen, Yujiao, et al.
Veröffentlicht: (2026)
von: Shen, Yujiao, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
LiveStar: Live Streaming Assistant for Real-World Online Video Understanding
von: Yang, Zhenyu, et al.
Veröffentlicht: (2025) -
StreamingCoT: A Dataset for Temporal Dynamics and Multimodal Chain-of-Thought Reasoning in Streaming VideoQA
von: Hu, Yuhang, et al.
Veröffentlicht: (2025) -
Short-video Propagation Influence Rating: A New Real-world Dataset and A New Large Graph Model
von: Xue, Dizhan, et al.
Veröffentlicht: (2025) -
SoMe: A Realistic Benchmark for LLM-based Social Media Agents
von: Xue, Dizhan, et al.
Veröffentlicht: (2025) -
From Linguistic Giants to Sensory Maestros: A Survey on Cross-Modal Reasoning with Large Language Models
von: Qian, Shengsheng, et al.
Veröffentlicht: (2024)