TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos
Fuente:
arXiv
Guardado en:
| Autores principales: | Kong, Fanheng, Zhang, Jingyuan, Zhang, Hongzhi, Feng, Shi, Wang, Daling, Yu, Linhao, Ji, Xingguang, Tian, Yu, W., Victoria, Zhang, Fuzheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval
por: Kong, Fanheng, et al.
Publicado: (2025)
por: Kong, Fanheng, et al.
Publicado: (2025)
DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding
por: Zhang, Hongzhi, et al.
Publicado: (2025)
por: Zhang, Hongzhi, et al.
Publicado: (2025)
Fine-grained Knowledge Graph-driven Video-Language Learning for Action Recognition
por: Zhang, Rui, et al.
Publicado: (2024)
por: Zhang, Rui, et al.
Publicado: (2024)
Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search
por: Yu, Linhao, et al.
Publicado: (2025)
por: Yu, Linhao, et al.
Publicado: (2025)
Video DataFlywheel: Resolving the Impossible Data Trinity in Video-Language Understanding
por: Wang, Xiao, et al.
Publicado: (2024)
por: Wang, Xiao, et al.
Publicado: (2024)
Muse: A Multimodal Conversational Recommendation Dataset with Scenario-Grounded User Profiles
por: Wang, Zihan, et al.
Publicado: (2024)
por: Wang, Zihan, et al.
Publicado: (2024)
TPIFM: A Task-Aware Model for Evaluating Perceptual Interaction Fluency in Remote AR Collaboration
por: Song, Jiarun, et al.
Publicado: (2026)
por: Song, Jiarun, et al.
Publicado: (2026)
MM-InstructEval: Zero-Shot Evaluation of (Multimodal) Large Language Models on Multimodal Reasoning Tasks
por: Yang, Xiaocui, et al.
Publicado: (2024)
por: Yang, Xiaocui, et al.
Publicado: (2024)
FineBadminton: A Multi-Level Dataset for Fine-Grained Badminton Video Understanding
por: He, Xusheng, et al.
Publicado: (2025)
por: He, Xusheng, et al.
Publicado: (2025)
Latency Effects on Multi-Dimensional QoE in Networked VR Whiteboards
por: Song, Jiarun, et al.
Publicado: (2026)
por: Song, Jiarun, et al.
Publicado: (2026)
High-level Codes and Fine-grained Weights for Online Multi-modal Hashing Retrieval
por: Zhan, Yu-Wei, et al.
Publicado: (2024)
por: Zhan, Yu-Wei, et al.
Publicado: (2024)
Towards Universal Modal Tracking with Online Dense Temporal Token Learning
por: Zheng, Yaozong, et al.
Publicado: (2025)
por: Zheng, Yaozong, et al.
Publicado: (2025)
Dynamic Multimodal Expression Generation for LLM-Driven Pedagogical Agents: From User Experience Perspective
por: Wan, Ninghao, et al.
Publicado: (2026)
por: Wan, Ninghao, et al.
Publicado: (2026)
Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation
por: Tong, Xinyi, et al.
Publicado: (2025)
por: Tong, Xinyi, et al.
Publicado: (2025)
Pursuing Temporal-Consistent Video Virtual Try-On via Dynamic Pose Interaction
por: Li, Dong, et al.
Publicado: (2025)
por: Li, Dong, et al.
Publicado: (2025)
TopoCode: Topologically Informed Error Detection and Correction in Communication Systems
por: Guo, Hongzhi
Publicado: (2024)
por: Guo, Hongzhi
Publicado: (2024)
Design and Development of Laughter Recognition System Based on Multimodal Fusion and Deep Learning
por: Zhao, Fuzheng, et al.
Publicado: (2024)
por: Zhao, Fuzheng, et al.
Publicado: (2024)
SpikEmo: Enhancing Emotion Recognition With Spiking Temporal Dynamics in Conversations
por: Yu, Xiaomin, et al.
Publicado: (2024)
por: Yu, Xiaomin, et al.
Publicado: (2024)
LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding
por: Han, ZhaoYang, et al.
Publicado: (2025)
por: Han, ZhaoYang, et al.
Publicado: (2025)
Seeing Further and Wider: Joint Spatio-Temporal Enlargement for Micro-Video Popularity Prediction
por: Wang, Dali, et al.
Publicado: (2026)
por: Wang, Dali, et al.
Publicado: (2026)
HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models
por: Wang, Xiao, et al.
Publicado: (2025)
por: Wang, Xiao, et al.
Publicado: (2025)
SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding
por: Sun, Luoyi, et al.
Publicado: (2026)
por: Sun, Luoyi, et al.
Publicado: (2026)
Spatio-Temporal Data Enhanced Vision-Language Model for Traffic Scene Understanding
por: Ma, Jingtian, et al.
Publicado: (2025)
por: Ma, Jingtian, et al.
Publicado: (2025)
PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
por: Xiao, Yicheng, et al.
Publicado: (2025)
por: Xiao, Yicheng, et al.
Publicado: (2025)
TeMTG: Text-Enhanced Multi-Hop Temporal Graph Modeling for Audio-Visual Video Parsing
por: Chen, Yaru, et al.
Publicado: (2025)
por: Chen, Yaru, et al.
Publicado: (2025)
A Comprehensive Survey on Generative AI for Video-to-Music Generation
por: Ji, Shulei, et al.
Publicado: (2025)
por: Ji, Shulei, et al.
Publicado: (2025)
G4G:A Generic Framework for High Fidelity Talking Face Generation with Fine-grained Intra-modal Alignment
por: Zhang, Juan, et al.
Publicado: (2024)
por: Zhang, Juan, et al.
Publicado: (2024)
Adaptive Offloading and Enhancement for Low-Light Video Analytics on Mobile Devices
por: He, Yuanyi, et al.
Publicado: (2024)
por: He, Yuanyi, et al.
Publicado: (2024)
Virbo: Multimodal Multilingual Avatar Video Generation in Digital Marketing
por: Zhang, Juan, et al.
Publicado: (2024)
por: Zhang, Juan, et al.
Publicado: (2024)
Contextual Wireless Video Semantic Communication in MIMO-OFDM Systems
por: Xie, Bingyan, et al.
Publicado: (2026)
por: Xie, Bingyan, et al.
Publicado: (2026)
Data Metabolism: An Efficient Data Design Schema For Vision Language Model
por: Zhang, Jingyuan, et al.
Publicado: (2025)
por: Zhang, Jingyuan, et al.
Publicado: (2025)
Integrated Semantic and Temporal Alignment for Interactive Video Retrieval
por: Luu, Thanh-Danh, et al.
Publicado: (2025)
por: Luu, Thanh-Danh, et al.
Publicado: (2025)
ConvBench: A Multi-Turn Conversation Evaluation Benchmark with Hierarchical Capability for Large Vision-Language Models
por: Liu, Shuo, et al.
Publicado: (2024)
por: Liu, Shuo, et al.
Publicado: (2024)
SpeechEE: A Novel Benchmark for Speech Event Extraction
por: Wang, Bin, et al.
Publicado: (2024)
por: Wang, Bin, et al.
Publicado: (2024)
RBFIM: Perceptual Quality Assessment for Compressed Point Clouds Using Radial Basis Function Interpolation
por: Chen, Zhang, et al.
Publicado: (2025)
por: Chen, Zhang, et al.
Publicado: (2025)
Beyond Isolated Utterances: Cue-Guided Interaction for Context-Dependent Conversational Multimodal Understanding
por: Pan, Zhaoyan, et al.
Publicado: (2026)
por: Pan, Zhaoyan, et al.
Publicado: (2026)
FineFake: A Knowledge-Enriched Dataset for Fine-Grained Multi-Domain Fake News Detection
por: Zhou, Ziyi, et al.
Publicado: (2024)
por: Zhou, Ziyi, et al.
Publicado: (2024)
Evaluating Multimodal Large Language Models on Spoken Sarcasm Understanding
por: Li, Zhu, et al.
Publicado: (2025)
por: Li, Zhu, et al.
Publicado: (2025)
Sec2Sec Co-attention for Video-Based Apparent Affective Prediction
por: Sun, Mingwei, et al.
Publicado: (2024)
por: Sun, Mingwei, et al.
Publicado: (2024)
MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding
por: Fang, Pengcheng, et al.
Publicado: (2026)
por: Fang, Pengcheng, et al.
Publicado: (2026)
Ejemplares similares
-
Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval
por: Kong, Fanheng, et al.
Publicado: (2025) -
DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding
por: Zhang, Hongzhi, et al.
Publicado: (2025) -
Fine-grained Knowledge Graph-driven Video-Language Learning for Action Recognition
por: Zhang, Rui, et al.
Publicado: (2024) -
Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search
por: Yu, Linhao, et al.
Publicado: (2025) -
Video DataFlywheel: Resolving the Impossible Data Trinity in Video-Language Understanding
por: Wang, Xiao, et al.
Publicado: (2024)