Understanding Temporal Logic Consistency in Video-Language Models through Cross-Modal Attention Discriminability
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Chengzhi, Huang, Heyan, Jian, Ping, Yang, Zhen, Tian, Yaning, Guo, Zhongbin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Look, Listen and Segment: Towards Weakly Supervised Audio-visual Semantic Segmentation
di: Li, Chengzhi, et al.
Pubblicazione: (2026)
di: Li, Chengzhi, et al.
Pubblicazione: (2026)
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
di: Chen, Yaru, et al.
Pubblicazione: (2025)
di: Chen, Yaru, et al.
Pubblicazione: (2025)
MSCT: Differential Cross-Modal Attention for Deepfake Detection
di: Wei, Fangda, et al.
Pubblicazione: (2026)
di: Wei, Fangda, et al.
Pubblicazione: (2026)
Probabilistic Temporal Masked Attention for Cross-view Online Action Detection
di: Xie, Liping, et al.
Pubblicazione: (2025)
di: Xie, Liping, et al.
Pubblicazione: (2025)
ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
di: Yang, Jianxuan, et al.
Pubblicazione: (2026)
di: Yang, Jianxuan, et al.
Pubblicazione: (2026)
VidCompress: Memory-Enhanced Temporal Compression for Video Understanding in Large Language Models
di: Lan, Xiaohan, et al.
Pubblicazione: (2024)
di: Lan, Xiaohan, et al.
Pubblicazione: (2024)
TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos
di: Kong, Fanheng, et al.
Pubblicazione: (2025)
di: Kong, Fanheng, et al.
Pubblicazione: (2025)
CMTA: Leveraging Cross-Modal Temporal Artifacts for Generalizable AI-Generated Video Detection
di: Wang, Hang, et al.
Pubblicazione: (2026)
di: Wang, Hang, et al.
Pubblicazione: (2026)
Pursuing Temporal-Consistent Video Virtual Try-On via Dynamic Pose Interaction
di: Li, Dong, et al.
Pubblicazione: (2025)
di: Li, Dong, et al.
Pubblicazione: (2025)
Exposure Completing for Temporally Consistent Neural High Dynamic Range Video Rendering
di: Cui, Jiahao, et al.
Pubblicazione: (2024)
di: Cui, Jiahao, et al.
Pubblicazione: (2024)
Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation
di: Roy, Prasun, et al.
Pubblicazione: (2025)
di: Roy, Prasun, et al.
Pubblicazione: (2025)
SpikeMba: Multi-Modal Spiking Saliency Mamba for Temporal Video Grounding
di: Li, Wenrui, et al.
Pubblicazione: (2024)
di: Li, Wenrui, et al.
Pubblicazione: (2024)
Cross-Modal and Uni-Modal Soft-Label Alignment for Image-Text Retrieval
di: Huang, Hailang, et al.
Pubblicazione: (2024)
di: Huang, Hailang, et al.
Pubblicazione: (2024)
Detecting Misinformation in Multimedia Content through Cross-Modal Entity Consistency: A Dual Learning Approach
di: Fu, Zhe, et al.
Pubblicazione: (2024)
di: Fu, Zhe, et al.
Pubblicazione: (2024)
SkeFi: Cross-Modal Knowledge Transfer for Wireless Skeleton-Based Action Recognition
di: Huang, Shunyu, et al.
Pubblicazione: (2026)
di: Huang, Shunyu, et al.
Pubblicazione: (2026)
Long Video Diffusion Generation with Segmented Cross-Attention and Content-Rich Video Data Curation
di: Yan, Xin, et al.
Pubblicazione: (2024)
di: Yan, Xin, et al.
Pubblicazione: (2024)
Logic Unseen: Revealing the Logical Blindspots of Vision-Language Models
di: Zhou, Yuchen, et al.
Pubblicazione: (2025)
di: Zhou, Yuchen, et al.
Pubblicazione: (2025)
LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding
di: Han, ZhaoYang, et al.
Pubblicazione: (2025)
di: Han, ZhaoYang, et al.
Pubblicazione: (2025)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
Deep Reversible Consistency Learning for Cross-modal Retrieval
di: Pu, Ruitao, et al.
Pubblicazione: (2025)
di: Pu, Ruitao, et al.
Pubblicazione: (2025)
FlowVid: Taming Imperfect Optical Flows for Consistent Video-to-Video Synthesis
di: Liang, Feng, et al.
Pubblicazione: (2023)
di: Liang, Feng, et al.
Pubblicazione: (2023)
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
di: Qu, Mengxue, et al.
Pubblicazione: (2024)
di: Qu, Mengxue, et al.
Pubblicazione: (2024)
Consistency-aware Fake Videos Detection on Short Video Platforms
di: Wang, Junxi, et al.
Pubblicazione: (2025)
di: Wang, Junxi, et al.
Pubblicazione: (2025)
Spatio-Temporal Data Enhanced Vision-Language Model for Traffic Scene Understanding
di: Ma, Jingtian, et al.
Pubblicazione: (2025)
di: Ma, Jingtian, et al.
Pubblicazione: (2025)
Joint Explicit and Implicit Cross-Modal Interaction Network for Anterior Chamber Inflammation Diagnosis
di: Shao, Qian, et al.
Pubblicazione: (2023)
di: Shao, Qian, et al.
Pubblicazione: (2023)
Unified Generative and Discriminative Training for Multi-modal Large Language Models
di: Chow, Wei, et al.
Pubblicazione: (2024)
di: Chow, Wei, et al.
Pubblicazione: (2024)
Face Consistency Benchmark for GenAI Video
di: Podstawski, Michal, et al.
Pubblicazione: (2025)
di: Podstawski, Michal, et al.
Pubblicazione: (2025)
Representing Long Volumetric Video with Temporal Gaussian Hierarchy
di: Xu, Zhen, et al.
Pubblicazione: (2024)
di: Xu, Zhen, et al.
Pubblicazione: (2024)
Linguistics-Vision Monotonic Consistent Network for Sign Language Production
di: Wang, Xu, et al.
Pubblicazione: (2024)
di: Wang, Xu, et al.
Pubblicazione: (2024)
Robust Self-Paced Hashing for Cross-Modal Retrieval with Noisy Labels
di: Pu, Ruitao, et al.
Pubblicazione: (2025)
di: Pu, Ruitao, et al.
Pubblicazione: (2025)
Cross-Modal Transfer from Memes to Videos: Addressing Data Scarcity in Hateful Video Detection
di: Wang, Han, et al.
Pubblicazione: (2025)
di: Wang, Han, et al.
Pubblicazione: (2025)
Towards Robust and Realible Multimodal Misinformation Recognition with Incomplete Modality
di: Zhou, Hengyang, et al.
Pubblicazione: (2025)
di: Zhou, Hengyang, et al.
Pubblicazione: (2025)
VAGU & GtS: LLM-Based Benchmark and Framework for Joint Video Anomaly Grounding and Understanding
di: Gao, Shibo, et al.
Pubblicazione: (2025)
di: Gao, Shibo, et al.
Pubblicazione: (2025)
TEn-CATG:Text-Enriched Audio-Visual Video Parsing with Multi-Scale Category-Aware Temporal Graph
di: Chen, Yaru, et al.
Pubblicazione: (2025)
di: Chen, Yaru, et al.
Pubblicazione: (2025)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
di: Fang, Xiang, et al.
Pubblicazione: (2026)
di: Fang, Xiang, et al.
Pubblicazione: (2026)
Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding
di: Wang, Shaoguang, et al.
Pubblicazione: (2026)
di: Wang, Shaoguang, et al.
Pubblicazione: (2026)
Vision-Language Meets the Skeleton: Progressively Distillation with Cross-Modal Knowledge for 3D Action Representation Learning
di: Chen, Yang, et al.
Pubblicazione: (2024)
di: Chen, Yang, et al.
Pubblicazione: (2024)
Where Does Vision Meet Language? Understanding and Refining Visual Fusion in MLLMs via Contrastive Attention
di: Song, Shezheng, et al.
Pubblicazione: (2026)
di: Song, Shezheng, et al.
Pubblicazione: (2026)
FreeMask: Rethinking the Importance of Attention Masks for Zero-Shot Video Editing
di: Cai, Lingling, et al.
Pubblicazione: (2024)
di: Cai, Lingling, et al.
Pubblicazione: (2024)
Towards Universal Modal Tracking with Online Dense Temporal Token Learning
di: Zheng, Yaozong, et al.
Pubblicazione: (2025)
di: Zheng, Yaozong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Look, Listen and Segment: Towards Weakly Supervised Audio-visual Semantic Segmentation
di: Li, Chengzhi, et al.
Pubblicazione: (2026) -
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
di: Chen, Yaru, et al.
Pubblicazione: (2025) -
MSCT: Differential Cross-Modal Attention for Deepfake Detection
di: Wei, Fangda, et al.
Pubblicazione: (2026) -
Probabilistic Temporal Masked Attention for Cross-view Online Action Detection
di: Xie, Liping, et al.
Pubblicazione: (2025) -
ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
di: Yang, Jianxuan, et al.
Pubblicazione: (2026)