Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kim, Namho, Kim, Junhwa |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Learning Relative Representations for Fine-Grained Multimodal Alignment with Limited Data
par: Kim, Shiwon, et autres
Publié: (2026)
par: Kim, Shiwon, et autres
Publié: (2026)
VideoComp: Advancing Fine-Grained Compositional and Temporal Alignment in Video-Text Models
par: Kim, Dahun, et autres
Publié: (2025)
par: Kim, Dahun, et autres
Publié: (2025)
SyCoCa: Symmetrizing Contrastive Captioners with Attentive Masking for Multimodal Alignment
par: Ma, Ziping, et autres
Publié: (2024)
par: Ma, Ziping, et autres
Publié: (2024)
COHERENCE: Benchmarking Fine-Grained Image-Text Alignment in Interleaved Multimodal Contexts
par: Wang, Bingli, et autres
Publié: (2026)
par: Wang, Bingli, et autres
Publié: (2026)
Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models
par: Jiang, Jiachen, et autres
Publié: (2025)
par: Jiang, Jiachen, et autres
Publié: (2025)
VERIFIED: A Video Corpus Moment Retrieval Benchmark for Fine-Grained Video Understanding
par: Chen, Houlun, et autres
Publié: (2024)
par: Chen, Houlun, et autres
Publié: (2024)
FAVOR-Bench: A Comprehensive Benchmark for Fine-Grained Video Motion Understanding
par: Tu, Chongjun, et autres
Publié: (2025)
par: Tu, Chongjun, et autres
Publié: (2025)
Representation Learning for Compressed Video Action Recognition via Attentive Cross-modal Interaction with Motion Enhancement
par: Li, Bing, et autres
Publié: (2022)
par: Li, Bing, et autres
Publié: (2022)
FG-CLIP: Fine-Grained Visual and Textual Alignment
par: Xie, Chunyu, et autres
Publié: (2025)
par: Xie, Chunyu, et autres
Publié: (2025)
DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPO
par: Park, Jinyoung, et autres
Publié: (2025)
par: Park, Jinyoung, et autres
Publié: (2025)
FPANet: Frequency-based Video Demoireing using Frame-level Post Alignment
par: Oh, Gyeongrok, et autres
Publié: (2023)
par: Oh, Gyeongrok, et autres
Publié: (2023)
Personalized Video Summarization by Multimodal Video Understanding
par: Chen, Brian, et autres
Publié: (2024)
par: Chen, Brian, et autres
Publié: (2024)
Enhanced OoD Detection through Cross-Modal Alignment of Multi-Modal Representations
par: Kim, Jeonghyeon, et autres
Publié: (2025)
par: Kim, Jeonghyeon, et autres
Publié: (2025)
Towards Fine-Grained Human Motion Video Captioning
par: Song, Guorui, et autres
Publié: (2025)
par: Song, Guorui, et autres
Publié: (2025)
Capturing Fine-Grained Alignments Improves 3D Affordance Detection
par: Tokumitsu, Junsei, et autres
Publié: (2025)
par: Tokumitsu, Junsei, et autres
Publié: (2025)
Decomposed Vision-Language Alignment for Fine-Grained Open-Vocabulary Segmentation
par: Wang, Chenhao, et autres
Publié: (2026)
par: Wang, Chenhao, et autres
Publié: (2026)
WaymoQA: A Multi-View Visual Question Answering Dataset for Safety-Critical Reasoning in Autonomous Driving
par: Yu, Seungjun, et autres
Publié: (2025)
par: Yu, Seungjun, et autres
Publié: (2025)
STRIDE: When to Speak Meets Sequence Denoising for Streaming Video Understanding
par: Kim, Junho, et autres
Publié: (2026)
par: Kim, Junho, et autres
Publié: (2026)
Coarse-to-Fine Domain Incremental Learning with Attentive Distillation for Mining Footprint Segmentation in Multispectral Imagery
par: Handoyo, Alif Tri, et autres
Publié: (2026)
par: Handoyo, Alif Tri, et autres
Publié: (2026)
VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding
par: Wang, Shihao, et autres
Publié: (2025)
par: Wang, Shihao, et autres
Publié: (2025)
MMGeoLM: Hard Negative Contrastive Learning for Fine-Grained Geometric Understanding in Large Multimodal Models
par: Sun, Kai, et autres
Publié: (2025)
par: Sun, Kai, et autres
Publié: (2025)
CGC: Compositional Grounded Contrast for Fine-Grained Multi-Image Understanding
par: Zheng, Lihao, et autres
Publié: (2026)
par: Zheng, Lihao, et autres
Publié: (2026)
MANTA: Cross-Modal Semantic Alignment and Information-Theoretic Optimization for Long-form Multimodal Understanding
par: Zhong, Ziqi, et autres
Publié: (2025)
par: Zhong, Ziqi, et autres
Publié: (2025)
ConsistentID: Portrait Generation with Multimodal Fine-Grained Identity Preserving
par: Huang, Jiehui, et autres
Publié: (2024)
par: Huang, Jiehui, et autres
Publié: (2024)
Enhancing Alignment for Unified Multimodal Models via Semantically-Grounded Supervision
par: Kim, Jiyeong, et autres
Publié: (2026)
par: Kim, Jiyeong, et autres
Publié: (2026)
Is 'Right' Right? Enhancing Object Orientation Understanding in Multimodal Large Language Models through Egocentric Instruction Tuning
par: Jung, Ji Hyeok, et autres
Publié: (2024)
par: Jung, Ji Hyeok, et autres
Publié: (2024)
FastCar: Cache Attentive Replay for Fast Auto-Regressive Video Generation on the Edge
par: Shen, Xuan, et autres
Publié: (2025)
par: Shen, Xuan, et autres
Publié: (2025)
QEVA: A Reference-Free Evaluation Metric for Narrative Video Summarization with Multimodal Question Answering
par: Jung, Woojun, et autres
Publié: (2026)
par: Jung, Woojun, et autres
Publié: (2026)
AIFIND: Artifact-Aware Interpreting Fine-Grained Alignment for Incremental Face Forgery Detection
par: Wang, Hao, et autres
Publié: (2026)
par: Wang, Hao, et autres
Publié: (2026)
Multimodal Emotion Recognition via Bi-directional Cross-Attention and Temporal Modeling
par: Byeon, Junhyeong, et autres
Publié: (2026)
par: Byeon, Junhyeong, et autres
Publié: (2026)
DETACH : Decomposed Spatio-Temporal Alignment for Exocentric Video and Ambient Sensors with Staged Learning
par: Yoon, Junho, et autres
Publié: (2025)
par: Yoon, Junho, et autres
Publié: (2025)
StarFT: Robust Fine-tuning of Zero-shot Models via Spuriosity Alignment
par: Kim, Younghyun, et autres
Publié: (2025)
par: Kim, Younghyun, et autres
Publié: (2025)
Safety Alignment Backfires: Preventing the Re-emergence of Suppressed Concepts in Fine-tuned Text-to-Image Diffusion Models
par: Kim, Sanghyun, et autres
Publié: (2024)
par: Kim, Sanghyun, et autres
Publié: (2024)
Apollo: An Exploration of Video Understanding in Large Multimodal Models
par: Zohar, Orr, et autres
Publié: (2024)
par: Zohar, Orr, et autres
Publié: (2024)
Attentive Fine-Grained Structured Sparsity for Image Restoration
par: Oh, Junghun, et autres
Publié: (2022)
par: Oh, Junghun, et autres
Publié: (2022)
VideoICL: Confidence-based Iterative In-context Learning for Out-of-Distribution Video Understanding
par: Kim, Kangsan, et autres
Publié: (2024)
par: Kim, Kangsan, et autres
Publié: (2024)
FineLIP: Extending CLIP's Reach via Fine-Grained Alignment with Longer Text Inputs
par: Asokan, Mothilal, et autres
Publié: (2025)
par: Asokan, Mothilal, et autres
Publié: (2025)
Hierarchical and Multimodal Data for Daily Activity Understanding
par: Kaviani, Ghazal, et autres
Publié: (2025)
par: Kaviani, Ghazal, et autres
Publié: (2025)
VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding
par: Zhang, Zhihong, et autres
Publié: (2025)
par: Zhang, Zhihong, et autres
Publié: (2025)
TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models
par: Yu, Ya-Qi, et autres
Publié: (2024)
par: Yu, Ya-Qi, et autres
Publié: (2024)
Documents similaires
-
Learning Relative Representations for Fine-Grained Multimodal Alignment with Limited Data
par: Kim, Shiwon, et autres
Publié: (2026) -
VideoComp: Advancing Fine-Grained Compositional and Temporal Alignment in Video-Text Models
par: Kim, Dahun, et autres
Publié: (2025) -
SyCoCa: Symmetrizing Contrastive Captioners with Attentive Masking for Multimodal Alignment
par: Ma, Ziping, et autres
Publié: (2024) -
COHERENCE: Benchmarking Fine-Grained Image-Text Alignment in Interleaved Multimodal Contexts
par: Wang, Bingli, et autres
Publié: (2026) -
Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models
par: Jiang, Jiachen, et autres
Publié: (2025)