Hierarchical Banzhaf Interaction for General Video-Language Representation Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Jin, Peng, Li, Hao, Yuan, Li, Yan, Shuicheng, Chen, Jie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Enhancing Video-Language Representations with Structural Spatio-Temporal Alignment
di: Fei, Hao, et al.
Pubblicazione: (2024)
di: Fei, Hao, et al.
Pubblicazione: (2024)
MOST: Motion Diffusion Model for Rare Text via Temporal Clip Banzhaf Interaction
di: Wang, Yin, et al.
Pubblicazione: (2025)
di: Wang, Yin, et al.
Pubblicazione: (2025)
Explaining Similarity in Vision-Language Encoders with Weighted Banzhaf Interactions
di: Baniecki, Hubert, et al.
Pubblicazione: (2025)
di: Baniecki, Hubert, et al.
Pubblicazione: (2025)
MoH: Multi-Head Attention as Mixture-of-Head Attention
di: Jin, Peng, et al.
Pubblicazione: (2024)
di: Jin, Peng, et al.
Pubblicazione: (2024)
Hierarchical Action Recognition: A Contrastive Video-Language Approach with Hierarchical Interactions
di: Zhang, Rui, et al.
Pubblicazione: (2024)
di: Zhang, Rui, et al.
Pubblicazione: (2024)
Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding
di: Jin, Peng, et al.
Pubblicazione: (2023)
di: Jin, Peng, et al.
Pubblicazione: (2023)
OphCLIP: Hierarchical Retrieval-Augmented Learning for Ophthalmic Surgical Video-Language Pretraining
di: Hu, Ming, et al.
Pubblicazione: (2024)
di: Hu, Ming, et al.
Pubblicazione: (2024)
Open-world Hand-Object Interaction Video Generation Based on Structure and Contact-aware Representation
di: Yan, Haodong, et al.
Pubblicazione: (2025)
di: Yan, Haodong, et al.
Pubblicazione: (2025)
Video-LLaVA: Learning United Visual Representation by Alignment Before Projection
di: Lin, Bin, et al.
Pubblicazione: (2023)
di: Lin, Bin, et al.
Pubblicazione: (2023)
DVIS-DAQ: Improving Video Segmentation via Dynamic Anchor Queries
di: Zhou, Yikang, et al.
Pubblicazione: (2024)
di: Zhou, Yikang, et al.
Pubblicazione: (2024)
Hierarchical Compositional Representations for Few-shot Action Recognition
di: Li, Changzhen, et al.
Pubblicazione: (2022)
di: Li, Changzhen, et al.
Pubblicazione: (2022)
Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency
di: Li, Hongyu, et al.
Pubblicazione: (2025)
di: Li, Hongyu, et al.
Pubblicazione: (2025)
Generative Video Compression with One-Dimensional Latent Representation
di: Zheng, Zihan, et al.
Pubblicazione: (2026)
di: Zheng, Zihan, et al.
Pubblicazione: (2026)
BIMM: Brain Inspired Masked Modeling for Video Representation Learning
di: Wan, Zhifan, et al.
Pubblicazione: (2024)
di: Wan, Zhifan, et al.
Pubblicazione: (2024)
Learning from Next-Frame Prediction: Autoregressive Video Modeling Encodes Effective Representations
di: Li, Jinghan, et al.
Pubblicazione: (2025)
di: Li, Jinghan, et al.
Pubblicazione: (2025)
Language-Guided Graph Representation Learning for Video Summarization
di: Li, Wenrui, et al.
Pubblicazione: (2025)
di: Li, Wenrui, et al.
Pubblicazione: (2025)
On Representation Learning with Feedback
di: Li, Hao
Pubblicazione: (2022)
di: Li, Hao
Pubblicazione: (2022)
DGMamba: Domain Generalization via Generalized State Space Model
di: Long, Shaocong, et al.
Pubblicazione: (2024)
di: Long, Shaocong, et al.
Pubblicazione: (2024)
Interactive Face Video Coding: A Generative Compression Framework
di: Chen, Bolin, et al.
Pubblicazione: (2023)
di: Chen, Bolin, et al.
Pubblicazione: (2023)
PointDGRWKV: Generalizing RWKV-like Architecture to Unseen Domains for Point Cloud Classification
di: Yang, Hao, et al.
Pubblicazione: (2025)
di: Yang, Hao, et al.
Pubblicazione: (2025)
Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models
di: Chen, Yuxiao, et al.
Pubblicazione: (2026)
di: Chen, Yuxiao, et al.
Pubblicazione: (2026)
Improving Hierarchical Representations of Vectorized HD Maps with Perspective Clues
di: Zhang, Chi, et al.
Pubblicazione: (2024)
di: Zhang, Chi, et al.
Pubblicazione: (2024)
Focus-to-Perceive Representation Learning: A Cognition-Inspired Hierarchical Framework for Endoscopic Video Analysis
di: Zhang, Yuan, et al.
Pubblicazione: (2026)
di: Zhang, Yuan, et al.
Pubblicazione: (2026)
PointDGMamba: Domain Generalization of Point Cloud Classification via Generalized State Space Model
di: Yang, Hao, et al.
Pubblicazione: (2024)
di: Yang, Hao, et al.
Pubblicazione: (2024)
Local Action-Guided Motion Diffusion Model for Text-to-Motion Generation
di: Jin, Peng, et al.
Pubblicazione: (2024)
di: Jin, Peng, et al.
Pubblicazione: (2024)
Instance Brownian Bridge as Texts for Open-vocabulary Video Instance Segmentation
di: Cheng, Zesen, et al.
Pubblicazione: (2024)
di: Cheng, Zesen, et al.
Pubblicazione: (2024)
Learning Streaming Video Representation via Multitask Training
di: Yan, Yibin, et al.
Pubblicazione: (2025)
di: Yan, Yibin, et al.
Pubblicazione: (2025)
VRAG: Learning World Models for Interactive Video Generation
di: Chen, Taiye, et al.
Pubblicazione: (2025)
di: Chen, Taiye, et al.
Pubblicazione: (2025)
MEMO: Memory-Guided Diffusion for Expressive Talking Video Generation
di: Zheng, Longtao, et al.
Pubblicazione: (2024)
di: Zheng, Longtao, et al.
Pubblicazione: (2024)
PROMISE: Prompt-Attentive Hierarchical Contrastive Learning for Robust Cross-Modal Representation with Missing Modalities
di: Chen, Jiajun, et al.
Pubblicazione: (2025)
di: Chen, Jiajun, et al.
Pubblicazione: (2025)
HINT: Hierarchical Interaction Modeling for Autoregressive Multi-Human Motion Generation
di: Liu, Mengge, et al.
Pubblicazione: (2026)
di: Liu, Mengge, et al.
Pubblicazione: (2026)
DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation
di: Chen, Junhao, et al.
Pubblicazione: (2025)
di: Chen, Junhao, et al.
Pubblicazione: (2025)
Video Compression with Hierarchical Temporal Neural Representation
di: Zhu, Jun, et al.
Pubblicazione: (2026)
di: Zhu, Jun, et al.
Pubblicazione: (2026)
Reason3D: Searching and Reasoning 3D Segmentation via Large Language Model
di: Huang, Kuan-Chih, et al.
Pubblicazione: (2024)
di: Huang, Kuan-Chih, et al.
Pubblicazione: (2024)
Unlocking Exocentric Video-Language Data for Egocentric Video Representation Learning
di: Dou, Zi-Yi, et al.
Pubblicazione: (2024)
di: Dou, Zi-Yi, et al.
Pubblicazione: (2024)
OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding
di: Zhang, Tao, et al.
Pubblicazione: (2024)
di: Zhang, Tao, et al.
Pubblicazione: (2024)
Aggregated Structural Representation with Large Language Models for Human-Centric Layout Generation
di: Jin, Jiongchao, et al.
Pubblicazione: (2025)
di: Jin, Jiongchao, et al.
Pubblicazione: (2025)
DeCo-VAE: Learning Compact Latents for Video Reconstruction via Decoupled Representation
di: Yin, Xiangchen, et al.
Pubblicazione: (2025)
di: Yin, Xiangchen, et al.
Pubblicazione: (2025)
Implicit Neural Representation for Video Restoration
di: Aiyetigbo, Mary, et al.
Pubblicazione: (2025)
di: Aiyetigbo, Mary, et al.
Pubblicazione: (2025)
Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking
di: Wu, Shengqiong, et al.
Pubblicazione: (2026)
di: Wu, Shengqiong, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Enhancing Video-Language Representations with Structural Spatio-Temporal Alignment
di: Fei, Hao, et al.
Pubblicazione: (2024) -
MOST: Motion Diffusion Model for Rare Text via Temporal Clip Banzhaf Interaction
di: Wang, Yin, et al.
Pubblicazione: (2025) -
Explaining Similarity in Vision-Language Encoders with Weighted Banzhaf Interactions
di: Baniecki, Hubert, et al.
Pubblicazione: (2025) -
MoH: Multi-Head Attention as Mixture-of-Head Attention
di: Jin, Peng, et al.
Pubblicazione: (2024) -
Hierarchical Action Recognition: A Contrastive Video-Language Approach with Hierarchical Interactions
di: Zhang, Rui, et al.
Pubblicazione: (2024)