Saved in:
| Main Authors: | Maier, James, Mohankumar, Nishanth |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2405.16382 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Unifying Specialized Visual Encoders for Video Language Models
by: Chung, Jihoon, et al.
Published: (2025)
by: Chung, Jihoon, et al.
Published: (2025)
Contextual Encoder-Decoder Network for Visual Saliency Prediction
by: Kroner, Alexander, et al.
Published: (2019)
by: Kroner, Alexander, et al.
Published: (2019)
VideoPrism: A Foundational Visual Encoder for Video Understanding
by: Zhao, Long, et al.
Published: (2024)
by: Zhao, Long, et al.
Published: (2024)
Visual Environment Assessment for Safe Autonomous Quadrotor Landing
by: Secchiero, Mattia, et al.
Published: (2023)
by: Secchiero, Mattia, et al.
Published: (2023)
Video-Panda: Parameter-efficient Alignment for Encoder-free Video-Language Models
by: Yi, Jinhui, et al.
Published: (2024)
by: Yi, Jinhui, et al.
Published: (2024)
VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding
by: Maaz, Muhammad, et al.
Published: (2024)
by: Maaz, Muhammad, et al.
Published: (2024)
CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder
by: Ma, Lichen, et al.
Published: (2024)
by: Ma, Lichen, et al.
Published: (2024)
G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models
by: Li, Junxian, et al.
Published: (2026)
by: Li, Junxian, et al.
Published: (2026)
AlignTok: Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models
by: Chen, Bowei, et al.
Published: (2025)
by: Chen, Bowei, et al.
Published: (2025)
Attention Based Encoder Decoder Model for Video Captioning in Nepali (2023)
by: Parajuli, Kabita, et al.
Published: (2023)
by: Parajuli, Kabita, et al.
Published: (2023)
OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning
by: Liu, Yanqing, et al.
Published: (2025)
by: Liu, Yanqing, et al.
Published: (2025)
Rethinking the Mixture of Vision Encoders Paradigm for Enhanced Visual Understanding in Multimodal LLMs
by: Azadani, Mozhgan Nasr, et al.
Published: (2025)
by: Azadani, Mozhgan Nasr, et al.
Published: (2025)
Beyond the Encoder: Joint Encoder-Decoder Contrastive Pre-Training Improves Dense Prediction
by: Quetin, Sébastien, et al.
Published: (2025)
by: Quetin, Sébastien, et al.
Published: (2025)
ConvLLaVA: Hierarchical Backbones as Visual Encoder for Large Multimodal Models
by: Ge, Chunjiang, et al.
Published: (2024)
by: Ge, Chunjiang, et al.
Published: (2024)
Text-Audio-Visual-conditioned Diffusion Model for Video Saliency Prediction
by: Yu, Li, et al.
Published: (2025)
by: Yu, Li, et al.
Published: (2025)
3D Gaussian Point Encoders
by: James, Jim, et al.
Published: (2025)
by: James, Jim, et al.
Published: (2025)
Breaking the Encoder Barrier for Seamless Video-Language Understanding
by: Li, Handong, et al.
Published: (2025)
by: Li, Handong, et al.
Published: (2025)
From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models
by: Jiang, Dongsheng, et al.
Published: (2023)
by: Jiang, Dongsheng, et al.
Published: (2023)
Recognition of Abnormal Events in Surveillance Videos using Weakly Supervised Dual-Encoder Models
by: Tsfaty, Noam, et al.
Published: (2025)
by: Tsfaty, Noam, et al.
Published: (2025)
Encoder-Decoder Based Long Short-Term Memory (LSTM) Model for Video Captioning
by: Adewale, Sikiru, et al.
Published: (2023)
by: Adewale, Sikiru, et al.
Published: (2023)
Effortless Vision-Language Model Specialization in Histopathology without Annotation
by: Qiu, Jingna, et al.
Published: (2025)
by: Qiu, Jingna, et al.
Published: (2025)
One Layer Is Enough: Adapting Pretrained Visual Encoders for Image Generation
by: Gao, Yuan, et al.
Published: (2025)
by: Gao, Yuan, et al.
Published: (2025)
Knowing When Not to Answer: Evaluating Abstention in Multimodal Reasoning Systems
by: Madhusudhan, Nishanth, et al.
Published: (2026)
by: Madhusudhan, Nishanth, et al.
Published: (2026)
Dale meets Langevin: A Multiplicative Denoising Diffusion Model
by: Shetty, Nishanth, et al.
Published: (2025)
by: Shetty, Nishanth, et al.
Published: (2025)
Enhancing Lip Reading with Multi-Scale Video and Multi-Encoder
by: Wang, He, et al.
Published: (2024)
by: Wang, He, et al.
Published: (2024)
Efficient Reinforcement Learning Through Adaptively Pretrained Visual Encoder
by: Zhang, Yuhan, et al.
Published: (2025)
by: Zhang, Yuhan, et al.
Published: (2025)
Image Generation with a Sphere Encoder
by: Yue, Kaiyu, et al.
Published: (2026)
by: Yue, Kaiyu, et al.
Published: (2026)
Visual Prompt Engineering for Vision Language Models in Radiology
by: Denner, Stefan, et al.
Published: (2024)
by: Denner, Stefan, et al.
Published: (2024)
GSE: Evaluating Sticker Visual Semantic Similarity via a General Sticker Encoder
by: Chee, Heng Er Metilda, et al.
Published: (2025)
by: Chee, Heng Er Metilda, et al.
Published: (2025)
Video Generation with Predictive Latents
by: Zhao, Yian, et al.
Published: (2026)
by: Zhao, Yian, et al.
Published: (2026)
Visual Encoders for Data-Efficient Imitation Learning in Modern Video Games
by: Schäfer, Lukas, et al.
Published: (2023)
by: Schäfer, Lukas, et al.
Published: (2023)
VII: Visual Instruction Injection for Jailbreaking Image-to-Video Generation Models
by: Zheng, Bowen, et al.
Published: (2026)
by: Zheng, Bowen, et al.
Published: (2026)
Leveraging Pre-Trained Visual Models for AI-Generated Video Detection
by: Veeramachaneni, Keerthi, et al.
Published: (2025)
by: Veeramachaneni, Keerthi, et al.
Published: (2025)
Zero-shot Prompt-based Video Encoder for Surgical Gesture Recognition
by: Rao, Mingxing, et al.
Published: (2024)
by: Rao, Mingxing, et al.
Published: (2024)
Omni-Attribute: Open-vocabulary Attribute Encoder for Visual Concept Personalization
by: Chen, Tsai-Shien, et al.
Published: (2025)
by: Chen, Tsai-Shien, et al.
Published: (2025)
Relevance-guided Audio Visual Fusion for Video Saliency Prediction
by: Yu, Li, et al.
Published: (2024)
by: Yu, Li, et al.
Published: (2024)
Fusion to Enhance: Fusion Visual Encoder to Enhance Multimodal Language Model
by: She, Yifei, et al.
Published: (2025)
by: She, Yifei, et al.
Published: (2025)
Unified Multimodal Models as Auto-Encoders
by: Yan, Zhiyuan, et al.
Published: (2025)
by: Yan, Zhiyuan, et al.
Published: (2025)
VENI: Variational Encoder for Natural Illumination
by: Walker, Paul, et al.
Published: (2026)
by: Walker, Paul, et al.
Published: (2026)
From Visual to Multimodal: Systematic Ablation of Encoders and Fusion Strategies in Animal Identification
by: Kudryavtsev, Vasiliy, et al.
Published: (2026)
by: Kudryavtsev, Vasiliy, et al.
Published: (2026)
Similar Items
-
Unifying Specialized Visual Encoders for Video Language Models
by: Chung, Jihoon, et al.
Published: (2025) -
Contextual Encoder-Decoder Network for Visual Saliency Prediction
by: Kroner, Alexander, et al.
Published: (2019) -
VideoPrism: A Foundational Visual Encoder for Video Understanding
by: Zhao, Long, et al.
Published: (2024) -
Visual Environment Assessment for Safe Autonomous Quadrotor Landing
by: Secchiero, Mattia, et al.
Published: (2023) -
Video-Panda: Parameter-efficient Alignment for Encoder-free Video-Language Models
by: Yi, Jinhui, et al.
Published: (2024)