Frozen Transformers in Language Models Are Effective Visual Encoder Layers
Fuente:
arXiv
Guardado en:
| Autores principales: | Pang, Ziqi, Xie, Ziyang, Man, Yunze, Wang, Yu-Xiong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Situational Awareness Matters in 3D Vision Language Reasoning
por: Man, Yunze, et al.
Publicado: (2024)
por: Man, Yunze, et al.
Publicado: (2024)
PPTArena: A Benchmark for Agentic PowerPoint Editing
por: Ofengenden, Michael, et al.
Publicado: (2025)
por: Ofengenden, Michael, et al.
Publicado: (2025)
Lexicon3D: Probing Visual Foundation Models for Complex 3D Scene Understanding
por: Man, Yunze, et al.
Publicado: (2024)
por: Man, Yunze, et al.
Publicado: (2024)
RandAR: Decoder-only Autoregressive Visual Generation in Random Orders
por: Pang, Ziqi, et al.
Publicado: (2024)
por: Pang, Ziqi, et al.
Publicado: (2024)
Can Visual Encoder Learn to See Arrows?
por: Terashita, Naoyuki, et al.
Publicado: (2025)
por: Terashita, Naoyuki, et al.
Publicado: (2025)
CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models
por: Tang, Zicong, et al.
Publicado: (2025)
por: Tang, Zicong, et al.
Publicado: (2025)
Imperfect Vision Encoders: Efficient and Robust Tuning for Vision-Language Models
por: Panos, Aristeidis, et al.
Publicado: (2024)
por: Panos, Aristeidis, et al.
Publicado: (2024)
Renaissance: Investigating the Pretraining of Vision-Language Encoders
por: Fields, Clayton, et al.
Publicado: (2024)
por: Fields, Clayton, et al.
Publicado: (2024)
Do Vision and Language Encoders Represent the World Similarly?
por: Maniparambil, Mayug, et al.
Publicado: (2024)
por: Maniparambil, Mayug, et al.
Publicado: (2024)
UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation
por: Lin, Bin, et al.
Publicado: (2025)
por: Lin, Bin, et al.
Publicado: (2025)
Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective
por: Ma, Xiaorui, et al.
Publicado: (2025)
por: Ma, Xiaorui, et al.
Publicado: (2025)
PaintScene4D: Consistent 4D Scene Generation from Text Prompts
por: Gupta, Vinayak, et al.
Publicado: (2024)
por: Gupta, Vinayak, et al.
Publicado: (2024)
Evaluation Agent: Efficient and Promptable Evaluation Framework for Visual Generative Models
por: Zhang, Fan, et al.
Publicado: (2024)
por: Zhang, Fan, et al.
Publicado: (2024)
Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models
por: Zhou, Andy, et al.
Publicado: (2023)
por: Zhou, Andy, et al.
Publicado: (2023)
Impact of Layer Norm on Memorization and Generalization in Transformers
por: Singhal, Rishi, et al.
Publicado: (2025)
por: Singhal, Rishi, et al.
Publicado: (2025)
Explainable AI: Context-Aware Layer-Wise Integrated Gradients for Explaining Transformer Models
por: Mersha, Melkamu Abay, et al.
Publicado: (2026)
por: Mersha, Melkamu Abay, et al.
Publicado: (2026)
MouSi: Poly-Visual-Expert Vision-Language Models
por: Fan, Xiaoran, et al.
Publicado: (2024)
por: Fan, Xiaoran, et al.
Publicado: (2024)
Universal Approximation of Visual Autoregressive Transformers
por: Chen, Yifang, et al.
Publicado: (2025)
por: Chen, Yifang, et al.
Publicado: (2025)
Visual Question Decomposition on Multimodal Large Language Models
por: Zhang, Haowei, et al.
Publicado: (2024)
por: Zhang, Haowei, et al.
Publicado: (2024)
FlashVID: Efficient Video Large Language Models via Training-free Tree-based Spatiotemporal Token Merging
por: Fan, Ziyang, et al.
Publicado: (2026)
por: Fan, Ziyang, et al.
Publicado: (2026)
InstructG2I: Synthesizing Images from Multimodal Attributed Graphs
por: Jin, Bowen, et al.
Publicado: (2024)
por: Jin, Bowen, et al.
Publicado: (2024)
MLLMs-Augmented Visual-Language Representation Learning
por: Liu, Yanqing, et al.
Publicado: (2023)
por: Liu, Yanqing, et al.
Publicado: (2023)
Why are Visually-Grounded Language Models Bad at Image Classification?
por: Zhang, Yuhui, et al.
Publicado: (2024)
por: Zhang, Yuhui, et al.
Publicado: (2024)
Towards Visual Text Grounding of Multimodal Large Language Model
por: Li, Ming, et al.
Publicado: (2025)
por: Li, Ming, et al.
Publicado: (2025)
AttnLRP: Attention-Aware Layer-Wise Relevance Propagation for Transformers
por: Achtibat, Reduan, et al.
Publicado: (2024)
por: Achtibat, Reduan, et al.
Publicado: (2024)
EGA: Adapting Frozen Encoders for Vector Search with Bounded Out-of-Distribution Degradation
por: Zhao, Dongfang
Publicado: (2026)
por: Zhao, Dongfang
Publicado: (2026)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
por: Wang, Xiyao, et al.
Publicado: (2024)
por: Wang, Xiyao, et al.
Publicado: (2024)
Transformers are Stateless Differentiable Neural Computers
por: Tang, Bo, et al.
Publicado: (2026)
por: Tang, Bo, et al.
Publicado: (2026)
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
por: Prasad, Archiki, et al.
Publicado: (2023)
por: Prasad, Archiki, et al.
Publicado: (2023)
ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
por: Lee, Jewon, et al.
Publicado: (2025)
por: Lee, Jewon, et al.
Publicado: (2025)
Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis
por: Nagar, Aishik, et al.
Publicado: (2024)
por: Nagar, Aishik, et al.
Publicado: (2024)
Pre-trained Vision-Language Models Learn Discoverable Visual Concepts
por: Zang, Yuan, et al.
Publicado: (2024)
por: Zang, Yuan, et al.
Publicado: (2024)
Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models
por: Ma, Chuofan, et al.
Publicado: (2024)
por: Ma, Chuofan, et al.
Publicado: (2024)
Rethinking Visual Prompting for Multimodal Large Language Models with External Knowledge
por: Lin, Yuanze, et al.
Publicado: (2024)
por: Lin, Yuanze, et al.
Publicado: (2024)
Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models
por: Karamcheti, Siddharth, et al.
Publicado: (2024)
por: Karamcheti, Siddharth, et al.
Publicado: (2024)
ECoFLaP: Efficient Coarse-to-Fine Layer-Wise Pruning for Vision-Language Models
por: Sung, Yi-Lin, et al.
Publicado: (2023)
por: Sung, Yi-Lin, et al.
Publicado: (2023)
Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models
por: Zeng, Yu, et al.
Publicado: (2026)
por: Zeng, Yu, et al.
Publicado: (2026)
Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models
por: Xiong, Guangzhi, et al.
Publicado: (2026)
por: Xiong, Guangzhi, et al.
Publicado: (2026)
Analyzing The Language of Visual Tokens
por: Chan, David M., et al.
Publicado: (2024)
por: Chan, David M., et al.
Publicado: (2024)
AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition
por: Lin, Zichuan, et al.
Publicado: (2025)
por: Lin, Zichuan, et al.
Publicado: (2025)
Ejemplares similares
-
Situational Awareness Matters in 3D Vision Language Reasoning
por: Man, Yunze, et al.
Publicado: (2024) -
PPTArena: A Benchmark for Agentic PowerPoint Editing
por: Ofengenden, Michael, et al.
Publicado: (2025) -
Lexicon3D: Probing Visual Foundation Models for Complex 3D Scene Understanding
por: Man, Yunze, et al.
Publicado: (2024) -
RandAR: Decoder-only Autoregressive Visual Generation in Random Orders
por: Pang, Ziqi, et al.
Publicado: (2024) -
Can Visual Encoder Learn to See Arrows?
por: Terashita, Naoyuki, et al.
Publicado: (2025)