Vision Transformers with Natural Language Semantics
Fuente:
arXiv
Guardado en:
| Autores principales: | Kim, Young Kyung, Di Martino, J. Matías, Sapiro, Guillermo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Chain-of-Image Generation: Toward Monitorable and Controllable Image Generation
por: Kim, Young Kyung, et al.
Publicado: (2025)
por: Kim, Young Kyung, et al.
Publicado: (2025)
SPOT: Sparsification with Attention Dynamics via Token Relevance in Vision Transformers
por: Schlesinger, Oded, et al.
Publicado: (2025)
por: Schlesinger, Oded, et al.
Publicado: (2025)
M2P: Improving Visual Foundation Models with Mask-to-Point Weakly-Supervised Learning for Dense Point Tracking
por: Wu, Qiangqiang, et al.
Publicado: (2026)
por: Wu, Qiangqiang, et al.
Publicado: (2026)
MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers
por: Bae, Jongseong, et al.
Publicado: (2024)
por: Bae, Jongseong, et al.
Publicado: (2024)
Superpixel Tokenization for Vision Transformers: Preserving Semantic Integrity in Visual Tokens
por: Lew, Jaihyun, et al.
Publicado: (2024)
por: Lew, Jaihyun, et al.
Publicado: (2024)
Uncertainty-guided Compositional Alignment with Part-to-Whole Semantic Representativeness in Hyperbolic Vision-Language Models
por: Kim, Hayeon, et al.
Publicado: (2026)
por: Kim, Hayeon, et al.
Publicado: (2026)
Semantic-Aware Gaussian Process Calibration with Structured Layerwise Kernels for Deep Neural Networks
por: Lee, Kyung-hwan, et al.
Publicado: (2025)
por: Lee, Kyung-hwan, et al.
Publicado: (2025)
Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling
por: Park, Sungjune, et al.
Publicado: (2025)
por: Park, Sungjune, et al.
Publicado: (2025)
ESREAL: Exploiting Semantic Reconstruction to Mitigate Hallucinations in Vision-Language Models
por: Kim, Minchan, et al.
Publicado: (2024)
por: Kim, Minchan, et al.
Publicado: (2024)
Markerless Head Tracking for Accurate and Accessible Neuronavigation
por: Xie, Ziye, et al.
Publicado: (2026)
por: Xie, Ziye, et al.
Publicado: (2026)
Distilling Vision-Language Pretraining for Efficient Cross-Modal Retrieval
por: Jang, Young Kyun, et al.
Publicado: (2024)
por: Jang, Young Kyun, et al.
Publicado: (2024)
Brain Mapping with Dense Features: Grounding Cortical Semantic Selectivity in Natural Images With Vision Transformers
por: Luo, Andrew F., et al.
Publicado: (2024)
por: Luo, Andrew F., et al.
Publicado: (2024)
Vision Transformers: From Semantic Segmentation to Dense Prediction
por: Zhang, Li, et al.
Publicado: (2022)
por: Zhang, Li, et al.
Publicado: (2022)
VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models
por: Ju, Jeongho, et al.
Publicado: (2024)
por: Ju, Jeongho, et al.
Publicado: (2024)
Semantic Alignment and Reinforcement for Data-Free Quantization of Vision Transformers
por: Zhong, Yunshan, et al.
Publicado: (2024)
por: Zhong, Yunshan, et al.
Publicado: (2024)
On Efficient Language and Vision Assistants for Visually-Situated Natural Language Understanding: What Matters in Reading and Reasoning
por: Kim, Geewook, et al.
Publicado: (2024)
por: Kim, Geewook, et al.
Publicado: (2024)
Plan-X: Instruct Video Generation via Semantic Planning
por: Huang, Lun, et al.
Publicado: (2025)
por: Huang, Lun, et al.
Publicado: (2025)
SurgCheck: Do Vision-Language Models Really Look at Images in Surgical VQA?
por: Shin, Jongmin, et al.
Publicado: (2026)
por: Shin, Jongmin, et al.
Publicado: (2026)
VL-OrdinalFormer: Vision Language Guided Ordinal Transformers for Interpretable Knee Osteoarthritis Grading
por: Ullah, Zahid, et al.
Publicado: (2025)
por: Ullah, Zahid, et al.
Publicado: (2025)
DA-VPT: Semantic-Guided Visual Prompt Tuning for Vision Transformers
por: Ren, Li, et al.
Publicado: (2025)
por: Ren, Li, et al.
Publicado: (2025)
Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks
por: Chengyu, Jia, et al.
Publicado: (2026)
por: Chengyu, Jia, et al.
Publicado: (2026)
Semantic-Aware Ship Detection with Vision-Language Integration
por: Li, Jiahao, et al.
Publicado: (2025)
por: Li, Jiahao, et al.
Publicado: (2025)
Unleashing Vision-Language Semantics for Deepfake Video Detection
por: Zhu, Jiawen, et al.
Publicado: (2026)
por: Zhu, Jiawen, et al.
Publicado: (2026)
Semantically Grounded QFormer for Efficient Vision Language Understanding
por: Choraria, Moulik, et al.
Publicado: (2023)
por: Choraria, Moulik, et al.
Publicado: (2023)
Transforming Vision Transformer: Towards Efficient Multi-Task Asynchronous Learning
por: Zhong, Hanwen, et al.
Publicado: (2025)
por: Zhong, Hanwen, et al.
Publicado: (2025)
Semantic Alignment of Unimodal Medical Text and Vision Representations
por: Di Folco, Maxime, et al.
Publicado: (2025)
por: Di Folco, Maxime, et al.
Publicado: (2025)
ConSept: Continual Semantic Segmentation via Adapter-based Vision Transformer
por: Dong, Bowen, et al.
Publicado: (2024)
por: Dong, Bowen, et al.
Publicado: (2024)
Adapting Vision Transformers to Ultra-High Resolution Semantic Segmentation with Relay Tokens
por: Perron, Yohann, et al.
Publicado: (2026)
por: Perron, Yohann, et al.
Publicado: (2026)
WeakTr: Exploring Plain Vision Transformer for Weakly-supervised Semantic Segmentation
por: Zhu, Lianghui, et al.
Publicado: (2023)
por: Zhu, Lianghui, et al.
Publicado: (2023)
Exploring Token-Level Augmentation in Vision Transformer for Semi-Supervised Semantic Segmentation
por: Zhang, Dengke, et al.
Publicado: (2025)
por: Zhang, Dengke, et al.
Publicado: (2025)
Intriguing Properties of Large Language and Vision Models
por: Lee, Young-Jun, et al.
Publicado: (2024)
por: Lee, Young-Jun, et al.
Publicado: (2024)
Learning Correlation Structures for Vision Transformers
por: Kim, Manjin, et al.
Publicado: (2024)
por: Kim, Manjin, et al.
Publicado: (2024)
Representation Separation for Semantic Segmentation with Vision Transformers
por: Hong, Yuanduo, et al.
Publicado: (2022)
por: Hong, Yuanduo, et al.
Publicado: (2022)
GLASS: Graph and Vision-Language Assisted Semantic Shape Correspondence
por: Xiao, Qinfeng, et al.
Publicado: (2026)
por: Xiao, Qinfeng, et al.
Publicado: (2026)
SemPT: Semantic Prompt Tuning for Vision-Language Models
por: Shi, Xiao, et al.
Publicado: (2025)
por: Shi, Xiao, et al.
Publicado: (2025)
SIF: Semantically In-Distribution Fingerprints for Large Vision-Language Models
por: Zhao, Yifei, et al.
Publicado: (2026)
por: Zhao, Yifei, et al.
Publicado: (2026)
Semantic Misalignment in Vision-Language Models under Perceptual Degradation
por: Cheng, Guo
Publicado: (2026)
por: Cheng, Guo
Publicado: (2026)
Beyond Semantics: Rediscovering Spatial Awareness in Vision-Language Models
por: Qi, Jianing, et al.
Publicado: (2025)
por: Qi, Jianing, et al.
Publicado: (2025)
See-Saw Modality Balance: See Gradient, and Sew Impaired Vision-Language Balance to Mitigate Dominant Modality Bias
por: Kwon, JuneHyoung, et al.
Publicado: (2025)
por: Kwon, JuneHyoung, et al.
Publicado: (2025)
Can 3D Vision-Language Models Truly Understand Natural Language?
por: Deng, Weipeng, et al.
Publicado: (2024)
por: Deng, Weipeng, et al.
Publicado: (2024)
Ejemplares similares
-
Chain-of-Image Generation: Toward Monitorable and Controllable Image Generation
por: Kim, Young Kyung, et al.
Publicado: (2025) -
SPOT: Sparsification with Attention Dynamics via Token Relevance in Vision Transformers
por: Schlesinger, Oded, et al.
Publicado: (2025) -
M2P: Improving Visual Foundation Models with Mask-to-Point Weakly-Supervised Learning for Dense Point Tracking
por: Wu, Qiangqiang, et al.
Publicado: (2026) -
MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers
por: Bae, Jongseong, et al.
Publicado: (2024) -
Superpixel Tokenization for Vision Transformers: Preserving Semantic Integrity in Visual Tokens
por: Lew, Jaihyun, et al.
Publicado: (2024)