Bridging Vision and Language Spaces with Assignment Prediction
Fuente:
arXiv
Guardado en:
| Autores principales: | Park, Jungin, Lee, Jiyoung, Sohn, Kwanghoon |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Saliency-Aware Model Merging
por: Park, Jungin, et al.
Publicado: (2026)
por: Park, Jungin, et al.
Publicado: (2026)
PointFix: Learning to Fix Domain Bias for Robust Online Stereo Adaptation
por: Kim, Kwonyoung, et al.
Publicado: (2022)
por: Kim, Kwonyoung, et al.
Publicado: (2022)
Language-guided Recursive Spatiotemporal Graph Modeling for Video Summarization
por: Park, Jungin, et al.
Publicado: (2025)
por: Park, Jungin, et al.
Publicado: (2025)
Bootstrap Your Own Views: Masked Ego-Exo Modeling for Fine-grained View-invariant Video Representations
por: Park, Jungin, et al.
Publicado: (2025)
por: Park, Jungin, et al.
Publicado: (2025)
V-LynX: Token Interface Alignment for Video+X LLMs
por: Park, Jungin, et al.
Publicado: (2026)
por: Park, Jungin, et al.
Publicado: (2026)
Rethinking Open-World Semi-Supervised Learning: Distribution Mismatch and Inductive Inference
por: Park, Seongheon, et al.
Publicado: (2024)
por: Park, Seongheon, et al.
Publicado: (2024)
Descriptive Image-Text Matching with Graded Contextual Similarity
por: Jang, Jinhyun, et al.
Publicado: (2025)
por: Jang, Jinhyun, et al.
Publicado: (2025)
Faster Parameter-Efficient Tuning with Token Redundancy Reduction
por: Kim, Kwonyoung, et al.
Publicado: (2025)
por: Kim, Kwonyoung, et al.
Publicado: (2025)
EBDM: Exemplar-guided Image Translation with Brownian-bridge Diffusion Models
por: Lee, Eungbean, et al.
Publicado: (2024)
por: Lee, Eungbean, et al.
Publicado: (2024)
ZIP: An Efficient Zeroth-order Prompt Tuning for Black-box Vision-Language Models
por: Park, Seonghwan, et al.
Publicado: (2025)
por: Park, Seonghwan, et al.
Publicado: (2025)
Bridge the Modality and Capability Gaps in Vision-Language Model Selection
por: Yi, Chao, et al.
Publicado: (2024)
por: Yi, Chao, et al.
Publicado: (2024)
BridgeTower: Building Bridges Between Encoders in Vision-Language Representation Learning
por: Xu, Xiao, et al.
Publicado: (2022)
por: Xu, Xiao, et al.
Publicado: (2022)
A Theoretical Framework for Preventing Class Collapse in Supervised Contrastive Learning
por: Lee, Chungpa, et al.
Publicado: (2025)
por: Lee, Chungpa, et al.
Publicado: (2025)
Bridging Human Oversight and Black-box Driver Assistance: Vision-Language Models for Predictive Alerting in Lane Keeping Assist Systems
por: Wang, Yuhang, et al.
Publicado: (2025)
por: Wang, Yuhang, et al.
Publicado: (2025)
Attention Guided Alignment in Efficient Vision-Language Models
por: Mahajan, Shweta, et al.
Publicado: (2025)
por: Mahajan, Shweta, et al.
Publicado: (2025)
TroL: Traversal of Layers for Large Language and Vision Models
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
Hard Cases Detection in Motion Prediction by Vision-Language Foundation Models
por: Yang, Yi, et al.
Publicado: (2024)
por: Yang, Yi, et al.
Publicado: (2024)
HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction
por: Bao, Chen, et al.
Publicado: (2024)
por: Bao, Chen, et al.
Publicado: (2024)
Right Predictions, Misleading Explanations: On the Vulnerability of Vision-Language Model Explanations
por: Babadi, Narges, et al.
Publicado: (2026)
por: Babadi, Narges, et al.
Publicado: (2026)
Structuring GUI Elements through Vision Language Models: Towards Action Space Generation
por: Xu, Yi, et al.
Publicado: (2025)
por: Xu, Yi, et al.
Publicado: (2025)
Bi-MCQ: Reformulating Vision-Language Alignment for Negation Understanding
por: Kim, Tae Hun, et al.
Publicado: (2026)
por: Kim, Tae Hun, et al.
Publicado: (2026)
Bridging the Modality Gap in Roadside LiDAR: A Training-Free Vision-Language Model Framework for Vehicle Classification
por: Li, Yiqiao, et al.
Publicado: (2026)
por: Li, Yiqiao, et al.
Publicado: (2026)
Test-Time Training for Visual Foresight Vision-Language-Action Models
por: Park, Sangwu, et al.
Publicado: (2026)
por: Park, Sangwu, et al.
Publicado: (2026)
TrajDiffuse: A Conditional Diffusion Model for Environment-Aware Trajectory Prediction
por: Qingze, et al.
Publicado: (2024)
por: Qingze, et al.
Publicado: (2024)
Activation Quantization of Vision Encoders Needs Prefixing Registers
por: Kim, Seunghyeon, et al.
Publicado: (2025)
por: Kim, Seunghyeon, et al.
Publicado: (2025)
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
por: Jie, Shibo, et al.
Publicado: (2024)
por: Jie, Shibo, et al.
Publicado: (2024)
Multimodal Metadata Assignment for Cultural Heritage Artifacts
por: Rei, Luis, et al.
Publicado: (2024)
por: Rei, Luis, et al.
Publicado: (2024)
Concept-skill Transferability-based Data Selection for Large Vision-Language Models
por: Lee, Jaewoo, et al.
Publicado: (2024)
por: Lee, Jaewoo, et al.
Publicado: (2024)
BARD: Bridging AutoRegressive and Diffusion Vision-Language Models Via Highly Efficient Progressive Block Merging and Stage-Wise Distillation
por: Chen, Baoyou, et al.
Publicado: (2026)
por: Chen, Baoyou, et al.
Publicado: (2026)
Bridging Vision Language Models and Symbolic Grounding for Video Question Answering
por: Ma, Haodi, et al.
Publicado: (2025)
por: Ma, Haodi, et al.
Publicado: (2025)
Yo'LLaVA: Your Personalized Language and Vision Assistant
por: Nguyen, Thao, et al.
Publicado: (2024)
por: Nguyen, Thao, et al.
Publicado: (2024)
Do VLMs Need Vision Transformers? Evaluating State Space Models as Vision Encoders
por: Kuo, Shang-Jui Ray, et al.
Publicado: (2026)
por: Kuo, Shang-Jui Ray, et al.
Publicado: (2026)
Breast Cancer VLMs: Clinically Practical Vision-Language Train-Inference Models
por: Zheng, Shunjie-Fabian, et al.
Publicado: (2025)
por: Zheng, Shunjie-Fabian, et al.
Publicado: (2025)
Topological Alignment of Shared Vision-Language Embedding Space
por: You, Junwon, et al.
Publicado: (2025)
por: You, Junwon, et al.
Publicado: (2025)
Transferable Model-agnostic Vision-Language Model Adaptation for Efficient Weak-to-Strong Generalization
por: Park, Jihwan, et al.
Publicado: (2025)
por: Park, Jihwan, et al.
Publicado: (2025)
FRAM: Frobenius-Regularized Assignment Matching with Mixed-Precision Computing
por: Shen, Binrui, et al.
Publicado: (2025)
por: Shen, Binrui, et al.
Publicado: (2025)
Vision Language Models are Biased
por: Vo, An, et al.
Publicado: (2025)
por: Vo, An, et al.
Publicado: (2025)
Rotary Position Embedding for Vision Transformer
por: Heo, Byeongho, et al.
Publicado: (2024)
por: Heo, Byeongho, et al.
Publicado: (2024)
Thermal Vision: Pioneering Non-Invasive Temperature Tracking in Congested Spaces
por: Samal, Arijit, et al.
Publicado: (2024)
por: Samal, Arijit, et al.
Publicado: (2024)
Hear What Matters! Text-conditioned Selective Video-to-Audio Generation
por: Lee, Junwon, et al.
Publicado: (2025)
por: Lee, Junwon, et al.
Publicado: (2025)
Ejemplares similares
-
Saliency-Aware Model Merging
por: Park, Jungin, et al.
Publicado: (2026) -
PointFix: Learning to Fix Domain Bias for Robust Online Stereo Adaptation
por: Kim, Kwonyoung, et al.
Publicado: (2022) -
Language-guided Recursive Spatiotemporal Graph Modeling for Video Summarization
por: Park, Jungin, et al.
Publicado: (2025) -
Bootstrap Your Own Views: Masked Ego-Exo Modeling for Fine-grained View-invariant Video Representations
por: Park, Jungin, et al.
Publicado: (2025) -
V-LynX: Token Interface Alignment for Video+X LLMs
por: Park, Jungin, et al.
Publicado: (2026)