Unified Attention Modeling for Efficient Free-Viewing and Visual Search via Shared Representations
Fuente:
arXiv
Salvato in:
| Autori principali: | Mohammed, Fatma Youssef, Alexis, Kostas |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Birds of a Feather Flock Together: Background-Invariant Representations via Linear Structure in VLMs
di: Zaazou, Youssef, et al.
Pubblicazione: (2026)
di: Zaazou, Youssef, et al.
Pubblicazione: (2026)
Efficient-LVSM: Faster, Cheaper, and Better Large View Synthesis Model via Decoupled Co-Refinement Attention
di: Jia, Xiaosong, et al.
Pubblicazione: (2026)
di: Jia, Xiaosong, et al.
Pubblicazione: (2026)
Unified Panoramic Geometry Estimation via Multi-View Foundation Models
di: Bozic, Vukasin, et al.
Pubblicazione: (2026)
di: Bozic, Vukasin, et al.
Pubblicazione: (2026)
Next Best View Selections for Semantic and Dynamic 3D Gaussian Splatting
di: Li, Yiqian, et al.
Pubblicazione: (2025)
di: Li, Yiqian, et al.
Pubblicazione: (2025)
Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding
di: Luo, Bingjun, et al.
Pubblicazione: (2026)
di: Luo, Bingjun, et al.
Pubblicazione: (2026)
DuoFormer: Leveraging Hierarchical Visual Representations by Local and Global Attention
di: Tang, Xiaoya, et al.
Pubblicazione: (2024)
di: Tang, Xiaoya, et al.
Pubblicazione: (2024)
UNO: Unifying One-stage Video Scene Graph Generation via Object-Centric Visual Representation Learning
di: Le, Huy, et al.
Pubblicazione: (2025)
di: Le, Huy, et al.
Pubblicazione: (2025)
Flexiffusion: Training-Free Segment-Wise Neural Architecture Search for Efficient Diffusion Models
di: Huang, Hongtao, et al.
Pubblicazione: (2025)
di: Huang, Hongtao, et al.
Pubblicazione: (2025)
A Unified View of Abstract Visual Reasoning Problems
di: Małkiński, Mikołaj, et al.
Pubblicazione: (2024)
di: Małkiński, Mikołaj, et al.
Pubblicazione: (2024)
Modelling Visual Semantics via Image Captioning to extract Enhanced Multi-Level Cross-Modal Semantic Incongruity Representation with Attention for Multimodal Sarcasm Detection
di: Aggarwal, Sajal, et al.
Pubblicazione: (2024)
di: Aggarwal, Sajal, et al.
Pubblicazione: (2024)
CarFormer: Self-Driving with Learned Object-Centric Representations
di: Hamdan, Shadi, et al.
Pubblicazione: (2024)
di: Hamdan, Shadi, et al.
Pubblicazione: (2024)
RealGeneral: Unifying Visual Generation via Temporal In-Context Learning with Video Models
di: Lin, Yijing, et al.
Pubblicazione: (2025)
di: Lin, Yijing, et al.
Pubblicazione: (2025)
Human Multi-View Synthesis from a Single-View Model:Transferred Body and Face Representations
di: Feng, Yu, et al.
Pubblicazione: (2024)
di: Feng, Yu, et al.
Pubblicazione: (2024)
Free Lunch for Unified Multimodal Models: Enhancing Generation via Reflective Rectification with Inherent Understanding
di: Jiang, Yibo, et al.
Pubblicazione: (2026)
di: Jiang, Yibo, et al.
Pubblicazione: (2026)
Incomplete Multi-View Multi-Label Classification via Shared Codebook and Fused-Teacher Self-Distillation
di: Yan, Xu, et al.
Pubblicazione: (2026)
di: Yan, Xu, et al.
Pubblicazione: (2026)
MergeVQ: A Unified Framework for Visual Generation and Representation with Disentangled Token Merging and Quantization
di: Li, Siyuan, et al.
Pubblicazione: (2025)
di: Li, Siyuan, et al.
Pubblicazione: (2025)
JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search
di: Zou, Dongyun, et al.
Pubblicazione: (2026)
di: Zou, Dongyun, et al.
Pubblicazione: (2026)
A Unified Model for Longitudinal Multi-Modal Multi-View Prediction with Missingness
di: Chen, Boqi, et al.
Pubblicazione: (2024)
di: Chen, Boqi, et al.
Pubblicazione: (2024)
Unified Multimodal Understanding via Byte-Pair Visual Encoding
di: Zhang, Wanpeng, et al.
Pubblicazione: (2025)
di: Zhang, Wanpeng, et al.
Pubblicazione: (2025)
Robust Multi-View Learning via Representation Fusion of Sample-Level Attention and Alignment of Simulated Perturbation
di: Xu, Jie, et al.
Pubblicazione: (2025)
di: Xu, Jie, et al.
Pubblicazione: (2025)
Bootstrap Your Own Views: Masked Ego-Exo Modeling for Fine-grained View-invariant Video Representations
di: Park, Jungin, et al.
Pubblicazione: (2025)
di: Park, Jungin, et al.
Pubblicazione: (2025)
UniGaussian: Driving Scene Reconstruction from Multiple Camera Models via Unified Gaussian Representations
di: Ren, Yuan, et al.
Pubblicazione: (2024)
di: Ren, Yuan, et al.
Pubblicazione: (2024)
Learning Disentangled Representation in Object-Centric Models for Visual Dynamics Prediction via Transformers
di: Gandhi, Sanket, et al.
Pubblicazione: (2024)
di: Gandhi, Sanket, et al.
Pubblicazione: (2024)
Training-Free Representation Guidance for Diffusion Models with a Representation Alignment Projector
di: Zu, Wenqiang, et al.
Pubblicazione: (2026)
di: Zu, Wenqiang, et al.
Pubblicazione: (2026)
Nexus-Gen: Unified Image Understanding, Generation, and Editing via Prefilled Autoregression in Shared Embedding Space
di: Zhang, Hong, et al.
Pubblicazione: (2025)
di: Zhang, Hong, et al.
Pubblicazione: (2025)
Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations
di: Han, Jiaming, et al.
Pubblicazione: (2025)
di: Han, Jiaming, et al.
Pubblicazione: (2025)
CAM-VFD: Cross-Attention Multimodal Video Forgery Detection
di: Elkhodary, Hoda Osama, et al.
Pubblicazione: (2026)
di: Elkhodary, Hoda Osama, et al.
Pubblicazione: (2026)
Learning Street View Representations with Spatiotemporal Contrast
di: Li, Yong, et al.
Pubblicazione: (2025)
di: Li, Yong, et al.
Pubblicazione: (2025)
Restoring Linguistic Grounding in VLA Models via Train-Free Attention Recalibration
di: Zhang, Ninghao, et al.
Pubblicazione: (2026)
di: Zhang, Ninghao, et al.
Pubblicazione: (2026)
Steering Visual Generation in Unified Multimodal Models with Understanding Supervision
di: Liu, Zeyu, et al.
Pubblicazione: (2026)
di: Liu, Zeyu, et al.
Pubblicazione: (2026)
SUM: Saliency Unification through Mamba for Visual Attention Modeling
di: Hosseini, Alireza, et al.
Pubblicazione: (2024)
di: Hosseini, Alireza, et al.
Pubblicazione: (2024)
LCV2: An Efficient Pretraining-Free Framework for Grounded Visual Question Answering
di: Chen, Yuhan, et al.
Pubblicazione: (2024)
di: Chen, Yuhan, et al.
Pubblicazione: (2024)
Unsupervised Multi-View Visual Anomaly Detection via Progressive Homography-Guided Alignment
di: Chen, Xintao, et al.
Pubblicazione: (2025)
di: Chen, Xintao, et al.
Pubblicazione: (2025)
Steerable Visual Representations
di: Ruthardt, Jona, et al.
Pubblicazione: (2026)
di: Ruthardt, Jona, et al.
Pubblicazione: (2026)
Trusted Unified Feature-Neighborhood Dynamics for Multi-View Classification
di: Huang, Haojian, et al.
Pubblicazione: (2024)
di: Huang, Haojian, et al.
Pubblicazione: (2024)
A Generic Shared Attention Mechanism for Various Backbone Neural Networks
di: Huang, Zhongzhan, et al.
Pubblicazione: (2022)
di: Huang, Zhongzhan, et al.
Pubblicazione: (2022)
Hierarchical Modeling for Medical Visual Question Answering with Cross-Attention Fusion
di: Zhang, Junkai, et al.
Pubblicazione: (2025)
di: Zhang, Junkai, et al.
Pubblicazione: (2025)
Joint Imaging-ROI Representation Learning via Cross-View Contrastive Alignment for Brain Disorder Classification
di: Liang, Wei, et al.
Pubblicazione: (2026)
di: Liang, Wei, et al.
Pubblicazione: (2026)
Learning Content-Aware Multi-Modal Joint Input Pruning via Bird's-Eye-View Representation
di: Li, Yuxin, et al.
Pubblicazione: (2024)
di: Li, Yuxin, et al.
Pubblicazione: (2024)
Towards Unified World Models for Visual Navigation via Memory-Augmented Planning and Foresight
di: Dong, Yifei, et al.
Pubblicazione: (2025)
di: Dong, Yifei, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Birds of a Feather Flock Together: Background-Invariant Representations via Linear Structure in VLMs
di: Zaazou, Youssef, et al.
Pubblicazione: (2026) -
Efficient-LVSM: Faster, Cheaper, and Better Large View Synthesis Model via Decoupled Co-Refinement Attention
di: Jia, Xiaosong, et al.
Pubblicazione: (2026) -
Unified Panoramic Geometry Estimation via Multi-View Foundation Models
di: Bozic, Vukasin, et al.
Pubblicazione: (2026) -
Next Best View Selections for Semantic and Dynamic 3D Gaussian Splatting
di: Li, Yiqian, et al.
Pubblicazione: (2025) -
Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding
di: Luo, Bingjun, et al.
Pubblicazione: (2026)