FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens
Fuente:
arXiv
Saved in:
| Main Authors: | Schlarmann, Christian, Croce, Francesco, Flammarion, Nicolas, Hein, Matthias |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
On the Out-of-Distribution Generalization of Reasoning in Multimodal LLMs for Simple Visual Planning Tasks
by: Neuhaus, Yannic, et al.
Published: (2026)
by: Neuhaus, Yannic, et al.
Published: (2026)
Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models
by: Schlarmann, Christian, et al.
Published: (2024)
by: Schlarmann, Christian, et al.
Published: (2024)
Adversarially Robust CLIP Models Can Induce Better (Robust) Perceptual Metrics
by: Croce, Francesco, et al.
Published: (2025)
by: Croce, Francesco, et al.
Published: (2025)
Visual Memory Injection Attacks for Multi-Turn Conversations
by: Schlarmann, Christian, et al.
Published: (2026)
by: Schlarmann, Christian, et al.
Published: (2026)
On the Adversarial Robustness of Discrete Image Tokenizers
by: Bhagwatkar, Rishika, et al.
Published: (2026)
by: Bhagwatkar, Rishika, et al.
Published: (2026)
Towards Reliable Evaluation and Fast Training of Robust Semantic Segmentation Models
by: Croce, Francesco, et al.
Published: (2023)
by: Croce, Francesco, et al.
Published: (2023)
Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics
by: Ghazanfari, Sara, et al.
Published: (2024)
by: Ghazanfari, Sara, et al.
Published: (2024)
Perturb and Recover: Fine-tuning for Effective Backdoor Removal from CLIP
by: Singh, Naman Deep, et al.
Published: (2024)
by: Singh, Naman Deep, et al.
Published: (2024)
Robustness in Both Domains: CLIP Needs a Robust Text Encoder
by: Rocamora, Elias Abad, et al.
Published: (2025)
by: Rocamora, Elias Abad, et al.
Published: (2025)
Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning
by: Ghazanfari, Sara, et al.
Published: (2025)
by: Ghazanfari, Sara, et al.
Published: (2025)
AmorLIP: Efficient Language-Image Pretraining via Amortization
by: Sun, Haotian, et al.
Published: (2025)
by: Sun, Haotian, et al.
Published: (2025)
Mahalanobis++: Improving OOD Detection via Feature Normalization
by: Mueller, Maximilian, et al.
Published: (2025)
by: Mueller, Maximilian, et al.
Published: (2025)
LoGex: Improved tail detection of extremely rare histopathology classes via guided diffusion
by: Mueller, Maximilian, et al.
Published: (2024)
by: Mueller, Maximilian, et al.
Published: (2024)
Beyond Single Tokens: Distilling Discrete Diffusion Models via Discrete MMD
by: Hoogeboom, Emiel, et al.
Published: (2026)
by: Hoogeboom, Emiel, et al.
Published: (2026)
PruneFuse: Efficient Data Selection via Weight Pruning and Network Fusion
by: Kousar, Humaira, et al.
Published: (2026)
by: Kousar, Humaira, et al.
Published: (2026)
LongProLIP: A Probabilistic Vision-Language Model with Long Context Text
by: Chun, Sanghyuk, et al.
Published: (2025)
by: Chun, Sanghyuk, et al.
Published: (2025)
How to train your ViT for OOD Detection
by: Mueller, Maximilian, et al.
Published: (2024)
by: Mueller, Maximilian, et al.
Published: (2024)
MaskBit: Embedding-free Image Generation via Bit Tokens
by: Weber, Mark, et al.
Published: (2024)
by: Weber, Mark, et al.
Published: (2024)
SFTok: Bridging the Performance Gap in Discrete Tokenizers
by: Rao, Qihang, et al.
Published: (2025)
by: Rao, Qihang, et al.
Published: (2025)
On the Role of Discrete Tokenization in Visual Representation Learning
by: Du, Tianqi, et al.
Published: (2024)
by: Du, Tianqi, et al.
Published: (2024)
ClearVision: Leveraging CycleGAN and SigLIP-2 for Robust All-Weather Classification in Traffic Camera Imagery
by: Sivaraman, Anush Lakshman, et al.
Published: (2025)
by: Sivaraman, Anush Lakshman, et al.
Published: (2025)
Diverse via bounded Agreement: Geometric Regularization for Multimodal Fusion
by: Xia, Zixuan, et al.
Published: (2026)
by: Xia, Zixuan, et al.
Published: (2026)
LGQ: Learning Discretization Geometry for Scalable and Stable Image Tokenization
by: Altun, Idil Bilge, et al.
Published: (2026)
by: Altun, Idil Bilge, et al.
Published: (2026)
SECURE: Stable Early Collision Understanding via Robust Embeddings in Autonomous Driving
by: Wang, Wenjing, et al.
Published: (2026)
by: Wang, Wenjing, et al.
Published: (2026)
Semantic Residual for Multimodal Unified Discrete Representation
by: Huang, Hai, et al.
Published: (2024)
by: Huang, Hai, et al.
Published: (2024)
Advancing Compositional Awareness in CLIP with Efficient Fine-Tuning
by: Peleg, Amit, et al.
Published: (2025)
by: Peleg, Amit, et al.
Published: (2025)
Multimodal Latent Fusion of ECG Leads for Early Assessment of Pulmonary Hypertension
by: Suvon, Mohammod N. I., et al.
Published: (2025)
by: Suvon, Mohammod N. I., et al.
Published: (2025)
Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning
by: Zhang, Dingkun, et al.
Published: (2026)
by: Zhang, Dingkun, et al.
Published: (2026)
DualSwinFusionSeg: Multimodal Martian Landslide Segmentation via Dual Swin Transformer with Multi-Scale Fusion and UNet++
by: Kabir, Shahriar, et al.
Published: (2026)
by: Kabir, Shahriar, et al.
Published: (2026)
CrossFuse: Learning Infrared and Visible Image Fusion by Cross-Sensor Top-K Vision Alignment and Beyond
by: Shi, Yukai, et al.
Published: (2025)
by: Shi, Yukai, et al.
Published: (2025)
UrbanFusion: Stochastic Multimodal Fusion for Contrastive Learning of Robust Spatial Representations
by: Mühlematter, Dominik J., et al.
Published: (2025)
by: Mühlematter, Dominik J., et al.
Published: (2025)
Beyond Simple Fusion: Adaptive Gated Fusion for Robust Multimodal Sentiment Analysis
by: Wu, Han, et al.
Published: (2025)
by: Wu, Han, et al.
Published: (2025)
RePOPE: Impact of Annotation Errors on the POPE Benchmark
by: Neuhaus, Yannic, et al.
Published: (2025)
by: Neuhaus, Yannic, et al.
Published: (2025)
Introducing Visual Perception Token into Multimodal Large Language Model
by: Yu, Runpeng, et al.
Published: (2025)
by: Yu, Runpeng, et al.
Published: (2025)
DashFusion: Dual-stream Alignment with Hierarchical Bottleneck Fusion for Multimodal Sentiment Analysis
by: Wen, Yuhua, et al.
Published: (2025)
by: Wen, Yuhua, et al.
Published: (2025)
TokLIP: Marry Visual Tokens to CLIP for Multimodal Comprehension and Generation
by: Lin, Haokun, et al.
Published: (2025)
by: Lin, Haokun, et al.
Published: (2025)
Automatic Fused Multimodal Deep Learning for Plant Identification
by: Lapkovskis, Alfreds, et al.
Published: (2024)
by: Lapkovskis, Alfreds, et al.
Published: (2024)
EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling
by: Song, Jiafei, et al.
Published: (2026)
by: Song, Jiafei, et al.
Published: (2026)
DisCoRD: Discrete Tokens to Continuous Motion via Rectified Flow Decoding
by: Cho, Jungbin, et al.
Published: (2024)
by: Cho, Jungbin, et al.
Published: (2024)
Robust Multimodal Learning via Cross-Modal Proxy Tokens
by: Reza, Md Kaykobad, et al.
Published: (2025)
by: Reza, Md Kaykobad, et al.
Published: (2025)
Similar Items
-
On the Out-of-Distribution Generalization of Reasoning in Multimodal LLMs for Simple Visual Planning Tasks
by: Neuhaus, Yannic, et al.
Published: (2026) -
Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models
by: Schlarmann, Christian, et al.
Published: (2024) -
Adversarially Robust CLIP Models Can Induce Better (Robust) Perceptual Metrics
by: Croce, Francesco, et al.
Published: (2025) -
Visual Memory Injection Attacks for Multi-Turn Conversations
by: Schlarmann, Christian, et al.
Published: (2026) -
On the Adversarial Robustness of Discrete Image Tokenizers
by: Bhagwatkar, Rishika, et al.
Published: (2026)