Language-Image Alignment with Fixed Text Encoders
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Jingfeng, Wu, Ziyang, Zhao, Yue, Ma, Yi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
UNIT: Unifying Image and Text Recognition in One Vision Encoder
par: Zhu, Yi, et autres
Publié: (2024)
par: Zhu, Yi, et autres
Publié: (2024)
Layer-wise Alignment: Examining Safety Alignment Across Image Encoder Layers in Vision Language Models
par: Bachu, Saketh, et autres
Publié: (2024)
par: Bachu, Saketh, et autres
Publié: (2024)
Text-Guided Semantic Image Encoder
par: Thirukovalluru, Raghuveer, et autres
Publié: (2025)
par: Thirukovalluru, Raghuveer, et autres
Publié: (2025)
CDPDNet: Integrating Text Guidance with Hybrid Vision Encoders for Medical Image Segmentation
par: Wu, Jiong, et autres
Publié: (2025)
par: Wu, Jiong, et autres
Publié: (2025)
Think-Then-Generate: Reasoning-Aware Text-to-Image Diffusion with LLM Encoders
par: Kou, Siqi, et autres
Publié: (2026)
par: Kou, Siqi, et autres
Publié: (2026)
TIGaussian: Disentangle Gaussians for Spatial-Awared Text-Image-3D Alignment
par: Liu, Jiarun, et autres
Publié: (2026)
par: Liu, Jiarun, et autres
Publié: (2026)
TextBoost: Boosting Text Encoder for Personalized Text-to-Image Generation
par: Park, NaHyeon, et autres
Publié: (2024)
par: Park, NaHyeon, et autres
Publié: (2024)
Video-Panda: Parameter-efficient Alignment for Encoder-free Video-Language Models
par: Yi, Jinhui, et autres
Publié: (2024)
par: Yi, Jinhui, et autres
Publié: (2024)
Scaling Down Text Encoders of Text-to-Image Diffusion Models
par: Wang, Lifu, et autres
Publié: (2025)
par: Wang, Lifu, et autres
Publié: (2025)
BideDPO: Conditional Image Generation with Simultaneous Text and Condition Alignment
par: Zhou, Dewei, et autres
Publié: (2025)
par: Zhou, Dewei, et autres
Publié: (2025)
Image Generation with a Sphere Encoder
par: Yue, Kaiyu, et autres
Publié: (2026)
par: Yue, Kaiyu, et autres
Publié: (2026)
TAMISeg: Text-Aligned Multi-scale Medical Image Segmentation with Semantic Encoder Distillation
par: Gao, Qiang, et autres
Publié: (2026)
par: Gao, Qiang, et autres
Publié: (2026)
InstructEngine: Instruction-driven Text-to-Image Alignment
par: Lu, Xingyu, et autres
Publié: (2025)
par: Lu, Xingyu, et autres
Publié: (2025)
Image Regeneration: Evaluating Text-to-Image Model via Generating Identical Image with Multimodal Large Language Models
par: Meng, Chutian, et autres
Publié: (2024)
par: Meng, Chutian, et autres
Publié: (2024)
Day-Night Adaptation: An Innovative Source-free Adaptation Framework for Medical Image Segmentation
par: Chen, Ziyang, et autres
Publié: (2024)
par: Chen, Ziyang, et autres
Publié: (2024)
How to Make Cross Encoder a Good Teacher for Efficient Image-Text Retrieval?
par: Chen, Yuxin, et autres
Publié: (2024)
par: Chen, Yuxin, et autres
Publié: (2024)
Instruction-augmented Multimodal Alignment for Image-Text and Element Matching
par: Yue, Xinli, et autres
Publié: (2025)
par: Yue, Xinli, et autres
Publié: (2025)
LCM-Lookahead for Encoder-based Text-to-Image Personalization
par: Gal, Rinon, et autres
Publié: (2024)
par: Gal, Rinon, et autres
Publié: (2024)
FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL
par: Pan, Kaihang, et autres
Publié: (2025)
par: Pan, Kaihang, et autres
Publié: (2025)
Beyond Fixed Inference: Quantitative Flow Matching for Adaptive Image Denoising
par: Duan, Jigang, et autres
Publié: (2026)
par: Duan, Jigang, et autres
Publié: (2026)
Restoring Initial Noise Sensitivity in Text-to-Image Distillation via Geometric Alignment
par: Huang, Huayang, et autres
Publié: (2026)
par: Huang, Huayang, et autres
Publié: (2026)
One-Way Ticket:Time-Independent Unified Encoder for Distilling Text-to-Image Diffusion Models
par: Li, Senmao, et autres
Publié: (2025)
par: Li, Senmao, et autres
Publié: (2025)
TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval
par: Zhao, Zixu, et autres
Publié: (2025)
par: Zhao, Zixu, et autres
Publié: (2025)
UniSemAlign: Text-Prototype Alignment with a Foundation Encoder for Semi-Supervised Histopathology Segmentation
par: Thai, Le-Van, et autres
Publié: (2026)
par: Thai, Le-Van, et autres
Publié: (2026)
CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder
par: Ma, Lichen, et autres
Publié: (2024)
par: Ma, Lichen, et autres
Publié: (2024)
Fast Prompt Alignment for Text-to-Image Generation
par: Mrini, Khalil, et autres
Publié: (2024)
par: Mrini, Khalil, et autres
Publié: (2024)
Gradient Alignment Improves Test-Time Adaptation for Medical Image Segmentation
par: Chen, Ziyang, et autres
Publié: (2024)
par: Chen, Ziyang, et autres
Publié: (2024)
Hierarchical Vision-Language Alignment for Text-to-Image Generation via Diffusion Models
par: Johnson, Emily, et autres
Publié: (2025)
par: Johnson, Emily, et autres
Publié: (2025)
Focus-N-Fix: Region-Aware Fine-Tuning for Text-to-Image Generation
par: Xing, Xiaoying, et autres
Publié: (2025)
par: Xing, Xiaoying, et autres
Publié: (2025)
Graph Domain Adaptation with Dual-branch Encoder and Two-level Alignment for Whole Slide Image-based Survival Prediction
par: Shou, Yuntao, et autres
Publié: (2024)
par: Shou, Yuntao, et autres
Publié: (2024)
Enhancing Diffusion Models with Text-Encoder Reinforcement Learning
par: Chen, Chaofeng, et autres
Publié: (2023)
par: Chen, Chaofeng, et autres
Publié: (2023)
Detecting Deepfakes with Multivariate Soft Blending and CLIP-based Image-Text Alignment
par: Li, Jingwei, et autres
Publié: (2026)
par: Li, Jingwei, et autres
Publié: (2026)
Breaking the Encoder Barrier for Seamless Video-Language Understanding
par: Li, Handong, et autres
Publié: (2025)
par: Li, Handong, et autres
Publié: (2025)
Extending CLIP's Image-Text Alignment to Referring Image Segmentation
par: Kim, Seoyeon, et autres
Publié: (2023)
par: Kim, Seoyeon, et autres
Publié: (2023)
Object Fidelity Diffusion for Remote Sensing Image Generation
par: Ye, Ziqi, et autres
Publié: (2025)
par: Ye, Ziqi, et autres
Publié: (2025)
MIGC: Multi-Instance Generation Controller for Text-to-Image Synthesis
par: Zhou, Dewei, et autres
Publié: (2024)
par: Zhou, Dewei, et autres
Publié: (2024)
TAI++: Text as Image for Multi-Label Image Classification by Co-Learning Transferable Prompt
par: Wu, Xiangyu, et autres
Publié: (2024)
par: Wu, Xiangyu, et autres
Publié: (2024)
MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation
par: Li, Mingcheng, et autres
Publié: (2025)
par: Li, Mingcheng, et autres
Publié: (2025)
TIT-Score: Evaluating Long-Prompt Based Text-to-Image Alignment via Text-to-Image-to-Text Consistency
par: Wang, Juntong, et autres
Publié: (2025)
par: Wang, Juntong, et autres
Publié: (2025)
Harnessing Frozen Unimodal Encoders for Flexible Multimodal Alignment
par: Maniparambil, Mayug, et autres
Publié: (2024)
par: Maniparambil, Mayug, et autres
Publié: (2024)
Documents similaires
-
UNIT: Unifying Image and Text Recognition in One Vision Encoder
par: Zhu, Yi, et autres
Publié: (2024) -
Layer-wise Alignment: Examining Safety Alignment Across Image Encoder Layers in Vision Language Models
par: Bachu, Saketh, et autres
Publié: (2024) -
Text-Guided Semantic Image Encoder
par: Thirukovalluru, Raghuveer, et autres
Publié: (2025) -
CDPDNet: Integrating Text Guidance with Hybrid Vision Encoders for Medical Image Segmentation
par: Wu, Jiong, et autres
Publié: (2025) -
Think-Then-Generate: Reasoning-Aware Text-to-Image Diffusion with LLM Encoders
par: Kou, Siqi, et autres
Publié: (2026)