Saved in:
| Main Authors: | Yue, Kaiyu, Jia, Menglin, Hou, Ji, Goldstein, Tom |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2602.15030 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Zero-Shot Vision Encoder Grafting via LLM Surrogates
by: Yue, Kaiyu, et al.
Published: (2025)
by: Yue, Kaiyu, et al.
Published: (2025)
Efficient Image Synthesis with Sphere Latent Encoder
by: Do, Tung, et al.
Published: (2026)
by: Do, Tung, et al.
Published: (2026)
Object Recognition as Next Token Prediction
by: Yue, Kaiyu, et al.
Published: (2023)
by: Yue, Kaiyu, et al.
Published: (2023)
From Pixels to Prose: A Large Dataset of Dense Image Captions
by: Singla, Vasu, et al.
Published: (2024)
by: Singla, Vasu, et al.
Published: (2024)
Language-Image Alignment with Fixed Text Encoders
by: Yang, Jingfeng, et al.
Published: (2025)
by: Yang, Jingfeng, et al.
Published: (2025)
FlowBypass: Rectified Flow Trajectory Bypass for Training-Free Image Editing
by: Han, Menglin, et al.
Published: (2026)
by: Han, Menglin, et al.
Published: (2026)
UNIT: Unifying Image and Text Recognition in One Vision Encoder
by: Zhu, Yi, et al.
Published: (2024)
by: Zhu, Yi, et al.
Published: (2024)
Flow Matching Posterior Sampling: A Training-free Conditional Generation for Flow Matching
by: Song, Kaiyu, et al.
Published: (2024)
by: Song, Kaiyu, et al.
Published: (2024)
General Vision Encoder Features as Guidance in Medical Image Registration
by: Kögl, Fryderyk, et al.
Published: (2024)
by: Kögl, Fryderyk, et al.
Published: (2024)
Modality-Aware Bias Mitigation and Invariance Learning for Unsupervised Visible-Infrared Person Re-Identification
by: Wang, Menglin, et al.
Published: (2025)
by: Wang, Menglin, et al.
Published: (2025)
Prior-Constrained Association Learning for Fine-Grained Generalized Category Discovery
by: Wang, Menglin, et al.
Published: (2025)
by: Wang, Menglin, et al.
Published: (2025)
Encoder-Only Image Registration
by: Chen, Xiang, et al.
Published: (2025)
by: Chen, Xiang, et al.
Published: (2025)
Think-Then-Generate: Reasoning-Aware Text-to-Image Diffusion with LLM Encoders
by: Kou, Siqi, et al.
Published: (2026)
by: Kou, Siqi, et al.
Published: (2026)
FineGRAIN: Evaluating Failure Modes of Text-to-Image Models with Vision Language Model Judges
by: Hayes, Kevin David, et al.
Published: (2025)
by: Hayes, Kevin David, et al.
Published: (2025)
TextBoost: Boosting Text Encoder for Personalized Text-to-Image Generation
by: Park, NaHyeon, et al.
Published: (2024)
by: Park, NaHyeon, et al.
Published: (2024)
Semantically Robust Unsupervised Image Translation for Paired Remote Sensing Images
by: Fang, Sheng, et al.
Published: (2025)
by: Fang, Sheng, et al.
Published: (2025)
Text-Guided Semantic Image Encoder
by: Thirukovalluru, Raghuveer, et al.
Published: (2025)
by: Thirukovalluru, Raghuveer, et al.
Published: (2025)
IDProtector: An Adversarial Noise Encoder to Protect Against ID-Preserving Image Generation
by: Song, Yiren, et al.
Published: (2024)
by: Song, Yiren, et al.
Published: (2024)
Vision-Based Localization in Dense Urban Environments: A Case Study of an Urban Village in China
by: Wu, Menglin, et al.
Published: (2026)
by: Wu, Menglin, et al.
Published: (2026)
MobileDiffusion: Instant Text-to-Image Generation on Mobile Devices
by: Zhao, Yang, et al.
Published: (2023)
by: Zhao, Yang, et al.
Published: (2023)
PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation
by: Cai, Yuanhao, et al.
Published: (2025)
by: Cai, Yuanhao, et al.
Published: (2025)
Patch-enhanced Mask Encoder Prompt Image Generation
by: Xu, Shusong, et al.
Published: (2024)
by: Xu, Shusong, et al.
Published: (2024)
General Purpose Image Encoder DINOv2 for Medical Image Registration
by: Song, Xinrui, et al.
Published: (2024)
by: Song, Xinrui, et al.
Published: (2024)
Topology Sculptor, Shape Refiner: Discrete Diffusion Model for High-Fidelity 3D Meshes Generation
by: Song, Kaiyu, et al.
Published: (2025)
by: Song, Kaiyu, et al.
Published: (2025)
Adaptive Caching for Faster Video Generation with Diffusion Transformers
by: Kahatapitiya, Kumara, et al.
Published: (2024)
by: Kahatapitiya, Kumara, et al.
Published: (2024)
Rethinking Oversaturation in Classifier-Free Guidance via Low Frequency
by: Song, Kaiyu, et al.
Published: (2025)
by: Song, Kaiyu, et al.
Published: (2025)
Leveraging Previous Steps: A Training-free Fast Solver for Flow Diffusion
by: Song, Kaiyu, et al.
Published: (2024)
by: Song, Kaiyu, et al.
Published: (2024)
Improving Training-free Conditional Diffusion Model via Fisher Information
by: Song, Kaiyu, et al.
Published: (2024)
by: Song, Kaiyu, et al.
Published: (2024)
Zebra-CoT: A Dataset for Interleaved Vision Language Reasoning
by: Li, Ang, et al.
Published: (2025)
by: Li, Ang, et al.
Published: (2025)
Neural Light Spheres for Implicit Image Stitching and View Synthesis
by: Chugunov, Ilya, et al.
Published: (2024)
by: Chugunov, Ilya, et al.
Published: (2024)
SphereDrag: Spherical Geometry-Aware Panoramic Image Editing
by: Feng, Zhiao, et al.
Published: (2025)
by: Feng, Zhiao, et al.
Published: (2025)
Analysis of Attention in Video Diffusion Transformers
by: Wen, Yuxin, et al.
Published: (2025)
by: Wen, Yuxin, et al.
Published: (2025)
ARGUS: Hallucination and Omission Evaluation in Video-LLMs
by: Rawal, Ruchit, et al.
Published: (2025)
by: Rawal, Ruchit, et al.
Published: (2025)
Both Semantics and Reconstruction Matter: Making Representation Encoders Ready for Text-to-Image Generation and Editing
by: Zhang, Shilong, et al.
Published: (2025)
by: Zhang, Shilong, et al.
Published: (2025)
Covariance Descriptors Meet General Vision Encoders: Riemannian Deep Learning for Medical Image Classification
by: Mayr, Josef, et al.
Published: (2025)
by: Mayr, Josef, et al.
Published: (2025)
PromptFusion: Decoupling Stability and Plasticity for Continual Learning
by: Chen, Haoran, et al.
Published: (2023)
by: Chen, Haoran, et al.
Published: (2023)
Latent Enhancing AutoEncoder for Occluded Image Classification
by: Kotwal, Ketan, et al.
Published: (2024)
by: Kotwal, Ketan, et al.
Published: (2024)
Breaking the Encoder Barrier for Seamless Video-Language Understanding
by: Li, Handong, et al.
Published: (2025)
by: Li, Handong, et al.
Published: (2025)
Video Prediction Models as General Visual Encoders
by: Maier, James, et al.
Published: (2024)
by: Maier, James, et al.
Published: (2024)
TABLET: Table Structure Recognition using Encoder-only Transformers
by: Hou, Qiyu, et al.
Published: (2025)
by: Hou, Qiyu, et al.
Published: (2025)
Similar Items
-
Zero-Shot Vision Encoder Grafting via LLM Surrogates
by: Yue, Kaiyu, et al.
Published: (2025) -
Efficient Image Synthesis with Sphere Latent Encoder
by: Do, Tung, et al.
Published: (2026) -
Object Recognition as Next Token Prediction
by: Yue, Kaiyu, et al.
Published: (2023) -
From Pixels to Prose: A Large Dataset of Dense Image Captions
by: Singla, Vasu, et al.
Published: (2024) -
Language-Image Alignment with Fixed Text Encoders
by: Yang, Jingfeng, et al.
Published: (2025)