VIRTUE: Visual-Interactive Text-Image Universal Embedder
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Wei-Yao, Tateishi, Kazuya, Wu, Qiyu, Takahashi, Shusuke, Mitsufuji, Yuki |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MMAudio-LABEL: Audio Event Labeling via Audio Generation for Silent Video
par: Tateishi, Kazuya, et autres
Publié: (2026)
par: Tateishi, Kazuya, et autres
Publié: (2026)
Mining Your Own Secrets: Diffusion Classifier Scores for Continual Personalization of Text-to-Image Diffusion Models
par: Jha, Saurav, et autres
Publié: (2024)
par: Jha, Saurav, et autres
Publié: (2024)
MMAudioSep: Taming Video-to-Audio Generative Model Towards Video/Text-Queried Sound Separation
par: Takahashi, Akira, et autres
Publié: (2025)
par: Takahashi, Akira, et autres
Publié: (2025)
Echoes Over Time: Unlocking Length Generalization in Video-to-Audio Generation Models
par: Simon, Christian, et autres
Publié: (2026)
par: Simon, Christian, et autres
Publié: (2026)
mEOL: Training-Free Instruction-Guided Multimodal Embedder for Vector Graphics and Image Retrieval
par: Kim, Kyeong Seon, et autres
Publié: (2026)
par: Kim, Kyeong Seon, et autres
Publié: (2026)
Blind Inverse Problem Solving Made Easy by Text-to-Image Latent Diffusion
par: Dontas, Michail, et autres
Publié: (2024)
par: Dontas, Michail, et autres
Publié: (2024)
Interactive Visual Assessment for Text-to-Image Generation Models
par: Mi, Xiaoyue, et autres
Publié: (2024)
par: Mi, Xiaoyue, et autres
Publié: (2024)
Self-supervised Learning on Camera Trap Footage Yields a Strong Universal Face Embedder
par: Iashin, Vladimir, et autres
Publié: (2025)
par: Iashin, Vladimir, et autres
Publié: (2025)
TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models
par: Simon, Christian, et autres
Publié: (2025)
par: Simon, Christian, et autres
Publié: (2025)
MMAudioReverbs: Video-Guided Acoustic Modeling for Dereverberation and Room Impulse Response Estimation
par: Takahashi, Akira, et autres
Publié: (2026)
par: Takahashi, Akira, et autres
Publié: (2026)
Informative Text-Image Alignment for Visual Affordance Learning with Foundation Models
par: Zhang, Qian, et autres
Publié: (2025)
par: Zhang, Qian, et autres
Publié: (2025)
Memory-Inspired Temporal Prompt Interaction for Text-Image Classification
par: Yu, Xinyao, et autres
Publié: (2024)
par: Yu, Xinyao, et autres
Publié: (2024)
Training-Free Text-Guided Image Editing with Visual Autoregressive Model
par: Wang, Yufei, et autres
Publié: (2025)
par: Wang, Yufei, et autres
Publié: (2025)
VinaBench: Benchmark for Faithful and Consistent Visual Narratives
par: Gao, Silin, et autres
Publié: (2025)
par: Gao, Silin, et autres
Publié: (2025)
E3: Ensemble of Expert Embedders for Adapting Synthetic Image Detectors to New Generators Using Limited Data
par: Azizpour, Aref, et autres
Publié: (2024)
par: Azizpour, Aref, et autres
Publié: (2024)
AID: Attention Interpolation of Text-to-Image Diffusion
par: He, Qiyuan, et autres
Publié: (2024)
par: He, Qiyuan, et autres
Publié: (2024)
Text-Printed Image: Bridging the Image-Text Modality Gap for Text-centric Training of Large Vision-Language Models
par: Yamabe, Shojiro, et autres
Publié: (2025)
par: Yamabe, Shojiro, et autres
Publié: (2025)
MeanFlow Transformers with Representation Autoencoders
par: Hu, Zheyuan, et autres
Publié: (2025)
par: Hu, Zheyuan, et autres
Publié: (2025)
Leveraging Hierarchical Image-Text Misalignment for Universal Fake Image Detection
par: Zhang, Daichi, et autres
Publié: (2025)
par: Zhang, Daichi, et autres
Publié: (2025)
Towards Universal Text-driven CT Image Segmentation
par: Li, Yuheng, et autres
Publié: (2025)
par: Li, Yuheng, et autres
Publié: (2025)
Denoising Multi-Beta VAE: Representation Learning for Disentanglement and Generation
par: Uppal, Anshuk, et autres
Publié: (2025)
par: Uppal, Anshuk, et autres
Publié: (2025)
CMT: Mid-Training for Efficient Learning of Consistency, Mean Flow, and Flow Map Models
par: Hu, Zheyuan, et autres
Publié: (2025)
par: Hu, Zheyuan, et autres
Publié: (2025)
Automated Black-box Prompt Engineering for Personalized Text-to-Image Generation
par: He, Yutong, et autres
Publié: (2024)
par: He, Yutong, et autres
Publié: (2024)
Chatting with Images for Introspective Visual Thinking
par: Wu, Junfei, et autres
Publié: (2026)
par: Wu, Junfei, et autres
Publié: (2026)
Towards Unified Multi-granularity Text Detection with Interactive Attention
par: Wan, Xingyu, et autres
Publié: (2024)
par: Wan, Xingyu, et autres
Publié: (2024)
Improved Object-Centric Diffusion Learning with Registers and Contrastive Alignment
par: Nguyen, Bac, et autres
Publié: (2026)
par: Nguyen, Bac, et autres
Publié: (2026)
Synergistic Dual Spatial-aware Generation of Image-to-Text and Text-to-Image
par: Zhao, Yu, et autres
Publié: (2024)
par: Zhao, Yu, et autres
Publié: (2024)
Deep Semantic-Visual Alignment for Zero-Shot Remote Sensing Image Scene Classification
par: Xu, Wenjia, et autres
Publié: (2024)
par: Xu, Wenjia, et autres
Publié: (2024)
Text2Seg: Remote Sensing Image Semantic Segmentation via Text-Guided Visual Foundation Models
par: Zhang, Jielu, et autres
Publié: (2023)
par: Zhang, Jielu, et autres
Publié: (2023)
ArtAug: Enhancing Text-to-Image Generation through Synthesis-Understanding Interaction
par: Duan, Zhongjie, et autres
Publié: (2024)
par: Duan, Zhongjie, et autres
Publié: (2024)
VCD: A Dataset for Visual Commonsense Discovery in Images
par: Shen, Xiangqing, et autres
Publié: (2024)
par: Shen, Xiangqing, et autres
Publié: (2024)
Anomagic: Crossmodal Prompt-driven Zero-shot Anomaly Generation
par: Jiang, Yuxin, et autres
Publié: (2025)
par: Jiang, Yuxin, et autres
Publié: (2025)
ChainMPQ: Interleaved Text-Image Reasoning Chains for Mitigating Relation Hallucinations
par: Wu, Yike, et autres
Publié: (2025)
par: Wu, Yike, et autres
Publié: (2025)
CoF-T2I: Video Models as Pure Visual Reasoners for Text-to-Image Generation
par: Tong, Chengzhuo, et autres
Publié: (2026)
par: Tong, Chengzhuo, et autres
Publié: (2026)
Uncovering the Text Embedding in Text-to-Image Diffusion Models
par: Yu, Hu, et autres
Publié: (2024)
par: Yu, Hu, et autres
Publié: (2024)
Instant Preference Alignment for Text-to-Image Diffusion Models
par: Li, Yang, et autres
Publié: (2025)
par: Li, Yang, et autres
Publié: (2025)
MoLA: Motion Generation and Editing with Latent Diffusion Enhanced by Adversarial Training
par: Uchida, Kengo, et autres
Publié: (2024)
par: Uchida, Kengo, et autres
Publié: (2024)
TIER: Text-Image Encoder-based Regression for AIGC Image Quality Assessment
par: Yuan, Jiquan, et autres
Publié: (2024)
par: Yuan, Jiquan, et autres
Publié: (2024)
IFAdapter: Instance Feature Control for Grounded Text-to-Image Generation
par: Wu, Yinwei, et autres
Publié: (2024)
par: Wu, Yinwei, et autres
Publié: (2024)
Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education
par: Wang, Junling, et autres
Publié: (2026)
par: Wang, Junling, et autres
Publié: (2026)
Documents similaires
-
MMAudio-LABEL: Audio Event Labeling via Audio Generation for Silent Video
par: Tateishi, Kazuya, et autres
Publié: (2026) -
Mining Your Own Secrets: Diffusion Classifier Scores for Continual Personalization of Text-to-Image Diffusion Models
par: Jha, Saurav, et autres
Publié: (2024) -
MMAudioSep: Taming Video-to-Audio Generative Model Towards Video/Text-Queried Sound Separation
par: Takahashi, Akira, et autres
Publié: (2025) -
Echoes Over Time: Unlocking Length Generalization in Video-to-Audio Generation Models
par: Simon, Christian, et autres
Publié: (2026) -
mEOL: Training-Free Instruction-Guided Multimodal Embedder for Vector Graphics and Image Retrieval
par: Kim, Kyeong Seon, et autres
Publié: (2026)