Multi-modal Reference Learning for Fine-grained Text-to-Image Retrieval
Fuente:
arXiv
Salvato in:
| Autori principali: | Ma, Zehong, Chen, Hao, Zeng, Wei, Su, Limin, Zhang, Shiliang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Efficient Multi-modal Long Context Learning for Training-free Adaptation
di: Ma, Zehong, et al.
Pubblicazione: (2025)
di: Ma, Zehong, et al.
Pubblicazione: (2025)
OVMR: Open-Vocabulary Recognition with Multi-Modal References
di: Ma, Zehong, et al.
Pubblicazione: (2024)
di: Ma, Zehong, et al.
Pubblicazione: (2024)
Cross-modal Full-mode Fine-grained Alignment for Text-to-Image Person Retrieval
di: Yin, Hao, et al.
Pubblicazione: (2025)
di: Yin, Hao, et al.
Pubblicazione: (2025)
Self-paced Multi-grained Cross-modal Interaction Modeling for Referring Expression Comprehension
di: Miao, Peihan, et al.
Pubblicazione: (2022)
di: Miao, Peihan, et al.
Pubblicazione: (2022)
PixelGen: Improving Pixel Diffusion with Perceptual Supervision
di: Ma, Zehong, et al.
Pubblicazione: (2026)
di: Ma, Zehong, et al.
Pubblicazione: (2026)
DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation
di: Ma, Zehong, et al.
Pubblicazione: (2025)
di: Ma, Zehong, et al.
Pubblicazione: (2025)
Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval
di: Shen, Li-Cheng, et al.
Pubblicazione: (2025)
di: Shen, Li-Cheng, et al.
Pubblicazione: (2025)
MagCache: Fast Video Generation with Magnitude-Aware Cache
di: Ma, Zehong, et al.
Pubblicazione: (2025)
di: Ma, Zehong, et al.
Pubblicazione: (2025)
Composed Image Retrieval with Text Feedback via Multi-grained Uncertainty Regularization
di: Chen, Yiyang, et al.
Pubblicazione: (2022)
di: Chen, Yiyang, et al.
Pubblicazione: (2022)
Fine-grained Text to Image Synthesis
di: Ouyang, Xu, et al.
Pubblicazione: (2024)
di: Ouyang, Xu, et al.
Pubblicazione: (2024)
Fine-grained Multiple Supervisory Network for Multi-modal Manipulation Detecting and Grounding
di: Yu, Xinquan, et al.
Pubblicazione: (2025)
di: Yu, Xinquan, et al.
Pubblicazione: (2025)
Prompt-Anchored Vision-Text Distillation for Lifelong Person Re-identification
di: Wen, Wen, et al.
Pubblicazione: (2026)
di: Wen, Wen, et al.
Pubblicazione: (2026)
MFCLIP: Multi-modal Fine-grained CLIP for Generalizable Diffusion Face Forgery Detection
di: Zhang, Yaning, et al.
Pubblicazione: (2024)
di: Zhang, Yaning, et al.
Pubblicazione: (2024)
Learning to Align Generative Appearance Priors for Fine-grained Image Retrieval
di: Wang, Shijie, et al.
Pubblicazione: (2026)
di: Wang, Shijie, et al.
Pubblicazione: (2026)
Fine-grained Image Retrieval via Dual-Vision Adaptation
di: Jiang, Xin, et al.
Pubblicazione: (2025)
di: Jiang, Xin, et al.
Pubblicazione: (2025)
Fine-grained Context and Multi-modal Alignment for Freehand 3D Ultrasound Reconstruction
di: Yan, Zhongnuo, et al.
Pubblicazione: (2024)
di: Yan, Zhongnuo, et al.
Pubblicazione: (2024)
Multi-modal Instruction Tuned LLMs with Fine-grained Visual Perception
di: He, Junwen, et al.
Pubblicazione: (2024)
di: He, Junwen, et al.
Pubblicazione: (2024)
Multi-Granularity and Multi-modal Feature Interaction Approach for Text Video Retrieval
di: Li, Wenjun, et al.
Pubblicazione: (2024)
di: Li, Wenjun, et al.
Pubblicazione: (2024)
Language-driven Fine-grained Retrieval
di: Wang, Shijie, et al.
Pubblicazione: (2025)
di: Wang, Shijie, et al.
Pubblicazione: (2025)
AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation
di: Girish, Sharath, et al.
Pubblicazione: (2025)
di: Girish, Sharath, et al.
Pubblicazione: (2025)
MMHead: Towards Fine-grained Multi-modal 3D Facial Animation
di: Wu, Sijing, et al.
Pubblicazione: (2024)
di: Wu, Sijing, et al.
Pubblicazione: (2024)
MVAM: Multi-View Attention Method for Fine-grained Image-Text Matching
di: Cui, Wanqing, et al.
Pubblicazione: (2024)
di: Cui, Wanqing, et al.
Pubblicazione: (2024)
Fine-grained Action Analysis: A Multi-modality and Multi-task Dataset of Figure Skating
di: Liu, Sheng-Lan, et al.
Pubblicazione: (2023)
di: Liu, Sheng-Lan, et al.
Pubblicazione: (2023)
Robust Fusion Controller: Degradation-aware Image Fusion with Fine-grained Language Instructions
di: Zhang, Hao, et al.
Pubblicazione: (2025)
di: Zhang, Hao, et al.
Pubblicazione: (2025)
CADFormer: Fine-Grained Cross-modal Alignment and Decoding Transformer for Referring Remote Sensing Image Segmentation
di: Liu, Maofu, et al.
Pubblicazione: (2025)
di: Liu, Maofu, et al.
Pubblicazione: (2025)
Integrating Text and Image Pre-training for Multi-modal Algorithmic Reasoning
di: Zhang, Zijian, et al.
Pubblicazione: (2024)
di: Zhang, Zijian, et al.
Pubblicazione: (2024)
Achieving Fine-grained Cross-modal Understanding through Brain-inspired Hierarchical Representation Learning
di: You, Weihang, et al.
Pubblicazione: (2026)
di: You, Weihang, et al.
Pubblicazione: (2026)
Exploring Fine-Grained Image-Text Alignment for Referring Remote Sensing Image Segmentation
di: Lei, Sen, et al.
Pubblicazione: (2024)
di: Lei, Sen, et al.
Pubblicazione: (2024)
Hybrid-Tower: Fine-grained Pseudo-query Interaction and Generation for Text-to-Video Retrieval
di: Lan, Bangxiang, et al.
Pubblicazione: (2025)
di: Lan, Bangxiang, et al.
Pubblicazione: (2025)
FineCLIPER: Multi-modal Fine-grained CLIP for Dynamic Facial Expression Recognition with AdaptERs
di: Chen, Haodong, et al.
Pubblicazione: (2024)
di: Chen, Haodong, et al.
Pubblicazione: (2024)
Multimodal Model for Computational Pathology:Representation Learning and Image Compression
di: Wu, Peihang, et al.
Pubblicazione: (2026)
di: Wu, Peihang, et al.
Pubblicazione: (2026)
FITA: Fine-grained Image-Text Aligner for Radiology Report Generation
di: Yang, Honglong, et al.
Pubblicazione: (2024)
di: Yang, Honglong, et al.
Pubblicazione: (2024)
Pink: Unveiling the Power of Referential Comprehension for Multi-modal LLMs
di: Xuan, Shiyu, et al.
Pubblicazione: (2023)
di: Xuan, Shiyu, et al.
Pubblicazione: (2023)
WaMo: Wavelet-Enhanced Multi-Frequency Trajectory Analysis for Fine-Grained Text-Motion Retrieval
di: Ren, Junlong, et al.
Pubblicazione: (2025)
di: Ren, Junlong, et al.
Pubblicazione: (2025)
FocusDiT: Masking Queries in Diffusion Transformers for Fine-grained Image Generation
di: Fang, Xueji, et al.
Pubblicazione: (2026)
di: Fang, Xueji, et al.
Pubblicazione: (2026)
MagicMirror: A Large-Scale Dataset and Benchmark for Fine-Grained Artifacts Assessment in Text-to-Image Generation
di: Wang, Jia, et al.
Pubblicazione: (2025)
di: Wang, Jia, et al.
Pubblicazione: (2025)
Multi-modal In-Context Learning Makes an Ego-evolving Scene Text Recognizer
di: Zhao, Zhen, et al.
Pubblicazione: (2023)
di: Zhao, Zhen, et al.
Pubblicazione: (2023)
FiVA: Fine-grained Visual Attribute Dataset for Text-to-Image Diffusion Models
di: Wu, Tong, et al.
Pubblicazione: (2024)
di: Wu, Tong, et al.
Pubblicazione: (2024)
FIRE-CIR: Fine-grained Reasoning for Composed Fashion Image Retrieval
di: Gardères, François, et al.
Pubblicazione: (2026)
di: Gardères, François, et al.
Pubblicazione: (2026)
T2I-VeRW: Part-level Fine-grained Perception for Text-to-Image Vehicle Retrieval
di: Wang, Xiao, et al.
Pubblicazione: (2026)
di: Wang, Xiao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Efficient Multi-modal Long Context Learning for Training-free Adaptation
di: Ma, Zehong, et al.
Pubblicazione: (2025) -
OVMR: Open-Vocabulary Recognition with Multi-Modal References
di: Ma, Zehong, et al.
Pubblicazione: (2024) -
Cross-modal Full-mode Fine-grained Alignment for Text-to-Image Person Retrieval
di: Yin, Hao, et al.
Pubblicazione: (2025) -
Self-paced Multi-grained Cross-modal Interaction Modeling for Referring Expression Comprehension
di: Miao, Peihan, et al.
Pubblicazione: (2022) -
PixelGen: Improving Pixel Diffusion with Perceptual Supervision
di: Ma, Zehong, et al.
Pubblicazione: (2026)