UniCoRN: Unified Commented Retrieval Network with LMMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jaritz, Maximilian, Guillaumin, Matthieu, Sternig, Sabine, Bazzani, Loris |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ToFu: Visual Tokens Reduction via Fusion for Multi-modal, Multi-patch, Multi-image Task
par: Pippi, Vittorio, et autres
Publié: (2025)
par: Pippi, Vittorio, et autres
Publié: (2025)
LatteCLIP: Unsupervised CLIP Fine-Tuning via LMM-Synthetic Texts
par: Cao, Anh-Quan, et autres
Publié: (2024)
par: Cao, Anh-Quan, et autres
Publié: (2024)
UniCoRN: Latent Diffusion-based Unified Controllable Image Restoration Network across Multiple Degradations
par: Mandal, Debabrata, et autres
Publié: (2025)
par: Mandal, Debabrata, et autres
Publié: (2025)
Interactive Episodic Memory with User Feedback
par: Subedi, Nikesh, et autres
Publié: (2026)
par: Subedi, Nikesh, et autres
Publié: (2026)
Learning Visual Hierarchies in Hyperbolic Space for Image Retrieval
par: Wang, Ziwei, et autres
Publié: (2024)
par: Wang, Ziwei, et autres
Publié: (2024)
UniTraj: A Unified Framework for Scalable Vehicle Trajectory Prediction
par: Feng, Lan, et autres
Publié: (2024)
par: Feng, Lan, et autres
Publié: (2024)
UniMD: Towards Unifying Moment Retrieval and Temporal Action Detection
par: Zeng, Yingsen, et autres
Publié: (2024)
par: Zeng, Yingsen, et autres
Publié: (2024)
ViewFusion: Towards Multi-View Consistency via Interpolated Denoising
par: Yang, Xianghui, et autres
Publié: (2024)
par: Yang, Xianghui, et autres
Publié: (2024)
UniMoCo: Unified Modality Completion for Robust Multi-Modal Embeddings
par: Qin, Jiajun, et autres
Publié: (2025)
par: Qin, Jiajun, et autres
Publié: (2025)
Multi-Level Conditioning by Pairing Localized Text and Sketch for Fashion Image Generation
par: Liu, Ziyue, et autres
Publié: (2026)
par: Liu, Ziyue, et autres
Publié: (2026)
Teaching LMMs for Image Quality Scoring and Interpreting
par: Zhang, Zicheng, et autres
Publié: (2025)
par: Zhang, Zicheng, et autres
Publié: (2025)
Enhancing Image Quality Assessment Ability of LMMs via Retrieval-Augmented Generation
par: Fu, Kang, et autres
Publié: (2026)
par: Fu, Kang, et autres
Publié: (2026)
UniCVR: From Alignment to Reranking for Unified Zero-Shot Composed Visual Retrieval
par: Wen, Haokun, et autres
Publié: (2026)
par: Wen, Haokun, et autres
Publié: (2026)
Benchmarking Interaction, Beyond Policy: a Reproducible Benchmark for Collaborative Instance Object Navigation
par: Zorzi, Edoardo, et autres
Publié: (2026)
par: Zorzi, Edoardo, et autres
Publié: (2026)
UniLight: A Unified Representation for Lighting
par: Zhang, Zitian, et autres
Publié: (2025)
par: Zhang, Zitian, et autres
Publié: (2025)
Uni-Animator: Towards Unified Visual Colorization
par: Chen, Xinyuan, et autres
Publié: (2026)
par: Chen, Xinyuan, et autres
Publié: (2026)
MMSearch-R1: Incentivizing LMMs to Search
par: Wu, Jinming, et autres
Publié: (2025)
par: Wu, Jinming, et autres
Publié: (2025)
UniFashion: A Unified Vision-Language Model for Multimodal Fashion Retrieval and Generation
par: Zhao, Xiangyu, et autres
Publié: (2024)
par: Zhao, Xiangyu, et autres
Publié: (2024)
Q-Bench-Video: Benchmarking the Video Quality Understanding of LMMs
par: Zhang, Zicheng, et autres
Publié: (2024)
par: Zhang, Zicheng, et autres
Publié: (2024)
VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMs
par: Bharadwaj, Rohit, et autres
Publié: (2024)
par: Bharadwaj, Rohit, et autres
Publié: (2024)
UniVid: The Open-Source Unified Video Model
par: Luo, Jiabin, et autres
Publié: (2025)
par: Luo, Jiabin, et autres
Publié: (2025)
UniAPO: Unified Multimodal Automated Prompt Optimization
par: Zhu, Qipeng, et autres
Publié: (2025)
par: Zhu, Qipeng, et autres
Publié: (2025)
UniVideo: Unified Understanding, Generation, and Editing for Videos
par: Wei, Cong, et autres
Publié: (2025)
par: Wei, Cong, et autres
Publié: (2025)
UniT: Unified Geometry Learning with Group Autoregressive Transformer
par: Wang, Haotian, et autres
Publié: (2026)
par: Wang, Haotian, et autres
Publié: (2026)
UniHash: Unifying Pointwise and Pairwise Hashing Paradigms
par: Ma, Xiaoxu, et autres
Publié: (2026)
par: Ma, Xiaoxu, et autres
Publié: (2026)
UniGenDet: A Unified Generative-Discriminative Framework for Co-Evolutionary Image Generation and Generated Image Detection
par: Zhang, Yanran, et autres
Publié: (2026)
par: Zhang, Yanran, et autres
Publié: (2026)
MIBench: Evaluating LMMs on Multimodal Interaction
par: Miao, Yu, et autres
Publié: (2026)
par: Miao, Yu, et autres
Publié: (2026)
LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation
par: Yuan, Yuqian, et autres
Publié: (2026)
par: Yuan, Yuqian, et autres
Publié: (2026)
Exploring Multimodal LMMs for Online Episodic Memory Question Answering on the Edge
par: Lando, Giuseppe, et autres
Publié: (2026)
par: Lando, Giuseppe, et autres
Publié: (2026)
VisualCritic: Making LMMs Perceive Visual Quality Like Humans
par: Huang, Zhipeng, et autres
Publié: (2024)
par: Huang, Zhipeng, et autres
Publié: (2024)
UniCal: Unified Neural Sensor Calibration
par: Yang, Ze, et autres
Publié: (2024)
par: Yang, Ze, et autres
Publié: (2024)
UniViTAR: Unified Vision Transformer with Native Resolution
par: Qiao, Limeng, et autres
Publié: (2025)
par: Qiao, Limeng, et autres
Publié: (2025)
UniADC: A Unified Framework for Anomaly Detection and Classification
par: Zhang, Ximiao, et autres
Publié: (2025)
par: Zhang, Ximiao, et autres
Publié: (2025)
Uni-Sign: Toward Unified Sign Language Understanding at Scale
par: Li, Zecheng, et autres
Publié: (2025)
par: Li, Zecheng, et autres
Publié: (2025)
UniVBench: Towards Unified Evaluation for Video Foundation Models
par: Wei, Jianhui, et autres
Publié: (2026)
par: Wei, Jianhui, et autres
Publié: (2026)
UniScene: Unified Occupancy-centric Driving Scene Generation
par: Li, Bohan, et autres
Publié: (2024)
par: Li, Bohan, et autres
Publié: (2024)
UniMesh: Unifying 3D Mesh Understanding and Generation
par: Huang, Peng, et autres
Publié: (2026)
par: Huang, Peng, et autres
Publié: (2026)
UniFormer: Unifying Convolution and Self-attention for Visual Recognition
par: Li, Kunchang, et autres
Publié: (2022)
par: Li, Kunchang, et autres
Publié: (2022)
UniStitch: Unifying Semantic and Geometric Features for Image Stitching
par: Mei, Yuan, et autres
Publié: (2026)
par: Mei, Yuan, et autres
Publié: (2026)
LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models
par: Zhang, Kaichen, et autres
Publié: (2024)
par: Zhang, Kaichen, et autres
Publié: (2024)
Documents similaires
-
ToFu: Visual Tokens Reduction via Fusion for Multi-modal, Multi-patch, Multi-image Task
par: Pippi, Vittorio, et autres
Publié: (2025) -
LatteCLIP: Unsupervised CLIP Fine-Tuning via LMM-Synthetic Texts
par: Cao, Anh-Quan, et autres
Publié: (2024) -
UniCoRN: Latent Diffusion-based Unified Controllable Image Restoration Network across Multiple Degradations
par: Mandal, Debabrata, et autres
Publié: (2025) -
Interactive Episodic Memory with User Feedback
par: Subedi, Nikesh, et autres
Publié: (2026) -
Learning Visual Hierarchies in Hyperbolic Space for Image Retrieval
par: Wang, Ziwei, et autres
Publié: (2024)