MCoT-MVS: Multi-level Vision Selection by Multi-modal Chain-of-Thought Reasoning for Composed Image Retrieval
Fuente:
arXiv
Salvato in:
| Autori principali: | Ge, Xuri, Wang, Chunhao, Wang, Xindi, Qin, Zheyun, Chen, Zhumin, Xin, Xin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MCoT-RE: Multi-Faceted Chain-of-Thought and Re-Ranking for Training-Free Zero-Shot Composed Image Retrieval
di: Park, Jeong-Woo, et al.
Pubblicazione: (2025)
di: Park, Jeong-Woo, et al.
Pubblicazione: (2025)
Tool-MCoT: Tool Augmented Multimodal Chain-of-Thought for Content Safety Moderation
di: Zhang, Shutong, et al.
Pubblicazione: (2026)
di: Zhang, Shutong, et al.
Pubblicazione: (2026)
CoTMR: Chain-of-Thought Multi-Scale Reasoning for Training-Free Zero-Shot Composed Image Retrieval
di: Sun, Zelong, et al.
Pubblicazione: (2025)
di: Sun, Zelong, et al.
Pubblicazione: (2025)
Reason-before-Retrieve: One-Stage Reflective Chain-of-Thoughts for Training-Free Zero-Shot Composed Image Retrieval
di: Tang, Yuanmin, et al.
Pubblicazione: (2024)
di: Tang, Yuanmin, et al.
Pubblicazione: (2024)
Olapa-MCoT: Enhancing the Chinese Mathematical Reasoning Capability of LLMs
di: Zhu, Shaojie, et al.
Pubblicazione: (2023)
di: Zhu, Shaojie, et al.
Pubblicazione: (2023)
CIR-CoT: Towards Interpretable Composed Image Retrieval via End-to-End Chain-of-Thought Reasoning
di: Lin, Weihuang, et al.
Pubblicazione: (2025)
di: Lin, Weihuang, et al.
Pubblicazione: (2025)
Boosting Multi-modal Keyphrase Prediction with Dynamic Chain-of-Thought in Vision-Language Models
di: Ma, Qihang, et al.
Pubblicazione: (2025)
di: Ma, Qihang, et al.
Pubblicazione: (2025)
RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought
di: Lu, Yi, et al.
Pubblicazione: (2025)
di: Lu, Yi, et al.
Pubblicazione: (2025)
CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models
di: Cheng, Zihui, et al.
Pubblicazione: (2024)
di: Cheng, Zihui, et al.
Pubblicazione: (2024)
Generative Editing in the Joint Vision-Language Space for Zero-Shot Composed Image Retrieval
di: Wang, Xin, et al.
Pubblicazione: (2025)
di: Wang, Xin, et al.
Pubblicazione: (2025)
Composed Multi-modal Retrieval: A Survey of Approaches and Applications
di: Zhang, Kun, et al.
Pubblicazione: (2025)
di: Zhang, Kun, et al.
Pubblicazione: (2025)
MGRR-Net: Multi-level Graph Relational Reasoning Network for Facial Action Units Detection
di: Ge, Xuri, et al.
Pubblicazione: (2022)
di: Ge, Xuri, et al.
Pubblicazione: (2022)
Visual Delta Generator with Large Multi-modal Models for Semi-supervised Composed Image Retrieval
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
MSP-MVS: Multi-Granularity Segmentation Prior Guided Multi-View Stereo
di: Yuan, Zhenlong, et al.
Pubblicazione: (2024)
di: Yuan, Zhenlong, et al.
Pubblicazione: (2024)
Candidate Set Re-ranking for Composed Image Retrieval with Dual Multi-modal Encoder
di: Liu, Zheyuan, et al.
Pubblicazione: (2023)
di: Liu, Zheyuan, et al.
Pubblicazione: (2023)
Towards Enhanced Image Generation Via Multi-modal Chain of Thought in Unified Generative Models
di: Wang, Yi, et al.
Pubblicazione: (2025)
di: Wang, Yi, et al.
Pubblicazione: (2025)
Rationale-Enhanced Decoding for Multi-modal Chain-of-Thought
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2025)
di: Yamaguchi, Shin'ya, et al.
Pubblicazione: (2025)
IA-MVS: Instance-Focused Adaptive Depth Sampling for Multi-View Stereo
di: Wang, Yinzhe, et al.
Pubblicazione: (2025)
di: Wang, Yinzhe, et al.
Pubblicazione: (2025)
M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought
di: Chen, Qiguang, et al.
Pubblicazione: (2024)
di: Chen, Qiguang, et al.
Pubblicazione: (2024)
Revisiting the Necessity of Lengthy Chain-of-Thought in Vision-centric Reasoning Generalization
di: Du, Yifan, et al.
Pubblicazione: (2025)
di: Du, Yifan, et al.
Pubblicazione: (2025)
Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought
di: Man, Yunze, et al.
Pubblicazione: (2025)
di: Man, Yunze, et al.
Pubblicazione: (2025)
From Mapping to Composing: A Two-Stage Framework for Zero-shot Composed Image Retrieval
di: Wang, Yabing, et al.
Pubblicazione: (2025)
di: Wang, Yabing, et al.
Pubblicazione: (2025)
Multi-modal Attribute Prompting for Vision-Language Models
di: Liu, Xin, et al.
Pubblicazione: (2024)
di: Liu, Xin, et al.
Pubblicazione: (2024)
Composed Object Retrieval: Object-level Retrieval via Composed Expressions
di: Wang, Tong, et al.
Pubblicazione: (2025)
di: Wang, Tong, et al.
Pubblicazione: (2025)
Hire: Hybrid-modal Interaction with Multiple Relational Enhancements for Image-Text Matching
di: Ge, Xuri, et al.
Pubblicazione: (2024)
di: Ge, Xuri, et al.
Pubblicazione: (2024)
OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving
di: Zhang, Zhenguo, et al.
Pubblicazione: (2025)
di: Zhang, Zhenguo, et al.
Pubblicazione: (2025)
TEMA: Anchor the Image, Follow the Text for Multi-Modification Composed Image Retrieval
di: Li, Zixu, et al.
Pubblicazione: (2026)
di: Li, Zixu, et al.
Pubblicazione: (2026)
DVP-MVS: Synergize Depth-Edge and Visibility Prior for Multi-View Stereo
di: Yuan, Zhenlong, et al.
Pubblicazione: (2024)
di: Yuan, Zhenlong, et al.
Pubblicazione: (2024)
Multi-modal Generative AI: Multi-modal LLMs, Diffusions, and the Unification
di: Wang, Xin, et al.
Pubblicazione: (2024)
di: Wang, Xin, et al.
Pubblicazione: (2024)
Reasoning-Aligned Perception Decoupling for Scalable Multi-modal Reasoning
di: Gou, Yunhao, et al.
Pubblicazione: (2025)
di: Gou, Yunhao, et al.
Pubblicazione: (2025)
TSAR-MVS: Textureless-aware Segmentation and Correlative Refinement Guided Multi-View Stereo
di: Yuan, Zhenlong, et al.
Pubblicazione: (2023)
di: Yuan, Zhenlong, et al.
Pubblicazione: (2023)
PhotoFramer: Multi-modal Image Composition Instruction
di: You, Zhiyuan, et al.
Pubblicazione: (2025)
di: You, Zhiyuan, et al.
Pubblicazione: (2025)
PREGEN: Uncovering Latent Thoughts in Composed Video Retrieval
di: Serussi, Gabriele, et al.
Pubblicazione: (2026)
di: Serussi, Gabriele, et al.
Pubblicazione: (2026)
3SHNet: Boosting Image-Sentence Retrieval via Visual Semantic-Spatial Self-Highlighting
di: Ge, Xuri, et al.
Pubblicazione: (2024)
di: Ge, Xuri, et al.
Pubblicazione: (2024)
Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval
di: Tu, Rong-Cheng, et al.
Pubblicazione: (2025)
di: Tu, Rong-Cheng, et al.
Pubblicazione: (2025)
RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation
di: Wen, Junwei, et al.
Pubblicazione: (2026)
di: Wen, Junwei, et al.
Pubblicazione: (2026)
Let's Think with Images Efficiently! An Interleaved-Modal Chain-of-Thought Reasoning Framework with Dynamic and Precise Visual Thoughts
di: Liu, Xu, et al.
Pubblicazione: (2026)
di: Liu, Xu, et al.
Pubblicazione: (2026)
Multi-level Cross-modal Alignment for Image Clustering
di: Qiu, Liping, et al.
Pubblicazione: (2024)
di: Qiu, Liping, et al.
Pubblicazione: (2024)
CFIR: Fast and Effective Long-Text To Image Retrieval for Large Corpora
di: Long, Zijun, et al.
Pubblicazione: (2024)
di: Long, Zijun, et al.
Pubblicazione: (2024)
DeliCIR: Deliberative Test-Time Evolutionary Hierarchical Multi-Agents for Composed Image Retrieval
di: Pei, Xingtian, et al.
Pubblicazione: (2026)
di: Pei, Xingtian, et al.
Pubblicazione: (2026)
Documenti analoghi
-
MCoT-RE: Multi-Faceted Chain-of-Thought and Re-Ranking for Training-Free Zero-Shot Composed Image Retrieval
di: Park, Jeong-Woo, et al.
Pubblicazione: (2025) -
Tool-MCoT: Tool Augmented Multimodal Chain-of-Thought for Content Safety Moderation
di: Zhang, Shutong, et al.
Pubblicazione: (2026) -
CoTMR: Chain-of-Thought Multi-Scale Reasoning for Training-Free Zero-Shot Composed Image Retrieval
di: Sun, Zelong, et al.
Pubblicazione: (2025) -
Reason-before-Retrieve: One-Stage Reflective Chain-of-Thoughts for Training-Free Zero-Shot Composed Image Retrieval
di: Tang, Yuanmin, et al.
Pubblicazione: (2024) -
Olapa-MCoT: Enhancing the Chinese Mathematical Reasoning Capability of LLMs
di: Zhu, Shaojie, et al.
Pubblicazione: (2023)