CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Liupeng, Kang, Haoqian, Lu, Zhenyu, Wang, Jinpeng, Chen, Bin, Chen, Ke, Wang, Yaowei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SegCompass: Exploring Interpretable Alignment with Sparse Autoencoders for Enhanced Reasoning Segmentation
par: Lu, Zhenyu, et autres
Publié: (2026)
par: Lu, Zhenyu, et autres
Publié: (2026)
CoPRS: Learning Positional Prior from Chain-of-Thought for Reasoning Segmentation
par: Lu, Zhenyu, et autres
Publié: (2025)
par: Lu, Zhenyu, et autres
Publié: (2025)
Embracing Collaboration Over Competition: Condensing Multiple Prompts for Visual In-Context Learning
par: Wang, Jinpeng, et autres
Publié: (2025)
par: Wang, Jinpeng, et autres
Publié: (2025)
Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval
par: Li, Jun, et autres
Publié: (2026)
par: Li, Jun, et autres
Publié: (2026)
AutoSSVH: Exploring Automated Frame Sampling for Efficient Self-Supervised Video Hashing
par: Lian, Niu, et autres
Publié: (2025)
par: Lian, Niu, et autres
Publié: (2025)
Towards Efficient Low-rate Image Compression with Frequency-aware Diffusion Prior Refinement
par: Xia, Yichong, et autres
Publié: (2026)
par: Xia, Yichong, et autres
Publié: (2026)
HLFormer: Enhancing Partially Relevant Video Retrieval with Hyperbolic Learning
par: Li, Jun, et autres
Publié: (2025)
par: Li, Jun, et autres
Publié: (2025)
Empowering Multimodal LLMs with External Tools: A Comprehensive Survey
par: An, Wenbin, et autres
Publié: (2025)
par: An, Wenbin, et autres
Publié: (2025)
From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents
par: Lian, Niu, et autres
Publié: (2026)
par: Lian, Niu, et autres
Publié: (2026)
Revisiting Uncertainty: On Evidential Learning for Partially Relevant Video Retrieval
par: Li, Jun, et autres
Publié: (2026)
par: Li, Jun, et autres
Publié: (2026)
Spatiotemporal Graph Guided Multi-modal Network for Livestreaming Product Retrieval
par: Hu, Xiaowan, et autres
Publié: (2024)
par: Hu, Xiaowan, et autres
Publié: (2024)
Love Me, Love My Label: Rethinking the Role of Labels in Prompt Retrieval for Visual In-Context Learning
par: Luo, Tianci, et autres
Publié: (2026)
par: Luo, Tianci, et autres
Publié: (2026)
Hi3D: Pursuing High-Resolution Image-to-3D Generation with Video Diffusion Models
par: Yang, Haibo, et autres
Publié: (2024)
par: Yang, Haibo, et autres
Publié: (2024)
SmartSplat: Feature-Smart Gaussians for Scalable Compression of Ultra-High-Resolution Images
par: Li, Linfei, et autres
Publié: (2025)
par: Li, Linfei, et autres
Publié: (2025)
From Pixels to Feelings: Aligning MLLMs with Human Cognitive Perception of Images
par: Chen, Yiming, et autres
Publié: (2025)
par: Chen, Yiming, et autres
Publié: (2025)
HR-INR: Continuous Space-Time Video Super-Resolution via Event Camera
par: Lu, Yunfan, et autres
Publié: (2024)
par: Lu, Yunfan, et autres
Publié: (2024)
Synthetic Perception: Can Generated Images Unlock Latent Visual Prior for Text-Centric Reasoning?
par: Huang, Yuesheng, et autres
Publié: (2025)
par: Huang, Yuesheng, et autres
Publié: (2025)
Graph-Based Cross-Domain Knowledge Distillation for Cross-Dataset Text-to-Image Person Retrieval
par: Luo, Bingjun, et autres
Publié: (2025)
par: Luo, Bingjun, et autres
Publié: (2025)
Visual Semantic Description Generation with MLLMs for Image-Text Matching
par: Chen, Junyu, et autres
Publié: (2025)
par: Chen, Junyu, et autres
Publié: (2025)
Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing
par: Zhao, Pengcheng, et autres
Publié: (2024)
par: Zhao, Pengcheng, et autres
Publié: (2024)
GMMFormer: Gaussian-Mixture-Model Based Transformer for Efficient Partially Relevant Video Retrieval
par: Wang, Yuting, et autres
Publié: (2023)
par: Wang, Yuting, et autres
Publié: (2023)
Unlearning the Noisy Correspondence Makes CLIP More Robust
par: Han, Haochen, et autres
Publié: (2025)
par: Han, Haochen, et autres
Publié: (2025)
MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces
par: E, Shaojun, et autres
Publié: (2025)
par: E, Shaojun, et autres
Publié: (2025)
Towards Robust and Realible Multimodal Misinformation Recognition with Incomplete Modality
par: Zhou, Hengyang, et autres
Publié: (2025)
par: Zhou, Hengyang, et autres
Publié: (2025)
LMM4Edit: Benchmarking and Evaluating Multimodal Image Editing with LMMs
par: Xu, Zitong, et autres
Publié: (2025)
par: Xu, Zitong, et autres
Publié: (2025)
Audio-Guided Visual Perception for Audio-Visual Navigation
par: Wang, Yi, et autres
Publié: (2025)
par: Wang, Yi, et autres
Publié: (2025)
Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis
par: Chen, Shuang, et autres
Publié: (2026)
par: Chen, Shuang, et autres
Publié: (2026)
DIVA: Harnessing the Representation Divergence in Unified Multimodal Models for Mutual Reinforcement
par: Lu, Renjie, et autres
Publié: (2026)
par: Lu, Renjie, et autres
Publié: (2026)
Efficient Self-Supervised Video Hashing with Selective State Spaces
par: Wang, Jinpeng, et autres
Publié: (2024)
par: Wang, Jinpeng, et autres
Publié: (2024)
Beyond Semantic Search: Towards Referential Anchoring in Composed Image Retrieval
par: Yang, Yuxin, et autres
Publié: (2026)
par: Yang, Yuxin, et autres
Publié: (2026)
Proxy-Tuning: Tailoring Multimodal Autoregressive Models for Subject-Driven Image Generation
par: Wu, Yi, et autres
Publié: (2025)
par: Wu, Yi, et autres
Publié: (2025)
URMF: Uncertainty-aware Robust Multimodal Fusion for Multimodal Sarcasm Detection
par: Wang, Zhenyu, et autres
Publié: (2026)
par: Wang, Zhenyu, et autres
Publié: (2026)
Image Conductor: Precision Control for Interactive Video Synthesis
par: Li, Yaowei, et autres
Publié: (2024)
par: Li, Yaowei, et autres
Publié: (2024)
FakeBench: Probing Explainable Fake Image Detection via Large Multimodal Models
par: Li, Yixuan, et autres
Publié: (2024)
par: Li, Yixuan, et autres
Publié: (2024)
Enrich and Detect: Video Temporal Grounding with Multimodal LLMs
par: Pramanick, Shraman, et autres
Publié: (2025)
par: Pramanick, Shraman, et autres
Publié: (2025)
EchoSR: Efficient Context Harnessing for Lightweight Image Super-Resolution
par: Zhao, Hanli, et autres
Publié: (2026)
par: Zhao, Hanli, et autres
Publié: (2026)
Delving Deeper: Hierarchical Visual Perception for Robust Video-Text Retrieval
par: Xie, Zequn, et autres
Publié: (2026)
par: Xie, Zequn, et autres
Publié: (2026)
Beyond Walking: A Large-Scale Image-Text Benchmark for Text-based Person Anomaly Search
par: Yang, Shuyu, et autres
Publié: (2024)
par: Yang, Shuyu, et autres
Publié: (2024)
OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video
par: Pu, Junfu, et autres
Publié: (2026)
par: Pu, Junfu, et autres
Publié: (2026)
Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding
par: Wang, Shaoguang, et autres
Publié: (2026)
par: Wang, Shaoguang, et autres
Publié: (2026)
Documents similaires
-
SegCompass: Exploring Interpretable Alignment with Sparse Autoencoders for Enhanced Reasoning Segmentation
par: Lu, Zhenyu, et autres
Publié: (2026) -
CoPRS: Learning Positional Prior from Chain-of-Thought for Reasoning Segmentation
par: Lu, Zhenyu, et autres
Publié: (2025) -
Embracing Collaboration Over Competition: Condensing Multiple Prompts for Visual In-Context Learning
par: Wang, Jinpeng, et autres
Publié: (2025) -
Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval
par: Li, Jun, et autres
Publié: (2026) -
AutoSSVH: Exploring Automated Frame Sampling for Efficient Self-Supervised Video Hashing
par: Lian, Niu, et autres
Publié: (2025)