Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Ye, Zhipeng, Huang, Jiaqi, Jiang, Feng, Wang, Qiufeng, Duan, Yikang, Wang, Dawei, Zhou, Xihang, Qiao, Qian |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
IDEA: Image Description Enhanced CLIP-Adapter
por: Ye, Zhipeng, et al.
Publicado: (2025)
por: Ye, Zhipeng, et al.
Publicado: (2025)
Divide, Conquer and Combine: A Training-Free Framework for High-Resolution Image Perception in Multimodal Large Language Models
por: Wang, Wenbin, et al.
Publicado: (2024)
por: Wang, Wenbin, et al.
Publicado: (2024)
MERG3R: A Divide-and-Conquer Approach to Large-Scale Neural Visual Geometry
por: Cheng, Leo Kaixuan, et al.
Publicado: (2026)
por: Cheng, Leo Kaixuan, et al.
Publicado: (2026)
Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models
por: Xiao, Junyuan, et al.
Publicado: (2026)
por: Xiao, Junyuan, et al.
Publicado: (2026)
Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension
por: Xu, Haoran, et al.
Publicado: (2026)
por: Xu, Haoran, et al.
Publicado: (2026)
Divide and Conquer: Reliable Multi-View Evidential Learning for Deepfake Detection
por: Kang, Xiaolu, et al.
Publicado: (2026)
por: Kang, Xiaolu, et al.
Publicado: (2026)
Divide, Conquer and Unite: Hierarchical Style-Recalibrated Prototype Alignment for Federated Medical Segmentation
por: Zhao, Xingyue, et al.
Publicado: (2025)
por: Zhao, Xingyue, et al.
Publicado: (2025)
Divide and Conquer: A Large-Scale Dataset and Model for Left-Right Breast MRI Segmentation
por: Rokuss, Maximilian, et al.
Publicado: (2025)
por: Rokuss, Maximilian, et al.
Publicado: (2025)
Divide-and-Conquer: Tree-structured Strategy with Answer Distribution Estimator for Goal-Oriented Visual Dialogue
por: Cai, Shuo, et al.
Publicado: (2025)
por: Cai, Shuo, et al.
Publicado: (2025)
Divide-and-Conquer Approach to Holistic Cognition in High-Similarity Contexts with Limited Data
por: Wang, Shijie, et al.
Publicado: (2026)
por: Wang, Shijie, et al.
Publicado: (2026)
OphIn-500K: Curating Web-Scale Visual Instructions for Scaling Ophthalmic Multimodal Large Language Models
por: Dong, Xuanzhao, et al.
Publicado: (2026)
por: Dong, Xuanzhao, et al.
Publicado: (2026)
Divide-and-Conquer Decoupled Network for Cross-Domain Few-Shot Segmentation
por: Cong, Runmin, et al.
Publicado: (2025)
por: Cong, Runmin, et al.
Publicado: (2025)
Control Large Language Models via Divide and Conquer
por: Li, Bingxuan, et al.
Publicado: (2024)
por: Li, Bingxuan, et al.
Publicado: (2024)
MQuant: Unleashing the Inference Potential of Multimodal Large Language Models via Full Static Quantization
por: Yu, JiangYong, et al.
Publicado: (2025)
por: Yu, JiangYong, et al.
Publicado: (2025)
DCA: Dividing and Conquering Amnesia in Incremental Object Detection
por: Zhang, Aoting, et al.
Publicado: (2025)
por: Zhang, Aoting, et al.
Publicado: (2025)
Divide and Conquer: Language Models can Plan and Self-Correct for Compositional Text-to-Image Generation
por: Wang, Zhenyu, et al.
Publicado: (2024)
por: Wang, Zhenyu, et al.
Publicado: (2024)
MicroCinema: A Divide-and-Conquer Approach for Text-to-Video Generation
por: Wang, Yanhui, et al.
Publicado: (2023)
por: Wang, Yanhui, et al.
Publicado: (2023)
Progressive Divide-and-Conquer via Subsampling Decomposition for Accelerated MRI
por: Wang, Chong, et al.
Publicado: (2024)
por: Wang, Chong, et al.
Publicado: (2024)
CoVFT: Context-aware Visual Fine-tuning for Multimodal Large Language Models
por: Zhou, Nan, et al.
Publicado: (2026)
por: Zhou, Nan, et al.
Publicado: (2026)
Divide, Harmonize, Then Conquer It: Shooting Multi-Commodity Flow Problems with Multimodal Language Models
por: Yuan, Xinyu, et al.
Publicado: (2026)
por: Yuan, Xinyu, et al.
Publicado: (2026)
Divide and Conquer: A Hybrid Strategy Defeats Multimodal Large Language Models
por: Mao, Yanxu, et al.
Publicado: (2024)
por: Mao, Yanxu, et al.
Publicado: (2024)
DCText: Scheduled Attention Masking for Visual Text Generation via Divide-and-Conquer Strategy
por: Song, Jaewoo, et al.
Publicado: (2025)
por: Song, Jaewoo, et al.
Publicado: (2025)
Divide-and-Conquer for Enhancing Unlabeled Learning, Stability, and Plasticity in Semi-supervised Continual Learning
por: Duan, Yue, et al.
Publicado: (2025)
por: Duan, Yue, et al.
Publicado: (2025)
DCDM: Divide-and-Conquer Diffusion Models for Consistency-Preserving Video Generation
por: Zhao, Haoyu, et al.
Publicado: (2026)
por: Zhao, Haoyu, et al.
Publicado: (2026)
DC-Net: Divide-and-Conquer for Salient Object Detection
por: Zhu, Jiayi, et al.
Publicado: (2023)
por: Zhu, Jiayi, et al.
Publicado: (2023)
Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces
por: Luo, Gen, et al.
Publicado: (2025)
por: Luo, Gen, et al.
Publicado: (2025)
UniChest: Conquer-and-Divide Pre-training for Multi-Source Chest X-Ray Classification
por: Dai, Tianjie, et al.
Publicado: (2023)
por: Dai, Tianjie, et al.
Publicado: (2023)
UDC: A Unified Neural Divide-and-Conquer Framework for Large-Scale Combinatorial Optimization Problems
por: Zheng, Zhi, et al.
Publicado: (2024)
por: Zheng, Zhi, et al.
Publicado: (2024)
V-ITI: Mitigating Hallucinations in Multimodal Large Language Models via Visual Inference-Time Intervention
por: Sun, Nan, et al.
Publicado: (2025)
por: Sun, Nan, et al.
Publicado: (2025)
UniCode: Learning a Unified Codebook for Multimodal Large Language Models
por: Zheng, Sipeng, et al.
Publicado: (2024)
por: Zheng, Sipeng, et al.
Publicado: (2024)
Divide and Conquer: Heterogeneous Noise Integration for Diffusion-based Adversarial Purification
por: Pei, Gaozheng, et al.
Publicado: (2025)
por: Pei, Gaozheng, et al.
Publicado: (2025)
Semantics versus Identity: A Divide-and-Conquer Approach towards Adjustable Medical Image De-Identification
por: Tian, Yuan, et al.
Publicado: (2025)
por: Tian, Yuan, et al.
Publicado: (2025)
White-box Multimodal Jailbreaks Against Large Vision-Language Models
por: Wang, Ruofan, et al.
Publicado: (2024)
por: Wang, Ruofan, et al.
Publicado: (2024)
EM-KD: Distilling Efficient Multimodal Large Language Model with Unbalanced Vision Tokens
por: Feng, Ze, et al.
Publicado: (2025)
por: Feng, Ze, et al.
Publicado: (2025)
Visual-Guided Key-Token Regularization for Multimodal Large Language Model Unlearning
por: Cai, Chengyi, et al.
Publicado: (2026)
por: Cai, Chengyi, et al.
Publicado: (2026)
GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing
por: Fang, Rongyao, et al.
Publicado: (2025)
por: Fang, Rongyao, et al.
Publicado: (2025)
Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference
por: Lin, Zhihang, et al.
Publicado: (2024)
por: Lin, Zhihang, et al.
Publicado: (2024)
Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models
por: Dong, Xinpeng, et al.
Publicado: (2026)
por: Dong, Xinpeng, et al.
Publicado: (2026)
Are We on the Right Way for Evaluating Large Vision-Language Models?
por: Chen, Lin, et al.
Publicado: (2024)
por: Chen, Lin, et al.
Publicado: (2024)
An Examination on the Effectiveness of Divide-and-Conquer Prompting in Large Language Models
por: Zhang, Yizhou, et al.
Publicado: (2024)
por: Zhang, Yizhou, et al.
Publicado: (2024)
Ejemplares similares
-
IDEA: Image Description Enhanced CLIP-Adapter
por: Ye, Zhipeng, et al.
Publicado: (2025) -
Divide, Conquer and Combine: A Training-Free Framework for High-Resolution Image Perception in Multimodal Large Language Models
por: Wang, Wenbin, et al.
Publicado: (2024) -
MERG3R: A Divide-and-Conquer Approach to Large-Scale Neural Visual Geometry
por: Cheng, Leo Kaixuan, et al.
Publicado: (2026) -
Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models
por: Xiao, Junyuan, et al.
Publicado: (2026) -
Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension
por: Xu, Haoran, et al.
Publicado: (2026)