Empowering Small VLMs to Think with Dynamic Memorization and Exploration
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Jiazhen, Deng, Yuchuan, Chen, Long |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Segmentation as A Plug-and-Play Capability for Frozen Multimodal LLMs
par: Liu, Jiazhen, et autres
Publié: (2025)
par: Liu, Jiazhen, et autres
Publié: (2025)
Better, Stronger, Faster: Tackling the Trilemma in MLLM-based Segmentation with Simultaneous Textual Mask Prediction
par: Liu, Jiazhen, et autres
Publié: (2025)
par: Liu, Jiazhen, et autres
Publié: (2025)
Fundus-R1: Training a Fundus-Reading MLLM with Knowledge-Aware Reasoning on Public Data
par: Deng, Yuchuan, et autres
Publié: (2026)
par: Deng, Yuchuan, et autres
Publié: (2026)
How to Take a Memorable Picture? Empowering Users with Actionable Feedback
par: Laiti, Francesco, et autres
Publié: (2026)
par: Laiti, Francesco, et autres
Publié: (2026)
CLGRPO: Reasoning Ability Enhancement for Small VLMs
par: Wang, Fanyi, et autres
Publié: (2025)
par: Wang, Fanyi, et autres
Publié: (2025)
Listener-Rewarded Thinking in VLMs for Image Preferences
par: Gambashidze, Alexander, et autres
Publié: (2025)
par: Gambashidze, Alexander, et autres
Publié: (2025)
DDX-TRACE: A Benchmark for Medical Diagnostic Trajectories in VLMs
par: Pan, Jiazhen, et autres
Publié: (2026)
par: Pan, Jiazhen, et autres
Publié: (2026)
Think Twice to See More: Iterative Visual Reasoning in Medical VLMs
par: Chen, Kaitao, et autres
Publié: (2025)
par: Chen, Kaitao, et autres
Publié: (2025)
Towards Memorization-Free Diffusion Models
par: Chen, Chen, et autres
Publié: (2024)
par: Chen, Chen, et autres
Publié: (2024)
Investigating Memorization in Video Diffusion Models
par: Chen, Chen, et autres
Publié: (2024)
par: Chen, Chen, et autres
Publié: (2024)
Exploration of VLMs for Driver Monitoring Systems Applications
par: Cañas, Paola Natalia, et autres
Publié: (2025)
par: Cañas, Paola Natalia, et autres
Publié: (2025)
PuzzleCraft: Exploration-Aware Curriculum Learning for Puzzle-Based RLVR in VLMs
par: Jeddi, Ahmadreza, et autres
Publié: (2025)
par: Jeddi, Ahmadreza, et autres
Publié: (2025)
Detecting, Explaining, and Mitigating Memorization in Diffusion Models
par: Wen, Yuxin, et autres
Publié: (2024)
par: Wen, Yuxin, et autres
Publié: (2024)
VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs
par: Berman, Shmuel, et autres
Publié: (2025)
par: Berman, Shmuel, et autres
Publié: (2025)
Integration of Object Detection and Small VLMs for Construction Safety Hazard Identification
par: Adil, Muhammad, et autres
Publié: (2026)
par: Adil, Muhammad, et autres
Publié: (2026)
Thinking with Gaze: Sequential Eye-Tracking as Visual Reasoning Supervision for Medical VLMs
par: Li, Yiwei, et autres
Publié: (2026)
par: Li, Yiwei, et autres
Publié: (2026)
MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning
par: Pan, Jiazhen, et autres
Publié: (2025)
par: Pan, Jiazhen, et autres
Publié: (2025)
DAPL: Integration of Positive and Negative Descriptions in Text-Based Person Search
par: Deng, Yuchuan, et autres
Publié: (2024)
par: Deng, Yuchuan, et autres
Publié: (2024)
From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
par: Zhu, Wenxin, et autres
Publié: (2025)
par: Zhu, Wenxin, et autres
Publié: (2025)
Enhancing Privacy-Utility Trade-offs to Mitigate Memorization in Diffusion Models
par: Chen, Chen, et autres
Publié: (2025)
par: Chen, Chen, et autres
Publié: (2025)
Exploring Local Memorization in Diffusion Models via Bright Ending Attention
par: Chen, Chen, et autres
Publié: (2024)
par: Chen, Chen, et autres
Publié: (2024)
SemVink: Advancing VLMs' Semantic Understanding of Optical Illusions via Visual Global Thinking
par: Li, Sifan, et autres
Publié: (2025)
par: Li, Sifan, et autres
Publié: (2025)
Unconsciously Forget: Mitigating Memorization; Without Knowing What is being Memorized
par: Jin, Er, et autres
Publié: (2025)
par: Jin, Er, et autres
Publié: (2025)
Modeling Visual Memorability Assessment with Autoencoders Reveals Characteristics of Memorable Images
par: Bagheri, Elham, et autres
Publié: (2024)
par: Bagheri, Elham, et autres
Publié: (2024)
Learn to Memorize and to Forget: A Continual Learning Perspective of Dynamic SLAM
par: Li, Baicheng, et autres
Publié: (2024)
par: Li, Baicheng, et autres
Publié: (2024)
Memorizing SAM: 3D Medical Segment Anything Model with Memorizing Transformer
par: Shao, Xinyuan, et autres
Publié: (2024)
par: Shao, Xinyuan, et autres
Publié: (2024)
World2VLM: Distilling World Model Imagination into VLMs for Dynamic Spatial Reasoning
par: Zhang, Wanyue, et autres
Publié: (2026)
par: Zhang, Wanyue, et autres
Publié: (2026)
A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs
par: Zhao, Wangbo, et autres
Publié: (2024)
par: Zhao, Wangbo, et autres
Publié: (2024)
Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs
par: Zhang, Xintong, et autres
Publié: (2025)
par: Zhang, Xintong, et autres
Publié: (2025)
Start Small, Think Big: Curriculum-based Relative Policy Optimization for Visual Grounding
par: Yan, Qingyang, et autres
Publié: (2025)
par: Yan, Qingyang, et autres
Publié: (2025)
Empowering Dynamic Urban Navigation with Stereo and Mid-Level Vision
par: Zhou, Wentao, et autres
Publié: (2025)
par: Zhou, Wentao, et autres
Publié: (2025)
How Diffusion Models Memorize
par: Kim, Juyeop, et autres
Publié: (2025)
par: Kim, Juyeop, et autres
Publié: (2025)
Global-Local Tree Search in VLMs for 3D Indoor Scene Generation
par: Deng, Wei, et autres
Publié: (2025)
par: Deng, Wei, et autres
Publié: (2025)
Efficient Large-Deformation Medical Image Registration via Recurrent Dynamic Correlation
par: Li, Tianran, et autres
Publié: (2025)
par: Li, Tianran, et autres
Publié: (2025)
AdaThinkDrive: Adaptive Thinking via Reinforcement Learning for Autonomous Driving
par: Luo, Yuechen, et autres
Publié: (2025)
par: Luo, Yuechen, et autres
Publié: (2025)
XSPA: Crafting Imperceptible X-Shaped Sparse Adversarial Perturbations for Transferable Attacks on VLMs
par: Hu, Chengyin, et autres
Publié: (2026)
par: Hu, Chengyin, et autres
Publié: (2026)
Are VLMs Ready for Lane Topology Awareness in Autonomous Driving?
par: Chen, Xin, et autres
Publié: (2025)
par: Chen, Xin, et autres
Publié: (2025)
Filtering Memorization from Parameter-Space in Diffusion Models
par: Zhe, Yu, et autres
Publié: (2026)
par: Zhe, Yu, et autres
Publié: (2026)
Deep Pre-Alignment for VLMs
par: Yu, Tianyu, et autres
Publié: (2026)
par: Yu, Tianyu, et autres
Publié: (2026)
Redistribute Ensemble Training for Mitigating Memorization in Diffusion Models
par: Guan, Xiaoliu, et autres
Publié: (2025)
par: Guan, Xiaoliu, et autres
Publié: (2025)
Documents similaires
-
Segmentation as A Plug-and-Play Capability for Frozen Multimodal LLMs
par: Liu, Jiazhen, et autres
Publié: (2025) -
Better, Stronger, Faster: Tackling the Trilemma in MLLM-based Segmentation with Simultaneous Textual Mask Prediction
par: Liu, Jiazhen, et autres
Publié: (2025) -
Fundus-R1: Training a Fundus-Reading MLLM with Knowledge-Aware Reasoning on Public Data
par: Deng, Yuchuan, et autres
Publié: (2026) -
How to Take a Memorable Picture? Empowering Users with Actionable Feedback
par: Laiti, Francesco, et autres
Publié: (2026) -
CLGRPO: Reasoning Ability Enhancement for Small VLMs
par: Wang, Fanyi, et autres
Publié: (2025)