Learning to Think Fast and Slow for Visual Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lin, Chenyu, Chi, Cheng, Wu, Jinlin, Li, Sharon, Zhou, Kaiyang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Interactive Continual Learning: Fast and Slow Thinking
par: Qi, Biqing, et autres
Publié: (2024)
par: Qi, Biqing, et autres
Publié: (2024)
Visionary-R1: Mitigating Shortcuts in Visual Reasoning with Reinforcement Learning
par: Xia, Jiaer, et autres
Publié: (2025)
par: Xia, Jiaer, et autres
Publié: (2025)
Language-Conditioned Robotic Manipulation with Fast and Slow Thinking
par: Zhu, Minjie, et autres
Publié: (2024)
par: Zhu, Minjie, et autres
Publié: (2024)
Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning
par: Xiao, Wenyi, et autres
Publié: (2025)
par: Xiao, Wenyi, et autres
Publié: (2025)
SlowFast-SCI: Slow-Fast Deep Unfolding Learning for Spectral Compressive Imaging
par: Zeng, Haijin, et autres
Publié: (2025)
par: Zeng, Haijin, et autres
Publié: (2025)
Language-Informed Visual Concept Learning
par: Lee, Sharon, et autres
Publié: (2023)
par: Lee, Sharon, et autres
Publié: (2023)
Fine-tuning Quantized Neural Networks with Zeroth-order Optimization
par: Shang, Sifeng, et autres
Publié: (2025)
par: Shang, Sifeng, et autres
Publié: (2025)
A Self-Correcting Vision-Language-Action Model for Fast and Slow System Manipulation
par: Li, Chenxuan, et autres
Publié: (2024)
par: Li, Chenxuan, et autres
Publié: (2024)
Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning
par: Zhang, Dingkun, et autres
Publié: (2026)
par: Zhang, Dingkun, et autres
Publié: (2026)
Think-Clip-Sample: Slow-Fast Frame Selection for Video Understanding
par: Tan, Wenhui, et autres
Publié: (2026)
par: Tan, Wenhui, et autres
Publié: (2026)
Slot-VLM: SlowFast Slots for Video-Language Modeling
par: Xu, Jiaqi, et autres
Publié: (2024)
par: Xu, Jiaqi, et autres
Publié: (2024)
Semi-off-Policy Reinforcement Learning for Vision-Language Slow-Thinking Reasoning
par: Shen, Junhao, et autres
Publié: (2025)
par: Shen, Junhao, et autres
Publié: (2025)
Slow-Fast Architecture for Video Multi-Modal Large Language Models
par: Shi, Min, et autres
Publié: (2025)
par: Shi, Min, et autres
Publié: (2025)
Measuring Epistemic Humility in Multimodal Large Language Models
par: Tong, Bingkui, et autres
Publié: (2025)
par: Tong, Bingkui, et autres
Publié: (2025)
SlowFast-VGen: Slow-Fast Learning for Action-Driven Long Video Generation
par: Hong, Yining, et autres
Publié: (2024)
par: Hong, Yining, et autres
Publié: (2024)
OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning
par: Su, Zhaochen, et autres
Publié: (2025)
par: Su, Zhaochen, et autres
Publié: (2025)
Towards Open Environments and Instructions: General Vision-Language Navigation via Fast-Slow Interactive Reasoning
par: Li, Yang, et autres
Publié: (2026)
par: Li, Yang, et autres
Publié: (2026)
Emotional Theory of Mind: Bridging Fast Visual Processing with Slow Linguistic Reasoning
par: Etesam, Yasaman, et autres
Publié: (2023)
par: Etesam, Yasaman, et autres
Publié: (2023)
LION-FS: Fast & Slow Video-Language Thinker as Online Video Assistant
par: Li, Wei, et autres
Publié: (2025)
par: Li, Wei, et autres
Publié: (2025)
Journey Before Destination: On the importance of Visual Faithfulness in Slow Thinking
par: Uppaal, Rheeya, et autres
Publié: (2025)
par: Uppaal, Rheeya, et autres
Publié: (2025)
ThinkGen: Generalized Thinking for Visual Generation
par: Jiao, Siyu, et autres
Publié: (2025)
par: Jiao, Siyu, et autres
Publié: (2025)
FASTopoWM: Fast-Slow Lane Segment Topology Reasoning with Latent World Models
par: Yang, Yiming, et autres
Publié: (2025)
par: Yang, Yiming, et autres
Publié: (2025)
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
par: Ye, Weihao, et autres
Publié: (2024)
par: Ye, Weihao, et autres
Publié: (2024)
Skill-Conditioned Visual Geolocation for Vision-Language Models
par: Yang, Chenjie, et autres
Publié: (2026)
par: Yang, Chenjie, et autres
Publié: (2026)
Fast-Slow Test-Time Adaptation for Online Vision-and-Language Navigation
par: Gao, Junyu, et autres
Publié: (2023)
par: Gao, Junyu, et autres
Publié: (2023)
SlowFastVAD: Video Anomaly Detection via Integrating Simple Detector and RAG-Enhanced Vision-Language Model
par: Ding, Zongcan, et autres
Publié: (2025)
par: Ding, Zongcan, et autres
Publié: (2025)
EgoThink: Evaluating First-Person Perspective Thinking Capability of Vision-Language Models
par: Cheng, Sijie, et autres
Publié: (2023)
par: Cheng, Sijie, et autres
Publié: (2023)
AutoLayout: Closed-Loop Layout Synthesis via Slow-Fast Collaborative Reasoning
par: Chen, Weixing, et autres
Publié: (2025)
par: Chen, Weixing, et autres
Publié: (2025)
AdaDrive: Self-Adaptive Slow-Fast System for Language-Grounded Autonomous Driving
par: Zhang, Ruifei, et autres
Publié: (2025)
par: Zhang, Ruifei, et autres
Publié: (2025)
AtomThink: Multimodal Slow Thinking with Atomic Step Reasoning
par: Xiang, Kun, et autres
Publié: (2024)
par: Xiang, Kun, et autres
Publié: (2024)
UniDA3D: A Unified Domain-Adaptive Framework for Multi-View 3D Object Detection
par: Wu, Hongjing, et autres
Publié: (2026)
par: Wu, Hongjing, et autres
Publié: (2026)
From Slow Bidirectional to Fast Autoregressive Video Diffusion Models
par: Yin, Tianwei, et autres
Publié: (2024)
par: Yin, Tianwei, et autres
Publié: (2024)
SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models
par: Xu, Mingze, et autres
Publié: (2024)
par: Xu, Mingze, et autres
Publié: (2024)
Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
par: Wang, Jiaqi, et autres
Publié: (2025)
par: Wang, Jiaqi, et autres
Publié: (2025)
StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling
par: Wei, Meng, et autres
Publié: (2025)
par: Wei, Meng, et autres
Publié: (2025)
Think Twice, Click Once: Enhancing GUI Grounding via Fast and Slow Systems
par: Tang, Fei, et autres
Publié: (2025)
par: Tang, Fei, et autres
Publié: (2025)
Look Again, Think Slowly: Enhancing Visual Reflection in Vision-Language Models
par: Jian, Pu, et autres
Publié: (2025)
par: Jian, Pu, et autres
Publié: (2025)
SFMViT: SlowFast Meet ViT in Chaotic World
par: Lin, Jiaying, et autres
Publié: (2024)
par: Lin, Jiaying, et autres
Publié: (2024)
Enhancing Visual Place Recognition via Fast and Slow Adaptive Biasing in Event Cameras
par: Nair, Gokul B., et autres
Publié: (2024)
par: Nair, Gokul B., et autres
Publié: (2024)
Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
par: Wu, Junfei, et autres
Publié: (2025)
par: Wu, Junfei, et autres
Publié: (2025)
Documents similaires
-
Interactive Continual Learning: Fast and Slow Thinking
par: Qi, Biqing, et autres
Publié: (2024) -
Visionary-R1: Mitigating Shortcuts in Visual Reasoning with Reinforcement Learning
par: Xia, Jiaer, et autres
Publié: (2025) -
Language-Conditioned Robotic Manipulation with Fast and Slow Thinking
par: Zhu, Minjie, et autres
Publié: (2024) -
Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning
par: Xiao, Wenyi, et autres
Publié: (2025) -
SlowFast-SCI: Slow-Fast Deep Unfolding Learning for Spectral Compressive Imaging
par: Zeng, Haijin, et autres
Publié: (2025)