Pest-Thinker: Learning to Think and Reason like Entomologists via Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Xueheng, Wang, Yu, Hu, Tao, Huang, Ji, Cao, Ke, Yang, Qize, Li, Rui, Zhang, Jie, Xie, Chengjun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
PestVL-Net: Enabling Multimodal Pest Learning via Fine-grained Vision-Language Interaction
von: Li, Xueheng, et al.
Veröffentlicht: (2026)
von: Li, Xueheng, et al.
Veröffentlicht: (2026)
When Classes Evolve: A Benchmark and Framework for Stage-Aware Class-Incremental Learning
von: Zhang, Zheng, et al.
Veröffentlicht: (2026)
von: Zhang, Zheng, et al.
Veröffentlicht: (2026)
SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning
von: Chng, Yong Xien, et al.
Veröffentlicht: (2025)
von: Chng, Yong Xien, et al.
Veröffentlicht: (2025)
GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking
von: Cheng, Zixu, et al.
Veröffentlicht: (2026)
von: Cheng, Zixu, et al.
Veröffentlicht: (2026)
Video-Thinker: Sparking "Thinking with Videos" via Reinforcement Learning
von: Wang, Shijian, et al.
Veröffentlicht: (2025)
von: Wang, Shijian, et al.
Veröffentlicht: (2025)
FrameThinker: Learning to Think with Long Videos via Multi-Turn Frame Spotlighting
von: He, Zefeng, et al.
Veröffentlicht: (2025)
von: He, Zefeng, et al.
Veröffentlicht: (2025)
Rethinking Pan-sharpening: A New Training Process for Full-Resolution Generalization
von: Zhang, Ran, et al.
Veröffentlicht: (2025)
von: Zhang, Ran, et al.
Veröffentlicht: (2025)
Cross-Scale Pansharpening via ScaleFormer and the PanScale Benchmark
von: Cao, Ke, et al.
Veröffentlicht: (2026)
von: Cao, Ke, et al.
Veröffentlicht: (2026)
V-Thinker: Interactive Thinking with Images
von: Qiao, Runqi, et al.
Veröffentlicht: (2025)
von: Qiao, Runqi, et al.
Veröffentlicht: (2025)
DDA-Thinker: Decoupled Dual-Atomic Reinforcement Learning for Reasoning-Driven Image Editing
von: Yang, Hanqing, et al.
Veröffentlicht: (2026)
von: Yang, Hanqing, et al.
Veröffentlicht: (2026)
LookWise: Knowing When and Where to Look for Fine-Grained Visual Reasoning in Multimodal Large Language Models
von: Shen, Yuxiang, et al.
Veröffentlicht: (2026)
von: Shen, Yuxiang, et al.
Veröffentlicht: (2026)
VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning
von: Wang, Qunzhong, et al.
Veröffentlicht: (2025)
von: Wang, Qunzhong, et al.
Veröffentlicht: (2025)
OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning
von: Su, Zhaochen, et al.
Veröffentlicht: (2025)
von: Su, Zhaochen, et al.
Veröffentlicht: (2025)
Shuffle Mamba: State Space Models with Random Shuffle for Multi-Modal Image Fusion
von: Cao, Ke, et al.
Veröffentlicht: (2024)
von: Cao, Ke, et al.
Veröffentlicht: (2024)
WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning
von: Yang, Jie, et al.
Veröffentlicht: (2025)
von: Yang, Jie, et al.
Veröffentlicht: (2025)
TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs
von: Kan, Zhehan, et al.
Veröffentlicht: (2025)
von: Kan, Zhehan, et al.
Veröffentlicht: (2025)
AdaThinkDrive: Adaptive Thinking via Reinforcement Learning for Autonomous Driving
von: Luo, Yuechen, et al.
Veröffentlicht: (2025)
von: Luo, Yuechen, et al.
Veröffentlicht: (2025)
DiffThinker: Towards Generative Multimodal Reasoning with Diffusion Models
von: He, Zefeng, et al.
Veröffentlicht: (2025)
von: He, Zefeng, et al.
Veröffentlicht: (2025)
SpatialThinker: Reinforcing 3D Reasoning in Multimodal LLMs via Spatial Rewards
von: Batra, Hunar, et al.
Veröffentlicht: (2025)
von: Batra, Hunar, et al.
Veröffentlicht: (2025)
ThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editing
von: Li, Hengjia, et al.
Veröffentlicht: (2026)
von: Li, Hengjia, et al.
Veröffentlicht: (2026)
Pan-Mamba: Effective pan-sharpening with State Space Model
von: He, Xuanhua, et al.
Veröffentlicht: (2024)
von: He, Xuanhua, et al.
Veröffentlicht: (2024)
VLA-Thinker: Boosting Vision-Language-Action Models through Thinking-with-Image Reasoning
von: Wang, Chaoyang, et al.
Veröffentlicht: (2026)
von: Wang, Chaoyang, et al.
Veröffentlicht: (2026)
DocThinker: Explainable Multimodal Large Language Models with Rule-based Reinforcement Learning for Document Understanding
von: Yu, Wenwen, et al.
Veröffentlicht: (2025)
von: Yu, Wenwen, et al.
Veröffentlicht: (2025)
Thinker: Learning to Think Fast and Slow
von: Chung, Stephen, et al.
Veröffentlicht: (2025)
von: Chung, Stephen, et al.
Veröffentlicht: (2025)
EditThinker: Unlocking Iterative Reasoning for Any Image Editor
von: Li, Hongyu, et al.
Veröffentlicht: (2025)
von: Li, Hongyu, et al.
Veröffentlicht: (2025)
Audio-Thinker: Guiding Audio Language Model When and How to Think via Reinforcement Learning
von: Wu, Shu, et al.
Veröffentlicht: (2025)
von: Wu, Shu, et al.
Veröffentlicht: (2025)
Unified Thinker: A General Reasoning Modular Core for Image Generation
von: Zhou, Sashuai, et al.
Veröffentlicht: (2026)
von: Zhou, Sashuai, et al.
Veröffentlicht: (2026)
DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning
von: Zheng, Ziwei, et al.
Veröffentlicht: (2025)
von: Zheng, Ziwei, et al.
Veröffentlicht: (2025)
Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning
von: Deng, Huilin, et al.
Veröffentlicht: (2025)
von: Deng, Huilin, et al.
Veröffentlicht: (2025)
LOVE-R1: Advancing Long Video Understanding with an Adaptive Zoom-in Mechanism via Multi-Step Reasoning
von: Fu, Shenghao, et al.
Veröffentlicht: (2025)
von: Fu, Shenghao, et al.
Veröffentlicht: (2025)
Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning
von: Jiang, Qing, et al.
Veröffentlicht: (2025)
von: Jiang, Qing, et al.
Veröffentlicht: (2025)
Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
von: Wang, Jiaqi, et al.
Veröffentlicht: (2025)
von: Wang, Jiaqi, et al.
Veröffentlicht: (2025)
High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement Learning
von: Huang, Xinyu, et al.
Veröffentlicht: (2025)
von: Huang, Xinyu, et al.
Veröffentlicht: (2025)
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
von: Ding, Shengyuan, et al.
Veröffentlicht: (2025)
von: Ding, Shengyuan, et al.
Veröffentlicht: (2025)
EgoThinker: Unveiling Egocentric Reasoning with Spatio-Temporal CoT
von: Pei, Baoqi, et al.
Veröffentlicht: (2025)
von: Pei, Baoqi, et al.
Veröffentlicht: (2025)
GeoReason: Aligning Thinking And Answering In Remote Sensing Vision-Language Models Via Logical Consistency Reinforcement Learning
von: Li, Wenshuai, et al.
Veröffentlicht: (2026)
von: Li, Wenshuai, et al.
Veröffentlicht: (2026)
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
von: Yang, Senqiao, et al.
Veröffentlicht: (2025)
von: Yang, Senqiao, et al.
Veröffentlicht: (2025)
Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning
von: Zhang, Bob, et al.
Veröffentlicht: (2025)
von: Zhang, Bob, et al.
Veröffentlicht: (2025)
Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
von: Zhang, Haoji, et al.
Veröffentlicht: (2025)
von: Zhang, Haoji, et al.
Veröffentlicht: (2025)
LION-FS: Fast & Slow Video-Language Thinker as Online Video Assistant
von: Li, Wei, et al.
Veröffentlicht: (2025)
von: Li, Wei, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
PestVL-Net: Enabling Multimodal Pest Learning via Fine-grained Vision-Language Interaction
von: Li, Xueheng, et al.
Veröffentlicht: (2026) -
When Classes Evolve: A Benchmark and Framework for Stage-Aware Class-Incremental Learning
von: Zhang, Zheng, et al.
Veröffentlicht: (2026) -
SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning
von: Chng, Yong Xien, et al.
Veröffentlicht: (2025) -
GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking
von: Cheng, Zixu, et al.
Veröffentlicht: (2026) -
Video-Thinker: Sparking "Thinking with Videos" via Reinforcement Learning
von: Wang, Shijian, et al.
Veröffentlicht: (2025)