Agentic Jigsaw Interaction Learning for Enhancing Visual Perception and Reasoning in Vision-Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Zeng, Yu, Huang, Wenxuan, Huang, Shiting, Bao, Xikun, Qi, Yukun, Zhao, Yiming, Wang, Qiuchen, Chen, Lin, Chen, Zehui, Chen, Huaian, Ouyang, Wanli, Zhao, Feng |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VCR-Bench: A Comprehensive Evaluation Framework for Video Chain-of-Thought Reasoning
by: Qi, Yukun, et al.
Published: (2025)
by: Qi, Yukun, et al.
Published: (2025)
VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning
by: Wang, Qiuchen, et al.
Published: (2025)
by: Wang, Qiuchen, et al.
Published: (2025)
V2P-Bench: Evaluating Video-Language Understanding with Visual Prompts for Better Human-Model Interaction
by: Zhao, Yiming, et al.
Published: (2025)
by: Zhao, Yiming, et al.
Published: (2025)
AsyncTool: Evaluating the Asynchronous Function Calling Capability under Multi-Task Scenarios
by: Shi, Kou, et al.
Published: (2026)
by: Shi, Kou, et al.
Published: (2026)
Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models
by: Zeng, Yu, et al.
Published: (2026)
by: Zeng, Yu, et al.
Published: (2026)
Beyond Accuracy: Unveiling Inefficiency Patterns in Tool-Integrated Reasoning
by: Su, Qisheng, et al.
Published: (2026)
by: Su, Qisheng, et al.
Published: (2026)
VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation
by: Zhao, Yiming, et al.
Published: (2026)
by: Zhao, Yiming, et al.
Published: (2026)
ADORA: Training Reasoning Models with Dynamic Advantage Estimation on Reinforcement Learning
by: Ren, Qingnan, et al.
Published: (2026)
by: Ren, Qingnan, et al.
Published: (2026)
ViDoRAG: Visual Document Retrieval-Augmented Generation via Dynamic Iterative Reasoning Agents
by: Wang, Qiuchen, et al.
Published: (2025)
by: Wang, Qiuchen, et al.
Published: (2025)
Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models
by: Huang, Wenxuan, et al.
Published: (2026)
by: Huang, Wenxuan, et al.
Published: (2026)
DualVLA: Building a Generalizable Embodied Agent via Partial Decoupling of Reasoning and Action
by: Fang, Zhen, et al.
Published: (2025)
by: Fang, Zhen, et al.
Published: (2025)
A Vanilla Multi-Task Framework for Dense Visual Prediction Solution to 1st VCL Challenge -- Multi-Task Robustness Track
by: Chen, Zehui, et al.
Published: (2024)
by: Chen, Zehui, et al.
Published: (2024)
CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios
by: Huang, Shiting, et al.
Published: (2025)
by: Huang, Shiting, et al.
Published: (2025)
ACC: Compiling Agent Trajectories for Long-Context Training
by: Su, Qisheng, et al.
Published: (2026)
by: Su, Qisheng, et al.
Published: (2026)
Flow-OPD: On-Policy Distillation for Flow Matching Models
by: Fang, Zhen, et al.
Published: (2026)
by: Fang, Zhen, et al.
Published: (2026)
Confident RAG: Enhancing the Performance of LLMs for Mathematics Question Answering through Multi-Embedding and Confidence Scoring
by: Chen, Shiting, et al.
Published: (2025)
by: Chen, Shiting, et al.
Published: (2025)
SCOPE: Structured Decomposition and Conditional Skill Orchestration for Complex Image Generation
by: Ren, Tianfei, et al.
Published: (2026)
by: Ren, Tianfei, et al.
Published: (2026)
SkillFlow:Benchmarking Lifelong Skill Discovery and Evolution for Autonomous Agents
by: Zhang, Ziao, et al.
Published: (2026)
by: Zhang, Ziao, et al.
Published: (2026)
VimRAG: Navigating Massive Visual Context in Retrieval-Augmented Generation via Multimodal Memory Graph
by: Wang, Qiuchen, et al.
Published: (2026)
by: Wang, Qiuchen, et al.
Published: (2026)
MindSearch: Mimicking Human Minds Elicits Deep AI Searcher
by: Chen, Zehui, et al.
Published: (2024)
by: Chen, Zehui, et al.
Published: (2024)
Internalizing Meta-Experience into Memory for Guided Reinforcement Learning in Large Language Models
by: Huang, Shiting, et al.
Published: (2026)
by: Huang, Shiting, et al.
Published: (2026)
Human-Centric Foundation Models: Perception, Generation and Agentic Modeling
by: Tang, Shixiang, et al.
Published: (2025)
by: Tang, Shixiang, et al.
Published: (2025)
SaaSBench: Exploring the Boundaries of Coding Agents in Long-Horizon Enterprise SaaS Engineering
by: Ren, Qingnan, et al.
Published: (2026)
by: Ren, Qingnan, et al.
Published: (2026)
Agent-FLAN: Designing Data and Methods of Effective Agent Tuning for Large Language Models
by: Chen, Zehui, et al.
Published: (2024)
by: Chen, Zehui, et al.
Published: (2024)
Perception Before Reasoning: Two-Stage Reinforcement Learning for Visual Reasoning in Vision-Language Models
by: Chen, Yan, et al.
Published: (2025)
by: Chen, Yan, et al.
Published: (2025)
OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering
by: Jia, Yiduo, et al.
Published: (2026)
by: Jia, Yiduo, et al.
Published: (2026)
Perception-R1: Advancing Multimodal Reasoning Capabilities of MLLMs via Visual Perception Reward
by: Xiao, Tong, et al.
Published: (2025)
by: Xiao, Tong, et al.
Published: (2025)
Towards Fine-grained Large Object Segmentation 1st Place Solution to 3D AI Challenge 2020 -- Instance Segmentation Track
by: Chen, Zehui, et al.
Published: (2020)
by: Chen, Zehui, et al.
Published: (2020)
Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models
by: Lyu, Zesen, et al.
Published: (2025)
by: Lyu, Zesen, et al.
Published: (2025)
ActFormer: Scalable Collaborative Perception via Active Queries
by: Huang, Suozhi, et al.
Published: (2024)
by: Huang, Suozhi, et al.
Published: (2024)
SlowPerception: Physical-World Latency Attack against Visual Perception in Autonomous Driving
by: Ma, Chen, et al.
Published: (2024)
by: Ma, Chen, et al.
Published: (2024)
PEAR: Phase Entropy Aware Reward for Efficient Reasoning
by: Huang, Chen, et al.
Published: (2025)
by: Huang, Chen, et al.
Published: (2025)
CF-Net: A Cross-Feature Reconstruction Network for High-Accuracy 1-Bit Target Classification
by: Qi, Jundong, et al.
Published: (2025)
by: Qi, Jundong, et al.
Published: (2025)
PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues
by: Qi, Yukun, et al.
Published: (2026)
by: Qi, Yukun, et al.
Published: (2026)
Jigsaw Game: Federated Clustering
by: Xu, Jinxuan, et al.
Published: (2024)
by: Xu, Jinxuan, et al.
Published: (2024)
Neuro-Vision to Language: Enhancing Brain Recording-based Visual Reconstruction and Language Interaction
by: Shen, Guobin, et al.
Published: (2024)
by: Shen, Guobin, et al.
Published: (2024)
A note on the equivalence of super-Poincaré inequality
by: Chen, Xin, et al.
Published: (2026)
by: Chen, Xin, et al.
Published: (2026)
Tools as Continuous Flow for Evolving Agentic Reasoning
by: Huang, Tairan, et al.
Published: (2026)
by: Huang, Tairan, et al.
Published: (2026)
BabyVision: Visual Reasoning Beyond Language
by: Chen, Liang, et al.
Published: (2026)
by: Chen, Liang, et al.
Published: (2026)
ChemVLR: Prioritizing Reasoning in Perception for Chemical Vision-Language Understanding
by: Zhao, Xuanle, et al.
Published: (2026)
by: Zhao, Xuanle, et al.
Published: (2026)
Similar Items
-
VCR-Bench: A Comprehensive Evaluation Framework for Video Chain-of-Thought Reasoning
by: Qi, Yukun, et al.
Published: (2025) -
VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning
by: Wang, Qiuchen, et al.
Published: (2025) -
V2P-Bench: Evaluating Video-Language Understanding with Visual Prompts for Better Human-Model Interaction
by: Zhao, Yiming, et al.
Published: (2025) -
AsyncTool: Evaluating the Asynchronous Function Calling Capability under Multi-Task Scenarios
by: Shi, Kou, et al.
Published: (2026) -
Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models
by: Zeng, Yu, et al.
Published: (2026)