Thinking with Images via Self-Calling Agent
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yang, Wenxi, Zhao, Yuzhong, Wan, Fang, Ye, Qixiang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
DynRefer: Delving into Region-level Multimodal Tasks via Dynamic Resolution
von: Zhao, Yuzhong, et al.
Veröffentlicht: (2024)
von: Zhao, Yuzhong, et al.
Veröffentlicht: (2024)
CC-Diff: Enhancing Contextual Coherence in Remote Sensing Image Synthesis
von: Zhang, Mu, et al.
Veröffentlicht: (2024)
von: Zhang, Mu, et al.
Veröffentlicht: (2024)
ControlCap: Controllable Region-level Captioning
von: Zhao, Yuzhong, et al.
Veröffentlicht: (2024)
von: Zhao, Yuzhong, et al.
Veröffentlicht: (2024)
Evaluation of Text-to-Video Generation Models: A Dynamics Perspective
von: Liao, Mingxiang, et al.
Veröffentlicht: (2024)
von: Liao, Mingxiang, et al.
Veröffentlicht: (2024)
Timestep Embedding Tells: It's Time to Cache for Video Diffusion Model
von: Liu, Feng, et al.
Veröffentlicht: (2024)
von: Liu, Feng, et al.
Veröffentlicht: (2024)
URWKV: Unified RWKV Model with Multi-state Perspective for Low-light Image Restoration
von: Xu, Rui, et al.
Veröffentlicht: (2025)
von: Xu, Rui, et al.
Veröffentlicht: (2025)
Self-supervised Feature-Gate Coupling for Dynamic Network Pruning
von: Shi, Mengnan, et al.
Veröffentlicht: (2021)
von: Shi, Mengnan, et al.
Veröffentlicht: (2021)
VMamba: Visual State Space Model
von: Liu, Yue, et al.
Veröffentlicht: (2024)
von: Liu, Yue, et al.
Veröffentlicht: (2024)
Agent Banana: High-Fidelity Image Editing with Agentic Thinking and Tooling
von: Ye, Ruijie, et al.
Veröffentlicht: (2026)
von: Ye, Ruijie, et al.
Veröffentlicht: (2026)
AF-CLIP: Zero-Shot Anomaly Detection via Anomaly-Focused CLIP Adaptation
von: Fang, Qingqing, et al.
Veröffentlicht: (2025)
von: Fang, Qingqing, et al.
Veröffentlicht: (2025)
LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling
von: Yang, Zuhao, et al.
Veröffentlicht: (2025)
von: Yang, Zuhao, et al.
Veröffentlicht: (2025)
AceTone: Bridging Words and Colors for Conditional Image Grading
von: Ma, Tianren, et al.
Veröffentlicht: (2026)
von: Ma, Tianren, et al.
Veröffentlicht: (2026)
DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning
von: Zheng, Ziwei, et al.
Veröffentlicht: (2025)
von: Zheng, Ziwei, et al.
Veröffentlicht: (2025)
Delving Deep into Semantic Relation Distillation
von: Yan, Zhaoyi, et al.
Veröffentlicht: (2025)
von: Yan, Zhaoyi, et al.
Veröffentlicht: (2025)
V-Thinker: Interactive Thinking with Images
von: Qiao, Runqi, et al.
Veröffentlicht: (2025)
von: Qiao, Runqi, et al.
Veröffentlicht: (2025)
ORB-SfMLearner: ORB-Guided Self-supervised Visual Odometry with Selective Online Adaptation
von: Jin, Yanlin, et al.
Veröffentlicht: (2024)
von: Jin, Yanlin, et al.
Veröffentlicht: (2024)
Deep But Reliable: Advancing Multi-turn Reasoning for Thinking with Images
von: Yang, Wenhao, et al.
Veröffentlicht: (2025)
von: Yang, Wenhao, et al.
Veröffentlicht: (2025)
Ray Denoising: Depth-aware Hard Negative Sampling for Multi-view 3D Object Detection
von: Liu, Feng, et al.
Veröffentlicht: (2024)
von: Liu, Feng, et al.
Veröffentlicht: (2024)
OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning
von: Su, Zhaochen, et al.
Veröffentlicht: (2025)
von: Su, Zhaochen, et al.
Veröffentlicht: (2025)
S&D Messenger: Exchanging Semantic and Domain Knowledge for Generic Semi-Supervised Medical Image Segmentation
von: Zhang, Qixiang, et al.
Veröffentlicht: (2024)
von: Zhang, Qixiang, et al.
Veröffentlicht: (2024)
Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization
von: Yang, Wenhao, et al.
Veröffentlicht: (2026)
von: Yang, Wenhao, et al.
Veröffentlicht: (2026)
Enhanced Convolutional Neural Networks for Improved Image Classification
von: Yang, Xiaoran, et al.
Veröffentlicht: (2025)
von: Yang, Xiaoran, et al.
Veröffentlicht: (2025)
DiffuMask: Synthesizing Images with Pixel-level Annotations for Semantic Segmentation Using Diffusion Models
von: Wu, Weijia, et al.
Veröffentlicht: (2023)
von: Wu, Weijia, et al.
Veröffentlicht: (2023)
ReDDiT: Rehashing Noise for Discrete Visual Generation
von: Ma, Tianren, et al.
Veröffentlicht: (2025)
von: Ma, Tianren, et al.
Veröffentlicht: (2025)
ClawMachine: Learning to Fetch Visual Tokens for Referential Comprehension
von: Ma, Tianren, et al.
Veröffentlicht: (2024)
von: Ma, Tianren, et al.
Veröffentlicht: (2024)
AdaThinkDrive: Adaptive Thinking via Reinforcement Learning for Autonomous Driving
von: Luo, Yuechen, et al.
Veröffentlicht: (2025)
von: Luo, Yuechen, et al.
Veröffentlicht: (2025)
Maestro: Self-Improving Text-to-Image Generation via Agent Orchestration
von: Wan, Xingchen, et al.
Veröffentlicht: (2025)
von: Wan, Xingchen, et al.
Veröffentlicht: (2025)
Correspondence-Guided SfM-Free 3D Gaussian Splatting for NVS
von: Sun, Wei, et al.
Veröffentlicht: (2024)
von: Sun, Wei, et al.
Veröffentlicht: (2024)
Expandable Residual Approximation for Knowledge Distillation
von: Yan, Zhaoyi, et al.
Veröffentlicht: (2025)
von: Yan, Zhaoyi, et al.
Veröffentlicht: (2025)
Mixture of Physical Priors Adapter for Parameter-Efficient Fine-Tuning
von: Wang, Zhaozhi, et al.
Veröffentlicht: (2024)
von: Wang, Zhaozhi, et al.
Veröffentlicht: (2024)
Spatial Transform Decoupling for Oriented Object Detection
von: Yu, Hongtian, et al.
Veröffentlicht: (2023)
von: Yu, Hongtian, et al.
Veröffentlicht: (2023)
Delta-SVD: Efficient Compression for Personalized Text-to-Image Models
von: Zhang, Tangyuan, et al.
Veröffentlicht: (2025)
von: Zhang, Tangyuan, et al.
Veröffentlicht: (2025)
Beyond Night Visibility: Adaptive Multi-Scale Fusion of Infrared and Visible Images
von: Pei, Shufan, et al.
Veröffentlicht: (2024)
von: Pei, Shufan, et al.
Veröffentlicht: (2024)
Bridging the Intention-Expression Gap: Aligning Multi-Dimensional Preferences via Hierarchical Relevance Feedback in Text-to-Image Diffusion
von: Wang, Wenxi, et al.
Veröffentlicht: (2026)
von: Wang, Wenxi, et al.
Veröffentlicht: (2026)
MOC: Meta-Optimized Classifier for Few-Shot Whole Slide Image Classification
von: Xiang, Tianqi, et al.
Veröffentlicht: (2025)
von: Xiang, Tianqi, et al.
Veröffentlicht: (2025)
Depth-guided Texture Diffusion for Image Semantic Segmentation
von: Sun, Wei, et al.
Veröffentlicht: (2024)
von: Sun, Wei, et al.
Veröffentlicht: (2024)
GenEvolve: Self-Evolving Image Generation Agents via Tool-Orchestrated Visual Experience Distillation
von: Chen, Sixiang, et al.
Veröffentlicht: (2026)
von: Chen, Sixiang, et al.
Veröffentlicht: (2026)
MedScope: Incentivizing "Think with Videos" for Clinical Reasoning via Coarse-to-Fine Tool Calling
von: Li, Wenjie, et al.
Veröffentlicht: (2026)
von: Li, Wenjie, et al.
Veröffentlicht: (2026)
Explaining Human Preferences via Metrics for Structured 3D Reconstruction
von: Langerman, Jack, et al.
Veröffentlicht: (2025)
von: Langerman, Jack, et al.
Veröffentlicht: (2025)
DriveAgent-R1: Advancing VLM-based Autonomous Driving with Active Perception and Hybrid Thinking
von: Zheng, Weicheng, et al.
Veröffentlicht: (2025)
von: Zheng, Weicheng, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
DynRefer: Delving into Region-level Multimodal Tasks via Dynamic Resolution
von: Zhao, Yuzhong, et al.
Veröffentlicht: (2024) -
CC-Diff: Enhancing Contextual Coherence in Remote Sensing Image Synthesis
von: Zhang, Mu, et al.
Veröffentlicht: (2024) -
ControlCap: Controllable Region-level Captioning
von: Zhao, Yuzhong, et al.
Veröffentlicht: (2024) -
Evaluation of Text-to-Video Generation Models: A Dynamics Perspective
von: Liao, Mingxiang, et al.
Veröffentlicht: (2024) -
Timestep Embedding Tells: It's Time to Cache for Video Diffusion Model
von: Liu, Feng, et al.
Veröffentlicht: (2024)