Gen-Searcher: Reinforcing Agentic Search for Image Generation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Feng, Kaituo, Zhang, Manyuan, Chen, Shuang, Lin, Yunlong, Fan, Kaixuan, Jiang, Yilei, Li, Hongyu, Zheng, Dian, Wang, Chenyang, Yue, Xiangyu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
OneThinker: All-in-one Reasoning Model for Image and Video
von: Feng, Kaituo, et al.
Veröffentlicht: (2025)
von: Feng, Kaituo, et al.
Veröffentlicht: (2025)
SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward
von: Fan, Kaixuan, et al.
Veröffentlicht: (2025)
von: Fan, Kaixuan, et al.
Veröffentlicht: (2025)
Uni-Edit: Intelligent Editing Is A General Task For Unified Model Tuning
von: Zheng, Dian, et al.
Veröffentlicht: (2026)
von: Zheng, Dian, et al.
Veröffentlicht: (2026)
From Web to Pixels: Bringing Agentic Search into Visual Perception
von: Yang, Bokang, et al.
Veröffentlicht: (2026)
von: Yang, Bokang, et al.
Veröffentlicht: (2026)
OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents
von: Chen, Shuang, et al.
Veröffentlicht: (2026)
von: Chen, Shuang, et al.
Veröffentlicht: (2026)
FairGen: Enhancing Fairness in Text-to-Image Diffusion Models via Self-Discovering Latent Directions
von: Jiang, Yilei, et al.
Veröffentlicht: (2024)
von: Jiang, Yilei, et al.
Veröffentlicht: (2024)
AIA: Rethinking Architecture Decoupling Strategy In Unified Multimodal Model
von: Zheng, Dian, et al.
Veröffentlicht: (2025)
von: Zheng, Dian, et al.
Veröffentlicht: (2025)
HypDAE: Hyperbolic Diffusion Autoencoders for Hierarchical Few-shot Image Generation
von: Li, Lingxiao, et al.
Veröffentlicht: (2024)
von: Li, Lingxiao, et al.
Veröffentlicht: (2024)
EditThinker: Unlocking Iterative Reasoning for Any Image Editor
von: Li, Hongyu, et al.
Veröffentlicht: (2025)
von: Li, Hongyu, et al.
Veröffentlicht: (2025)
AdaTooler-V: Adaptive Tool-Use for Images and Videos
von: Wang, Chaoyang, et al.
Veröffentlicht: (2025)
von: Wang, Chaoyang, et al.
Veröffentlicht: (2025)
OpenGame: Open Agentic Coding for Games
von: Jiang, Yilei, et al.
Veröffentlicht: (2026)
von: Jiang, Yilei, et al.
Veröffentlicht: (2026)
OpenSubject: Leveraging Video-Derived Identity and Diversity Priors for Subject-driven Image Generation and Manipulation
von: Liu, Yexin, et al.
Veröffentlicht: (2025)
von: Liu, Yexin, et al.
Veröffentlicht: (2025)
GenClaw: Code-Driven Agentic Image Generation
von: Ye, Junyan, et al.
Veröffentlicht: (2026)
von: Ye, Junyan, et al.
Veröffentlicht: (2026)
Exploring Reasoning Reward Model for Agents
von: Fan, Kaixuan, et al.
Veröffentlicht: (2026)
von: Fan, Kaixuan, et al.
Veröffentlicht: (2026)
GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning
von: Jiang, Kaixun, et al.
Veröffentlicht: (2026)
von: Jiang, Kaixun, et al.
Veröffentlicht: (2026)
Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis
von: Chen, Shuang, et al.
Veröffentlicht: (2026)
von: Chen, Shuang, et al.
Veröffentlicht: (2026)
EchoGen: Cycle-Consistent Learning for Unified Layout-Image Generation and Understanding
von: Zou, Kai, et al.
Veröffentlicht: (2026)
von: Zou, Kai, et al.
Veröffentlicht: (2026)
REVERSE: Reinforcing Evidence Verification and Search for Agentic Image geo-localization
von: Li, Yong, et al.
Veröffentlicht: (2026)
von: Li, Yong, et al.
Veröffentlicht: (2026)
Event-Customized Image Generation
von: Wang, Zhen, et al.
Veröffentlicht: (2024)
von: Wang, Zhen, et al.
Veröffentlicht: (2024)
Learning to Generate Parameters of ConvNets for Unseen Image Data
von: Wang, Shiye, et al.
Veröffentlicht: (2023)
von: Wang, Shiye, et al.
Veröffentlicht: (2023)
ConceptGuard: Proactive Safety in Text-and-Image-to-Video Generation through Multimodal Risk Detection
von: Ma, Ruize, et al.
Veröffentlicht: (2025)
von: Ma, Ruize, et al.
Veröffentlicht: (2025)
MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs
von: Yuan, Jiakang, et al.
Veröffentlicht: (2025)
von: Yuan, Jiakang, et al.
Veröffentlicht: (2025)
Video-R1: Reinforcing Video Reasoning in MLLMs
von: Feng, Kaituo, et al.
Veröffentlicht: (2025)
von: Feng, Kaituo, et al.
Veröffentlicht: (2025)
ScreenCoder: Advancing Visual-to-Code Generation for Front-End Automation via Modular Multimodal Agents
von: Jiang, Yilei, et al.
Veröffentlicht: (2025)
von: Jiang, Yilei, et al.
Veröffentlicht: (2025)
MACRO: Advancing Multi-Reference Image Generation with Structured Long-Context Data
von: Chen, Zhekai, et al.
Veröffentlicht: (2026)
von: Chen, Zhekai, et al.
Veröffentlicht: (2026)
MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models
von: Xia, Yinan, et al.
Veröffentlicht: (2025)
von: Xia, Yinan, et al.
Veröffentlicht: (2025)
Mind-Brush: Integrating Agentic Cognitive Search and Reasoning into Image Generation
von: He, Jun, et al.
Veröffentlicht: (2026)
von: He, Jun, et al.
Veröffentlicht: (2026)
RPiAE: A Representation-Pivoted Autoencoder Enhancing Both Image Generation and Editing
von: Gong, Yue, et al.
Veröffentlicht: (2026)
von: Gong, Yue, et al.
Veröffentlicht: (2026)
Flow-OPD: On-Policy Distillation for Flow Matching Models
von: Fang, Zhen, et al.
Veröffentlicht: (2026)
von: Fang, Zhen, et al.
Veröffentlicht: (2026)
VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning
von: Wang, Qunzhong, et al.
Veröffentlicht: (2025)
von: Wang, Qunzhong, et al.
Veröffentlicht: (2025)
GenEvolve: Self-Evolving Image Generation Agents via Tool-Orchestrated Visual Experience Distillation
von: Chen, Sixiang, et al.
Veröffentlicht: (2026)
von: Chen, Sixiang, et al.
Veröffentlicht: (2026)
GenDDS: Generating Diverse Driving Video Scenarios with Prompt-to-Video Generative Model
von: Fu, Yongjie, et al.
Veröffentlicht: (2024)
von: Fu, Yongjie, et al.
Veröffentlicht: (2024)
PathGen-1.6M: 1.6 Million Pathology Image-text Pairs Generation through Multi-agent Collaboration
von: Sun, Yuxuan, et al.
Veröffentlicht: (2024)
von: Sun, Yuxuan, et al.
Veröffentlicht: (2024)
Gen-n-Val: Agentic Image Data Generation and Validation
von: Huang, Jing-En, et al.
Veröffentlicht: (2025)
von: Huang, Jing-En, et al.
Veröffentlicht: (2025)
EmoGen: Emotional Image Content Generation with Text-to-Image Diffusion Models
von: Yang, Jingyuan, et al.
Veröffentlicht: (2024)
von: Yang, Jingyuan, et al.
Veröffentlicht: (2024)
Feature-Space Planes Searcher: A Universal Domain Adaptation Framework for Interpretability and Computational Efficiency
von: Cheng, Zhitong, et al.
Veröffentlicht: (2025)
von: Cheng, Zhitong, et al.
Veröffentlicht: (2025)
EvoGuard: An Extensible Agentic RL-based Framework for Practical and Evolving AI-Generated Image Detection
von: Zhu, Chenyang, et al.
Veröffentlicht: (2026)
von: Zhu, Chenyang, et al.
Veröffentlicht: (2026)
Agentic Keyframe Search for Video Question Answering
von: Fan, Sunqi, et al.
Veröffentlicht: (2025)
von: Fan, Sunqi, et al.
Veröffentlicht: (2025)
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
von: Ding, Shengyuan, et al.
Veröffentlicht: (2025)
von: Ding, Shengyuan, et al.
Veröffentlicht: (2025)
UniGenDet: A Unified Generative-Discriminative Framework for Co-Evolutionary Image Generation and Generated Image Detection
von: Zhang, Yanran, et al.
Veröffentlicht: (2026)
von: Zhang, Yanran, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
OneThinker: All-in-one Reasoning Model for Image and Video
von: Feng, Kaituo, et al.
Veröffentlicht: (2025) -
SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward
von: Fan, Kaixuan, et al.
Veröffentlicht: (2025) -
Uni-Edit: Intelligent Editing Is A General Task For Unified Model Tuning
von: Zheng, Dian, et al.
Veröffentlicht: (2026) -
From Web to Pixels: Bringing Agentic Search into Visual Perception
von: Yang, Bokang, et al.
Veröffentlicht: (2026) -
OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents
von: Chen, Shuang, et al.
Veröffentlicht: (2026)