Self-Reasoning Agentic Framework for Narrative Product Grid-Collage Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Luo, Minyan, Zhang, Yuxin, Li, Yifei, Wang, Xincan, Wu, Fuzhang, Lee, Tong-Yee, Deussen, Oliver, Dong, Weiming |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
IP-Prompter: Training-Free Theme-Specific Image Generation via Dynamic Visual Prompting
par: Zhang, Yuxin, et autres
Publié: (2025)
par: Zhang, Yuxin, et autres
Publié: (2025)
Beyond Pixels: Visual Metaphor Transfer via Schema-Driven Agentic Reasoning
par: Xu, Yu, et autres
Publié: (2026)
par: Xu, Yu, et autres
Publié: (2026)
Break-for-Make: Modular Low-Rank Adaptations for Composable Content-Style Customization
par: Xu, Yu, et autres
Publié: (2024)
par: Xu, Yu, et autres
Publié: (2024)
Image Collage on Arbitrary Shape via Shape-Aware Slicing and Optimization
par: Wu, Dong-Yi, et autres
Publié: (2023)
par: Wu, Dong-Yi, et autres
Publié: (2023)
SongEcho: Towards Cover Song Generation via Instance-Adaptive Element-wise Linear Modulation
par: Li, Sifei, et autres
Publié: (2026)
par: Li, Sifei, et autres
Publié: (2026)
HeadRouter: A Training-free Image Editing Framework for MM-DiTs by Adaptively Routing Attention Heads
par: Xu, Yu, et autres
Publié: (2024)
par: Xu, Yu, et autres
Publié: (2024)
UHNet: An Ultra-Lightweight and High-Speed Edge Detection Network
par: Li, Fuzhang, et autres
Publié: (2024)
par: Li, Fuzhang, et autres
Publié: (2024)
Optimizing 4D Wires for Sparse 3D Abstraction
par: Wu, Dong-Yi, et autres
Publié: (2026)
par: Wu, Dong-Yi, et autres
Publié: (2026)
In-Context Brush: Zero-shot Customized Subject Insertion with Context-Aware Latent Space Manipulation
par: Xu, Yu, et autres
Publié: (2025)
par: Xu, Yu, et autres
Publié: (2025)
Mesh2SLAM in VR: A Fast Geometry-Based SLAM Framework for Rapid Prototyping in Virtual Reality Applications
par: de Sousa, Carlos Augusto Pinheiro, et autres
Publié: (2025)
par: de Sousa, Carlos Augusto Pinheiro, et autres
Publié: (2025)
CreativeSynth: Cross-Art-Attention for Artistic Image Synthesis with Multimodal Diffusion
par: Huang, Nisha, et autres
Publié: (2024)
par: Huang, Nisha, et autres
Publié: (2024)
Agentic Pipeline for Self-Synchronized Multiview Joint Angle Monitoring in Uncalibrated Environments
par: Yu, Juncheng, et autres
Publié: (2026)
par: Yu, Juncheng, et autres
Publié: (2026)
Dance-to-Music Generation with Encoder-based Textual Inversion
par: Li, Sifei, et autres
Publié: (2024)
par: Li, Sifei, et autres
Publié: (2024)
Make-Your-Anchor: A Diffusion-based 2D Avatar Generation Framework
par: Huang, Ziyao, et autres
Publié: (2024)
par: Huang, Ziyao, et autres
Publié: (2024)
A Masked Reverse Knowledge Distillation Method Incorporating Global and Local Information for Image Anomaly Detection
par: Jiang, Yuxin, et autres
Publié: (2025)
par: Jiang, Yuxin, et autres
Publié: (2025)
Prototypical Learning Guided Context-Aware Segmentation Network for Few-Shot Anomaly Detection
par: Jiang, Yuxin, et autres
Publié: (2025)
par: Jiang, Yuxin, et autres
Publié: (2025)
ViSS-R1: Self-Supervised Reinforcement Video Reasoning
par: Fang, Bo, et autres
Publié: (2025)
par: Fang, Bo, et autres
Publié: (2025)
Route, Retrieve, Reflect, Repair: Self-Improving Agentic Framework for Visual Detection and Linguistic Reasoning in Medical Imaging
par: Sayeedi, Md. Faiyaz Abdullah, et autres
Publié: (2026)
par: Sayeedi, Md. Faiyaz Abdullah, et autres
Publié: (2026)
Divide, Conquer and Combine: A Training-Free Framework for High-Resolution Image Perception in Multimodal Large Language Models
par: Wang, Wenbin, et autres
Publié: (2024)
par: Wang, Wenbin, et autres
Publié: (2024)
Threading Keyframe with Narratives: MLLMs as Strong Long Video Comprehenders
par: Fang, Bo, et autres
Publié: (2025)
par: Fang, Bo, et autres
Publié: (2025)
NoiseCollage: A Layout-Aware Text-to-Image Diffusion Model Based on Noise Cropping and Merging
par: Shirakawa, Takahiro, et autres
Publié: (2024)
par: Shirakawa, Takahiro, et autres
Publié: (2024)
TEXTRIX: Latent Attribute Grid for Native Texture Generation and Beyond
par: Zeng, Yifei, et autres
Publié: (2025)
par: Zeng, Yifei, et autres
Publié: (2025)
Grid: Omni Visual Generation
par: Wan, Cong, et autres
Publié: (2024)
par: Wan, Cong, et autres
Publié: (2024)
CollagePrompt: A Benchmark for Budget-Friendly Visual Recognition with GPT-4V
par: Xu, Siyu, et autres
Publié: (2024)
par: Xu, Siyu, et autres
Publié: (2024)
LumiSculpt: Enabling Consistent Portrait Lighting in Video Generation
par: Zhang, Yuxin, et autres
Publié: (2024)
par: Zhang, Yuxin, et autres
Publié: (2024)
Generating Sizing Fields for Mesh Generation via GCN-based Simplification of Adaptive Background Grids
par: Zhu, Xunyang, et autres
Publié: (2025)
par: Zhu, Xunyang, et autres
Publié: (2025)
Anomagic: Crossmodal Prompt-driven Zero-shot Anomaly Generation
par: Jiang, Yuxin, et autres
Publié: (2025)
par: Jiang, Yuxin, et autres
Publié: (2025)
EditRefiner: A Human-Aligned Agentic Framework for Image Editing Refinement
par: Xu, Zitong, et autres
Publié: (2026)
par: Xu, Zitong, et autres
Publié: (2026)
Neural Image Abstraction Using Long Smoothing B-Splines
par: Berio, Daniel, et autres
Publié: (2025)
par: Berio, Daniel, et autres
Publié: (2025)
Grid Diffusion Models for Text-to-Video Generation
par: Lee, Taegyeong, et autres
Publié: (2024)
par: Lee, Taegyeong, et autres
Publié: (2024)
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
par: Ding, Shengyuan, et autres
Publié: (2025)
par: Ding, Shengyuan, et autres
Publié: (2025)
ActFER: Agentic Facial Expression Recognition via Active Tool-Augmented Visual Reasoning
par: Liu, Shifeng, et autres
Publié: (2026)
par: Liu, Shifeng, et autres
Publié: (2026)
VURF: A General-purpose Reasoning and Self-refinement Framework for Video Understanding
par: Mahmood, Ahmad, et autres
Publié: (2024)
par: Mahmood, Ahmad, et autres
Publié: (2024)
A Unified Agentic Framework for Evaluating Conditional Image Generation
par: Wang, Jifang, et autres
Publié: (2025)
par: Wang, Jifang, et autres
Publié: (2025)
VGRP-Bench: Visual Grid Reasoning Puzzle Benchmark for Large Vision-Language Models
par: Ren, Yufan, et autres
Publié: (2025)
par: Ren, Yufan, et autres
Publié: (2025)
A4-Agent: An Agentic Framework for Zero-Shot Affordance Reasoning
par: Zhang, Zixin, et autres
Publié: (2025)
par: Zhang, Zixin, et autres
Publié: (2025)
Mind-Brush: Integrating Agentic Cognitive Search and Reasoning into Image Generation
par: He, Jun, et autres
Publié: (2026)
par: He, Jun, et autres
Publié: (2026)
Connecting the Dots: Training-Free Visual Grounding via Agentic Reasoning
par: Luo, Liqin, et autres
Publié: (2025)
par: Luo, Liqin, et autres
Publié: (2025)
RadFabric: Agentic AI System with Reasoning Capability for Radiology
par: Chen, Wenting, et autres
Publié: (2025)
par: Chen, Wenting, et autres
Publié: (2025)
Generation Navigator: A State-Aware Agentic Framework for Image Generation
par: Liu, Jinming, et autres
Publié: (2026)
par: Liu, Jinming, et autres
Publié: (2026)
Documents similaires
-
IP-Prompter: Training-Free Theme-Specific Image Generation via Dynamic Visual Prompting
par: Zhang, Yuxin, et autres
Publié: (2025) -
Beyond Pixels: Visual Metaphor Transfer via Schema-Driven Agentic Reasoning
par: Xu, Yu, et autres
Publié: (2026) -
Break-for-Make: Modular Low-Rank Adaptations for Composable Content-Style Customization
par: Xu, Yu, et autres
Publié: (2024) -
Image Collage on Arbitrary Shape via Shape-Aware Slicing and Optimization
par: Wu, Dong-Yi, et autres
Publié: (2023) -
SongEcho: Towards Cover Song Generation via Instance-Adaptive Element-wise Linear Modulation
par: Li, Sifei, et autres
Publié: (2026)