AutoStudio: Crafting Consistent Subjects in Multi-turn Interactive Image Generation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Cheng, Junhao, Lu, Xi, Li, Hanhui, Zai, Khun Loun, Yin, Baiqiao, Cheng, Yuhao, Yan, Yiqiang, Liang, Xiaodan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
TheaterGen: Character Management with LLM for Consistent Multi-turn Image Generation
von: Cheng, Junhao, et al.
Veröffentlicht: (2024)
von: Cheng, Junhao, et al.
Veröffentlicht: (2024)
Learning Interaction-aware 3D Gaussian Splatting for One-shot Hand Avatars
von: Huang, Xuan, et al.
Veröffentlicht: (2024)
von: Huang, Xuan, et al.
Veröffentlicht: (2024)
GarmentAligner: Text-to-Garment Generation via Retrieval-augmented Multi-level Corrections
von: Zhang, Shiyue, et al.
Veröffentlicht: (2024)
von: Zhang, Shiyue, et al.
Veröffentlicht: (2024)
LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation
von: Song, Wenhui, et al.
Veröffentlicht: (2025)
von: Song, Wenhui, et al.
Veröffentlicht: (2025)
WildGHand: Learning Anti-Perturbation Gaussian Hand Avatars from Monocular In-the-Wild Videos
von: Li, Hanhui, et al.
Veröffentlicht: (2026)
von: Li, Hanhui, et al.
Veröffentlicht: (2026)
ConsistentID: Portrait Generation with Multimodal Fine-Grained Identity Preserving
von: Huang, Jiehui, et al.
Veröffentlicht: (2024)
von: Huang, Jiehui, et al.
Veröffentlicht: (2024)
DialogGen: Multi-modal Interactive Dialogue System for Multi-turn Text-to-Image Generation
von: Huang, Minbin, et al.
Veröffentlicht: (2024)
von: Huang, Minbin, et al.
Veröffentlicht: (2024)
EvolveNav: Empowering LLM-Based Vision-Language Navigation via Self-Improving Embodied Reasoning
von: Lin, Bingqian, et al.
Veröffentlicht: (2025)
von: Lin, Bingqian, et al.
Veröffentlicht: (2025)
ProPhy: Progressive Physical Alignment for Dynamic World Simulation
von: Wang, Zijun, et al.
Veröffentlicht: (2025)
von: Wang, Zijun, et al.
Veröffentlicht: (2025)
Rethink Predicting the Optical Flow with the Kinetics Perspective
von: Cheng, Yuhao, et al.
Veröffentlicht: (2024)
von: Cheng, Yuhao, et al.
Veröffentlicht: (2024)
Institutional Design, Outside Director Effectiveness, and Stock Price Crash Risk: Evidence from Japan's 2015 Hybrid Board Reform*
von: Baiqiao Yin
Veröffentlicht: (2026)
von: Baiqiao Yin
Veröffentlicht: (2026)
Multi-turn Consistent Image Editing
von: Zhou, Zijun, et al.
Veröffentlicht: (2025)
von: Zhou, Zijun, et al.
Veröffentlicht: (2025)
3D Visibility-aware Generalizable Neural Radiance Fields for Interacting Hands
von: Huang, Xuan, et al.
Veröffentlicht: (2024)
von: Huang, Xuan, et al.
Veröffentlicht: (2024)
Auto-Regressively Generating Multi-View Consistent Images
von: Hu, JiaKui, et al.
Veröffentlicht: (2025)
von: Hu, JiaKui, et al.
Veröffentlicht: (2025)
FireEdit: Fine-grained Instruction-based Image Editing via Region-aware Vision Language Model
von: Zhou, Jun, et al.
Veröffentlicht: (2025)
von: Zhou, Jun, et al.
Veröffentlicht: (2025)
Evolving in Tasks: Empowering the Multi-modality Large Language Model as the Computer Use Agent
von: Cheng, Yuhao, et al.
Veröffentlicht: (2025)
von: Cheng, Yuhao, et al.
Veröffentlicht: (2025)
VideoStudio: Generating Consistent-Content and Multi-Scene Videos
von: Long, Fuchen, et al.
Veröffentlicht: (2024)
von: Long, Fuchen, et al.
Veröffentlicht: (2024)
PSR: Scaling Multi-Subject Personalized Image Generation with Pairwise Subject-Consistency Rewards
von: Wang, Shulei, et al.
Veröffentlicht: (2025)
von: Wang, Shulei, et al.
Veröffentlicht: (2025)
Subject-Diffusion:Open Domain Personalized Text-to-Image Generation without Test-time Fine-tuning
von: Ma, Jian, et al.
Veröffentlicht: (2023)
von: Ma, Jian, et al.
Veröffentlicht: (2023)
MoireStudio: A Universal Twisted Electronic Structure Calculation Package
von: Yu, Junxi, et al.
Veröffentlicht: (2026)
von: Yu, Junxi, et al.
Veröffentlicht: (2026)
AutoGen Studio: A No-Code Developer Tool for Building and Debugging Multi-Agent Systems
von: Dibia, Victor, et al.
Veröffentlicht: (2024)
von: Dibia, Victor, et al.
Veröffentlicht: (2024)
Improving Multi-Subject Consistency in Open-Domain Image Generation with Isolation and Reposition Attention
von: He, Huiguo, et al.
Veröffentlicht: (2024)
von: He, Huiguo, et al.
Veröffentlicht: (2024)
Content-Based Image Retrieval for Multi-Class Volumetric Radiology Images: A Benchmark Study
von: Jush, Farnaz Khun, et al.
Veröffentlicht: (2024)
von: Jush, Farnaz Khun, et al.
Veröffentlicht: (2024)
BAMI: Training-Free Bias Mitigation in GUI Grounding
von: Zhang, Borui, et al.
Veröffentlicht: (2026)
von: Zhang, Borui, et al.
Veröffentlicht: (2026)
Remaining Useful Life Analysis for Two‐Stage Nonlinear Inverse Gaussian Process With Random Effects
von: Zai‐Zai Yan, et al.
Veröffentlicht: (2025)
von: Zai‐Zai Yan, et al.
Veröffentlicht: (2025)
Improved Supervised Fine-Tuning for Large Language Models to Mitigate Catastrophic Forgetting
von: Ding, Fei, et al.
Veröffentlicht: (2025)
von: Ding, Fei, et al.
Veröffentlicht: (2025)
UMA REVISÃO SISTEMÁTICA SOBRE OS FATORES QUE PROPICIAM UM AMBIENTE FECUNDO A INOVAÇÃO
von: Juliano Aparecido Khun
Veröffentlicht: (2019)
von: Juliano Aparecido Khun
Veröffentlicht: (2019)
BRIEDGE: EEG-Adaptive Edge AI for Multi-Brain to Multi-Robot Interaction
von: Ouyang, Jinhui, et al.
Veröffentlicht: (2024)
von: Ouyang, Jinhui, et al.
Veröffentlicht: (2024)
Improving Multi-turn Dialogue Consistency with Self-Recall Thinking
von: Pang, Renning, et al.
Veröffentlicht: (2026)
von: Pang, Renning, et al.
Veröffentlicht: (2026)
Confidence Estimation for LLMs in Multi-turn Interactions
von: Zhang, Caiqi, et al.
Veröffentlicht: (2026)
von: Zhang, Caiqi, et al.
Veröffentlicht: (2026)
Evaluating Multi-turn Human-AI Interaction
von: Ding, Shi, et al.
Veröffentlicht: (2026)
von: Ding, Shi, et al.
Veröffentlicht: (2026)
4DGS-Craft: Consistent and Interactive 4D Gaussian Splatting Editing
von: Liu, Lei, et al.
Veröffentlicht: (2025)
von: Liu, Lei, et al.
Veröffentlicht: (2025)
CoDi: Subject-Consistent and Pose-Diverse Text-to-Image Generation
von: Gao, Zhanxin, et al.
Veröffentlicht: (2025)
von: Gao, Zhanxin, et al.
Veröffentlicht: (2025)
Benchmarking Pretrained Vision Embeddings for Near- and Duplicate Detection in Medical Images
von: Truong, Tuan, et al.
Veröffentlicht: (2023)
von: Truong, Tuan, et al.
Veröffentlicht: (2023)
Rethinking Patient Education as Multi-turn Multi-modal Interaction
von: Yao, Zonghai, et al.
Veröffentlicht: (2026)
von: Yao, Zonghai, et al.
Veröffentlicht: (2026)
Multi-Layer GRPO: Enhancing Reasoning and Self-Correction in Large Language Models
von: Ding, Fei, et al.
Veröffentlicht: (2025)
von: Ding, Fei, et al.
Veröffentlicht: (2025)
DTAMS: High-Capacity Generative Steganography via Dynamic Multi-Timestep Selection and Adaptive Deviation Mapping in Latent Diffusion
von: Xue, Yuhao, et al.
Veröffentlicht: (2026)
von: Xue, Yuhao, et al.
Veröffentlicht: (2026)
Multimodal Multi-turn Conversation Stance Detection: A Challenge Dataset and Effective Model
von: Niu, Fuqiang, et al.
Veröffentlicht: (2024)
von: Niu, Fuqiang, et al.
Veröffentlicht: (2024)
Deep But Reliable: Advancing Multi-turn Reasoning for Thinking with Images
von: Yang, Wenhao, et al.
Veröffentlicht: (2025)
von: Yang, Wenhao, et al.
Veröffentlicht: (2025)
LexInstructEval: Lexical Instruction Following Evaluation for Large Language Models
von: Ren, Huimin, et al.
Veröffentlicht: (2025)
von: Ren, Huimin, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
TheaterGen: Character Management with LLM for Consistent Multi-turn Image Generation
von: Cheng, Junhao, et al.
Veröffentlicht: (2024) -
Learning Interaction-aware 3D Gaussian Splatting for One-shot Hand Avatars
von: Huang, Xuan, et al.
Veröffentlicht: (2024) -
GarmentAligner: Text-to-Garment Generation via Retrieval-augmented Multi-level Corrections
von: Zhang, Shiyue, et al.
Veröffentlicht: (2024) -
LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation
von: Song, Wenhui, et al.
Veröffentlicht: (2025) -
WildGHand: Learning Anti-Perturbation Gaussian Hand Avatars from Monocular In-the-Wild Videos
von: Li, Hanhui, et al.
Veröffentlicht: (2026)