AutoStudio: Crafting Consistent Subjects in Multi-turn Interactive Image Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Cheng, Junhao, Lu, Xi, Li, Hanhui, Zai, Khun Loun, Yin, Baiqiao, Cheng, Yuhao, Yan, Yiqiang, Liang, Xiaodan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TheaterGen: Character Management with LLM for Consistent Multi-turn Image Generation
por: Cheng, Junhao, et al.
Publicado: (2024)
por: Cheng, Junhao, et al.
Publicado: (2024)
Learning Interaction-aware 3D Gaussian Splatting for One-shot Hand Avatars
por: Huang, Xuan, et al.
Publicado: (2024)
por: Huang, Xuan, et al.
Publicado: (2024)
GarmentAligner: Text-to-Garment Generation via Retrieval-augmented Multi-level Corrections
por: Zhang, Shiyue, et al.
Publicado: (2024)
por: Zhang, Shiyue, et al.
Publicado: (2024)
LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation
por: Song, Wenhui, et al.
Publicado: (2025)
por: Song, Wenhui, et al.
Publicado: (2025)
WildGHand: Learning Anti-Perturbation Gaussian Hand Avatars from Monocular In-the-Wild Videos
por: Li, Hanhui, et al.
Publicado: (2026)
por: Li, Hanhui, et al.
Publicado: (2026)
ConsistentID: Portrait Generation with Multimodal Fine-Grained Identity Preserving
por: Huang, Jiehui, et al.
Publicado: (2024)
por: Huang, Jiehui, et al.
Publicado: (2024)
DialogGen: Multi-modal Interactive Dialogue System for Multi-turn Text-to-Image Generation
por: Huang, Minbin, et al.
Publicado: (2024)
por: Huang, Minbin, et al.
Publicado: (2024)
EvolveNav: Empowering LLM-Based Vision-Language Navigation via Self-Improving Embodied Reasoning
por: Lin, Bingqian, et al.
Publicado: (2025)
por: Lin, Bingqian, et al.
Publicado: (2025)
ProPhy: Progressive Physical Alignment for Dynamic World Simulation
por: Wang, Zijun, et al.
Publicado: (2025)
por: Wang, Zijun, et al.
Publicado: (2025)
Rethink Predicting the Optical Flow with the Kinetics Perspective
por: Cheng, Yuhao, et al.
Publicado: (2024)
por: Cheng, Yuhao, et al.
Publicado: (2024)
Institutional Design, Outside Director Effectiveness, and Stock Price Crash Risk: Evidence from Japan's 2015 Hybrid Board Reform*
por: Baiqiao Yin
Publicado: (2026)
por: Baiqiao Yin
Publicado: (2026)
Multi-turn Consistent Image Editing
por: Zhou, Zijun, et al.
Publicado: (2025)
por: Zhou, Zijun, et al.
Publicado: (2025)
3D Visibility-aware Generalizable Neural Radiance Fields for Interacting Hands
por: Huang, Xuan, et al.
Publicado: (2024)
por: Huang, Xuan, et al.
Publicado: (2024)
Auto-Regressively Generating Multi-View Consistent Images
por: Hu, JiaKui, et al.
Publicado: (2025)
por: Hu, JiaKui, et al.
Publicado: (2025)
FireEdit: Fine-grained Instruction-based Image Editing via Region-aware Vision Language Model
por: Zhou, Jun, et al.
Publicado: (2025)
por: Zhou, Jun, et al.
Publicado: (2025)
Evolving in Tasks: Empowering the Multi-modality Large Language Model as the Computer Use Agent
por: Cheng, Yuhao, et al.
Publicado: (2025)
por: Cheng, Yuhao, et al.
Publicado: (2025)
VideoStudio: Generating Consistent-Content and Multi-Scene Videos
por: Long, Fuchen, et al.
Publicado: (2024)
por: Long, Fuchen, et al.
Publicado: (2024)
PSR: Scaling Multi-Subject Personalized Image Generation with Pairwise Subject-Consistency Rewards
por: Wang, Shulei, et al.
Publicado: (2025)
por: Wang, Shulei, et al.
Publicado: (2025)
Subject-Diffusion:Open Domain Personalized Text-to-Image Generation without Test-time Fine-tuning
por: Ma, Jian, et al.
Publicado: (2023)
por: Ma, Jian, et al.
Publicado: (2023)
MoireStudio: A Universal Twisted Electronic Structure Calculation Package
por: Yu, Junxi, et al.
Publicado: (2026)
por: Yu, Junxi, et al.
Publicado: (2026)
AutoGen Studio: A No-Code Developer Tool for Building and Debugging Multi-Agent Systems
por: Dibia, Victor, et al.
Publicado: (2024)
por: Dibia, Victor, et al.
Publicado: (2024)
Improving Multi-Subject Consistency in Open-Domain Image Generation with Isolation and Reposition Attention
por: He, Huiguo, et al.
Publicado: (2024)
por: He, Huiguo, et al.
Publicado: (2024)
Content-Based Image Retrieval for Multi-Class Volumetric Radiology Images: A Benchmark Study
por: Jush, Farnaz Khun, et al.
Publicado: (2024)
por: Jush, Farnaz Khun, et al.
Publicado: (2024)
BAMI: Training-Free Bias Mitigation in GUI Grounding
por: Zhang, Borui, et al.
Publicado: (2026)
por: Zhang, Borui, et al.
Publicado: (2026)
Remaining Useful Life Analysis for Two‐Stage Nonlinear Inverse Gaussian Process With Random Effects
por: Zai‐Zai Yan, et al.
Publicado: (2025)
por: Zai‐Zai Yan, et al.
Publicado: (2025)
Improved Supervised Fine-Tuning for Large Language Models to Mitigate Catastrophic Forgetting
por: Ding, Fei, et al.
Publicado: (2025)
por: Ding, Fei, et al.
Publicado: (2025)
UMA REVISÃO SISTEMÁTICA SOBRE OS FATORES QUE PROPICIAM UM AMBIENTE FECUNDO A INOVAÇÃO
por: Juliano Aparecido Khun
Publicado: (2019)
por: Juliano Aparecido Khun
Publicado: (2019)
BRIEDGE: EEG-Adaptive Edge AI for Multi-Brain to Multi-Robot Interaction
por: Ouyang, Jinhui, et al.
Publicado: (2024)
por: Ouyang, Jinhui, et al.
Publicado: (2024)
Improving Multi-turn Dialogue Consistency with Self-Recall Thinking
por: Pang, Renning, et al.
Publicado: (2026)
por: Pang, Renning, et al.
Publicado: (2026)
Confidence Estimation for LLMs in Multi-turn Interactions
por: Zhang, Caiqi, et al.
Publicado: (2026)
por: Zhang, Caiqi, et al.
Publicado: (2026)
Evaluating Multi-turn Human-AI Interaction
por: Ding, Shi, et al.
Publicado: (2026)
por: Ding, Shi, et al.
Publicado: (2026)
4DGS-Craft: Consistent and Interactive 4D Gaussian Splatting Editing
por: Liu, Lei, et al.
Publicado: (2025)
por: Liu, Lei, et al.
Publicado: (2025)
CoDi: Subject-Consistent and Pose-Diverse Text-to-Image Generation
por: Gao, Zhanxin, et al.
Publicado: (2025)
por: Gao, Zhanxin, et al.
Publicado: (2025)
Benchmarking Pretrained Vision Embeddings for Near- and Duplicate Detection in Medical Images
por: Truong, Tuan, et al.
Publicado: (2023)
por: Truong, Tuan, et al.
Publicado: (2023)
Rethinking Patient Education as Multi-turn Multi-modal Interaction
por: Yao, Zonghai, et al.
Publicado: (2026)
por: Yao, Zonghai, et al.
Publicado: (2026)
Multi-Layer GRPO: Enhancing Reasoning and Self-Correction in Large Language Models
por: Ding, Fei, et al.
Publicado: (2025)
por: Ding, Fei, et al.
Publicado: (2025)
DTAMS: High-Capacity Generative Steganography via Dynamic Multi-Timestep Selection and Adaptive Deviation Mapping in Latent Diffusion
por: Xue, Yuhao, et al.
Publicado: (2026)
por: Xue, Yuhao, et al.
Publicado: (2026)
Multimodal Multi-turn Conversation Stance Detection: A Challenge Dataset and Effective Model
por: Niu, Fuqiang, et al.
Publicado: (2024)
por: Niu, Fuqiang, et al.
Publicado: (2024)
Deep But Reliable: Advancing Multi-turn Reasoning for Thinking with Images
por: Yang, Wenhao, et al.
Publicado: (2025)
por: Yang, Wenhao, et al.
Publicado: (2025)
LexInstructEval: Lexical Instruction Following Evaluation for Large Language Models
por: Ren, Huimin, et al.
Publicado: (2025)
por: Ren, Huimin, et al.
Publicado: (2025)
Ejemplares similares
-
TheaterGen: Character Management with LLM for Consistent Multi-turn Image Generation
por: Cheng, Junhao, et al.
Publicado: (2024) -
Learning Interaction-aware 3D Gaussian Splatting for One-shot Hand Avatars
por: Huang, Xuan, et al.
Publicado: (2024) -
GarmentAligner: Text-to-Garment Generation via Retrieval-augmented Multi-level Corrections
por: Zhang, Shiyue, et al.
Publicado: (2024) -
LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation
por: Song, Wenhui, et al.
Publicado: (2025) -
WildGHand: Learning Anti-Perturbation Gaussian Hand Avatars from Monocular In-the-Wild Videos
por: Li, Hanhui, et al.
Publicado: (2026)