TheaterGen: Character Management with LLM for Consistent Multi-turn Image Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cheng, Junhao, Yin, Baiqiao, Cai, Kaixin, Huang, Minbin, Li, Hanhui, He, Yuxin, Lu, Xi, Li, Yue, Li, Yifei, Cheng, Yuhao, Yan, Yiqiang, Liang, Xiaodan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AutoStudio: Crafting Consistent Subjects in Multi-turn Interactive Image Generation
par: Cheng, Junhao, et autres
Publié: (2024)
par: Cheng, Junhao, et autres
Publié: (2024)
GarmentAligner: Text-to-Garment Generation via Retrieval-augmented Multi-level Corrections
par: Zhang, Shiyue, et autres
Publié: (2024)
par: Zhang, Shiyue, et autres
Publié: (2024)
Learning Interaction-aware 3D Gaussian Splatting for One-shot Hand Avatars
par: Huang, Xuan, et autres
Publié: (2024)
par: Huang, Xuan, et autres
Publié: (2024)
DialogGen: Multi-modal Interactive Dialogue System for Multi-turn Text-to-Image Generation
par: Huang, Minbin, et autres
Publié: (2024)
par: Huang, Minbin, et autres
Publié: (2024)
LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation
par: Song, Wenhui, et autres
Publié: (2025)
par: Song, Wenhui, et autres
Publié: (2025)
WildGHand: Learning Anti-Perturbation Gaussian Hand Avatars from Monocular In-the-Wild Videos
par: Li, Hanhui, et autres
Publié: (2026)
par: Li, Hanhui, et autres
Publié: (2026)
ConsistentID: Portrait Generation with Multimodal Fine-Grained Identity Preserving
par: Huang, Jiehui, et autres
Publié: (2024)
par: Huang, Jiehui, et autres
Publié: (2024)
ProPhy: Progressive Physical Alignment for Dynamic World Simulation
par: Wang, Zijun, et autres
Publié: (2025)
par: Wang, Zijun, et autres
Publié: (2025)
Institutional Design, Outside Director Effectiveness, and Stock Price Crash Risk: Evidence from Japan's 2015 Hybrid Board Reform*
par: Baiqiao Yin
Publié: (2026)
par: Baiqiao Yin
Publié: (2026)
Rethink Predicting the Optical Flow with the Kinetics Perspective
par: Cheng, Yuhao, et autres
Publié: (2024)
par: Cheng, Yuhao, et autres
Publié: (2024)
Leveraging Self-supervised Audio Representations for Data-Efficient Acoustic Scene Classification
par: Cai, Yiqiang, et autres
Publié: (2024)
par: Cai, Yiqiang, et autres
Publié: (2024)
3D Visibility-aware Generalizable Neural Radiance Fields for Interacting Hands
par: Huang, Xuan, et autres
Publié: (2024)
par: Huang, Xuan, et autres
Publié: (2024)
Answer-Consistent Chain-of-thought Reinforcement Learning For Multi-modal Large Langauge Models
par: Huang, Minbin, et autres
Publié: (2025)
par: Huang, Minbin, et autres
Publié: (2025)
CharacterFactory: Sampling Consistent Characters with GANs for Diffusion Models
par: Wang, Qinghe, et autres
Publié: (2024)
par: Wang, Qinghe, et autres
Publié: (2024)
FireEdit: Fine-grained Instruction-based Image Editing via Region-aware Vision Language Model
par: Zhou, Jun, et autres
Publié: (2025)
par: Zhou, Jun, et autres
Publié: (2025)
Getting More Juice Out of Your Data: Hard Pair Refinement Enhances Visual-Language Models Without Extra Data
par: Wang, Haonan, et autres
Publié: (2023)
par: Wang, Haonan, et autres
Publié: (2023)
2K-Characters-10K-Stories: A Quality-Gated Stylized Narrative Dataset with Disentangled Control and Sequence Consistency
par: Yin, Xingxi, et autres
Publié: (2025)
par: Yin, Xingxi, et autres
Publié: (2025)
SFMViT: SlowFast Meet ViT in Chaotic World
par: Lin, Jiaying, et autres
Publié: (2024)
par: Lin, Jiaying, et autres
Publié: (2024)
HDBN: A Novel Hybrid Dual-branch Network for Robust Skeleton-based Action Recognition
par: Liu, Jinfu, et autres
Publié: (2024)
par: Liu, Jinfu, et autres
Publié: (2024)
SemiPL: A Semi-supervised Method for Event Sound Source Localization
par: Li, Yue, et autres
Publié: (2024)
par: Li, Yue, et autres
Publié: (2024)
Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration
par: Yang, Zhicheng, et autres
Publié: (2025)
par: Yang, Zhicheng, et autres
Publié: (2025)
InstruGen: Automatic Instruction Generation for Vision-and-Language Navigation Via Large Multimodal Models
par: Yan, Yu, et autres
Publié: (2024)
par: Yan, Yu, et autres
Publié: (2024)
Hecke algebras and edge contractions
par: Li, Yiqiang
Publié: (2024)
par: Li, Yiqiang
Publié: (2024)
C-LLM: Learn to Check Chinese Spelling Errors Character by Character
par: Li, Kunting, et autres
Publié: (2024)
par: Li, Kunting, et autres
Publié: (2024)
Detect, Explain, Escalate: Sustainable Dialogue Breakdown Management for LLM Agents
par: Ghassel, Abdellah, et autres
Publié: (2025)
par: Ghassel, Abdellah, et autres
Publié: (2025)
The Tradwife Revolution: An Ethnography of Trad Futurism on Social Media. By AlexandraDeem, New York: Routledge, 2026. 230 pp. $200.00 (hbk). ISBN : 978‐1‐0410‐9029‐8
par: Jinfang Liu, et autres
Publié: (2026)
par: Jinfang Liu, et autres
Publié: (2026)
A Unified Framework for Next-Gen Urban Forecasting via LLM-driven Dependency Retrieval and GeoTransformer
par: Jia, Yuhao, et autres
Publié: (2024)
par: Jia, Yuhao, et autres
Publié: (2024)
ERGO: Excess-Risk-Guided Optimization for High-Fidelity Monocular 3D Gaussian Splatting
par: Ma, Zehua, et autres
Publié: (2026)
par: Ma, Zehua, et autres
Publié: (2026)
Evolving in Tasks: Empowering the Multi-modality Large Language Model as the Computer Use Agent
par: Cheng, Yuhao, et autres
Publié: (2025)
par: Cheng, Yuhao, et autres
Publié: (2025)
CharacterShot: Controllable and Consistent 4D Character Animation
par: Gao, Junyao, et autres
Publié: (2025)
par: Gao, Junyao, et autres
Publié: (2025)
TF-SepNet: An Efficient 1D Kernel Design in CNNs for Low-Complexity Acoustic Scene Classification
par: Cai, Yiqiang, et autres
Publié: (2023)
par: Cai, Yiqiang, et autres
Publié: (2023)
SimVLA: A Simple VLA Baseline for Robotic Manipulation
par: Luo, Yuankai, et autres
Publié: (2026)
par: Luo, Yuankai, et autres
Publié: (2026)
CoGen: 3D Consistent Video Generation via Adaptive Conditioning for Autonomous Driving
par: Ji, Yishen, et autres
Publié: (2025)
par: Ji, Yishen, et autres
Publié: (2025)
From Detection to Mitigation: Addressing Gender Bias in Chinese Texts via Efficient Tuning and Voting-Based Rebalancing
par: Wu, Chengyan, et autres
Publié: (2025)
par: Wu, Chengyan, et autres
Publié: (2025)
Improved Supervised Fine-Tuning for Large Language Models to Mitigate Catastrophic Forgetting
par: Ding, Fei, et autres
Publié: (2025)
par: Ding, Fei, et autres
Publié: (2025)
StoryMaker: Towards Holistic Consistent Characters in Text-to-image Generation
par: Zhou, Zhengguang, et autres
Publié: (2024)
par: Zhou, Zhengguang, et autres
Publié: (2024)
AnomalyGen: An Automated Semantic Log Sequence Generation Framework with LLM for Anomaly Detection
par: Li, Xinyu, et autres
Publié: (2025)
par: Li, Xinyu, et autres
Publié: (2025)
Improving Acoustic Scene Classification with City Features
par: Cai, Yiqiang, et autres
Publié: (2025)
par: Cai, Yiqiang, et autres
Publié: (2025)
A Chinese Patient With Alopecia‐Intellectual Disability Syndrome 4 Carrying a Known Missense Variant of LSS Gene and an Unreported Gross Deletion Involving LSS Gene
par: Huazhen Liu, et autres
Publié: (2025)
par: Huazhen Liu, et autres
Publié: (2025)
Consistency-Aware Parameter-Preserving Knowledge Editing Framework for Multi-Hop Question Answering
par: Deng, Lingwen, et autres
Publié: (2025)
par: Deng, Lingwen, et autres
Publié: (2025)
Documents similaires
-
AutoStudio: Crafting Consistent Subjects in Multi-turn Interactive Image Generation
par: Cheng, Junhao, et autres
Publié: (2024) -
GarmentAligner: Text-to-Garment Generation via Retrieval-augmented Multi-level Corrections
par: Zhang, Shiyue, et autres
Publié: (2024) -
Learning Interaction-aware 3D Gaussian Splatting for One-shot Hand Avatars
par: Huang, Xuan, et autres
Publié: (2024) -
DialogGen: Multi-modal Interactive Dialogue System for Multi-turn Text-to-Image Generation
par: Huang, Minbin, et autres
Publié: (2024) -
LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation
par: Song, Wenhui, et autres
Publié: (2025)