DuoGen: Towards General Purpose Interleaved Multimodal Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shi, Min, Zeng, Xiaohui, Huang, Jiannan, Cui, Yin, Ferroni, Francesco, Li, Jialuo, Pachori, Shubham, Li, Zhaoshuo, Balaji, Yogesh, Wang, Haoxiang, Lin, Tsung-Yi, Fu, Xiao, Zhao, Yue, Chen, Chieh-Yun, Liu, Ming-Yu, Shi, Humphrey |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PAI-Bench: A Comprehensive Benchmark For Physical AI
par: Zhou, Fengzhe, et autres
Publié: (2025)
par: Zhou, Fengzhe, et autres
Publié: (2025)
T2I-Copilot: A Training-Free Multi-Agent Text-to-Image System for Enhanced Prompt Interpretation and Interactive Generation
par: Chen, Chieh-Yun, et autres
Publié: (2025)
par: Chen, Chieh-Yun, et autres
Publié: (2025)
ExpertGen: Training-Free Expert Guidance for Controllable Text-to-Face Generation
par: Shi, Liang, et autres
Publié: (2025)
par: Shi, Liang, et autres
Publié: (2025)
AUGUSTUS: An LLM-Driven Multimodal Agent System with Contextualized User Memory
par: Jain, Jitesh, et autres
Publié: (2025)
par: Jain, Jitesh, et autres
Publié: (2025)
ARMOR: Empowering Multimodal Understanding Model with Interleaved Multimodal Generation Capability
par: Sun, Jianwen, et autres
Publié: (2025)
par: Sun, Jianwen, et autres
Publié: (2025)
Le-DETR: Revisiting Real-Time Detection Transformer with Efficient Encoder Design
par: Huang, Jiannan, et autres
Publié: (2026)
par: Huang, Jiannan, et autres
Publié: (2026)
An Expert-grounded benchmark of General Purpose LLMs in LCA
par: Donaldson, Artur, et autres
Publié: (2025)
par: Donaldson, Artur, et autres
Publié: (2025)
EasyGen: Easing Multimodal Generation with BiDiffuser and LLMs
par: Zhao, Xiangyu, et autres
Publié: (2023)
par: Zhao, Xiangyu, et autres
Publié: (2023)
SpiderGen: Towards Procedure Generation For Carbon Life Cycle Assessments with Generative AI
par: Sitaraman, Anupama, et autres
Publié: (2025)
par: Sitaraman, Anupama, et autres
Publié: (2025)
EFCM: Efficient Fine-tuning on Compressed Models for deployment of large models in medical image analysis
par: Li, Shaojie, et autres
Publié: (2024)
par: Li, Shaojie, et autres
Publié: (2024)
Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking
par: Wu, Shengqiong, et autres
Publié: (2026)
par: Wu, Shengqiong, et autres
Publié: (2026)
TextBind: Multi-turn Interleaved Multimodal Instruction-following in the Wild
par: Li, Huayang, et autres
Publié: (2023)
par: Li, Huayang, et autres
Publié: (2023)
Generalized Neighborhood Attention: Multi-dimensional Sparse Attention at the Speed of Light
par: Hassani, Ali, et autres
Publié: (2025)
par: Hassani, Ali, et autres
Publié: (2025)
OmniMoGen: Unifying Human Motion Generation via Learning from Interleaved Text-Motion Instructions
par: Bu, Wendong, et autres
Publié: (2025)
par: Bu, Wendong, et autres
Publié: (2025)
Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization
par: Nie, Ming, et autres
Publié: (2026)
par: Nie, Ming, et autres
Publié: (2026)
IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation
par: Li, Yuan-Ming, et autres
Publié: (2025)
par: Li, Yuan-Ming, et autres
Publié: (2025)
Collaborative Vision-Text Representation Optimizing for Open-Vocabulary Segmentation
par: Jiao, Siyu, et autres
Publié: (2024)
par: Jiao, Siyu, et autres
Publié: (2024)
MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models
par: Xia, Peng, et autres
Publié: (2024)
par: Xia, Peng, et autres
Publié: (2024)
Combating Label Noise With A General Surrogate Model For Sample Selection
par: Liang, Chao, et autres
Publié: (2023)
par: Liang, Chao, et autres
Publié: (2023)
GenDRAM:Hardware-Software Co-Design of General Platform in DRAM
par: Lu, Tsung-Han, et autres
Publié: (2026)
par: Lu, Tsung-Han, et autres
Publié: (2026)
Gen4DS: Workshop on Data Storytelling in an Era of Generative AI
par: Lan, Xingyu, et autres
Publié: (2024)
par: Lan, Xingyu, et autres
Publié: (2024)
GenArtist: Multimodal LLM as an Agent for Unified Image Generation and Editing
par: Wang, Zhenyu, et autres
Publié: (2024)
par: Wang, Zhenyu, et autres
Publié: (2024)
CoMM: A Coherent Interleaved Image-Text Dataset for Multimodal Understanding and Generation
par: Chen, Wei, et autres
Publié: (2024)
par: Chen, Wei, et autres
Publié: (2024)
GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning
par: Jiang, Kaixun, et autres
Publié: (2026)
par: Jiang, Kaixun, et autres
Publié: (2026)
SAGE: Scalable Agentic 3D Scene Generation for Embodied AI
par: Xia, Hongchi, et autres
Publié: (2026)
par: Xia, Hongchi, et autres
Publié: (2026)
Exploring General-Purpose Autonomous Multimodal Agents for Pathology Report Generation
par: Aubreville, Marc, et autres
Publié: (2025)
par: Aubreville, Marc, et autres
Publié: (2025)
DuoLungo: Usability Study of Duo 2FA
par: Prapty, Renascence Tarafder, et autres
Publié: (2026)
par: Prapty, Renascence Tarafder, et autres
Publié: (2026)
DuoCast: Duo-Probabilistic Diffusion for Precipitation Nowcasting
par: Wen, Penghui, et autres
Publié: (2024)
par: Wen, Penghui, et autres
Publié: (2024)
Efficient Image Generation with Variadic Attention Heads
par: Walton, Steven, et autres
Publié: (2022)
par: Walton, Steven, et autres
Publié: (2022)
Efficient Part-level 3D Object Generation via Dual Volume Packing
par: Tang, Jiaxiang, et autres
Publié: (2025)
par: Tang, Jiaxiang, et autres
Publié: (2025)
Supercritical CO2‐Assisted Foaming of PBST/PHBH Blends: Mechanisms of Morphological Control and Shrinkage Reduction
par: Xiayan Tong, et autres
Publié: (2025)
par: Xiayan Tong, et autres
Publié: (2025)
Mechanically Induced Contact‐Electro‐Catalysis: Free Radical Generation, Reaction Pathways, and Catalytic Applications
par: Zihan Liang, et autres
Publié: (2025)
par: Zihan Liang, et autres
Publié: (2025)
GenSelect: A Generative Approach to Best-of-N
par: Toshniwal, Shubham, et autres
Publié: (2025)
par: Toshniwal, Shubham, et autres
Publié: (2025)
MapReduce LoRA: Advancing the Pareto Front in Multi-Preference Optimization for Generative Models
par: Chen, Chieh-Yun, et autres
Publié: (2025)
par: Chen, Chieh-Yun, et autres
Publié: (2025)
Astra: Toward General-Purpose Mobile Robots via Hierarchical Multimodal Learning
par: Chen, Sheng, et autres
Publié: (2025)
par: Chen, Sheng, et autres
Publié: (2025)
Interleaved Scene Graphs for Interleaved Text-and-Image Generation Assessment
par: Chen, Dongping, et autres
Publié: (2024)
par: Chen, Dongping, et autres
Publié: (2024)
Generalizing 6-DoF Grasp Detection via Domain Prior Knowledge
par: Ma, Haoxiang, et autres
Publié: (2024)
par: Ma, Haoxiang, et autres
Publié: (2024)
Correlation Between Bonding Mechanism and Interleaved Mesh– GPTMS Surface Synergy in Co‐Cured Composite Joints
par: Sekar Balaji, et autres
Publié: (2026)
par: Sekar Balaji, et autres
Publié: (2026)
RAGME: Retrieval Augmented Video Generation for Enhanced Motion Realism
par: Peruzzo, Elia, et autres
Publié: (2025)
par: Peruzzo, Elia, et autres
Publié: (2025)
Idea23D: Collaborative LMM Agents Enable 3D Model Generation from Interleaved Multimodal Inputs
par: Chen, Junhao, et autres
Publié: (2024)
par: Chen, Junhao, et autres
Publié: (2024)
Documents similaires
-
PAI-Bench: A Comprehensive Benchmark For Physical AI
par: Zhou, Fengzhe, et autres
Publié: (2025) -
T2I-Copilot: A Training-Free Multi-Agent Text-to-Image System for Enhanced Prompt Interpretation and Interactive Generation
par: Chen, Chieh-Yun, et autres
Publié: (2025) -
ExpertGen: Training-Free Expert Guidance for Controllable Text-to-Face Generation
par: Shi, Liang, et autres
Publié: (2025) -
AUGUSTUS: An LLM-Driven Multimodal Agent System with Contextualized User Memory
par: Jain, Jitesh, et autres
Publié: (2025) -
ARMOR: Empowering Multimodal Understanding Model with Interleaved Multimodal Generation Capability
par: Sun, Jianwen, et autres
Publié: (2025)