EasyGen: Easing Multimodal Generation with BiDiffuser and LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Xiangyu, Liu, Bo, Liu, Qijiong, Shi, Guangyuan, Wu, Xiao-Ming |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
How Easy is It to Fool Your Multimodal LLMs? An Empirical Analysis on Deceptive Prompts
par: Qian, Yusu, et autres
Publié: (2024)
par: Qian, Yusu, et autres
Publié: (2024)
OmniGen2: Towards Instruction-Aligned Multimodal Generation
par: Wu, Chenyuan, et autres
Publié: (2025)
par: Wu, Chenyuan, et autres
Publié: (2025)
EasyAnimate: High-Performance Video Generation Framework with Hybrid Windows Attention and Reward Backpropagation
par: Xu, Jiaqi, et autres
Publié: (2024)
par: Xu, Jiaqi, et autres
Publié: (2024)
R2GenCSR: Mining Contextual and Residual Information for LLMs-based Radiology Report Generation
par: Wang, Xiao, et autres
Publié: (2024)
par: Wang, Xiao, et autres
Publié: (2024)
UEval: A Benchmark for Unified Multimodal Generation
par: Li, Bo, et autres
Publié: (2026)
par: Li, Bo, et autres
Publié: (2026)
ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention
par: Liu, Wenjie, et autres
Publié: (2026)
par: Liu, Wenjie, et autres
Publié: (2026)
MegaPairs: Massive Data Synthesis For Universal Multimodal Retrieval
par: Zhou, Junjie, et autres
Publié: (2024)
par: Zhou, Junjie, et autres
Publié: (2024)
CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs
par: Wang, Zirui, et autres
Publié: (2024)
par: Wang, Zirui, et autres
Publié: (2024)
DuoGen: Towards General Purpose Interleaved Multimodal Generation
par: Shi, Min, et autres
Publié: (2026)
par: Shi, Min, et autres
Publié: (2026)
Insight Over Sight: Exploring the Vision-Knowledge Conflicts in Multimodal LLMs
par: Liu, Xiaoyuan, et autres
Publié: (2024)
par: Liu, Xiaoyuan, et autres
Publié: (2024)
EmbodiedEval: Evaluate Multimodal LLMs as Embodied Agents
par: Cheng, Zhili, et autres
Publié: (2025)
par: Cheng, Zhili, et autres
Publié: (2025)
EasyGenNet: An Efficient Framework for Audio-Driven Gesture Video Generation Based on Diffusion Model
par: Li, Renda, et autres
Publié: (2025)
par: Li, Renda, et autres
Publié: (2025)
Reading, Not Thinking: Understanding and Bridging the Modality Gap When Text Becomes Pixels in Multimodal LLMs
par: Sun, Kaiser, et autres
Publié: (2026)
par: Sun, Kaiser, et autres
Publié: (2026)
DialectGen: Benchmarking and Improving Dialect Robustness in Multimodal Generation
par: Zhou, Yu, et autres
Publié: (2025)
par: Zhou, Yu, et autres
Publié: (2025)
MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models
par: Xia, Yinan, et autres
Publié: (2025)
par: Xia, Yinan, et autres
Publié: (2025)
DiSA: Diffusion Step Annealing in Autoregressive Image Generation
par: Zhao, Qinyu, et autres
Publié: (2025)
par: Zhao, Qinyu, et autres
Publié: (2025)
UGen: Unified Autoregressive Multimodal Model with Progressive Vocabulary Learning
par: Tang, Hongxuan, et autres
Publié: (2025)
par: Tang, Hongxuan, et autres
Publié: (2025)
Memory-Augmented Multimodal LLMs for Surgical VQA via Self-Contained Inquiry
par: Hou, Wenjun, et autres
Publié: (2024)
par: Hou, Wenjun, et autres
Publié: (2024)
From Reasoning to Pixels: Benchmarking the Alignment Gap in Unified Multimodal Models
par: Yang, Cheng, et autres
Publié: (2026)
par: Yang, Cheng, et autres
Publié: (2026)
MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs
par: Fu, Chaoyou, et autres
Publié: (2024)
par: Fu, Chaoyou, et autres
Publié: (2024)
LLaVA-OneVision: Easy Visual Task Transfer
par: Li, Bo, et autres
Publié: (2024)
par: Li, Bo, et autres
Publié: (2024)
UNIDOC-BENCH: A Unified Benchmark for Document-Centric Multimodal RAG
par: Peng, Xiangyu, et autres
Publié: (2025)
par: Peng, Xiangyu, et autres
Publié: (2025)
VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos
par: Song, Tingyu, et autres
Publié: (2025)
par: Song, Tingyu, et autres
Publié: (2025)
DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification
par: Liu, Rui, et autres
Publié: (2026)
par: Liu, Rui, et autres
Publié: (2026)
SK-VQA: Synthetic Knowledge Generation at Scale for Training Context-Augmented Multimodal LLMs
par: Su, Xin, et autres
Publié: (2024)
par: Su, Xin, et autres
Publié: (2024)
Implicit Multimodal Alignment: On the Generalization of Frozen LLMs to Multimodal Inputs
par: Shukor, Mustafa, et autres
Publié: (2024)
par: Shukor, Mustafa, et autres
Publié: (2024)
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
par: Ma, David, et autres
Publié: (2025)
par: Ma, David, et autres
Publié: (2025)
ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction
par: Guo, Zichun, et autres
Publié: (2026)
par: Guo, Zichun, et autres
Publié: (2026)
EasyRef: Omni-Generalized Group Image Reference for Diffusion Models via Multimodal LLM
par: Zong, Zhuofan, et autres
Publié: (2024)
par: Zong, Zhuofan, et autres
Publié: (2024)
Contrastive Language Prompting to Ease False Positives in Medical Anomaly Detection
par: Park, YeongHyeon, et autres
Publié: (2024)
par: Park, YeongHyeon, et autres
Publié: (2024)
LLMs Meet Multimodal Generation and Editing: A Survey
par: He, Yingqing, et autres
Publié: (2024)
par: He, Yingqing, et autres
Publié: (2024)
Learning Human-Perceived Fakeness in AI-Generated Videos via Multimodal LLMs
par: Fu, Xingyu, et autres
Publié: (2025)
par: Fu, Xingyu, et autres
Publié: (2025)
AI-Generated Fall Data: Assessing LLMs and Diffusion Model for Wearable Fall Detection
par: Alamgeer, Sana, et autres
Publié: (2025)
par: Alamgeer, Sana, et autres
Publié: (2025)
Reinforcing Multimodal Reasoning Against Visual Degradation
par: Liu, Rui, et autres
Publié: (2026)
par: Liu, Rui, et autres
Publié: (2026)
Scientific Reasoning: Assessment of Multimodal Generative LLMs
par: Dreyer, Florian, et autres
Publié: (2025)
par: Dreyer, Florian, et autres
Publié: (2025)
EmotionHallucer: Evaluating Emotion Hallucinations in Multimodal Large Language Models
par: Xing, Bohao, et autres
Publié: (2025)
par: Xing, Bohao, et autres
Publié: (2025)
Leveraging Entity Information for Cross-Modality Correlation Learning: The Entity-Guided Multimodal Summarization
par: Zhang, Yanghai, et autres
Publié: (2024)
par: Zhang, Yanghai, et autres
Publié: (2024)
Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding Bridge
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
GenEscape: Hierarchical Multi-Agent Generation of Escape Room Puzzles
par: Shan, Mengyi, et autres
Publié: (2025)
par: Shan, Mengyi, et autres
Publié: (2025)
Vision Enhancing LLMs: Empowering Multimodal Knowledge Storage and Sharing in LLMs
par: Li, Yunxin, et autres
Publié: (2023)
par: Li, Yunxin, et autres
Publié: (2023)
Documents similaires
-
How Easy is It to Fool Your Multimodal LLMs? An Empirical Analysis on Deceptive Prompts
par: Qian, Yusu, et autres
Publié: (2024) -
OmniGen2: Towards Instruction-Aligned Multimodal Generation
par: Wu, Chenyuan, et autres
Publié: (2025) -
EasyAnimate: High-Performance Video Generation Framework with Hybrid Windows Attention and Reward Backpropagation
par: Xu, Jiaqi, et autres
Publié: (2024) -
R2GenCSR: Mining Contextual and Residual Information for LLMs-based Radiology Report Generation
par: Wang, Xiao, et autres
Publié: (2024) -
UEval: A Benchmark for Unified Multimodal Generation
par: Li, Bo, et autres
Publié: (2026)