Hyper-Bagel: A Unified Acceleration Framework for Multimodal Understanding and Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lu, Yanzuo, Xia, Xin, Zhang, Manlin, Kuang, Huafeng, Zheng, Jianbin, Ren, Yuxi, Xiao, Xuefeng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Hyper-SD: Trajectory Segmented Consistency Model for Efficient Image Synthesis
par: Ren, Yuxi, et autres
Publié: (2024)
par: Ren, Yuxi, et autres
Publié: (2024)
ByteEdit: Boost, Comply and Accelerate Generative Image Editing
par: Ren, Yuxi, et autres
Publié: (2024)
par: Ren, Yuxi, et autres
Publié: (2024)
Dense2MoE: Restructuring Diffusion Transformer to MoE for Efficient Text-to-Image Generation
par: Zheng, Youwei, et autres
Publié: (2025)
par: Zheng, Youwei, et autres
Publié: (2025)
UniFL: Improve Latent Diffusion Model via Unified Feedback Learning
par: Zhang, Jiacheng, et autres
Publié: (2024)
par: Zhang, Jiacheng, et autres
Publié: (2024)
Adversarial Distribution Matching for Diffusion Distillation Towards Efficient Image and Video Synthesis
par: Lu, Yanzuo, et autres
Publié: (2025)
par: Lu, Yanzuo, et autres
Publié: (2025)
Coarse-to-Fine Latent Diffusion for Pose-Guided Person Image Synthesis
par: Lu, Yanzuo, et autres
Publié: (2024)
par: Lu, Yanzuo, et autres
Publié: (2024)
Diffusion Adversarial Post-Training for One-Step Video Generation
par: Lin, Shanchuan, et autres
Publié: (2025)
par: Lin, Shanchuan, et autres
Publié: (2025)
Training-free Diffusion Acceleration with Bottleneck Sampling
par: Tian, Ye, et autres
Publié: (2025)
par: Tian, Ye, et autres
Publié: (2025)
MammothModa2: A Unified AR-Diffusion Framework for Multimodal Understanding and Generation
par: Shen, Tao, et autres
Publié: (2025)
par: Shen, Tao, et autres
Publié: (2025)
RayFlow: Instance-Aware Diffusion Acceleration via Adaptive Flow Trajectories
par: Shao, Huiyang, et autres
Publié: (2025)
par: Shao, Huiyang, et autres
Publié: (2025)
RAVEN: Real-time Autoregressive Video Extrapolation with Consistency-model GRPO
par: Lu, Yanzuo, et autres
Publié: (2026)
par: Lu, Yanzuo, et autres
Publié: (2026)
UniModel: A Visual-Only Framework for Unified Multimodal Understanding and Generation
par: Zhang, Chi, et autres
Publié: (2025)
par: Zhang, Chi, et autres
Publié: (2025)
UniEval: Unified Holistic Evaluation for Unified Multimodal Understanding and Generation
par: Li, Yi, et autres
Publié: (2025)
par: Li, Yi, et autres
Publié: (2025)
UniFork: Exploring Modality Alignment for Unified Multimodal Understanding and Generation
par: Li, Teng, et autres
Publié: (2025)
par: Li, Teng, et autres
Publié: (2025)
MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models
par: Xie, Wulin, et autres
Publié: (2025)
par: Xie, Wulin, et autres
Publié: (2025)
EMMA: Efficient Multimodal Understanding, Generation, and Editing with a Unified Architecture
par: He, Xin, et autres
Publié: (2025)
par: He, Xin, et autres
Publié: (2025)
Autoregressive Adversarial Post-Training for Real-Time Interactive Video Generation
par: Lin, Shanchuan, et autres
Publié: (2025)
par: Lin, Shanchuan, et autres
Publié: (2025)
ResAdapter: Domain Consistent Resolution Adapter for Diffusion Models
par: Cheng, Jiaxiang, et autres
Publié: (2024)
par: Cheng, Jiaxiang, et autres
Publié: (2024)
Harmonizing Visual Representations for Unified Multimodal Understanding and Generation
par: Wu, Size, et autres
Publié: (2025)
par: Wu, Size, et autres
Publié: (2025)
Show-o: One Single Transformer to Unify Multimodal Understanding and Generation
par: Xie, Jinheng, et autres
Publié: (2024)
par: Xie, Jinheng, et autres
Publié: (2024)
Unified Reward Model for Multimodal Understanding and Generation
par: Wang, Yibin, et autres
Publié: (2025)
par: Wang, Yibin, et autres
Publié: (2025)
Understanding-in-Generation: Reinforcing Generative Capability of Unified Model via Infusing Understanding into Generation
par: Lyu, Yuanhuiyi, et autres
Publié: (2025)
par: Lyu, Yuanhuiyi, et autres
Publié: (2025)
HBridge: H-Shape Bridging of Heterogeneous Experts for Unified Multimodal Understanding and Generation
par: Wang, Xiang, et autres
Publié: (2025)
par: Wang, Xiang, et autres
Publié: (2025)
Unified Multimodal Understanding and Generation Models: Advances, Challenges, and Opportunities
par: Zhao, Shanshan, et autres
Publié: (2025)
par: Zhao, Shanshan, et autres
Publié: (2025)
A Unified Framework for Human-centric Point Cloud Video Understanding
par: Xu, Yiteng, et autres
Publié: (2024)
par: Xu, Yiteng, et autres
Publié: (2024)
AV-Unified: A Unified Framework for Audio-visual Scene Understanding
par: Li, Guangyao, et autres
Publié: (2026)
par: Li, Guangyao, et autres
Publié: (2026)
UniLiP: Adapting CLIP for Unified Multimodal Understanding, Generation and Editing
par: Tang, Hao, et autres
Publié: (2025)
par: Tang, Hao, et autres
Publié: (2025)
HyperDet: Generalizable Detection of Synthesized Images by Generating and Merging A Mixture of Hyper LoRAs
par: Cao, Huangsen, et autres
Publié: (2024)
par: Cao, Huangsen, et autres
Publié: (2024)
UniDrive-WM: Unified Understanding, Planning and Generation World Model For Autonomous Driving
par: Xiong, Zhexiao, et autres
Publié: (2026)
par: Xiong, Zhexiao, et autres
Publié: (2026)
Relax Forcing: Relaxed KV-Memory for Consistent Long Video Generation
par: Zhao, Zengqun, et autres
Publié: (2026)
par: Zhao, Zengqun, et autres
Publié: (2026)
LightFusion: A Light-weighted, Double Fusion Framework for Unified Multimodal Understanding and Generation
par: Wang, Zeyu, et autres
Publié: (2025)
par: Wang, Zeyu, et autres
Publié: (2025)
Unified Multimodal Understanding via Byte-Pair Visual Encoding
par: Zhang, Wanpeng, et autres
Publié: (2025)
par: Zhang, Wanpeng, et autres
Publié: (2025)
CLEAR: Unlocking Generative Potential for Degraded Image Understanding in Unified Multimodal Models
par: Hao, Xiangzhao, et autres
Publié: (2026)
par: Hao, Xiangzhao, et autres
Publié: (2026)
MambaTrans: Multimodal Fusion Image Translation via Large Language Model Priors for Downstream Visual Tasks
par: Xu, Yushen, et autres
Publié: (2025)
par: Xu, Yushen, et autres
Publié: (2025)
X-OmniClaw Technical Report: A Unified Mobile Agent for Multimodal Understanding and Interaction
par: Ren, Xiaoming, et autres
Publié: (2026)
par: Ren, Xiaoming, et autres
Publié: (2026)
Seedream 4.0: Toward Next-generation Multimodal Image Generation
par: Seedream, Team, et autres
Publié: (2025)
par: Seedream, Team, et autres
Publié: (2025)
HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation
par: Xiao, Yicheng, et autres
Publié: (2025)
par: Xiao, Yicheng, et autres
Publié: (2025)
UniFuse: A Unified All-in-One Framework for Multi-Modal Medical Image Fusion Under Diverse Degradations and Misalignments
par: Su, Dayong, et autres
Publié: (2025)
par: Su, Dayong, et autres
Publié: (2025)
UMCFuse: A Unified Multiple Complex Scenes Infrared and Visible Image Fusion Framework
par: Li, Xilai, et autres
Publié: (2024)
par: Li, Xilai, et autres
Publié: (2024)
Mobile-O: Unified Multimodal Understanding and Generation on Mobile Device
par: Shaker, Abdelrahman, et autres
Publié: (2026)
par: Shaker, Abdelrahman, et autres
Publié: (2026)
Documents similaires
-
Hyper-SD: Trajectory Segmented Consistency Model for Efficient Image Synthesis
par: Ren, Yuxi, et autres
Publié: (2024) -
ByteEdit: Boost, Comply and Accelerate Generative Image Editing
par: Ren, Yuxi, et autres
Publié: (2024) -
Dense2MoE: Restructuring Diffusion Transformer to MoE for Efficient Text-to-Image Generation
par: Zheng, Youwei, et autres
Publié: (2025) -
UniFL: Improve Latent Diffusion Model via Unified Feedback Learning
par: Zhang, Jiacheng, et autres
Publié: (2024) -
Adversarial Distribution Matching for Diffusion Distillation Towards Efficient Image and Video Synthesis
par: Lu, Yanzuo, et autres
Publié: (2025)