Saved in:
| Main Authors: | Chen, Sixiang, Bai, Jinbin, Zhao, Zhuoran, Ye, Tian, Shi, Qingyu, Zhou, Donghao, Chai, Wenhao, Lin, Xin, Wu, Jianzong, Tang, Chao, Xu, Shilin, Zhang, Tao, Yuan, Haobo, Zhou, Yikang, Chow, Wei, Li, Linfeng, Li, Xiangtai, Zhu, Lei, Qi, Lu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2504.05979 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model
by: Shi, Qingyu, et al.
Published: (2025)
by: Shi, Qingyu, et al.
Published: (2025)
Decouple and Track: Benchmarking and Improving Video Diffusion Transformers for Motion Transfer
by: Shi, Qingyu, et al.
Published: (2025)
by: Shi, Qingyu, et al.
Published: (2025)
DreamRelation: Bridging Customization and Relation Generation
by: Shi, Qingyu, et al.
Published: (2024)
by: Shi, Qingyu, et al.
Published: (2024)
EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
by: Chow, Wei, et al.
Published: (2025)
by: Chow, Wei, et al.
Published: (2025)
Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models
by: Xu, Shilin, et al.
Published: (2025)
by: Xu, Shilin, et al.
Published: (2025)
Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis
by: Bai, Jinbin, et al.
Published: (2024)
by: Bai, Jinbin, et al.
Published: (2024)
Masked Generative Transformer Is What You Need for Image Editing
by: Chow, Wei, et al.
Published: (2026)
by: Chow, Wei, et al.
Published: (2026)
HumanEdit: A High-Quality Human-Rewarded Dataset for Instruction-based Image Editing
by: Bai, Jinbin, et al.
Published: (2024)
by: Bai, Jinbin, et al.
Published: (2024)
The 1st Solution for 7th LSVOS RVOS Track: SaSaSa2VA
by: Niu, Quanzhu, et al.
Published: (2025)
by: Niu, Quanzhu, et al.
Published: (2025)
Dense360: Dense Understanding from Omnidirectional Panoramas
by: Zhou, Yikang, et al.
Published: (2025)
by: Zhou, Yikang, et al.
Published: (2025)
Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs
by: Zhou, Yikang, et al.
Published: (2025)
by: Zhou, Yikang, et al.
Published: (2025)
DVIS-DAQ: Improving Video Segmentation via Dynamic Anchor Queries
by: Zhou, Yikang, et al.
Published: (2024)
by: Zhou, Yikang, et al.
Published: (2024)
Conditional Panoramic Image Generation via Masked Autoregressive Modeling
by: Wang, Chaoyang, et al.
Published: (2025)
by: Wang, Chaoyang, et al.
Published: (2025)
RecTok: Reconstruction Distillation along Rectified Flow
by: Shi, Qingyu, et al.
Published: (2025)
by: Shi, Qingyu, et al.
Published: (2025)
LLAVADI: What Matters For Multimodal Large Language Models Distillation
by: Xu, Shilin, et al.
Published: (2024)
by: Xu, Shilin, et al.
Published: (2024)
DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World
by: Li, Xiangtai, et al.
Published: (2025)
by: Li, Xiangtai, et al.
Published: (2025)
Towards Open Vocabulary Learning: A Survey
by: Wu, Jianzong, et al.
Published: (2023)
by: Wu, Jianzong, et al.
Published: (2023)
4th PVUW MeViS 3rd Place Report: Sa2VA
by: Yuan, Haobo, et al.
Published: (2025)
by: Yuan, Haobo, et al.
Published: (2025)
DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation
by: Wu, Jianzong, et al.
Published: (2024)
by: Wu, Jianzong, et al.
Published: (2024)
Prism: Efficient Test-Time Scaling via Hierarchical Search and Self-Verification for Discrete Diffusion Language Models
by: Bai, Jinbin, et al.
Published: (2026)
by: Bai, Jinbin, et al.
Published: (2026)
RMP-SAM: Towards Real-Time Multi-Purpose Segment Anything
by: Xu, Shilin, et al.
Published: (2024)
by: Xu, Shilin, et al.
Published: (2024)
Point Cloud Mamba: Point Cloud Learning via State Space Model
by: Zhang, Tao, et al.
Published: (2024)
by: Zhang, Tao, et al.
Published: (2024)
Threshold-Guided Optimization for Visual Generative Models
by: Bai, Jinbin, et al.
Published: (2026)
by: Bai, Jinbin, et al.
Published: (2026)
LLMs are Bug Replicators: An Empirical Study on LLMs' Capability in Completing Bug-prone Code
by: Guo, Liwei, et al.
Published: (2025)
by: Guo, Liwei, et al.
Published: (2025)
SAMTok: Representing Any Mask with Two Words
by: Zhou, Yikang, et al.
Published: (2026)
by: Zhou, Yikang, et al.
Published: (2026)
MotionBooth: Motion-Aware Customized Text-to-Video Generation
by: Wu, Jianzong, et al.
Published: (2024)
by: Wu, Jianzong, et al.
Published: (2024)
Open-Vocabulary SAM: Segment and Recognize Twenty-thousand Classes Interactively
by: Yuan, Haobo, et al.
Published: (2024)
by: Yuan, Haobo, et al.
Published: (2024)
PanopticPartFormer++: A Unified and Decoupled View for Panoptic Part Segmentation
by: Li, Xiangtai, et al.
Published: (2023)
by: Li, Xiangtai, et al.
Published: (2023)
Integrating View Conditions for Image Synthesis
by: Bai, Jinbin, et al.
Published: (2023)
by: Bai, Jinbin, et al.
Published: (2023)
Towards Customized Multimodal Role-Play
by: Tang, Chao, et al.
Published: (2026)
by: Tang, Chao, et al.
Published: (2026)
Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos
by: Yuan, Haobo, et al.
Published: (2025)
by: Yuan, Haobo, et al.
Published: (2025)
AGLLDiff: Guiding Diffusion Models Towards Unsupervised Training-free Real-world Low-light Image Enhancement
by: Lin, Yunlong, et al.
Published: (2024)
by: Lin, Yunlong, et al.
Published: (2024)
UniHPR: Unified Human Pose Representation via Singular Value Contrastive Learning
by: Jiang, Zhongyu, et al.
Published: (2025)
by: Jiang, Zhongyu, et al.
Published: (2025)
MagicTailor: Component-Controllable Personalization in Text-to-Image Diffusion Models
by: Zhou, Donghao, et al.
Published: (2024)
by: Zhou, Donghao, et al.
Published: (2024)
Auto Cherry-Picker: Learning from High-quality Generative Data Driven by Language
by: Chen, Yicheng, et al.
Published: (2024)
by: Chen, Yicheng, et al.
Published: (2024)
Mamba or RWKV: Exploring High-Quality and High-Efficiency Segment Anything Model
by: Yuan, Haobo, et al.
Published: (2024)
by: Yuan, Haobo, et al.
Published: (2024)
From Masks to Worlds: A Hitchhiker's Guide to World Models
by: Bai, Jinbin, et al.
Published: (2025)
by: Bai, Jinbin, et al.
Published: (2025)
MERIT: Multilingual Semantic Retrieval with Interleaved Multi-Condition Query
by: Chow, Wei, et al.
Published: (2025)
by: Chow, Wei, et al.
Published: (2025)
SaSaSaSa2VA: 2nd Place of the 5th PVUW MeViS-Text Track
by: Gong, Dengxian, et al.
Published: (2026)
by: Gong, Dengxian, et al.
Published: (2026)
EncGPT: A Multi-Agent Workflow for Dynamic Encryption Algorithms
by: Li, Donghe, et al.
Published: (2025)
by: Li, Donghe, et al.
Published: (2025)
Similar Items
-
Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model
by: Shi, Qingyu, et al.
Published: (2025) -
Decouple and Track: Benchmarking and Improving Video Diffusion Transformers for Motion Transfer
by: Shi, Qingyu, et al.
Published: (2025) -
DreamRelation: Bridging Customization and Relation Generation
by: Shi, Qingyu, et al.
Published: (2024) -
EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
by: Chow, Wei, et al.
Published: (2025) -
Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models
by: Xu, Shilin, et al.
Published: (2025)