Guardado en:
| Autores principales: | Chen, Sixiang, Bai, Jinbin, Zhao, Zhuoran, Ye, Tian, Shi, Qingyu, Zhou, Donghao, Chai, Wenhao, Lin, Xin, Wu, Jianzong, Tang, Chao, Xu, Shilin, Zhang, Tao, Yuan, Haobo, Zhou, Yikang, Chow, Wei, Li, Linfeng, Li, Xiangtai, Zhu, Lei, Qi, Lu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2504.05979 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model
por: Shi, Qingyu, et al.
Publicado: (2025)
por: Shi, Qingyu, et al.
Publicado: (2025)
Decouple and Track: Benchmarking and Improving Video Diffusion Transformers for Motion Transfer
por: Shi, Qingyu, et al.
Publicado: (2025)
por: Shi, Qingyu, et al.
Publicado: (2025)
DreamRelation: Bridging Customization and Relation Generation
por: Shi, Qingyu, et al.
Publicado: (2024)
por: Shi, Qingyu, et al.
Publicado: (2024)
EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
por: Chow, Wei, et al.
Publicado: (2025)
por: Chow, Wei, et al.
Publicado: (2025)
Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models
por: Xu, Shilin, et al.
Publicado: (2025)
por: Xu, Shilin, et al.
Publicado: (2025)
Meissonic: Revitalizing Masked Generative Transformers for Efficient High-Resolution Text-to-Image Synthesis
por: Bai, Jinbin, et al.
Publicado: (2024)
por: Bai, Jinbin, et al.
Publicado: (2024)
Masked Generative Transformer Is What You Need for Image Editing
por: Chow, Wei, et al.
Publicado: (2026)
por: Chow, Wei, et al.
Publicado: (2026)
HumanEdit: A High-Quality Human-Rewarded Dataset for Instruction-based Image Editing
por: Bai, Jinbin, et al.
Publicado: (2024)
por: Bai, Jinbin, et al.
Publicado: (2024)
The 1st Solution for 7th LSVOS RVOS Track: SaSaSa2VA
por: Niu, Quanzhu, et al.
Publicado: (2025)
por: Niu, Quanzhu, et al.
Publicado: (2025)
Dense360: Dense Understanding from Omnidirectional Panoramas
por: Zhou, Yikang, et al.
Publicado: (2025)
por: Zhou, Yikang, et al.
Publicado: (2025)
Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs
por: Zhou, Yikang, et al.
Publicado: (2025)
por: Zhou, Yikang, et al.
Publicado: (2025)
DVIS-DAQ: Improving Video Segmentation via Dynamic Anchor Queries
por: Zhou, Yikang, et al.
Publicado: (2024)
por: Zhou, Yikang, et al.
Publicado: (2024)
Conditional Panoramic Image Generation via Masked Autoregressive Modeling
por: Wang, Chaoyang, et al.
Publicado: (2025)
por: Wang, Chaoyang, et al.
Publicado: (2025)
RecTok: Reconstruction Distillation along Rectified Flow
por: Shi, Qingyu, et al.
Publicado: (2025)
por: Shi, Qingyu, et al.
Publicado: (2025)
LLAVADI: What Matters For Multimodal Large Language Models Distillation
por: Xu, Shilin, et al.
Publicado: (2024)
por: Xu, Shilin, et al.
Publicado: (2024)
DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World
por: Li, Xiangtai, et al.
Publicado: (2025)
por: Li, Xiangtai, et al.
Publicado: (2025)
Towards Open Vocabulary Learning: A Survey
por: Wu, Jianzong, et al.
Publicado: (2023)
por: Wu, Jianzong, et al.
Publicado: (2023)
4th PVUW MeViS 3rd Place Report: Sa2VA
por: Yuan, Haobo, et al.
Publicado: (2025)
por: Yuan, Haobo, et al.
Publicado: (2025)
DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation
por: Wu, Jianzong, et al.
Publicado: (2024)
por: Wu, Jianzong, et al.
Publicado: (2024)
Prism: Efficient Test-Time Scaling via Hierarchical Search and Self-Verification for Discrete Diffusion Language Models
por: Bai, Jinbin, et al.
Publicado: (2026)
por: Bai, Jinbin, et al.
Publicado: (2026)
RMP-SAM: Towards Real-Time Multi-Purpose Segment Anything
por: Xu, Shilin, et al.
Publicado: (2024)
por: Xu, Shilin, et al.
Publicado: (2024)
Point Cloud Mamba: Point Cloud Learning via State Space Model
por: Zhang, Tao, et al.
Publicado: (2024)
por: Zhang, Tao, et al.
Publicado: (2024)
Threshold-Guided Optimization for Visual Generative Models
por: Bai, Jinbin, et al.
Publicado: (2026)
por: Bai, Jinbin, et al.
Publicado: (2026)
LLMs are Bug Replicators: An Empirical Study on LLMs' Capability in Completing Bug-prone Code
por: Guo, Liwei, et al.
Publicado: (2025)
por: Guo, Liwei, et al.
Publicado: (2025)
SAMTok: Representing Any Mask with Two Words
por: Zhou, Yikang, et al.
Publicado: (2026)
por: Zhou, Yikang, et al.
Publicado: (2026)
MotionBooth: Motion-Aware Customized Text-to-Video Generation
por: Wu, Jianzong, et al.
Publicado: (2024)
por: Wu, Jianzong, et al.
Publicado: (2024)
Open-Vocabulary SAM: Segment and Recognize Twenty-thousand Classes Interactively
por: Yuan, Haobo, et al.
Publicado: (2024)
por: Yuan, Haobo, et al.
Publicado: (2024)
PanopticPartFormer++: A Unified and Decoupled View for Panoptic Part Segmentation
por: Li, Xiangtai, et al.
Publicado: (2023)
por: Li, Xiangtai, et al.
Publicado: (2023)
Integrating View Conditions for Image Synthesis
por: Bai, Jinbin, et al.
Publicado: (2023)
por: Bai, Jinbin, et al.
Publicado: (2023)
Towards Customized Multimodal Role-Play
por: Tang, Chao, et al.
Publicado: (2026)
por: Tang, Chao, et al.
Publicado: (2026)
Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos
por: Yuan, Haobo, et al.
Publicado: (2025)
por: Yuan, Haobo, et al.
Publicado: (2025)
AGLLDiff: Guiding Diffusion Models Towards Unsupervised Training-free Real-world Low-light Image Enhancement
por: Lin, Yunlong, et al.
Publicado: (2024)
por: Lin, Yunlong, et al.
Publicado: (2024)
UniHPR: Unified Human Pose Representation via Singular Value Contrastive Learning
por: Jiang, Zhongyu, et al.
Publicado: (2025)
por: Jiang, Zhongyu, et al.
Publicado: (2025)
MagicTailor: Component-Controllable Personalization in Text-to-Image Diffusion Models
por: Zhou, Donghao, et al.
Publicado: (2024)
por: Zhou, Donghao, et al.
Publicado: (2024)
Auto Cherry-Picker: Learning from High-quality Generative Data Driven by Language
por: Chen, Yicheng, et al.
Publicado: (2024)
por: Chen, Yicheng, et al.
Publicado: (2024)
Mamba or RWKV: Exploring High-Quality and High-Efficiency Segment Anything Model
por: Yuan, Haobo, et al.
Publicado: (2024)
por: Yuan, Haobo, et al.
Publicado: (2024)
From Masks to Worlds: A Hitchhiker's Guide to World Models
por: Bai, Jinbin, et al.
Publicado: (2025)
por: Bai, Jinbin, et al.
Publicado: (2025)
MERIT: Multilingual Semantic Retrieval with Interleaved Multi-Condition Query
por: Chow, Wei, et al.
Publicado: (2025)
por: Chow, Wei, et al.
Publicado: (2025)
SaSaSaSa2VA: 2nd Place of the 5th PVUW MeViS-Text Track
por: Gong, Dengxian, et al.
Publicado: (2026)
por: Gong, Dengxian, et al.
Publicado: (2026)
EncGPT: A Multi-Agent Workflow for Dynamic Encryption Algorithms
por: Li, Donghe, et al.
Publicado: (2025)
por: Li, Donghe, et al.
Publicado: (2025)
Ejemplares similares
-
Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model
por: Shi, Qingyu, et al.
Publicado: (2025) -
Decouple and Track: Benchmarking and Improving Video Diffusion Transformers for Motion Transfer
por: Shi, Qingyu, et al.
Publicado: (2025) -
DreamRelation: Bridging Customization and Relation Generation
por: Shi, Qingyu, et al.
Publicado: (2024) -
EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
por: Chow, Wei, et al.
Publicado: (2025) -
Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models
por: Xu, Shilin, et al.
Publicado: (2025)