Guardado en:
| Autores principales: | Li, Xiaomin, Liu, Yixuan, Isobe, Takashi, Jia, Xu, Cui, Qinpeng, Zhou, Dong, Li, Dong, He, You, Lu, Huchuan, Wang, Zhongdao, Barsoum, Emad |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2412.19637 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AMD-Hummingbird: Towards an Efficient Text-to-Video Model
por: Isobe, Takashi, et al.
Publicado: (2025)
por: Isobe, Takashi, et al.
Publicado: (2025)
Ego-InBetween: Generating Object State Transitions in Ego-Centric Videos
por: Ge, Mengmeng, et al.
Publicado: (2026)
por: Ge, Mengmeng, et al.
Publicado: (2026)
Taming Diffusion Prior for Image Super-Resolution with Domain Shift SDEs
por: Cui, Qinpeng, et al.
Publicado: (2024)
por: Cui, Qinpeng, et al.
Publicado: (2024)
Edit as You See: Image-guided Video Editing via Masked Motion Modeling
por: Huang, Zhi-Lin, et al.
Publicado: (2025)
por: Huang, Zhi-Lin, et al.
Publicado: (2025)
Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking
por: Zheng, Zirui, et al.
Publicado: (2025)
por: Zheng, Zirui, et al.
Publicado: (2025)
Seek-and-Solve: Benchmarking MLLMs for Visual Clue-Driven Reasoning in Daily Scenarios
por: Li, Xiaomin, et al.
Publicado: (2026)
por: Li, Xiaomin, et al.
Publicado: (2026)
MSWA: Refining Local Attention with Multi-ScaleWindow Attention
por: Xu, Yixing, et al.
Publicado: (2025)
por: Xu, Yixing, et al.
Publicado: (2025)
E-MMDiT: Revisiting Multimodal Diffusion Transformer Design for Fast Image Synthesis under Limited Resources
por: Shen, Tong, et al.
Publicado: (2025)
por: Shen, Tong, et al.
Publicado: (2025)
Athena: Enhancing Multimodal Reasoning with Data-efficient Process Reward Models
por: Wang, Shuai, et al.
Publicado: (2025)
por: Wang, Shuai, et al.
Publicado: (2025)
DL-QAT: Weight-Decomposed Low-Rank Quantization-Aware Training for Large Language Models
por: Ke, Wenjin, et al.
Publicado: (2025)
por: Ke, Wenjin, et al.
Publicado: (2025)
MonoGS++: Fast and Accurate Monocular RGB Gaussian SLAM
por: Li, Renwu, et al.
Publicado: (2025)
por: Li, Renwu, et al.
Publicado: (2025)
SyNeg: LLM-Driven Synthetic Hard-Negatives for Dense Retrieval
por: Li, Xiaopeng, et al.
Publicado: (2024)
por: Li, Xiaopeng, et al.
Publicado: (2024)
LADDER: An Efficient Framework for Video Frame Interpolation
por: Shen, Tong, et al.
Publicado: (2024)
por: Shen, Tong, et al.
Publicado: (2024)
NegGS: Negative Gaussian Splatting
por: Kasymov, Artur, et al.
Publicado: (2024)
por: Kasymov, Artur, et al.
Publicado: (2024)
TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization
por: Zhu, Mingkang, et al.
Publicado: (2025)
por: Zhu, Mingkang, et al.
Publicado: (2025)
PARD: Accelerating LLM Inference with Low-Cost PARallel Draft Model Adaptation
por: An, Zihao, et al.
Publicado: (2025)
por: An, Zihao, et al.
Publicado: (2025)
MoTrans: Customized Motion Transfer with Text-driven Video Diffusion Models
por: Li, Xiaomin, et al.
Publicado: (2024)
por: Li, Xiaomin, et al.
Publicado: (2024)
Týr-the-Pruner: Structural Pruning LLMs via Global Sparsity Distribution Optimization
por: Li, Guanchen, et al.
Publicado: (2025)
por: Li, Guanchen, et al.
Publicado: (2025)
PARD-2: Target-Aligned Parallel Draft Model for Dual-Mode Speculative Decoding
por: An, Zihao, et al.
Publicado: (2026)
por: An, Zihao, et al.
Publicado: (2026)
NegVQA: Can Vision Language Models Understand Negation?
por: Zhang, Yuhui, et al.
Publicado: (2025)
por: Zhang, Yuhui, et al.
Publicado: (2025)
Dual LoRA: Enhancing LoRA with Magnitude and Direction Updates
por: Xu, Yixing, et al.
Publicado: (2025)
por: Xu, Yixing, et al.
Publicado: (2025)
Other Tokens Matter: Exploring Global and Local Features of Vision Transformers for Object Re-Identification
por: Wang, Yingquan, et al.
Publicado: (2024)
por: Wang, Yingquan, et al.
Publicado: (2024)
Enhancing One-shot Pruned Pre-trained Language Models through Sparse-Dense-Sparse Mechanism
por: Li, Guanchen, et al.
Publicado: (2024)
por: Li, Guanchen, et al.
Publicado: (2024)
CharacterFactory: Sampling Consistent Characters with GANs for Diffusion Models
por: Wang, Qinghe, et al.
Publicado: (2024)
por: Wang, Qinghe, et al.
Publicado: (2024)
StableIdentity: Inserting Anybody into Anywhere at First Sight
por: Wang, Qinghe, et al.
Publicado: (2024)
por: Wang, Qinghe, et al.
Publicado: (2024)
Learnable Permutation for Structured Sparsity on Transformer Models
por: Li, Zekai, et al.
Publicado: (2026)
por: Li, Zekai, et al.
Publicado: (2026)
Fast Occupancy Network
por: Lu, Mingjie, et al.
Publicado: (2024)
por: Lu, Mingjie, et al.
Publicado: (2024)
Theory-optimal Quantization Based on Flatness
por: Huang, Xiusheng, et al.
Publicado: (2026)
por: Huang, Xiusheng, et al.
Publicado: (2026)
Omni-NegCLIP: Enhancing CLIP with Front-Layer Contrastive Fine-Tuning for Comprehensive Negation Understanding
por: Xu, Jingqi
Publicado: (2026)
por: Xu, Jingqi
Publicado: (2026)
SparK: Query-Aware Unstructured Sparsity with Recoverable KV Cache Channel Pruning
por: Liao, Huanxuan, et al.
Publicado: (2025)
por: Liao, Huanxuan, et al.
Publicado: (2025)
TernaryLLM: Ternarized Large Language Model
por: Chen, Tianqi, et al.
Publicado: (2024)
por: Chen, Tianqi, et al.
Publicado: (2024)
What Makes You Unique? Attribute Prompt Composition for Object Re-Identification
por: Wang, Yingquan, et al.
Publicado: (2025)
por: Wang, Yingquan, et al.
Publicado: (2025)
NegRefine: Refining Negative Label-Based Zero-Shot OOD Detection
por: Ansari, Amirhossein, et al.
Publicado: (2025)
por: Ansari, Amirhossein, et al.
Publicado: (2025)
Gumiho: A Hybrid Architecture to Prioritize Early Tokens in Speculative Decoding
por: Li, Jinze, et al.
Publicado: (2025)
por: Li, Jinze, et al.
Publicado: (2025)
Partial Convolution Meets Visual Attention
por: Huang, Haiduo, et al.
Publicado: (2025)
por: Huang, Haiduo, et al.
Publicado: (2025)
SpecVLM: Fast Speculative Decoding in Vision-Language Models
por: Huang, Haiduo, et al.
Publicado: (2025)
por: Huang, Haiduo, et al.
Publicado: (2025)
DiffSparse: Accelerating Diffusion Transformers with Learned Token Sparsity
por: Zhu, Haowei, et al.
Publicado: (2026)
por: Zhu, Haowei, et al.
Publicado: (2026)
AdaNeg: Adaptive Negative Proxy Guided OOD Detection with Vision-Language Models
por: Zhang, Yabin, et al.
Publicado: (2024)
por: Zhang, Yabin, et al.
Publicado: (2024)
Boosting Continual Learning of Vision-Language Models via Mixture-of-Experts Adapters
por: Yu, Jiazuo, et al.
Publicado: (2024)
por: Yu, Jiazuo, et al.
Publicado: (2024)
Training-Free Loosely Speculative Decoding: Accepting Semantically Correct Drafts Beyond Exact Match
por: Li, Jinze, et al.
Publicado: (2025)
por: Li, Jinze, et al.
Publicado: (2025)
Ejemplares similares
-
AMD-Hummingbird: Towards an Efficient Text-to-Video Model
por: Isobe, Takashi, et al.
Publicado: (2025) -
Ego-InBetween: Generating Object State Transitions in Ego-Centric Videos
por: Ge, Mengmeng, et al.
Publicado: (2026) -
Taming Diffusion Prior for Image Super-Resolution with Domain Shift SDEs
por: Cui, Qinpeng, et al.
Publicado: (2024) -
Edit as You See: Image-guided Video Editing via Masked Motion Modeling
por: Huang, Zhi-Lin, et al.
Publicado: (2025) -
Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking
por: Zheng, Zirui, et al.
Publicado: (2025)