LASER: Tuning-Free LLM-Driven Attention Control for Efficient Text-conditioned Image-to-Animation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zheng, Haoyu, Zhang, Wenqiao, Wang, Yaoke, Li, Juncheng, Lv, Zheqi, Min, Xin, Li, Mengze, Zhang, Dongping, Tang, Siliang, Zhuang, Yueting |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MAKIMA: Tuning-free Multi-Attribute Open-domain Video Editing via Mask-Guided Attention Modulation
par: Zheng, Haoyu, et autres
Publié: (2024)
par: Zheng, Haoyu, et autres
Publié: (2024)
Bridging Local Details and Global Context in Text-Attributed Graphs
par: Wang, Yaoke, et autres
Publié: (2024)
par: Wang, Yaoke, et autres
Publié: (2024)
SOYO: A Tuning-Free Approach for Video Style Morphing via Style-Adaptive Interpolation in Diffusion Models
par: Zheng, Haoyu, et autres
Publié: (2025)
par: Zheng, Haoyu, et autres
Publié: (2025)
Fast Thinking for Large Language Models
par: Zheng, Haoyu, et autres
Publié: (2025)
par: Zheng, Haoyu, et autres
Publié: (2025)
MoA: Heterogeneous Mixture of Adapters for Parameter-Efficient Fine-Tuning of Large Language Models
par: Cao, Jie, et autres
Publié: (2025)
par: Cao, Jie, et autres
Publié: (2025)
De-fine: Decomposing and Refining Visual Programs with Auto-Feedback
par: Gao, Minghe, et autres
Publié: (2023)
par: Gao, Minghe, et autres
Publié: (2023)
Meta-Reflection: A Feedback-Free Reflection Learning Framework
par: Wang, Yaoke, et autres
Publié: (2024)
par: Wang, Yaoke, et autres
Publié: (2024)
HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language Models
par: Zhang, Wenqiao, et autres
Publié: (2024)
par: Zhang, Wenqiao, et autres
Publié: (2024)
Enhancing Post-Training Quantization via Future Activation Awareness
par: Lv, Zheqi, et autres
Publié: (2026)
par: Lv, Zheqi, et autres
Publié: (2026)
Graft: Integrating the Domain Knowledge via Efficient Parameter Synergy for MLLMs
par: Dai, Yang, et autres
Publié: (2025)
par: Dai, Yang, et autres
Publié: (2025)
DuetRAG: Collaborative Retrieval-Augmented Generation
par: Jiao, Dian, et autres
Publié: (2024)
par: Jiao, Dian, et autres
Publié: (2024)
InstructSAM: Segment Any Instance with Any Instructions
par: Yuan, Yuqian, et autres
Publié: (2026)
par: Yuan, Yuqian, et autres
Publié: (2026)
Backpropagation-Free Multi-modal On-Device Model Adaptation via Cloud-Device Collaboration
par: Ji, Wei, et autres
Publié: (2024)
par: Ji, Wei, et autres
Publié: (2024)
Boosting Private Domain Understanding of Efficient MLLMs: A Tuning-free, Adaptive, Universal Prompt Optimization Framework
par: Liu, Jiang, et autres
Publié: (2024)
par: Liu, Jiang, et autres
Publié: (2024)
Robust Modality-incomplete Anomaly Detection: A Modality-instructive Framework with Benchmark
par: Miao, Bingchen, et autres
Publié: (2024)
par: Miao, Bingchen, et autres
Publié: (2024)
Efficient Tuning and Inference for Large Language Models on Textual Graphs
par: Zhu, Yun, et autres
Publié: (2024)
par: Zhu, Yun, et autres
Publié: (2024)
IDEAL: Leveraging Infinite and Dynamic Characterizations of Large Language Models for Query-focused Summarization
par: Cao, Jie, et autres
Publié: (2024)
par: Cao, Jie, et autres
Publié: (2024)
VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies
par: Gao, Mingjian, et autres
Publié: (2026)
par: Gao, Mingjian, et autres
Publié: (2026)
WorldGPT: Empowering LLM as Multimodal World Model
par: Ge, Zhiqi, et autres
Publié: (2024)
par: Ge, Zhiqi, et autres
Publié: (2024)
InstructVid2Vid: Controllable Video Editing with Natural Language Instructions
par: Qin, Bosheng, et autres
Publié: (2023)
par: Qin, Bosheng, et autres
Publié: (2023)
SpatialFusion: Endowing Unified Image Generation with Intrinsic 3D Geometric Awareness
par: Qiu, Haiyi, et autres
Publié: (2026)
par: Qiu, Haiyi, et autres
Publié: (2026)
Towards Meta-Cognitive Knowledge Editing for Multimodal LLMs
par: Fan, Zhaoyu, et autres
Publié: (2025)
par: Fan, Zhaoyu, et autres
Publié: (2025)
CORE: Code-based Inverse Self-Training Framework with Graph Expansion for Virtual Agents
par: Wang, Keyu, et autres
Publié: (2026)
par: Wang, Keyu, et autres
Publié: (2026)
Mastering Collaborative Multi-modal Data Selection: A Focus on Informativeness, Uniqueness, and Representativeness
par: Yu, Qifan, et autres
Publié: (2024)
par: Yu, Qifan, et autres
Publié: (2024)
Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining
par: Ge, Zhiqi, et autres
Publié: (2024)
par: Ge, Zhiqi, et autres
Publié: (2024)
Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions
par: Li, Juncheng, et autres
Publié: (2023)
par: Li, Juncheng, et autres
Publié: (2023)
T2S-GPT: Dynamic Vector Quantization for Autoregressive Sign Language Production from Text
par: Yin, Aoxiong, et autres
Publié: (2024)
par: Yin, Aoxiong, et autres
Publié: (2024)
CrossView Suite: Harnessing Cross-view Spatial Intelligence of MLLMs with Dataset, Model and Benchmark
par: Wang, Wei, et autres
Publié: (2026)
par: Wang, Wei, et autres
Publié: (2026)
Align$^2$LLaVA: Cascaded Human and Large Language Model Preference Alignment for Multi-modal Instruction Curation
par: Huang, Hongzhe, et autres
Publié: (2024)
par: Huang, Hongzhe, et autres
Publié: (2024)
KCM: KAN-Based Collaboration Models Enhance Pretrained Large Models
par: Dai, Guangyu, et autres
Publié: (2025)
par: Dai, Guangyu, et autres
Publié: (2025)
Fact :Teaching MLLMs with Faithful, Concise and Transferable Rationales
par: Gao, Minghe, et autres
Publié: (2024)
par: Gao, Minghe, et autres
Publié: (2024)
AnyMS: Bottom-up Attention Decoupling for Layout-guided and Training-free Multi-subject Customization
par: Yu, Binhe, et autres
Publié: (2025)
par: Yu, Binhe, et autres
Publié: (2025)
Auto-Encoding Morph-Tokens for Multimodal LLM
par: Pan, Kaihang, et autres
Publié: (2024)
par: Pan, Kaihang, et autres
Publié: (2024)
TeamLoRA: Boosting Low-Rank Adaptation with Expert Collaboration and Competition
par: Lin, Tianwei, et autres
Publié: (2024)
par: Lin, Tianwei, et autres
Publié: (2024)
OmniMoGen: Unifying Human Motion Generation via Learning from Interleaved Text-Motion Instructions
par: Bu, Wendong, et autres
Publié: (2025)
par: Bu, Wendong, et autres
Publié: (2025)
FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL
par: Pan, Kaihang, et autres
Publié: (2025)
par: Pan, Kaihang, et autres
Publié: (2025)
What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities
par: Bu, Wendong, et autres
Publié: (2025)
par: Bu, Wendong, et autres
Publié: (2025)
GMFVAD: Using Grained Multi-modal Feature to Improve Video Anomaly Detection
par: Dai, Guangyu, et autres
Publié: (2025)
par: Dai, Guangyu, et autres
Publié: (2025)
Intelligent Model Update Strategy for Sequential Recommendation
par: Lv, Zheqi, et autres
Publié: (2023)
par: Lv, Zheqi, et autres
Publié: (2023)
Chart-HQA: A Benchmark for Hypothetical Question Answering in Charts
par: Chen, Xiangnan, et autres
Publié: (2025)
par: Chen, Xiangnan, et autres
Publié: (2025)
Documents similaires
-
MAKIMA: Tuning-free Multi-Attribute Open-domain Video Editing via Mask-Guided Attention Modulation
par: Zheng, Haoyu, et autres
Publié: (2024) -
Bridging Local Details and Global Context in Text-Attributed Graphs
par: Wang, Yaoke, et autres
Publié: (2024) -
SOYO: A Tuning-Free Approach for Video Style Morphing via Style-Adaptive Interpolation in Diffusion Models
par: Zheng, Haoyu, et autres
Publié: (2025) -
Fast Thinking for Large Language Models
par: Zheng, Haoyu, et autres
Publié: (2025) -
MoA: Heterogeneous Mixture of Adapters for Parameter-Efficient Fine-Tuning of Large Language Models
par: Cao, Jie, et autres
Publié: (2025)