Saved in:
| Main Authors: | Huang, Jiancheng, Gao, Yu, Jie, Zequn, Zhong, Yujie, Han, Xintong, Ma, Lin |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2409.05250 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Matten: Video Generation with Mamba-Attention
by: Gao, Yu, et al.
Published: (2024)
by: Gao, Yu, et al.
Published: (2024)
InstaGen: Enhancing Object Detection by Training on Synthetic Dataset
by: Feng, Chengjian, et al.
Published: (2024)
by: Feng, Chengjian, et al.
Published: (2024)
M4V: Multi-Modal Mamba for Text-to-Video Generation
by: Huang, Jiancheng, et al.
Published: (2025)
by: Huang, Jiancheng, et al.
Published: (2025)
CDST: Color Disentangled Style Transfer for Universal Style Reference Customization
by: Zhang, Shiwen, et al.
Published: (2025)
by: Zhang, Shiwen, et al.
Published: (2025)
Meta-Learning for Color-to-Infrared Cross-Modal Style Transfer
by: Stump, Evelyn A., et al.
Published: (2022)
by: Stump, Evelyn A., et al.
Published: (2022)
STAR: STacked AutoRegressive Scheme for Unified Multimodal Learning
by: Qin, Jie, et al.
Published: (2025)
by: Qin, Jie, et al.
Published: (2025)
MindBench: A Comprehensive Benchmark for Mind Map Structure Recognition and Analysis
by: Chen, Lei, et al.
Published: (2024)
by: Chen, Lei, et al.
Published: (2024)
Cross-Modal Attention Calibration for LVLM Hallucination Mitigation
by: Li, Jiaming, et al.
Published: (2025)
by: Li, Jiaming, et al.
Published: (2025)
M2StyleGS: Multi-Modality 3D Style Transfer with Gaussian Splatting
by: Miao, Xingyu, et al.
Published: (2026)
by: Miao, Xingyu, et al.
Published: (2026)
LLaVA-MoLE: Sparse Mixture of LoRA Experts for Mitigating Data Conflicts in Instruction Finetuning MLLMs
by: Chen, Shaoxiang, et al.
Published: (2024)
by: Chen, Shaoxiang, et al.
Published: (2024)
RoboTron-Drive: All-in-One Large Multimodal Model for Autonomous Driving
by: Huang, Zhijian, et al.
Published: (2024)
by: Huang, Zhijian, et al.
Published: (2024)
StyleTalk++: A Unified Framework for Controlling the Speaking Styles of Talking Heads
by: Wang, Suzhen, et al.
Published: (2024)
by: Wang, Suzhen, et al.
Published: (2024)
FlexVAR: Flexible Visual Autoregressive Modeling without Residual Prediction
by: Jiao, Siyu, et al.
Published: (2025)
by: Jiao, Siyu, et al.
Published: (2025)
UniVST: A Unified Framework for Training-free Localized Video Style Transfer
by: Song, Quanjian, et al.
Published: (2024)
by: Song, Quanjian, et al.
Published: (2024)
UniMD: Towards Unifying Moment Retrieval and Temporal Action Detection
by: Zeng, Yingsen, et al.
Published: (2024)
by: Zeng, Yingsen, et al.
Published: (2024)
CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder
by: Ma, Lichen, et al.
Published: (2024)
by: Ma, Lichen, et al.
Published: (2024)
Puff-Net: Efficient Style Transfer with Pure Content and Style Feature Fusion Network
by: Zheng, Sizhe, et al.
Published: (2024)
by: Zheng, Sizhe, et al.
Published: (2024)
Style-Preserving Lip Sync via Audio-Aware Style Reference
by: Zhong, Weizhi, et al.
Published: (2024)
by: Zhong, Weizhi, et al.
Published: (2024)
Quantifying and Enhancing Multi-modal Robustness with Modality Preference
by: Yang, Zequn, et al.
Published: (2024)
by: Yang, Zequn, et al.
Published: (2024)
AlignSAM: Aligning Segment Anything Model to Open Context via Reinforcement Learning
by: Huang, Duojun, et al.
Published: (2024)
by: Huang, Duojun, et al.
Published: (2024)
UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding
by: Jiao, Yang, et al.
Published: (2025)
by: Jiao, Yang, et al.
Published: (2025)
SpecRef: A Fast Training-free Baseline of Specific Reference-Condition Real Image Editing
by: Chen, Songyan, et al.
Published: (2024)
by: Chen, Songyan, et al.
Published: (2024)
VidCompress: Memory-Enhanced Temporal Compression for Video Understanding in Large Language Models
by: Lan, Xiaohan, et al.
Published: (2024)
by: Lan, Xiaohan, et al.
Published: (2024)
InstantStyleGaussian: Efficient Art Style Transfer with 3D Gaussian Splatting
by: Yu, Xin-Yi, et al.
Published: (2024)
by: Yu, Xin-Yi, et al.
Published: (2024)
StyleDiT: A Unified Framework for Diverse Child and Partner Faces Synthesis with Style Latent Diffusion Transformer
by: Chiu, Pin-Yen, et al.
Published: (2024)
by: Chiu, Pin-Yen, et al.
Published: (2024)
Multi-level Dynamic Style Transfer for NeRFs
by: Li, Zesheng, et al.
Published: (2025)
by: Li, Zesheng, et al.
Published: (2025)
Color and Texture Dual Pipeline Lightweight Style Transfer
by: Jiang, ShiQi
Published: (2023)
by: Jiang, ShiQi
Published: (2023)
Pluggable Style Representation Learning for Multi-Style Transfer
by: Liu, Hongda, et al.
Published: (2025)
by: Liu, Hongda, et al.
Published: (2025)
OmniStyle: Filtering High Quality Style Transfer Data at Scale
by: Wang, Ye, et al.
Published: (2025)
by: Wang, Ye, et al.
Published: (2025)
OVMR: Open-Vocabulary Recognition with Multi-Modal References
by: Ma, Zehong, et al.
Published: (2024)
by: Ma, Zehong, et al.
Published: (2024)
StyleGallery: Training-free and Semantic-aware Personalized Style Transfer from Arbitrary Image References
by: He, Boyu, et al.
Published: (2026)
by: He, Boyu, et al.
Published: (2026)
OmniColor: A Unified Framework for Multi-modal Lineart Colorization
by: Zhang, Xulu, et al.
Published: (2026)
by: Zhang, Xulu, et al.
Published: (2026)
Regional Style and Color Transfer
by: Ding, Zhicheng, et al.
Published: (2024)
by: Ding, Zhicheng, et al.
Published: (2024)
Lumen: Unleashing Versatile Vision-Centric Capabilities of Large Multimodal Models
by: Jiao, Yang, et al.
Published: (2024)
by: Jiao, Yang, et al.
Published: (2024)
StyleQoRA: Quality-Aware Low-Rank Adaptation for Few-Shot Multi-Style Editing
by: Cao, Cong, et al.
Published: (2025)
by: Cao, Cong, et al.
Published: (2025)
Multi-Prompt Alignment for Multi-Source Unsupervised Domain Adaptation
by: Chen, Haoran, et al.
Published: (2022)
by: Chen, Haoran, et al.
Published: (2022)
Style3D: Attention-guided Multi-view Style Transfer for 3D Object Generation
by: Song, Bingjie, et al.
Published: (2024)
by: Song, Bingjie, et al.
Published: (2024)
AttenST: A Training-Free Attention-Driven Style Transfer Framework with Pre-Trained Diffusion Models
by: Huang, Bo, et al.
Published: (2025)
by: Huang, Bo, et al.
Published: (2025)
All-in-One Transferring Image Compression from Human Perception to Multi-Machine Perception
by: Zhao, Jiancheng, et al.
Published: (2025)
by: Zhao, Jiancheng, et al.
Published: (2025)
IRConStyle: Image Restoration Framework Using Contrastive Learning and Style Transfer
by: Fan, Dongqi, et al.
Published: (2024)
by: Fan, Dongqi, et al.
Published: (2024)
Similar Items
-
Matten: Video Generation with Mamba-Attention
by: Gao, Yu, et al.
Published: (2024) -
InstaGen: Enhancing Object Detection by Training on Synthetic Dataset
by: Feng, Chengjian, et al.
Published: (2024) -
M4V: Multi-Modal Mamba for Text-to-Video Generation
by: Huang, Jiancheng, et al.
Published: (2025) -
CDST: Color Disentangled Style Transfer for Universal Style Reference Customization
by: Zhang, Shiwen, et al.
Published: (2025) -
Meta-Learning for Color-to-Infrared Cross-Modal Style Transfer
by: Stump, Evelyn A., et al.
Published: (2022)