CARE Transformer: Mobile-Friendly Linear Visual Transformer via Decoupled Dual Interaction
Fuente:
arXiv
Saved in:
| Main Authors: | Zhou, Yuan, Xu, Qingshan, Cui, Jiequan, Zhou, Junbao, Zhang, Jing, Hong, Richang, Zhang, Hanwang |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Streaming Drag-Oriented Interactive Video Manipulation: Drag Anything, Anytime!
by: Zhou, Junbao, et al.
Published: (2025)
by: Zhou, Junbao, et al.
Published: (2025)
DragNeXt: Rethinking Drag-Based Image Editing
by: Zhou, Yuan, et al.
Published: (2025)
by: Zhou, Yuan, et al.
Published: (2025)
NeuSpring: Neural Spring Fields for Reconstruction and Simulation of Deformable Objects from Videos
by: Xu, Qingshan, et al.
Published: (2025)
by: Xu, Qingshan, et al.
Published: (2025)
Robust Fine-tuning of Zero-shot Models via Variance Reduction
by: Zhu, Beier, et al.
Published: (2024)
by: Zhu, Beier, et al.
Published: (2024)
Pushing Rendering Boundaries: Hard Gaussian Splatting
by: Xu, Qingshan, et al.
Published: (2024)
by: Xu, Qingshan, et al.
Published: (2024)
Generalized Kullback-Leibler Divergence Loss
by: Cui, Jiequan, et al.
Published: (2025)
by: Cui, Jiequan, et al.
Published: (2025)
Generative Distribution Distillation
by: Cui, Jiequan, et al.
Published: (2025)
by: Cui, Jiequan, et al.
Published: (2025)
Doubly Abductive Counterfactual Inference for Text-based Image Editing
by: Song, Xue, et al.
Published: (2024)
by: Song, Xue, et al.
Published: (2024)
Project-Probe-Aggregate: Efficient Fine-Tuning for Group Robustness
by: Zhu, Beier, et al.
Published: (2025)
by: Zhu, Beier, et al.
Published: (2025)
Decoupled Kullback-Leibler Divergence Loss
by: Cui, Jiequan, et al.
Published: (2023)
by: Cui, Jiequan, et al.
Published: (2023)
MuSteerNet: Human Reaction Generation from Videos via Observation-Reaction Mutual Steering
by: Zhou, Yuan, et al.
Published: (2026)
by: Zhou, Yuan, et al.
Published: (2026)
Instruction Tuning-free Visual Token Complement for Multimodal LLMs
by: Wang, Dongsheng, et al.
Published: (2024)
by: Wang, Dongsheng, et al.
Published: (2024)
Reducing Class-Wise Performance Disparity via Margin Regularization
by: Zhu, Beier, et al.
Published: (2026)
by: Zhu, Beier, et al.
Published: (2026)
Thinking with Images as Continuous Actions: Numerical Visual Chain-of-Thought
by: Zhao, Kesen, et al.
Published: (2026)
by: Zhao, Kesen, et al.
Published: (2026)
Few-shot Learner Parameterization by Diffusion Time-steps
by: Yue, Zhongqi, et al.
Published: (2024)
by: Yue, Zhongqi, et al.
Published: (2024)
Controllable Relation Disentanglement for Few-Shot Class-Incremental Learning
by: Zhou, Yuan, et al.
Published: (2024)
by: Zhou, Yuan, et al.
Published: (2024)
Revisiting Audio-Visual Segmentation with Vision-Centric Transformer
by: Huang, Shaofei, et al.
Published: (2025)
by: Huang, Shaofei, et al.
Published: (2025)
Personalize Your Gaussian: Consistent 3D Scene Personalization from a Single Image
by: Wang, Yuxuan, et al.
Published: (2025)
by: Wang, Yuxuan, et al.
Published: (2025)
Rethinking VLMs for Image Forgery Detection and Localization
by: Guo, Shaofeng, et al.
Published: (2026)
by: Guo, Shaofeng, et al.
Published: (2026)
Real-Time Motion-Controllable Autoregressive Video Diffusion
by: Zhao, Kesen, et al.
Published: (2025)
by: Zhao, Kesen, et al.
Published: (2025)
Classes Are Not Equal: An Empirical Study on Image Recognition Fairness
by: Cui, Jiequan, et al.
Published: (2024)
by: Cui, Jiequan, et al.
Published: (2024)
LoRA of Change: Learning to Generate LoRA for the Editing Instruction from A Single Before-After Image Pair
by: Song, Xue, et al.
Published: (2024)
by: Song, Xue, et al.
Published: (2024)
Aligned Contrastive Loss for Long-Tailed Recognition
by: Ma, Jiali, et al.
Published: (2025)
by: Ma, Jiali, et al.
Published: (2025)
Diffusion Time-step Curriculum for One Image to 3D Generation
by: Yi, Xuanyu, et al.
Published: (2024)
by: Yi, Xuanyu, et al.
Published: (2024)
Scene Graph-guided SegCaptioning Transformer with Fine-grained Alignment for Controllable Video Segmentation and Captioning
by: Zhang, Xu, et al.
Published: (2026)
by: Zhang, Xu, et al.
Published: (2026)
Embedded Heterogeneous Attention Transformer for Cross-lingual Image Captioning
by: Song, Zijie, et al.
Published: (2023)
by: Song, Zijie, et al.
Published: (2023)
Seeing is Believing? Enhancing Vision-Language Navigation using Visual Perturbations
by: Zhang, Xuesong, et al.
Published: (2024)
by: Zhang, Xuesong, et al.
Published: (2024)
Few-shot NeRF by Adaptive Rendering Loss Regularization
by: Xu, Qingshan, et al.
Published: (2024)
by: Xu, Qingshan, et al.
Published: (2024)
Visual Transformation Telling
by: Cui, Wanqing, et al.
Published: (2023)
by: Cui, Wanqing, et al.
Published: (2023)
EmoKGEdit: Training-free Affective Injection via Visual Cue Transformation
by: Zhang, Jing, et al.
Published: (2026)
by: Zhang, Jing, et al.
Published: (2026)
Unsupervised Visual Chain-of-Thought Reasoning via Preference Optimization
by: Zhao, Kesen, et al.
Published: (2025)
by: Zhao, Kesen, et al.
Published: (2025)
DiT as Real-Time Rerenderer: Streaming Video Stylization with Autoregressive Diffusion Transformer
by: Lyu, Hengye, et al.
Published: (2026)
by: Lyu, Hengye, et al.
Published: (2026)
Emotion Separation and Recognition from a Facial Expression by Generating the Poker Face with Vision Transformers
by: Li, Jia, et al.
Published: (2022)
by: Li, Jia, et al.
Published: (2022)
SeaFormer++: Squeeze-enhanced Axial Transformer for Mobile Visual Recognition
by: Wan, Qiang, et al.
Published: (2023)
by: Wan, Qiang, et al.
Published: (2023)
Disentangling Foreground and Background for vision-Language Navigation via Online Augmentation
by: Xu, Yunbo, et al.
Published: (2025)
by: Xu, Yunbo, et al.
Published: (2025)
Group Multi-View Transformer for 3D Shape Analysis with Spatial Encoding
by: Xu, Lixiang, et al.
Published: (2023)
by: Xu, Lixiang, et al.
Published: (2023)
MVGamba: Unify 3D Content Generation as State Space Sequence Modeling
by: Yi, Xuanyu, et al.
Published: (2024)
by: Yi, Xuanyu, et al.
Published: (2024)
Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers
by: Lee, Dong Hoon, et al.
Published: (2024)
by: Lee, Dong Hoon, et al.
Published: (2024)
ViT-1.58b: Mobile Vision Transformers in the 1-bit Era
by: Yuan, Zhengqing, et al.
Published: (2024)
by: Yuan, Zhengqing, et al.
Published: (2024)
Dual Selective Fusion Transformer Network for Hyperspectral Image Classification
by: Xu, Yichu, et al.
Published: (2024)
by: Xu, Yichu, et al.
Published: (2024)
Similar Items
-
Streaming Drag-Oriented Interactive Video Manipulation: Drag Anything, Anytime!
by: Zhou, Junbao, et al.
Published: (2025) -
DragNeXt: Rethinking Drag-Based Image Editing
by: Zhou, Yuan, et al.
Published: (2025) -
NeuSpring: Neural Spring Fields for Reconstruction and Simulation of Deformable Objects from Videos
by: Xu, Qingshan, et al.
Published: (2025) -
Robust Fine-tuning of Zero-shot Models via Variance Reduction
by: Zhu, Beier, et al.
Published: (2024) -
Pushing Rendering Boundaries: Hard Gaussian Splatting
by: Xu, Qingshan, et al.
Published: (2024)