Beyond the Permutation Symmetry of Transformers: The Role of Rotation for Model Fusion
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Binchi, Zheng, Zaiyi, Chen, Zhengzhang, Li, Jundong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Resolving Editing-Unlearning Conflicts: A Knowledge Codebook Framework for Large Language Model Updating
par: Zhang, Binchi, et autres
Publié: (2025)
par: Zhang, Binchi, et autres
Publié: (2025)
PerFormer: A Permutation Based Vision Transformer for Remaining Useful Life Prediction
par: Fan, Zhengyang, et autres
Publié: (2025)
par: Fan, Zhengyang, et autres
Publié: (2025)
Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models
par: Li, Xu, et autres
Publié: (2024)
par: Li, Xu, et autres
Publié: (2024)
Beyond Simple Fusion: Adaptive Gated Fusion for Robust Multimodal Sentiment Analysis
par: Wu, Han, et autres
Publié: (2025)
par: Wu, Han, et autres
Publié: (2025)
Exploring Magnitude Preservation and Rotation Modulation in Diffusion Transformers
par: Bill, Eric Tillman, et autres
Publié: (2025)
par: Bill, Eric Tillman, et autres
Publié: (2025)
Eff-GRot: Efficient and Generalizable Rotation Estimation with Transformers
par: Mathioulakis, Fanis, et autres
Publié: (2025)
par: Mathioulakis, Fanis, et autres
Publié: (2025)
Investigating the Role of Bilateral Symmetry for Inpainting Brain MRI
par: Kuznetsov, Sergey, et autres
Publié: (2025)
par: Kuznetsov, Sergey, et autres
Publié: (2025)
A Transformer-based Multimodal Fusion Model for Efficient Crowd Counting Using Visual and Wireless Signals
par: Cui, Zhe, et autres
Publié: (2025)
par: Cui, Zhe, et autres
Publié: (2025)
Rotation-Robust Regression with Convolutional Model Trees
par: Li, Hongyi, et autres
Publié: (2026)
par: Li, Hongyi, et autres
Publié: (2026)
Hausdorff Distance Matching with Adaptive Query Denoising for Rotated Detection Transformer
par: Lee, Hakjin, et autres
Publié: (2023)
par: Lee, Hakjin, et autres
Publié: (2023)
DiRotQ: Rotation-Aware Quantization for 4-bit Diffusion Transformers
par: Sharify, Sayeh, et autres
Publié: (2026)
par: Sharify, Sayeh, et autres
Publié: (2026)
Adaptive Transformer Attention and Multi-Scale Fusion for Spine 3D Segmentation
par: Xiang, Yanlin, et autres
Publié: (2025)
par: Xiang, Yanlin, et autres
Publié: (2025)
MMInference: Accelerating Pre-filling for Long-Context VLMs via Modality-Aware Permutation Sparse Attention
par: Li, Yucheng, et autres
Publié: (2025)
par: Li, Yucheng, et autres
Publié: (2025)
Relating CNN-Transformer Fusion Network for Change Detection
par: Gao, Yuhao, et autres
Publié: (2024)
par: Gao, Yuhao, et autres
Publié: (2024)
Investigating Permutation-Invariant Discrete Representation Learning for Spatially Aligned Images
par: Stirling, Jamie S. J., et autres
Publié: (2026)
par: Stirling, Jamie S. J., et autres
Publié: (2026)
DualSwinFusionSeg: Multimodal Martian Landslide Segmentation via Dual Swin Transformer with Multi-Scale Fusion and UNet++
par: Kabir, Shahriar, et autres
Publié: (2026)
par: Kabir, Shahriar, et autres
Publié: (2026)
Beyond Fixed Formulas: Data-Driven Linear Predictor for Efficient Diffusion Models
par: Shen, Zhirong, et autres
Publié: (2026)
par: Shen, Zhirong, et autres
Publié: (2026)
TinyFusion: Diffusion Transformers Learned Shallow
par: Fang, Gongfan, et autres
Publié: (2024)
par: Fang, Gongfan, et autres
Publié: (2024)
Improving Robustness of LiDAR-Camera Fusion Model against Weather Corruption from Fusion Strategy Perspective
par: Huang, Yihao, et autres
Publié: (2024)
par: Huang, Yihao, et autres
Publié: (2024)
TDEC: Deep Embedded Image Clustering with Transformer and Distribution Information
par: Zhang, Ruilin, et autres
Publié: (2026)
par: Zhang, Ruilin, et autres
Publié: (2026)
Symmetry-Robust 3D Orientation Estimation
par: Scarvelis, Christopher, et autres
Publié: (2024)
par: Scarvelis, Christopher, et autres
Publié: (2024)
Permutation Learning with Only N Parameters: From SoftSort to Self-Organizing Gaussians
par: Barthel, Kai Uwe, et autres
Publié: (2025)
par: Barthel, Kai Uwe, et autres
Publié: (2025)
The Role of Masking for Efficient Supervised Knowledge Distillation of Vision Transformers
par: Son, Seungwoo, et autres
Publié: (2023)
par: Son, Seungwoo, et autres
Publié: (2023)
CrossFuse: Learning Infrared and Visible Image Fusion by Cross-Sensor Top-K Vision Alignment and Beyond
par: Shi, Yukai, et autres
Publié: (2025)
par: Shi, Yukai, et autres
Publié: (2025)
AFN: Adaptive Fusion Normalization via an Encoder-Decoder Framework
par: Zhou, Zikai, et autres
Publié: (2023)
par: Zhou, Zikai, et autres
Publié: (2023)
Beyond Gaussian Bottlenecks: Topologically Aligned Encoding of Vision-Transformer Feature Spaces
par: Bond, Andrew, et autres
Publié: (2026)
par: Bond, Andrew, et autres
Publié: (2026)
Enhancing 3D Human Pose Estimation Amidst Severe Occlusion with Dual Transformer Fusion
par: Ghafoor, Mehwish, et autres
Publié: (2024)
par: Ghafoor, Mehwish, et autres
Publié: (2024)
DashFusion: Dual-stream Alignment with Hierarchical Bottleneck Fusion for Multimodal Sentiment Analysis
par: Wen, Yuhua, et autres
Publié: (2025)
par: Wen, Yuhua, et autres
Publié: (2025)
Predictive Dynamic Fusion
par: Cao, Bing, et autres
Publié: (2024)
par: Cao, Bing, et autres
Publié: (2024)
TerDiT: Ternary Diffusion Models with Transformers
par: Lu, Xudong, et autres
Publié: (2024)
par: Lu, Xudong, et autres
Publié: (2024)
Soft Mixture Denoising: Beyond the Expressive Bottleneck of Diffusion Models
par: Li, Yangming, et autres
Publié: (2023)
par: Li, Yangming, et autres
Publié: (2023)
Rethinking Attention: Polynomial Alternatives to Softmax in Transformers
par: Saratchandran, Hemanth, et autres
Publié: (2024)
par: Saratchandran, Hemanth, et autres
Publié: (2024)
In-Context Symmetries: Self-Supervised Learning through Contextual World Models
par: Gupta, Sharut, et autres
Publié: (2024)
par: Gupta, Sharut, et autres
Publié: (2024)
DeFusion: An Effective Decoupling Fusion Network for Multi-Modal Pregnancy Prediction
par: Ouyang, Xueqiang, et autres
Publié: (2025)
par: Ouyang, Xueqiang, et autres
Publié: (2025)
ConvNet vs Transformer, Supervised vs CLIP: Beyond ImageNet Accuracy
par: Vishniakov, Kirill, et autres
Publié: (2023)
par: Vishniakov, Kirill, et autres
Publié: (2023)
Expanding the Role of Diffusion Models for Robust Classifier Training
par: Huang, Pin-Han, et autres
Publié: (2026)
par: Huang, Pin-Han, et autres
Publié: (2026)
HiPART: Hierarchical Pose AutoRegressive Transformer for Occluded 3D Human Pose Estimation
par: Zheng, Hongwei, et autres
Publié: (2025)
par: Zheng, Hongwei, et autres
Publié: (2025)
Beyond DAGs: A Latent Partial Causal Model for Multimodal Learning
par: Liu, Yuhang, et autres
Publié: (2024)
par: Liu, Yuhang, et autres
Publié: (2024)
Restructuring Vector Quantization with the Rotation Trick
par: Fifty, Christopher, et autres
Publié: (2024)
par: Fifty, Christopher, et autres
Publié: (2024)
SLA: Beyond Sparsity in Diffusion Transformers via Fine-Tunable Sparse-Linear Attention
par: Zhang, Jintao, et autres
Publié: (2025)
par: Zhang, Jintao, et autres
Publié: (2025)
Documents similaires
-
Resolving Editing-Unlearning Conflicts: A Knowledge Codebook Framework for Large Language Model Updating
par: Zhang, Binchi, et autres
Publié: (2025) -
PerFormer: A Permutation Based Vision Transformer for Remaining Useful Life Prediction
par: Fan, Zhengyang, et autres
Publié: (2025) -
Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models
par: Li, Xu, et autres
Publié: (2024) -
Beyond Simple Fusion: Adaptive Gated Fusion for Robust Multimodal Sentiment Analysis
par: Wu, Han, et autres
Publié: (2025) -
Exploring Magnitude Preservation and Rotation Modulation in Diffusion Transformers
par: Bill, Eric Tillman, et autres
Publié: (2025)