MoCHA: Advanced Vision-Language Reasoning with MoE Connector and Hierarchical Group Attention
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Pang, Yuqi, Yang, Bowen, Cao, Yun, Fan, Rong, Li, Xiaoyu, He, Chen |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MoCHA: Denoising Caption Supervision for Motion-Text Retrieval
von: Warner, Nikolai, et al.
Veröffentlicht: (2026)
von: Warner, Nikolai, et al.
Veröffentlicht: (2026)
MoCHA-former: Moiré-Conditioned Hybrid Adaptive Transformer for Video Demoiréing
von: Sung, Jeahun, et al.
Veröffentlicht: (2025)
von: Sung, Jeahun, et al.
Veröffentlicht: (2025)
MoE-LLaVA: Mixture of Experts for Large Vision-Language Models
von: Lin, Bin, et al.
Veröffentlicht: (2024)
von: Lin, Bin, et al.
Veröffentlicht: (2024)
MiM-DiT: MoE in MoE with Diffusion Transformers for All-in-One Image Restoration
von: Kong, Lingshun, et al.
Veröffentlicht: (2026)
von: Kong, Lingshun, et al.
Veröffentlicht: (2026)
CBDES MoE: Hierarchically Decoupled Mixture-of-Experts for Functional Modules in Autonomous Driving
von: Xiang, Qi, et al.
Veröffentlicht: (2025)
von: Xiang, Qi, et al.
Veröffentlicht: (2025)
Fair-MoE: Fairness-Oriented Mixture of Experts in Vision-Language Models
von: Wang, Peiran, et al.
Veröffentlicht: (2025)
von: Wang, Peiran, et al.
Veröffentlicht: (2025)
ChartMoE: Mixture of Diversely Aligned Expert Connector for Chart Understanding
von: Xu, Zhengzhuo, et al.
Veröffentlicht: (2024)
von: Xu, Zhengzhuo, et al.
Veröffentlicht: (2024)
VEQ: Modality-Adaptive Quantization for MoE Vision-Language Models
von: Qin, Guangshuo, et al.
Veröffentlicht: (2026)
von: Qin, Guangshuo, et al.
Veröffentlicht: (2026)
Language Models Can See Better: Visual Contrastive Decoding For LLM Multimodal Reasoning
von: Pang, Yuqi, et al.
Veröffentlicht: (2025)
von: Pang, Yuqi, et al.
Veröffentlicht: (2025)
Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and Data
von: Li, Yunxin, et al.
Veröffentlicht: (2025)
von: Li, Yunxin, et al.
Veröffentlicht: (2025)
Uni-Med: A Unified Medical Generalist Foundation Model For Multi-Task Learning Via Connector-MoE
von: Zhu, Xun, et al.
Veröffentlicht: (2024)
von: Zhu, Xun, et al.
Veröffentlicht: (2024)
Dense2MoE: Restructuring Diffusion Transformer to MoE for Efficient Text-to-Image Generation
von: Zheng, Youwei, et al.
Veröffentlicht: (2025)
von: Zheng, Youwei, et al.
Veröffentlicht: (2025)
BIG-MoE: Bypass Isolated Gating MoE for Generalized Multimodal Face Anti-Spoofing
von: Ma, Yingjie, et al.
Veröffentlicht: (2024)
von: Ma, Yingjie, et al.
Veröffentlicht: (2024)
MoE-GS: Mixture of Experts for Dynamic Gaussian Splatting
von: Jin, In-Hwan, et al.
Veröffentlicht: (2025)
von: Jin, In-Hwan, et al.
Veröffentlicht: (2025)
MoETTA: Test-Time Adaptation Under Mixed Distribution Shifts with MoE-LayerNorm
von: Fan, Xiao, et al.
Veröffentlicht: (2025)
von: Fan, Xiao, et al.
Veröffentlicht: (2025)
MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models
von: Ko, Dohwan, et al.
Veröffentlicht: (2026)
von: Ko, Dohwan, et al.
Veröffentlicht: (2026)
GazeFormer-MoE: Context-Aware Gaze Estimation via CLIP and MoE Transformer
von: Zhao, Xinyuan, et al.
Veröffentlicht: (2026)
von: Zhao, Xinyuan, et al.
Veröffentlicht: (2026)
Med-MoE: Mixture of Domain-Specific Experts for Lightweight Medical Vision-Language Models
von: Jiang, Songtao, et al.
Veröffentlicht: (2024)
von: Jiang, Songtao, et al.
Veröffentlicht: (2024)
TAG-MoE: Task-Aware Gating for Unified Generative Mixture-of-Experts
von: Xu, Yu, et al.
Veröffentlicht: (2026)
von: Xu, Yu, et al.
Veröffentlicht: (2026)
Nucleus-Image: Sparse MoE for Image Generation
von: Akiti, Chandan, et al.
Veröffentlicht: (2026)
von: Akiti, Chandan, et al.
Veröffentlicht: (2026)
LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
von: Shu, Fangxun, et al.
Veröffentlicht: (2024)
von: Shu, Fangxun, et al.
Veröffentlicht: (2024)
When Does Sparse MoE Help in Vision? The Role of Backbone Compute Leverage in Sparse Routing
von: Sun, Libo, et al.
Veröffentlicht: (2026)
von: Sun, Libo, et al.
Veröffentlicht: (2026)
LongScape: Advancing Long-Horizon Embodied World Models with Context-Aware MoE
von: Shang, Yu, et al.
Veröffentlicht: (2025)
von: Shang, Yu, et al.
Veröffentlicht: (2025)
MoE3D: A Mixture-of-Experts Module for 3D Reconstruction
von: Wang, Zichen, et al.
Veröffentlicht: (2026)
von: Wang, Zichen, et al.
Veröffentlicht: (2026)
eMoE-Tracker: Environmental MoE-based Transformer for Robust Event-guided Object Tracking
von: Chen, Yucheng, et al.
Veröffentlicht: (2024)
von: Chen, Yucheng, et al.
Veröffentlicht: (2024)
MoE Jetpack: From Dense Checkpoints to Adaptive Mixture of Experts for Vision Tasks
von: Zhu, Xingkui, et al.
Veröffentlicht: (2024)
von: Zhu, Xingkui, et al.
Veröffentlicht: (2024)
EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE
von: Chen, Junyi, et al.
Veröffentlicht: (2023)
von: Chen, Junyi, et al.
Veröffentlicht: (2023)
InterMoE: Individual-Specific 3D Human Interaction Generation via Dynamic Temporal-Selective MoE
von: Wang, Lipeng, et al.
Veröffentlicht: (2025)
von: Wang, Lipeng, et al.
Veröffentlicht: (2025)
HiFi-MambaV2: Hierarchical Shared-Routed MoE for High-Fidelity MRI Reconstruction
von: Fang, Pengcheng, et al.
Veröffentlicht: (2025)
von: Fang, Pengcheng, et al.
Veröffentlicht: (2025)
BioFact-MoE: Biologically Factorized Mixture of Experts for Vision-Language Prognostic Modeling in Hepatocellular Carcinoma
von: Yang, Junlin, et al.
Veröffentlicht: (2026)
von: Yang, Junlin, et al.
Veröffentlicht: (2026)
Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts
von: Zhang, Yue, et al.
Veröffentlicht: (2025)
von: Zhang, Yue, et al.
Veröffentlicht: (2025)
Guiding the Experts: Semantic Priors for Efficient and Focused MoE Routing
von: Min, Chengxi, et al.
Veröffentlicht: (2025)
von: Min, Chengxi, et al.
Veröffentlicht: (2025)
Symbiotic-MoE: Unlocking the Synergy between Generation and Understanding
von: Liu, Xiangyue, et al.
Veröffentlicht: (2026)
von: Liu, Xiangyue, et al.
Veröffentlicht: (2026)
Mamoda2.5: Enhancing Unified Multimodal Model with DiT-MoE
von: Shi, Yangming, et al.
Veröffentlicht: (2026)
von: Shi, Yangming, et al.
Veröffentlicht: (2026)
SocialNav-MoE: A Mixture-of-Experts Vision Language Model for Socially Compliant Navigation with Reinforcement Fine-Tuning
von: Kawabata, Tomohito, et al.
Veröffentlicht: (2025)
von: Kawabata, Tomohito, et al.
Veröffentlicht: (2025)
MD-Face: MoE-Enhanced Label-Free Disentangled Representation for Interactive Facial Attribute Editing
von: Cui, Xuan, et al.
Veröffentlicht: (2026)
von: Cui, Xuan, et al.
Veröffentlicht: (2026)
I2MoE: Interpretable Multimodal Interaction-aware Mixture-of-Experts
von: Xin, Jiayi, et al.
Veröffentlicht: (2025)
von: Xin, Jiayi, et al.
Veröffentlicht: (2025)
UniMMAD: Unified Multi-Modal and Multi-Class Anomaly Detection via MoE-Driven Feature Decompression
von: Zhao, Yuan, et al.
Veröffentlicht: (2025)
von: Zhao, Yuan, et al.
Veröffentlicht: (2025)
More Is Better: A MoE-Based Emotion Recognition Framework with Human Preference Alignment
von: Xie, Jun, et al.
Veröffentlicht: (2025)
von: Xie, Jun, et al.
Veröffentlicht: (2025)
RS-MoE: A Vision-Language Model with Mixture of Experts for Remote Sensing Image Captioning and Visual Question Answering
von: Lin, Hui, et al.
Veröffentlicht: (2024)
von: Lin, Hui, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
MoCHA: Denoising Caption Supervision for Motion-Text Retrieval
von: Warner, Nikolai, et al.
Veröffentlicht: (2026) -
MoCHA-former: Moiré-Conditioned Hybrid Adaptive Transformer for Video Demoiréing
von: Sung, Jeahun, et al.
Veröffentlicht: (2025) -
MoE-LLaVA: Mixture of Experts for Large Vision-Language Models
von: Lin, Bin, et al.
Veröffentlicht: (2024) -
MiM-DiT: MoE in MoE with Diffusion Transformers for All-in-One Image Restoration
von: Kong, Lingshun, et al.
Veröffentlicht: (2026) -
CBDES MoE: Hierarchically Decoupled Mixture-of-Experts for Functional Modules in Autonomous Driving
von: Xiang, Qi, et al.
Veröffentlicht: (2025)